Этот репозиторий содержит файлы для двух моделей на основе преобразователей Seq2Seq, использованных в нашей статье: https://aclanthology.org/2023.trustnlp-1.20/. — Разработчики: Александр Ермилов, Випул Рахея, Артем Чернодуб — Тип модели: Seq2Seq — Язык (NLP): английский — Лицензия: Apache License 2.0 — Доработано на основе модели: BART Эти модели можно использовать для анонимизации наборов данных на английском языке. https://huggingface.co/datasets/grammarly/pseudonymization-data/tree/main/seq2seq 1. Соберите текстовые данные из Википедии. 2. Предварительно обработать его с помощью псевдонимизации на основе NER. 3. Точная настройка модели BART для задачи перевода для перевода текста из «оригинала» в «псевдонимизированный». Мы обучаем модели для 3 эпох, используя оптимизацию AdamW со скоростью обучения α = 2 * 105, а размер пакета равен 8. Для данных, на которых обучалась эта модель, не существует исходной истинности именованных объектов. Мы проверяем, является ли слово именованным объектом, используя одну из систем NER (spaCy или FLAIR). Мы измеряем количество текста, измененного нашей моделью. В частности, мы проверяем следующие категории переведенного текста по словам: 1. Истинно положительный (TP) — именованный объект, который был изменен на другой именованный объект. 2. Истинно отрицательный (TN) – не…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: grammarly
Теги: text2text-generation, en
Лайков: 5 | Загрузок: 0
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.