Эта модель предварительно обучается с использованием BART на корпусе непальских данных, а затем настраивается на сводных данных на непальском языке. Модель генерирует сводку для ввода текста. Модель обучается с использованием методов зашумления BART, таких как перестановка предложений, удаление токенов и маскирование случайных токенов. Зашумленные данные подаются в кодер преобразователя, а задача/цель шумоподавления выполняется декодером модели преобразователя. Перекрестная энтропийная потеря используется как для предварительного обучения, так и для точной настройки модели. Оценка ROUGE после тонкой настройки для набора тестовых данных BBC XLSum Nepali: Вы можете использовать эту модель для суммирования текста. Может использоваться как модель только для кодировщика с использованием BartForSequenceClasssification. Модель подвергалась непрерывному предварительному обучению на одном графическом процессоре A10G в экземпляре AWS в течение 133 часов, причем каждая эпоха занимала 45 часов с использованием квантования bf16. 1. Используйте модель только для декодера для предварительного обучения и обобщения. Поскольку кажется, что диапазон удаления токенов не очень велик, модель учится копировать токен из контекста кодера во время генерации перекрестного внимания к декодеру. Таким образом, ухудшается выполнение задачи абстрактного суммирования. Данного случая нет в…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: pascalrai
Теги: bart, text2text-generation, Nepali summary, Nepali bart, Nepali, summary, text, nepali text summary
Лайков: 5 | Загрузок: 8
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.