Эта модель предназначена для машинного переводчика с английского на корейский, который основан на небольшой архитектуре T5, но обучен с нуля. Код обучения взят из моей лекции (LLM을 위한 김기현의 NLP EXPRESS), которая опубликована на FastCampus. Вы можете проверить обучающий код в этом репозитории GitHub. Набор обучающих данных для этой модели в основном взят из AI-Hub. Набор данных состоит из 11 миллионов параллельных выборок. Я использую токенизатор BPE на уровне байтов как для исходного, так и для целевого языка. Поскольку он охватывает оба языка, размер словаря токенизатора составляет 60 КБ. Архитектура модели основана на T5-small, популярной архитектуре модели кодера-декодера. Обратите внимание, что эта модель обучается с нуля, а не дорабатывается. Я провел оценку с использованием 5 различных наборов тестов. На следующем рисунке показаны оценки BLEU для каждого набора тестов. Модель DEEPCL — это частная версия этой модели, которая обучается на гораздо большем количестве данных.
Модальности:
Генерация текста
Задача: Генерация текста
Автор: nlp-with-deeplearning
Теги: t5, feature-extraction, nmt, aihub, text2text-generation, en, ko, text-generation-inference
Лайков: 5 | Загрузок: 6
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.