Эта модель представляет собой модель, специфичную для Кореи, обученную в phi-2 путем добавления корейского токенизатора и корейских данных. (Английский также доступен.) Хотя phi-2 работает очень хорошо, он не поддерживает корейский язык и не имеет токенизатора, обученного на корейском корпусе, поэтому для токенизации корейского текста будет использоваться во много раз больше токенов, чем для английских токенов. Чтобы преодолеть эти ограничения, я обучил модель, используя корейский корпус с открытой лицензией и немного английский корпус. Причины совместного использования корпуса английского языка следующие: 1. Цель состоит в том, чтобы сохранить превосходные характеристики существующей модели, предотвращая катастрофическое забывание. 2. Смешение подсказок на английском и корейском языках обычно дает лучшие результаты, чем использование всех подсказок на корейском языке. Поскольку моя роль — не работающий разработчик, а архитектор решений, помогающий клиентам с быстрыми PoC/прототипами, и я был ограничен доступными ресурсами графического процессора AWS, я обучался только с 5 ГБ данных вместо сотен ГБ огромных данных. Набор данных, используемый для обучения, выглядит следующим образом. Чтобы предотвратить катастрофическое забывание, я включил в качестве обучающих данных некоторый корпус английского языка. — Набор данных Википедии на корейском языке (https://huggingface.co/datasets/wikimedia/wikipedia) -…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: daekeun-ml
Теги: phi, custom_code, ko, en, text-generation-inference
Лайков: 26 | Загрузок: 194
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.