Мы представляем одноязычную модель для армянского языка на основе GPT-3. Модель основана на mGPT, семействе авторегрессионных GPT-подобных моделей с 1,3 миллиарда параметров, обученных на 60 языках из 25 языковых семей с использованием Википедии и Colossal Clean Crawled Corpus. Мы воспроизводим архитектуру GPT-3, используя источники GPT-2 и механизм разреженного внимания. Платформы Deepspeed и Megatron позволяют нам эффективно распараллеливать этапы обучения и вывода. Полученные модели демонстрируют производительность на уровне недавно выпущенных моделей XGLM, в то же время охватывая больше языков и расширяя возможности NLP для языков с ограниченными ресурсами. Исходный код модели mGPT XL доступен на Github  Модель была доработана на 170 ГБ армянских текстов, включая MC4, художественную литературу Archive.org, общедоступные данные EANC, OpenSubtitles, корпус OSCAR и тексты для блога. Модель mGPT предварительно обучалась в течение 12 дней x 256 GPU (Tesla NVidia V100), 4 эпохи, затем 9 дней x 64 GPU, 1 эпоха. Армянская точная настройка длилась около 7 дней с 4 Tesla NVidia V100 и составила 160 тыс. шагов.…
Модальности:
Генерация текста
Области применения:
Мультиязычность
Задача: Генерация текста
Автор: ai-forever
Теги: gpt2, multilingual, PyTorch, Transformers, gpt3, Deepspeed, Megatron, hy
Лайков: 8 | Загрузок: 6
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.