ai-forever/mGPT-armenian - Каталог нейросетей
Генерация текста

ai-forever/mGPT-armenian

Добавлено:

Мы представляем одноязычную модель для армянского языка на основе GPT-3. Модель основана на mGPT, семействе авторегрессионных GPT-подобных моделей с 1,3 миллиарда параметров, обученных на 60 языках из 25 языковых семей с использованием Википедии и Colossal Clean Crawled Corpus. Мы воспроизводим архитектуру GPT-3, используя источники GPT-2 и механизм разреженного внимания. Платформы Deepspeed и Megatron позволяют нам эффективно распараллеливать этапы обучения и вывода. Полученные модели демонстрируют производительность на уровне недавно выпущенных моделей XGLM, в то же время охватывая больше языков и расширяя возможности NLP для языков с ограниченными ресурсами. Исходный код модели mGPT XL доступен на Github ![](https://habrastorage.org/webt/1q/ru/yt/1qruytul6m2m-upyk9frq3pgrds.png) Модель была доработана на 170 ГБ армянских текстов, включая MC4, художественную литературу Archive.org, общедоступные данные EANC, OpenSubtitles, корпус OSCAR и тексты для блога. Модель mGPT предварительно обучалась в течение 12 дней x 256 GPU (Tesla NVidia V100), 4 эпохи, затем 9 дней x 64 GPU, 1 эпоха. Армянская точная настройка длилась около 7 дней с 4 Tesla NVidia V100 и составила 160 тыс. шагов.…

Модальности:
Генерация текста

Области применения:
Мультиязычность


Задача: Генерация текста
Автор: ai-forever
Теги: gpt2, multilingual, PyTorch, Transformers, gpt3, Deepspeed, Megatron, hy
Лайков: 8  |  Загрузок: 6

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.