ai-forever/mGPT - Каталог нейросетей
Генерация текста

ai-forever/mGPT

Добавлено:
ai-forever/mGPT

Мы представляем семейство авторегрессионных GPT-подобных моделей с 1,3 миллиардами параметров, обученных на 61 языке из 25 языковых семей с использованием Википедии и Colossal Clean Crawled Corpus. Мы воспроизводим архитектуру GPT-3, используя источники GPT-2 и механизм разреженного внимания. Платформы Deepspeed и Megatron позволяют нам эффективно распараллеливать этапы обучения и вывода. Полученные модели демонстрируют производительность на уровне недавно выпущенных моделей XGLM, в то же время охватывая больше языков и расширяя возможности NLP для языков с ограниченными ресурсами. Исходный код модели mGPT XL доступен на Github ![](https://habrastorage.org/webt/1q/ru/yt/1qruytul6m2m-upyk9frq3pgrds.png). Модель была обучена с длиной последовательности 512 с использованием библиотек Megatron и Deepspeed командой SberDevices на наборе данных объемом 600 ГБ текстов на 61 языке. Всего в модели использовано 440 миллиардов токенов BPE. Общее время обучения составило около 14 дней на 256 графических процессорах Nvidia V100.

Модальности:
Генерация текста

Области применения:
Мультиязычность


Задача: Генерация текста
Автор: ai-forever
Теги: gpt2, multilingual, PyTorch, Transformers, gpt3, Deepspeed, Megatron, ar
Лайков: 270  |  Загрузок: 5,265

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.