Мы представляем семейство авторегрессионных GPT-подобных моделей с 1,3 миллиардами параметров, обученных на 61 языке из 25 языковых семей с использованием Википедии и Colossal Clean Crawled Corpus. Мы воспроизводим архитектуру GPT-3, используя источники GPT-2 и механизм разреженного внимания. Платформы Deepspeed и Megatron позволяют нам эффективно распараллеливать этапы обучения и вывода. Полученные модели демонстрируют производительность на уровне недавно выпущенных моделей XGLM, в то же время охватывая больше языков и расширяя возможности NLP для языков с ограниченными ресурсами. Исходный код модели mGPT XL доступен на Github . Модель была обучена с длиной последовательности 512 с использованием библиотек Megatron и Deepspeed командой SberDevices на наборе данных объемом 600 ГБ текстов на 61 языке. Всего в модели использовано 440 миллиардов токенов BPE. Общее время обучения составило около 14 дней на 256 графических процессорах Nvidia V100.
Модальности:
Генерация текста
Области применения:
Мультиязычность
Задача: Генерация текста
Автор: ai-forever
Теги: gpt2, multilingual, PyTorch, Transformers, gpt3, Deepspeed, Megatron, ar
Лайков: 270 | Загрузок: 5,265
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.