Языковая модель для русского языка. Модель имеет 13B параметров, как можно догадаться по названию. На данный момент это наша самая большая модель, и она использовалась для обучения GigaChat (подробнее о ней читайте в статье). Модель была предварительно обучена на 300 ГБ различных доменов, а затем дополнительно обучена на 100 ГБ кода и юридических документов. Вот структура набора данных:  Данные обучения были дедуплицированы, дедупликация текста включает 64-битное хеширование каждого текста в корпусе для сохранения текстов с уникальным идентификатором. хеш. Мы также фильтруем документы по степени сжатия текста, используя zlib4. Наиболее сильно и слабо сжимаемые дедуплицированные тексты отбрасываются. Модель была обучена с использованием библиотек Deepspeed и Megatron на наборе данных токенов 300B за 3 эпохи, около 45 дней на 512 V100. После этого модель была доработана на 1 эпоху с длиной последовательности 2048 около 20 дней на 200 GPU A100 на дополнительных данных (см. выше). После финальной тренировки недоумение для этой модели составило около 8,8 для русского языка. Попробуйте разные стратегии генерации, чтобы достичь лучших результатов.
Модальности:
Генерация текста
Задача: Генерация текста
Автор: ai-forever
Теги: gpt2, gpt3, en, ru, text-generation-inference, endpoints_compatible
Лайков: 296 | Загрузок: 26,813
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.