Проектирование архитектуры модели, ее предварительное обучение и оценка описаны в нашем препринте: «Семейство предварительно обученных языковых моделей трансформеров для русского языка». Модель обучалась с длиной последовательности 1024 с использованием библиотеки Transformers от команды SberDevices на 80B токенах в течение 3 эпох. После этого модель была доработана на 1 эпоху с длиной последовательности 2048. Общее время обучения составило около 14 дней на 128 графических процессорах для контекста 1024 и несколько дней на 16 графических процессорах для контекста 2048. Итоговое недоумение на тестовом наборе — 13,6.
Модальности:
Генерация текста
Задача: Генерация текста
Автор: ai-forever
Теги: jax, gpt2, PyTorch, Transformers, ru, text-generation-inference, endpoints_compatible
Лайков: 95 | Загрузок: 4,877
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.