Проектирование архитектуры модели, ее предварительное обучение и оценка описаны в нашем препринте: «Семейство предварительно обученных языковых моделей трансформеров для русского языка». Модель была предварительно обучена с длиной последовательности 1024 с помощью преобразователей командой SberDevices на 80B токенах около 3 эпох. После этого модель была доработана с размером контекста 2048.
Модальности:
Генерация текста
Задача: Генерация текста
Автор: ai-forever
Теги: jax, gpt2, PyTorch, Transformers, ru, text-generation-inference, endpoints_compatible
Лайков: 54 | Загрузок: 32,165
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.