Это архив nvidia/megatron-gpt2-345m, который содержит легко доступные веса моделей (375M). Его производительность на Wikitext-103 составляет 19,31,1. Для сравнения: производительность GPT2-large (1,5B) составляет 17,48, а GPT2-medium (762M) — 22,05,2 1. Shoeybi, Mohammad, et al. Megatron-LM: обучение языковых моделей с несколькими миллиардами параметров с использованием параллелизма моделей. arXiv, 2019, https://doi.org/10.48550/ARXIV.1909.08053. 2. Алек Рэдфорд и др. Языковые модели предназначены для многозадачного обучения без присмотра. OpenAI, 2019. https://cdn.openai.com/better-language-models/languagemodelsareunsupervisedmultitask_learners.pdf. Megatron — это большой и мощный преобразователь, разработанный группой исследований в области прикладного глубокого обучения NVIDIA. Эта конкретная модель Мегатрона была обучена с помощью генеративного преобразователя слева направо в стиле GPT-2. Эта модель была обучена на тексте, взятом из Википедии, RealNews, OpenWebText и CC-Stories. Он содержит 345 миллионов параметров. Дополнительную информацию можно найти на https://github.com/NVIDIA/Megatron-LM. Следующий код показывает, как использовать контрольную точку Megatron GPT2 и трансформаторы для генерации текста. Исходный код Megatron можно найти здесь: https://github.com/NVIDIA/Megatron-LM.
Модальности:
Генерация текста
Задача: Генерация текста
Автор: robowaifudev
Теги: gpt2, en, model-index, text-generation-inference, endpoints_compatible
Лайков: 9 | Загрузок: 3,406
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.