Большие языковые модели (LLM) значительно продвинули обработку естественного языка, но их прогресс еще не одинаков для разных языков. Хотя большинство LLM обучаются на высокоресурсных языках, таких как английский, многоязычные модели обычно уступают одноязычным. Кроме того, аспекты их многоязычной основы иногда ограничивают побочные продукты, которые они производят, например, требования к вычислительным ресурсам и режимы лицензирования. Поэтому мы разработали пару TeenyTinyLlama: две компактные модели для генерации текста на бразильском португальском языке. — Архитектура: модель на основе Transformer, предварительно обученная с помощью причинно-языкового моделирования. — Размер: 468 239 360 параметров. — Длина контекста: 2048 токенов. — Набор данных: Pt-Corpus Instruct (6,2 млрд токенов). — Язык: португальский. — Количество шагов: 1 200 000. — Графический процессор: 1 NVIDIA A100-SXM4-40GB. — Время обучения: ~ 280 часов. — Выбросы: 41,1 кгCO2 (Германия) — Общее энергопотребление: 115,69 кВтч. В этом репозитории имеется исходный код, используемый для обучения этой модели. Основные используемые библиотеки: — Трансформеры — PyTorch — Наборы данных — Токенизаторы — Sentencepiece — Accelerate — FlashAttention — Codecarbon. Основное назначение TeenyTinyLlama — исследование проблем, связанных с разработкой…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: nicholasKluge
Теги: jax, llama, text-generation-inference, pt, model-index, co2_eq_emissions, endpoints_compatible
Лайков: 12 | Загрузок: 1,419
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.