Большие языковые модели (LLM) значительно продвинули обработку естественного языка, но их прогресс еще не одинаков для разных языков. Хотя большинство LLM обучаются на высокоресурсных языках, таких как английский, многоязычные модели обычно уступают одноязычным. Кроме того, аспекты их многоязычной основы иногда ограничивают побочные продукты, которые они производят, например, требования к вычислительным ресурсам и режимы лицензирования. Поэтому мы разработали пару TeenyTinyLlama: две компактные модели для генерации текста на бразильском португальском языке. — Архитектура: модель на основе Transformer, предварительно обученная с помощью причинно-языкового моделирования — Размер: 162 417 408 параметров — Длина контекста: 2048 токенов — Набор данных: Pt-Corpus Instruct (6,2 млрд токенов) — Язык: португальский — Количество шагов: 458 000 — Графический процессор: 1 NVIDIA A100-SXM4-40GB — Время обучения: ~ 36 часов — Выбросы: 5,6 кгCO2 (Германия) — Общее энергопотребление: 15,5 кВтч. В этом репозитории имеется исходный код, используемый для обучения этой модели. Основные используемые библиотеки: — Трансформеры — PyTorch — Наборы данных — Токенизаторы — Sentencepiece — Accelerate — FlashAttention — Codecarbon. Основное назначение TeenyTinyLlama — исследование проблем, связанных с разработкой…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: nicholasKluge
Теги: jax, llama, text-generation-inference, pt, model-index, co2_eq_emissions, endpoints_compatible
Лайков: 7 | Загрузок: 911
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.