nicholasKluge/TeenyTinyLlama-460m - Каталог нейросетей
Генерация текста

nicholasKluge/TeenyTinyLlama-460m

Добавлено:
nicholasKluge/TeenyTinyLlama-460m

Большие языковые модели (LLM) значительно продвинули обработку естественного языка, но их прогресс еще не одинаков для разных языков. Хотя большинство LLM обучаются на высокоресурсных языках, таких как английский, многоязычные модели обычно уступают одноязычным. Кроме того, аспекты их многоязычной основы иногда ограничивают побочные продукты, которые они производят, например, требования к вычислительным ресурсам и режимы лицензирования. Поэтому мы разработали пару TeenyTinyLlama: две компактные модели для генерации текста на бразильском португальском языке. — Архитектура: модель на основе Transformer, предварительно обученная с помощью причинно-языкового моделирования. — Размер: 468 239 360 параметров. — Длина контекста: 2048 токенов. — Набор данных: Pt-Corpus Instruct (6,2 млрд токенов). — Язык: португальский. — Количество шагов: 1 200 000. — Графический процессор: 1 NVIDIA A100-SXM4-40GB. — Время обучения: ~ 280 часов. — Выбросы: 41,1 кгCO2 (Германия) — Общее энергопотребление: 115,69 кВтч. В этом репозитории имеется исходный код, используемый для обучения этой модели. Основные используемые библиотеки: — Трансформеры — PyTorch — Наборы данных — Токенизаторы — Sentencepiece — Accelerate — FlashAttention — Codecarbon. Основное назначение TeenyTinyLlama — исследование проблем, связанных с разработкой…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: nicholasKluge
Теги: jax, llama, text-generation-inference, pt, model-index, co2_eq_emissions, endpoints_compatible
Лайков: 12  |  Загрузок: 1,419

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.