Tucano — это серия декодеров-трансформеров, предварительно обученных на португальском языке. Все модели Tucano были обучены на GigaVerbo — объединении дедуплицированных португальских текстовых корпусов объемом 200 миллиардов токенов. — Архитектура: модель на основе Transformer, предварительно обученная с помощью причинно-языкового моделирования. — Размер: 162 417 408 параметров. — Длина контекста: 2048 токенов. — Набор данных: TucanoBR/GigaVerbo. — Язык: португальский. — Количество шагов: 320 000. — Графический процессор: 8 NVIDIA A100-SXM4-80GB. — Время обучения: ~ 44 часа. — Выбросы: 89,73 кгCO2 (Германия) — Общее энергопотребление: 235,54 кВтч. В этом репозитории содержится исходный код, используемый для обучения этой модели. Основные используемые библиотеки: — PyTorch — Трансформеры — Наборы данных — Токенизаторы — Sentencepiece — Accelerate — FlashAttention — Liger Kernel — Codecarbon — TRL Основное назначение моделей Tucano — служить основой для исследований и разработок, включающих моделирование на родном португальском языке. Контрольные точки, сохраненные во время обучения, предназначены для обеспечения контролируемых настроек для проведения сравнительных экспериментов, в частности, в отношении влияния активного предварительного обучения на производительность доступных в настоящее время тестов. Вы также можете выполнить точную настройку и…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: TucanoBR
Теги: jax, llama, text-generation-inference, pt, model-index, co2_eq_emissions, endpoints_compatible
Лайков: 4 | Загрузок: 510
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.