el-llama-smol стремится стать первым в серии LLM, обучающихся в основном на греческих корпусах. Модель представляет собой небольшую (1 млрд параметров) версию LLama со следующей конфигурацией. Текущий снимок был обучен в течение 40 часов с помощью графического процессора RTX A6000 (48G) с использованием оптимизатора galoreadamw8bitperlayer от Zhao et. al [1] и размером контекста 1024 маркера. Модель обучается на греческом подмножестве набора данных allenai/c4. Текстовая токенизация выполняется с помощью (сильно неоптимизированного) токенизатора с размером словаря 22000 токенов, обученного с помощью SentencePiece [1] Jiawei Zhao, Zhenyu Zhang, Beidi Chen, Zhangyang Wang, Anima Anandkumar,
Модальности:
Генерация текста
Задача: Генерация текста
Автор: Konstantinos
Теги: llama, text-generation-inference, el, endpoints_compatible
Лайков: 3 | Загрузок: 192
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.