Это версия Tiny Llama с точной настройкой инструкций в наборе данных openhermes @Teknium1. «Проект TinyLlama направлен на предварительное обучение модели Llama размером 1,1 миллиарда на 3 триллионах токенов. При некоторой надлежащей оптимизации мы можем достичь этого в течение «всего» 90 дней, используя 16 графических процессоров A100-40G 🚀🚀. Обучение началось 01 сентября 2023 года». Во время обучения использовались следующие гиперпараметры: — скорость обучения: 0,0002 — trainbatchsize: 8 — evalbatchsize: 8 — начальное число: 42 — распределенный тип: multi-GPU — numdevices: 8 — градиентаккумуляция шагов: 2 — общий размер поезда: 128 — общий размер evalbatchsize: 64 — оптимизатор: Адам с betas=(0,9,0,999) и epsilon=1e-08 — lrschedulertype: cosine — lrschedulerwarmupsteps: 100 — numepochs: 1 — mixprecision_training: Native AMP — Transformers 4.36.2 — Pytorch 2.0.1+cu117 — Наборы данных 2.15.0 — Токенизаторы 0.15.0
Модальности:
Генерация текста
Задача: Генерация текста
Автор: Tensoic
Теги: llama, generated_from_trainer, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 7
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.