Это версия Tiny Llama с точной настройкой инструкций в наборе данных openhermes @Teknium1. «Проект TinyLlama направлен на предварительное обучение модели Llama размером 1,1 миллиарда на 3 триллионах токенов. При некоторой правильной оптимизации мы можем достичь этого в течение «всего» 90 дней, используя 16 графических процессоров A100-40G 🚀🚀. Обучение началось 01 сентября 2023 года». Потеря взорвалась через пару сотен шагов. Как предложил Winglian, мы установили следующие значения в файле конфигурации: Во время обучения использовались следующие гиперпараметры: — скорость обучения: 0,0002 — trainbatchsize: 8 — evalbatchsize: 8 — начальное число: 42 — распределенный тип: multi-GPU — numdevices: 8 — градиентаккумуляция шагов: 2 — totaltrainbatchsize: 128 — totalevalbatchsize: 64 — оптимизатор: Адам с betas=(0.9,0.999) и epsilon=1e-05 — lrschedulertype: cosine — lrschedulerwarmupsteps: 100 — numepochs: 1 — mixprecision_training: Native AMP — Transformers 4.36.2 — Pytorch 2.0.1+cu117 — Наборы данных 2.15.0 — Токенизаторы 0.15.0
Модальности:
Генерация текста
Задача: Генерация текста
Автор: Tensoic
Теги: llama, generated_from_trainer, text-generation-inference, endpoints_compatible
Лайков: 8 | Загрузок: 10
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.