Данная модель представляет собой доработанную (embeddings, lm head) версию TheBloke/Llama-2-7B-fp16 на русском датасете (33ГБ). На оценочном наборе он достигает следующих результатов: — Потеря: 2,7569 — Точность: 0,4617 Версия инструкции: https://huggingface.co/rccmsu/ruadaptsaiga27b_v0.1 Русская адаптация LLaMa-2-7B путем замены токенизатора. Статья: Тихомиров М., Чернышев Д. Влияние токенизации на русскую адаптацию LLaMa // Препринт arXiv arXiv:2312.02598. – 2023. Во время обучения использовались следующие гиперпараметры: — скорость обучения: 2e-05 — trainbatchsize: 6 — evalbatchsize: 6 — начальное число: 42 — распределенный тип: multi-GPU — numdevices: 16 — градиентаккумуляция шагов: 2 — общий размер поезда: 192 — общий размер evalbatchsize: 96 — оптимизатор: Адам с betas=(0.9,0.95) и epsilon=1e-05 — lrschedulertype: линейный — numepochs: 2.0 — Трансформаторы 4.34.0 — Pytorch 2.0.1+cu118 — Наборы данных 2.14.5 — Токенизаторы 0.14.1
Модальности:
Генерация текста
Задача: Генерация текста
Автор: rccmsu
Теги: llama, ru, text-generation-inference, endpoints_compatible
Лайков: 6 | Загрузок: 9
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.