Эта модель представляет собой доработанную версию HuggingFaceH4/zephyr-7b-gemma-sft-v0.1 в наборе данных argilla/dpo-mix-7k. Эта модель взята из статьи «Обнаружение алгоритмов оптимизации предпочтений с помощью и для больших языковых моделей». См. кодовую базу для ее создания здесь: https://github.com/SakanaAI/DiscoPOP. Эта модель идентична в обучении HuggingFaceH4/zephyr-7b-gemma-v0.1, за исключением того, что вместо использования прямой оптимизации предпочтений (DPO) она использует DiscoPOP. DiscoPOP — это наш алгоритм оптимизации обнаруженных предпочтений, который определяется следующим образом: Во время обучения использовались следующие гиперпараметры: — скорость обучения: 5e-07 — trainbatchsize: 2 — evalbatchsize: 4 — начальное число: 42 — распределенный тип: multi-GPU — numdevices: 8 -gradientaccumulationsteps: 8 — totaltrainbatchsize: 128 — totalevalbatchsize: 32 — оптимизатор: Адам с betas=(0.9,0.999) и epsilon=1e-08 — lrschedulertype: cosine — lrschedulerwarmupratio: 0.1 — num_epochs: 2 — Трансформаторы 4.40.1 — Pytorch 2.1.2+cu121 — Наборы данных 2.19.0 — Токенизаторы 0.19.1
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: SakanaAI
Теги: gemma, alignment-handbook, generated_from_trainer, conversational, text-generation-inference, endpoints_compatible
Лайков: 36 | Загрузок: 25
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.