Эта модель представляет собой доработанную версию Minbyul/biomistral-7b-wo-kqolden-iter-dpo-step2 в бинаризованном наборе данных HuggingFaceH4/ultrafeedback. Он достигает следующих результатов в наборе оценок: — Потеря: 0,6829 — Награды/выбрано: -0,0502 — Награды/отклонено: -0,0800 — Награды/точность: 0,6300 — Награды/прибыли: 0,0298 — Журналы/отклонены: -60,1185 — Журналы/выбраны: -40,1264 — Логиты/отклонено: -1,5228 — Логиты/выбрано: -0,8710 Во время обучения использовались следующие гиперпараметры: — скорость обучения: 1e-07 — trainbatchsize: 8 — evalbatchsize: 8 — начальное число: 42 — распределенный тип: multi-GPU — numdevices: 4 -gradientaccumulationsteps: 2 — totaltrainbatchsize: 64 — totalevalbatchsize: 32 — оптимизатор: Адам с betas=(0.9,0.999) и epsilon=1e-08 — lrschedulertype: cosine — lrschedulerwarmupratio: 0.1 — num_epochs: 1 — Transformers 4.39.0.dev0 — Pytorch 2.1.2 — Наборы данных 2.14.6 — Токенизаторы 0.15.2
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: dmis-lab
Теги: mistral, alignment-handbook, trl, dpo, generated_from_trainer, conversational, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 10
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.