Эта модель представляет собой доработанную версию Minbyul/selfbiorag-7b-wo-kqagolden-iter-dpo-step3, отфильтрованную по набору данных HuggingFace MedLFQA (без kqolden). В наборе оценок он достигает следующих результатов: — Потеря: 0,6766 — Награды/выбрано: -0,0828 — Награды/отклонено: -0,1144 — Награды/точность: 0,6319 — Награды/прибыли: 0,0316 — Журналы/отклонены: -98,9601 — Журналы/выбраны: -79,1920 — Логиты/отклонено: -1,2073 — Логиты/выбрано: -1,1930 Во время обучения использовались следующие гиперпараметры: — скорость обучения: 5e-07 — trainbatchsize: 8 — evalbatchsize: 8 — начальное число: 42 — распределенный тип: multi-GPU — numdevices: 4 -gradientaccumulationsteps: 2 — totaltrainbatchsize: 64 — totalevalbatchsize: 32 — оптимизатор: Адам с betas=(0.9,0.999) и epsilon=1e-08 — lrschedulertype: cosine — lrschedulerwarmupratio: 0.1 — num_epochs: 1 — Transformers 4.39.0.dev0 — Pytorch 2.1.2 — Наборы данных 2.14.6 — Токенизаторы 0.15.2
Модальности:
Генерация текста
Задача: Генерация текста
Автор: dmis-lab
Теги: llama, alignment-handbook, trl, dpo, generated_from_trainer, en, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 92
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.