tanliboy/lambda-qwen2.5-32b-dpo-test - Каталог нейросетей
Генерация текста

tanliboy/lambda-qwen2.5-32b-dpo-test

Добавлено:
tanliboy/lambda-qwen2.5-32b-dpo-test

Эта модель представляет собой доработанную версию Qwen/Qwen2.5-32B-Instruct для набора данных tanliboy/orcadpopairs. Он достигает следующих результатов в наборе оценок: — Потеря: 0,0003 — Награды/выбрано: -10,1618 — Награды/отклонено: -26,1150 — Награды/точность: 1,0 — Награды/прибыль: 15,9532 — Журналы/отклонены: -3049,5271 — Журналы/выбраны: -1372,8903 — Логиты/отклонено: -0,3154 — Логиты/выбрано: -0,0600 Во время обучения использовались следующие гиперпараметры: — скорость обучения: 5e-07 — trainbatchsize: 2 — evalbatchsize: 2 — начальное число: 42 — распределенный тип: multi-GPU — numdevices: 8 -gradientaccumulationsteps: 2 — totaltrainbatchsize: 32 — totalevalbatchsize: 16 — оптимизатор: Адам с betas=(0.9,0.999) и epsilon=1e-08 — lrschedulertype: cosine — lrschedulerwarmupratio: 0,1 — num_epochs: 1 — Трансформаторы 4.44.2 — Pytorch 2.4.0+cu121 — Наборы данных 2.19.1 — Токенизаторы 0.19.1

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: tanliboy
Теги: tensorboard, qwen2, alignment-handbook, trl, dpo, generated_from_trainer, conversational, text-generation-inference
Лайков: 5  |  Загрузок: 14

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.