Эта модель представляет собой точно настроенную версию allenai/Olmo-3.1-32B-Instruct, использующую humanline dpo для улучшения возможностей письма, ролевой игры и чата. Шаблон Chatml Я рекомендую .7 temp и (опционально) 1.05 rep pen. nvidia/HelpSteer3 для поддержания общих возможностей и повышения производительности чата. ConicCat/Lamp-P-Предлагается для улучшения прозы и уменьшения уклона. * Набор данных предпочтений ролевой игры человека с быстрым / синтетическим ответом на основе C2. V0 > V1: Изменение структуры данных предпочтений для улучшения разницы между выбранными и отклоненными ответами. V1 > V2: Более оптимальные гиперпараметры; снижение lr и увеличение bsz обеспечивают стабильную тренировку с более низким уровнем бета.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: ConicCat
Теги: tensorboard, olmo3, dpo, trl, conversational, endpoints_compatible
Лайков: 4 | Загрузок: 13
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.