OLMo 2 1B DPO April 2025 является посттренированным вариантом модели allenai/OLMo-2-0425-1B-SFT, которая прошла контролируемую доработку на OLMo-специфическом варианте набора данных Tülu 3 и дальнейшее обучение DPO на этом наборе данных. Tülu 3 предназначен для выполнения самых разных задач в дополнение к чату, таких как МАТЕМАТИКА, GSM8K и IFEval. Ознакомьтесь с бумагой OLMo 2 или Tülu 3 для получения более подробной информации! OLMo — это серия открытых языковых моделей, предназначенных для изучения языковых моделей. Эти модели обучаются на наборе данных Dolma. Мы публикуем весь код, контрольные точки, журналы и связанные с ними детали обучения. — Тип модели: модель, обученная на комбинации общедоступных, синтетических и созданных человеком наборов данных. — Язык(и) (НЛП): В основном английский — Лицензия: Apache 2.0 — Точная настройка по модели: allenai/OLMo-2-0425-1B-SFT — Страница проекта: https://allenai.org/olmo — Репозитории: — Основная репозитория (обучение, вывод, тонкая настройка и т. д.): https://github.com/allenai/OLMo-core — Код оценки: https://github.com/allenai/olmes — Дальнейшая точная настройка кода: https://github.com/allenai/open-instruct — Бумага: https://arxiv.org/abs/2501.00656 — Демо: https://playground.allenai.org/ Если…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: allenai
Теги: olmo2, conversational, en, endpoints_compatible
Лайков: 4 | Загрузок: 9,445
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.