После первоначального выпуска моделей OLMo-2 мы поняли, что модели после обучения не имеют общей логики предварительной токенизации, которую используют базовые модели. В результате мы обучили новые постобученные модели. Новые модели доступны под теми же названиями, что и исходные модели, однако мы сделали старые модели доступными с постфиксом «-preview». См. OLMo 2 Preview Post-trained Models для сбора устаревших моделей. OLMo 2 7B Instruct, ноябрь 2024 г. — это постобученный вариант модели OLMo-2 7B от ноября 2024 г., который прошел контролируемую тонкую настройку на специальном для OLMo варианте набора данных Tülu 3, дальнейшее обучение DPO на этом наборе данных и, наконец, обучение RLVR с использованием этих данных. Tülu 3 предназначен для решения самых современных задач, помимо чата, таких как MATH, GSM8K и IFEval. Для получения более подробной информации ознакомьтесь с бумагой OLMo 2 или Tülu 3! OLMo — это серия открытых языковых моделей, предназначенная для изучения языковых моделей. Эти модели обучаются на наборе данных Dolma. Мы публикуем весь код, контрольные точки, журналы (скоро) и связанные с ними подробности обучения. Основные модели, выпущенные в этой партии, включают следующее: — Тип модели: A…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: allenai
Теги: olmo2, conversational, en, endpoints_compatible
Лайков: 48 | Загрузок: 18,457
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.