SultanR/SmolTulu-1.7b-Reinforced - Каталог нейросетей
Генерация текста

SultanR/SmolTulu-1.7b-Reinforced

Добавлено:
SultanR/SmolTulu-1.7b-Reinforced

SmolTulu-1.7b-Reinforced — это версия SmolTulu-1.7b-Instruct для обучения с подкреплением и проверяемыми вознаграждениями (RLVR), которая использует конвейер постобучения AllenAI Tulu 3. Эта модель набирает наивысший текущий балл как в IFEval, так и в GSM8k, сохраняя при этом чрезвычайно низкие уровни загрязнения в Tulu 3 и SmolLM2! Я перечислил наборы данных, используемые для выполнения обоих этапов RLVR, которые упоминаются в статье Tulu 3. Я провел эти оценки, используя оценочный код SmolLM2 для более объективного сравнения. В усиленной модели использовался PPO с проверяемыми вознаграждениями: — Базовая модель: SmolTulu-1.7b-Instruct — Скорость обучения: 3e-6 — Всего эпизодов обучения: 10M — Штрафной коэффициент PPO KL (бета): 0,05 — Максимальная длина последовательности/подсказки: 2048 жетонов — Длина ответа: 2048 жетонов — Размер пакета развертывания: 32 — Размер мини-пакета: 32 — Температура: 1.0 — Штрафное вознаграждение: -10,0 для неполных поколений — Оптимизация DeepSpeed Stage 3 — Включена контрольная точка градиента — Данные обучения: RLVR-GSM-MATH-IF-Mixed-Constraints — Множитель модели вознаграждения: 0,0 (чистые проверяемые вознаграждения) Как и любую другую модель Huggingface, просто запустите ее с помощью библиотеки преобразователей:

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: SultanR
Теги: llama, Tulu3, Smollm, SLMs, Small, Huggingface, Allenai, SFT
Лайков: 5  |  Загрузок: 10

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.