SmolTulu-1.7b-Reinforced
SmolTulu-1.7b-Reinforced — это версия SmolTulu-1.7b-Instruct для обучения с подкреплением и проверяемыми вознаграждениями (RLVR), которая использует конвейер постобучения AllenAI...
SmolTulu-1.7b-Reinforced — это версия SmolTulu-1.7b-Instruct для обучения с подкреплением и проверяемыми вознаграждениями (RLVR), которая использует конвейер постобучения AllenAI...
— Разработчик: abhi9ab — Лицензия: apache-2.0 — Точная настройка на основе модели: unsloth/DeepSeek-R1-Distill-Llama-8B Эта модель ламы была обучена...
SmolTulu-1.7b-Instruct — первая модель в серии моделей, предназначенных для использования конвейера постобучения Tulu 3 от AllenAI для настройки...