TutorRL-7B
TutorRL-7B — это усовершенствованный вариант Qwen/Qwen2.5-7B-Instruct, обученный действовать как репетитор по математике, а не как решатель. Он соответствует...
TutorRL-7B — это усовершенствованный вариант Qwen/Qwen2.5-7B-Instruct, обученный действовать как репетитор по математике, а не как решатель. Он соответствует...
Эта модель представляет собой доработанную версию Qwen/Qwen2.5-3B-Instruct. Он был обучен с использованием TRL и GRPO в игре Countdown....
SmolLM2135MGrpo_Gsm8k доработан на базе SmolLM2-135M-Instruct. SmolLM2 демонстрирует значительные преимущества по сравнению со своим предшественником SmolLM1, особенно в следовании...
Turkish-Gemma-4b-T1-Scout — это турецкая модель агента веб-поиска, предназначенная для многоэтапного поиска информации, генерации обоснованных ответов и рассуждений, дополненных...
HumanLM — это симулятор пользователя, который генерирует ответы, отражающие основные состояния реальных пользователей (убеждения, эмоции, позиция, ценности, цели,...
Полный отчет о создании основанного на физике конвейера обучения RL для операций центра обработки данных — от индивидуальной...
SciJudge-Qwen3-30B — это усовершенствованная языковая модель для оценки научных статей. Учитывая метаданные двух научных статей (название, аннотация, дата...
DeepMath — это математическая модель рассуждения с 4B параметрами, которая сочетает в себе точно настроенный LLM с изолированным...
MedQwen3B-Reasoner — это специализированный вариант Qwen2.5-3B-Instruct, настроенный с использованием GRPO для достижения успеха в рассуждениях в медицинской области,...
Описание: Семейство языковых моделей Thespis предназначено для повышения эффективности ролевых игр посредством рассуждений, вдохновленных Теорией разума. Thespis-Llama-3.1-8B —...