Метка: grpo - Страница 5 - Каталог нейросетей

Метка: grpo

Генерация текста

eth-nlped/TutorRL-7B

TutorRL-7B — это усовершенствованный вариант Qwen/Qwen2.5-7B-Instruct, обученный действовать как репетитор по математике, а не как решатель. Он соответствует...

Генерация текста

philschmid/qwen-2.5-3b-r1-countdown

Эта модель представляет собой доработанную версию Qwen/Qwen2.5-3B-Instruct. Он был обучен с использованием TRL и GRPO в игре Countdown....

Генерация текста

prithivMLmods/SmolLM2_135M_Grpo_Gsm8k

SmolLM2135MGrpo_Gsm8k доработан на базе SmolLM2-135M-Instruct. SmolLM2 демонстрирует значительные преимущества по сравнению со своим предшественником SmolLM1, особенно в следовании...

Генерация текста

ytu-ce-cosmos/Turkish-Gemma-4b-T1-Scout

Turkish-Gemma-4b-T1-Scout — это турецкая модель агента веб-поиска, предназначенная для многоэтапного поиска информации, генерации обоснованных ответов и рассуждений, дополненных...

Генерация текста

snap-stanford/humanlm-opinion

HumanLM — это симулятор пользователя, который генерирует ответы, отражающие основные состояния реальных пользователей (убеждения, эмоции, позиция, ценности, цели,...

Генерация текста

Melikshah/dc_ops_grpo_lora

Полный отчет о создании основанного на физике конвейера обучения RL для операций центра обработки данных — от индивидуальной...

Генерация текста

OpenMOSS-Team/SciJudge-30B

SciJudge-Qwen3-30B — это усовершенствованная языковая модель для оценки научных статей. Учитывая метаданные двух научных статей (название, аннотация, дата...

Генерация текста

Intel/deepmath-v1

DeepMath — это математическая модель рассуждения с 4B параметрами, которая сочетает в себе точно настроенный LLM с изолированным...

Генерация текста

hooman650/MedQwen3B-Reasoner

MedQwen3B-Reasoner — это специализированный вариант Qwen2.5-3B-Instruct, настроенный с использованием GRPO для достижения успеха в рассуждениях в медицинской области,...

Генерация текста

Locutusque/Thespis-Llama-3.1-8B

Описание: Семейство языковых моделей Thespis предназначено для повышения эффективности ролевых игр посредством рассуждений, вдохновленных Теорией разума. Thespis-Llama-3.1-8B —...