Метка: grpo - Каталог нейросетей

Метка: grpo

Генерация текста

OpenMOSS-Team/SciJudge-4B-2605

SciJudge-4B-2605 — это модель Qwen3-4B-Instruct-2507, специально настроенная для оценки научных статей. Учитывая названия, аннотации и даты публикации двух...

Генерация текста

infraxa/Qwen3.5-Trading-Agent

Модель Qwen3.5-35B-A3B Mixture of Experts, настроенная GRPO, обученная на данных онлайн-торговли Solana и прогнозируемых рыночных сигналах. Создан для...

Генерация текста

Thrillcrazyer/Qwen-1.5B_THIP

Эта модель представляет собой доработанную версию deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B. Он был обучен с использованием TRL. Эта модель была обучена с...

Генерация текста

TorpedoSoftware/Luau-Devstral-24B-Instruct-v0.2

Современная генерация кода Luau посредством обучения с подкреплением после обучения. Усовершенствованная версия Luau-Devstral-24B-Instruct-v0.1, улучшенная с помощью Dr. GRPO...

Генерация текста

trentmkelly/Llama-3.1-8b-Instruct-Pangram

Эта модель была точно настроена с помощью GRPO с использованием API Pangram в качестве функции вознаграждения. Прочтите сообщение...

Генерация текста

grounded-ai/phi4-r1-guard

— Разработчик: Jlonge4 — Лицензия: apache-2.0 — Точная настройка на основе модели: unsloth/phi-4-bnb-4bit Эта модель Llama была обучена...

Генерация текста

OpenMOSS-Team/SciJudge-4B

> Обновление: новая версия доступна по адресу SciJudge-4B-2605. Мы рекомендуем использовать новую версию для текущих экспериментов и сравнений....