SciJudge-4B-2605
SciJudge-4B-2605 — это модель Qwen3-4B-Instruct-2507, специально настроенная для оценки научных статей. Учитывая названия, аннотации и даты публикации двух...
SciJudge-4B-2605 — это модель Qwen3-4B-Instruct-2507, специально настроенная для оценки научных статей. Учитывая названия, аннотации и даты публикации двух...
Модель Qwen3.5-35B-A3B Mixture of Experts, настроенная GRPO, обученная на данных онлайн-торговли Solana и прогнозируемых рыночных сигналах. Создан для...
Trinity-Mini-DrugProt-Think RLVR (GRPO) + LoRA после обучения на Arcee Trinity Mini для классификации отношений DrugProt. 📝 Отчет | ...
Эта модель представляет собой доработанную версию deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B. Он был обучен с использованием TRL. Эта модель была обучена с...
Современная генерация кода Luau посредством обучения с подкреплением после обучения. Усовершенствованная версия Luau-Devstral-24B-Instruct-v0.1, улучшенная с помощью Dr. GRPO...
Эта модель была точно настроена с помощью GRPO с использованием API Pangram в качестве функции вознаграждения. Прочтите сообщение...
— Разработчик: Jlonge4 — Лицензия: apache-2.0 — Точная настройка на основе модели: unsloth/phi-4-bnb-4bit Эта модель Llama была обучена...
Эта модель представляет собой доработанную версию Qwen/Qwen2.5-1.5B-Instruct. Он был обучен с использованием TRL. Желаемый ввод — абзацы неструктурированного...
Эта модель представляет собой доработанную версию Qwen/Qwen2.5-1.5B-Instruct. Он был обучен с использованием TRL. Эта модель была обучена с...
> Обновление: новая версия доступна по адресу SciJudge-4B-2605. Мы рекомендуем использовать новую версию для текущих экспериментов и сравнений....