Qwen3.5-Trading-Agent
Модель Qwen3.5-35B-A3B Mixture of Experts, настроенная GRPO, обученная на данных онлайн-торговли Solana и прогнозируемых рыночных сигналах. Создан для...
Модель Qwen3.5-35B-A3B Mixture of Experts, настроенная GRPO, обученная на данных онлайн-торговли Solana и прогнозируемых рыночных сигналах. Создан для...
Trinity-Mini-DrugProt-Think RLVR (GRPO) + LoRA после обучения на Arcee Trinity Mini для классификации отношений DrugProt. 📝 Отчет | ...
Эта модель представляет собой доработанную версию deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B. Он был обучен с использованием TRL. Эта модель была обучена с...
Современная генерация кода Luau посредством обучения с подкреплением после обучения. Усовершенствованная версия Luau-Devstral-24B-Instruct-v0.1, улучшенная с помощью Dr. GRPO...
Эта модель была точно настроена с помощью GRPO с использованием API Pangram в качестве функции вознаграждения. Прочтите сообщение...
— Разработчик: Jlonge4 — Лицензия: apache-2.0 — Точная настройка на основе модели: unsloth/phi-4-bnb-4bit Эта модель Llama была обучена...
Эта модель представляет собой доработанную версию Qwen/Qwen2.5-1.5B-Instruct. Он был обучен с использованием TRL. Желаемый ввод — абзацы неструктурированного...
Эта модель представляет собой доработанную версию Qwen/Qwen2.5-1.5B-Instruct. Он был обучен с использованием TRL. Эта модель была обучена с...
> Обновление: новая версия доступна по адресу SciJudge-4B-2605. Мы рекомендуем использовать новую версию для текущих экспериментов и сравнений....
AREaL-SEA-235B-A22B — это многоходовой интерактивный агент, использующий инструменты, доработанный на основе Qwen3-235B-A22B-Thinking-2507 с использованием SFT + обучение с...