AReaL-SEA-235B-A22B
AREaL-SEA-235B-A22B — это многоходовой интерактивный агент, использующий инструменты, доработанный на основе Qwen3-235B-A22B-Thinking-2507 с использованием SFT + обучение с...
AREaL-SEA-235B-A22B — это многоходовой интерактивный агент, использующий инструменты, доработанный на основе Qwen3-235B-A22B-Thinking-2507 с использованием SFT + обучение с...
Этот адаптер LoRA добавляет в Qwen/Qwen3-4B-Thinking-2507 возможности осведомленности о выполнении. Вдохновленный исследованием Meta CWM (Code World Model), он...
TutorRL-7B-think — это усовершенствованный вариант Qwen/Qwen2.5-7B-Instruct, обученный действовать как репетитор по математике, а не как решатель. Он соответствует...
Учитывая список событий и приоритетов, мы просим модель создать расписание, которое максимизирует общую продолжительность выбранных событий, взвешенных по...
Это тонкая настройка HuggingFaceTB/SmolLM2-135M-Instruct с использованием GRPO на mlabonne/smoltldr (2 тыс. образцов). Он предназначен для обобщения сообщений Reddit...
Metin/LLaMA-3-8B-GRPO-Finance-Math-TR — это версия ytu-ce-cosmos/Turkish-Llama-8b-DPO-v0.1, обученная RL. Он обучается вопросам финансовой математики с использованием метода GRPO. — Базовая...
Эта модель представляет собой доработанную версию Qwen/Qwen2.5-Math-7B в наборе данных DigitalLearningGmbH/MATH-lighteval. Он был обучен с использованием TRL. Эта...
ArrowCanaria-Llama-8B-RL-v0.1 は、ArrowCanaria-Llama-8B-SFT-v0.1 に対して RLHF(Обучение с подкреплением у человека Обратная связь) SFTモデルは高品質なデータで学習されていますが、モデルの応答が「データに含まれる平Награда Модель)品質や知識応答の正確性・分かりやすさを、SFTの水準からさらに引き上げています。強化学習アルゴリズムには GRPO (Оптимизация относительной политики группы)を採用し、DAPO損失関数による安定した最適化を実現しています。相談応答と知識応答の2フェーズで段階的にRLHFを行うことで、SFTで獲得した雑談・RP・キャラクター対話能力を保持しつつ、応答の質を選択的に向上させています。 —...
InfraMind — это языковая модель с параметрами 0,5 млрд, настроенная для генерации инфраструктуры как кода (IaC) с использованием...
Granite 4.0 Micro (≈3B) предназначен для медицинского образования и обучения. Рецепт: JEPA-LLM SFT на medmcqa-hard + увеличение персон...