Построен на базе Qwen/Qwen-AgentWorld-35B-A3B. Идеально настроен для действий. Agent-R2 — это модель слияния нескольких LoRA, построенная на Qwen/Qwen-AgentWorld-35B-A3B, объединяющая 7 специализированных адаптеров LoRA в один единый мощный агент: > Результат: модель, которая думает, действует и общается — не просто чат-бот, а агент. Agent-R2 создан с использованием двухэтапного подхода SFT + Distillation: каждый адаптер LoRA был обучен посредством SFT на специализированном наборе данных: Почему SFT + Distillation? — SFT учит модель, что делать, с помощью контролируемых примеров. — Дистилляция (посредством объединения LoRA) переносит знания из нескольких доменов учителей в одну модель ученика. — Результат: одна модель, которая унаследовала глубину рассуждений от Opus, теплоту разговора от Fable и точность инструментов от AgentWorld — без необходимости RL/CPT. Каждый LoRA обучался независимо на тщательно подобранных наборах данных, а затем объединялся в оптимизированных соотношениях посредством итеративного тестирования на тестах AgentWorld. Результатом является модель, в которой каждая способность дополняет другие — не конкурируя, а сотрудничая. Модель работает напрямую с vLLM из HuggingFace Safetensors — преобразование AWQ/GPTQ не требуется: > 💡 Параметры вывода: > — BF16 Safetensors — загрузка напрямую с помощью…
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат Вызов функций (Tool use)
Задача: Генерация текста
Автор: hotdogs
Теги: gguf, qwen3_5_moe_text, qwen, moe, mixture-of-experts, agent, agent-world, tool-use
Лайков: 6 | Загрузок: 2,810
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.