> 9B агентская модель, обученная на основе взаимодействий, сгенерированных в средах выполнения, развернутых в реальных рабочих процессах офиса и разработки программного обеспечения. O2-9B-Preview был оценен по одиннадцати тестам рассуждений, использования инструментов и кодирования. Мы сообщаем о его одноразмерной базе Qwen3.5-9B наряду с более крупными контрольными точками O2 и кросс-масштабными эталонными моделями. Баллы показаны по их оригинальным шкалам, и чем выше, тем лучше. Среднее значение — это невзвешенное среднее из одиннадцати отображаемых контрольных показателей. Reasoning Tool Use Coding Model Avg GPQA HMMT2025 HMMT2026 bfcl v3 bfcl v4 Tau2Retail Tau2Airline Tau2Telecom Tau3Banking AgentBench OS SWE-Verified DeepSeekV4 Flash(284b-a13b) 71.84 90.40 93.33 87.88 48.50 57.60 85.09 90.00 95.61 22.68 50.00 69.20 MiniMax-M2.5 62.33 85.9 75.60 73.70 37.00 49.27 79.24 70.67 90.94 8.93 41.00 73.40 Qwen3.5-397B-A17B 70.56 86.9 90.00 81.80 58.90 63.66 87.13 85.33 93.57 12.37 51.30 65.20 Qwen3.5-27B 69.97 86.04 90.00 81.80 58.10 62.15
Модальности:
Генерация текста
Области применения:
Генерация кода Логика и рассуждение Диалог / чат Вызов функций (Tool use) Агенты
Задача: Генерация текста
Автор: ant-intl
Теги: qwen3_5, agents, tool-use, coding, reasoning, runtime-learning, on-policy-distillation, conversational
Лайков: 4 | Загрузок: 604
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.