Мы представляем Tongyi DeepResearch, агентную модель большого языка с 30 миллиардами параметров, из которых на каждый токен активируется только 3 миллиарда. Модель, разработанная Tongyi Lab, специально предназначена для долгосрочных и глубоких задач по поиску информации. Tongyi-DeepResearch демонстрирует современную производительность в ряде тестов агентного поиска, включая Humanity’s Last Exam, BrowserComp, BrowserComp-ZH, WebWalkerQA, GAIA, xbench-DeepSearch и FRAMES. — ⚙️ Полностью автоматизированный конвейер синтеза данных: мы разрабатываем высокомасштабируемый конвейер синтеза данных, который является полностью автоматическим и обеспечивает предварительное обучение агентов, контролируемую тонкую настройку и обучение с подкреплением. — 🔄 Масштабное непрерывное предварительное обучение на агентских данных: использование разнообразных высококачественных данных взаимодействия агентов для расширения возможностей модели, поддержания ее актуальности и повышения производительности рассуждений. — 🔁 Сквозное обучение с подкреплением: мы применяем подход RL, строго соответствующий политике, на основе индивидуальной структуры оптимизации групповой относительной политики, с градиентами политик на уровне токенов, оценкой преимущества с исключением одного и выборочной фильтрацией отрицательных выборок для стабилизации обучения в…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Alibaba-NLP
Теги: qwen3_moe, conversational, en, endpoints_compatible
Лайков: 802 | Загрузок: 22,564
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.