dongguanting/Qwen3-14B-ARPO-DeepSearch - Каталог нейросетей
Генерация текста

dongguanting/Qwen3-14B-ARPO-DeepSearch

Добавлено:
dongguanting/Qwen3-14B-ARPO-DeepSearch

Модель контрольной точки ARPO выпущена для бумажной оптимизации агентной усиленной политики. Масштабное обучение с подкреплением и проверяемыми вознаграждениями (RLVR) продемонстрировало свою эффективность в использовании потенциала больших языковых моделей (LLM) для одноходовых задач рассуждения. В реалистичных сценариях рассуждения студенты LLM часто могут использовать внешние инструменты для помощи в процессах решения задач. Однако текущие алгоритмы RL неадекватно балансируют внутренние способности моделей к долгосрочному рассуждению и их умение работать с многооборотными инструментами. Чтобы восполнить этот пробел, мы предлагаем Agentic Reinforced Policy Optimization (ARPO), новый алгоритм агентного RL, предназначенный для обучения многоходовых агентов на основе LLM. В ходе предварительных экспериментов мы наблюдаем, что LLM имеют тенденцию демонстрировать крайне неопределенное поведение, характеризующееся увеличением энтропии распределения сгенерированных токенов сразу после взаимодействия с внешними инструментами. Руководствуясь этим наблюдением, ARPO включает основанный на энтропии механизм адаптивного развертывания, динамически балансирующий выборку глобальной траектории и выборку на уровне шагов, тем самым способствуя исследованию на этапах с высокой неопределенностью после использования инструмента.…

Модальности:
Генерация текста

Области применения:
Диалог / чат Вызов функций (Tool use)


Задача: Генерация текста
Автор: dongguanting
Теги: qwen3, agent, tool-use, reinforcement-learning, qwen, llm, conversational, text-generation-inference
Лайков: 5  |  Загрузок: 71

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.