> Это адаптер LoRA, а не отдельная модель. Для его использования вам понадобится базовая модель Qwen/Qwen3-30B-A3B-Instruct-2507. ~51 МБ весов адаптера; вывод загружает его поверх базы 30B через peft. Обучена политике рекурсивной языковой модели (RLM) в смешанном пакете сред с длинным контекстом с использованием RL. Конфигурация адаптера: LoRA, ранг r=32, loraalpha=64, loradropout=0.0, цели qproj, kproj, vproj, oproj — см. адаптерconfig.json`. Этот адаптер предназначен для загрузки внутри жгута RLM из alexzhang13/rlm, где модель выступает в качестве корневого LM в рекурсии, управляемой Python-REPL, которая выполняет подвызовы llmquery/rlmquery в длинных контекстах. Это не модель прямого чата — она ожидает подсказки системы RLM и поддержки REPL. Глубина рекурсии при выводе не ограничена 1. Модель была обучена на глубине = 1 (подвызовы сворачиваются в llmquery), но базовая каноническая обвязка RLM поддерживает произвольную глубину рекурсии, и адаптер можно использовать с глубиной>1` во время вывода. Некоторые флаги времени вывода (подсказки режима оркестратора, пользовательские прологи для каждого окружения и т. д.) должны быть установлены в соответствии с условиями во время обучения. Точный список флагов будет уточнен позже — будет задокументирован здесь после завершения. Оценивается по сравнению с…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: mit-oasys
Теги: peft, lora, adapter, rlm, long-context, qwen3, reinforcement-learning
Лайков: 9 | Загрузок: 40
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.