Сообщение в блоге: https://microsoft.github.io/debug-gym/blog/2025/10/bug-pilot | FrogMini построен на архитектуре преобразователя Qwen3-14B с максимальной длиной контекста 64 тыс. токенов. В модели используются многоэтапные рабочие процессы отладки и сложное анализ кода. В отличие от LLM общего назначения, FrogMini специализируется на задачах разработки программного обеспечения. Процедура обучения сводится к контролируемой точной настройке (SFT) на успешных траекториях отладки, созданных сильной моделью учителя (например, Клод-сонет-4). Эти траектории были получены на основе сочетания реальных и синтетических наборов данных об ошибках (например, R2E-Gym, SWE-Smith) и высококачественных ошибок FeatAdd, созданных с помощью платформы BugPilot. Такой подход гарантирует, что модель изучает реалистичные шаблоны отладки, а не тривиальные исправления. По сравнению с другими моделями с открытым весом, FrogMini выделяется эффективностью своих параметров, достигая самых современных производительностей при проверке SWE-Bench (Pass @ 1: 45,0%) с 14B параметрами, а также акцентом на реалистичные сценарии многофайловой отладки, что делает его более надежным для реальных сред кодирования. Модель была обучена для обеспечения соответствия предполагаемому поведению, обеспечивая точную идентификацию ошибок и…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: microsoft
Теги: qwen3, conversational, text-generation-inference, endpoints_compatible
Лайков: 61 | Загрузок: 1,632
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.