Модель, основанная на выполнении, для эволюционного машинного обучения и автоисследований 📄 Бумага • 🌐 Проект • 💻 Код • 🤗 Модели • 🧩 Задачи • 📚 SFT Traces Frontis-MA1-30B — это сопутствующая исследовательская модель с открытым весом 30B, выпущенная вместе с OpenMLE, системой для обучения, основанной на выполнении метаэволюция в машинном обучении (MLE). Начиная с Qwen3-30B-A3B-Thinking-2507, мы применяем контролируемую точную настройку и обучение с подкреплением, основанные на выполнении, так что модель изучает четыре многократно используемых оператора преобразования программы: — Черновик — создает полное начальное решение; — Улучшить — усовершенствовать родительскую программу, используя ее оценку и данные выполнения; — Debug — исправить неверный или ошибочный код; — Кроссовер — рекомбинируйте полезные элементы из двух родительских решений. Во время вывода OpenMLE-Evo объединяет эти операторы в цикл поиска с большим горизонтом. Таким образом, Frontis-MA1 является одновременно продуктом обучающего стека OpenMLE и моделью, которая управляет его эволюционным поиском. — Пост-тренинг, ориентированный на исполнение. Примеры SFT и вознаграждения RL создаются на основе программ, выполняемых в изолированных изолированных изолированных программных средах MLE. — Обучаемые эволюционные операторы.…
Модальности:
Генерация текста
Области применения:
Генерация кода Диалог / чат
Задача: Генерация текста
Автор: FrontisAI
Теги: qwen3_moe, openmle, frontis-ma1, machine-learning-engineering, autoresearch, agent, coding, qwen3
Лайков: 5 | Загрузок: 74
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.