Marco-Mini-Instruct — это настроенный на инструкции вариант Marco-Mini-Base, очень редкой многоязычной языковой модели Mixture-of-Experts (MoE) из семейства Marco-MoE, разработанной Alibaba International Digital Commerce. Он активирует только 0,86 млрд из 17,3 млрд параметров (коэффициент активации 5%) на каждый токен. Marco-Mini-Instruct достигает наилучшей средней производительности по английским, многоязычным общим и многоязычным культурным тестам по сравнению с моделями инструкций с активированными параметрами до 12B, включая Qwen3-4B-Instruct, Ministral3-8B-Instruct, Gemma3-12B-Instruct, LFM2-24B-A2B и Granite4-Small-Instruct. Marco-Mini-Instruct имеет ту же архитектуру, что и Marco-Mini-Base: преобразователь только для декодера с редкими слоями MoE, заменяющими стандартные слои FFN, переработанный из Qwen3-0.6B-Base с использованием мелкозернистого разделения подматриц в сочетании с Drop-Upcycling. Marco-Mini-Instruct обучается из Marco-Mini-Base с использованием двухэтапного конвейера постобучения, реализованного с помощью инфраструктуры SLIME: — Продолжительность: ~ 24 часа на 64 графических процессорах — Шаги: ~ 4000 (1 эпоха) — Скорость обучения: 1e-5 с косинусным распадом до 1e-6 — Размер пакета: 512, длина контекста 8 192 токена Источники данных: 1. Общие…
Модальности:
Генерация текста
Области применения:
Диалог / чат Мультиязычность Следование инструкциям
Задача: Генерация текста
Автор: AIDC-AI
Теги: qwen3_moe, moe, mixture-of-experts, multilingual, upcycling, on-policy distillation, conversational, en
Лайков: 28 | Загрузок: 674
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.