Marco-Mini-Global-Base — это расширенный вариант Marco-Mini-Base, который масштабирует лингвистический охват с 29 до 64 языков. Это очень редкая многоязычная языковая модель Mixture-of-Experts (MoE) из семейства Marco-MoE, разработанная Alibaba International Digital Commerce. Он активирует только 0,86 млрд из 17,3 млрд параметров (коэффициент активации 5%) на каждый токен, поддерживая при этом 64 языка, что демонстрирует, что архитектура MoE обеспечивает масштабируемое расширение языка без вмешательства, типичного для плотных моделей. Marco-Mini-Global имеет ту же архитектуру, что и Marco-Mini-Base: преобразователь только для декодера с разреженными слоями MoE, заменяющими стандартные слои FFN, обновленный из Qwen3-0.6B-Base с использованием мелкозернистого разделения подматриц в сочетании с Drop-Upcycling. Marco-Mini-Global-Base ответвляется от контрольной точки этапа 2 Marco-Mini-Base и повторно калибрует смеси данных на этапах 3 и 4 для интеграции корпусов предварительного обучения для 35 новых языков. Всего он был обучен на токенах 5,5Т. Четырехэтапная учебная программа имеет ту же структуру, что и Marco-Mini-Base: 1. Этап 1 (токены 0–2,4T): Базовое обучение — высококачественные данные на английском языке (Nemotron-CC-v2), рассуждения и…
Модальности:
Генерация текста
Области применения:
Диалог / чат Мультиязычность
Задача: Генерация текста
Автор: ATH-MaaS
Теги: qwen3_moe, moe, mixture-of-experts, multilingual, upcycling, conversational, en, zh
Лайков: 7 | Загрузок: 15
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.