Huihui-MoE-1B-A0.6B-SFT — это языковая модель смеси экспертов (MoE), разработанная huihui.ai, построенная на базовой модели huihui-ai/Huihui-MoE-1B-A0.6B. Модель предназначена для задач обработки естественного языка, включая генерацию текста, ответы на вопросы и разговорные приложения. — Архитектура: модель Qwen3MoeForCausalLM с 3 экспертами на слой (numexperts=3), активация 1 эксперта на токен (numexpertspertok=1). — Общие параметры: ~1,1 миллиарда (1B) — Активированные параметры: ~0,62 миллиарда (0,6B) во время вывода, сопоставимые с huihui-ai/Huihui-MoE-1B-A0.6B — Разработчик: huihui.ai — Дата выпуска: Июнь 2025 — Лицензия: Наследует лицензию базовой модели Qwen3 (apache-2.0) Эта модель получена путем полной настройки параметров. Для каждого набора данных(max_length=1024) настроены только соответствующие эксперты. — Кодирование: первые 20 000 строк набора данных nvidia/OpenCodeReasoning за 1 эпоху. — Математика: весь набор данных unsloth/OpenMathReasoning-mini за 1 эпоху. — Медицинский:первые 20 тыс. строк набора данных FreedomIntelligence/medical-o1-reasoning-SFT за 1 эпоху. — Генерация текста: статьи, диалоги и творческое письмо. — Ответ на вопрос: Поиск информации и разрешение запросов. -…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: huihui-ai
Теги: qwen3_moe, moe, conversational, endpoints_compatible
Лайков: 4 | Загрузок: 23
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.