Huihui-MoE-12B-A4B-abliterated — это языковая модель Mixture of Experts (MoE), разработанная huihui.ai и построенная на основе удаленной базовой модели huihui-ai/Qwen3-4B. Он расширяет стандартную архитектуру Transformer, заменяя уровни MLP уровнями MoE, каждый из которых содержит 4 эксперта, для достижения высокой производительности и эффективного вывода. Модель предназначена для задач обработки естественного языка, включая генерацию текста, ответы на вопросы и диалоговые приложения. Эта модель объединяет четыре аблированные модели и, возможно, она сможет достичь производительности всех аблированных моделей? Это всего лишь тест. Еще одной возможностью является исследование слияния различных проявлений моделей одного типа. — Архитектура: модель Qwen3MoeForCausalLM с 4 экспертами на уровень (numexperts=4), активация 1 эксперта на каждый токен (numexpertspertok=1). — Всего параметров: ~12 миллиардов (12Б) — Активированные параметры: ~4 миллиарда (4Б) во время вывода, что сопоставимо с Qwen3-4B-удаленным — Разработчик: huihui.ai — Дата выпуска: июнь 2025 г. — Лицензия: наследует лицензию базовой модели Qwen3 (apache-2.0) — Базовая модель: Qwen3-4B-удаленная — Преобразование: Модель копирует вложения, самостоятельное внимание, и…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: huihui-ai
Теги: qwen3_moe, moe, conversational, endpoints_compatible
Лайков: 11 | Загрузок: 46
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.