50% Экспертная обрезка — 80B → 24 ГБ при сохранении 93,5% оригинального качества. Половина всех экспертов MoE удалена из Qwen3-Coder-Next с использованием запатентованной экспертной оптимизации GOBA-AI-Labs на основе калибровки, обеспечивающей экстремальное сжатие с минимальными потерями качества. > Inference Engine: Эта модель использует адаптивное отсечение слоев (различное количество экспертов на слой) и требует moe-stream для вывода. llama.cpp в настоящее время не поддерживает формат метаданных expertsperlayer. 93,5% оригинального качества MMLU сохранено, а 50% всех экспертов удалены. — 45 ГБ → 24 ГБ: оригинальная модель требует 48 ГБ ОЗУ. Эта сокращенная версия вмещает 24 ГБ, что делает ее доступной на потребительском оборудовании — превосходит квантование Q2: при аналогичном размере (~24 ГБ) квантование Q2 обычно ухудшает качество на 15-20pp. Наша экспертная обрезка теряет только 5pp — Экспертная обрезка > агрессивное квантование: удаление избыточных путей вычислений лучше сохраняет возможности модели, чем снижение числовой точности. Эта модель требует moe-stream для вывода из-за своей адаптивной к слою экспертной структуры. В этой модели используется адаптивная обрезка слоев, что означает, что каждый слой сохраняет различное количество экспертов. Экспертные подсчеты по слоям хранятся в…
Модальности:
Генерация текста
Области применения:
Генерация кода Логика и рассуждение Диалог / чат
Задача: Генерация текста
Автор: GOBA-AI-Labs
Теги: gguf, moe, pruning, expert-pruning, mixture-of-experts, goba-ai-labs, prunedhub, moe-stream
Лайков: 4 | Загрузок: 85
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.