Квантование GGUF 0xSero/Qwen3.6-28B-REAP20-A3B, 20% экспертного варианта Qwen/Qwen3.6-35B-A3B с использованием метода REAP (взвешенное по маршрутизатору экспертное сокращение активации). 0xSero/Qwen3.6-28B-REAP20-A3B применяет экспертное сокращение REAP (arXiv:2510.13999) для удаления 20% экспертов MoE (51 из 256 на уровень) из Qwen3.6-35B-A3B, сохраняя при этом поведение маршрутизации посредством перенормировки веса маршрутизатора. Активные параметры на токен остаются неизменными и составляют ~3B. В результате получается модель примерно на 25% меньшего размера с конкурентоспособным качеством генерации по критериям кодирования, рассуждения и знаний.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: barozp
Теги: gguf, qwen3, moe, pruning, reap, cerebras, expert-pruning, conversational
Лайков: 12 | Загрузок: 3,095
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.