sandeshrajx/Qwen3.5-24B-A3B-REAP-0.32-GGUF - Каталог нейросетей
Генерация текста

sandeshrajx/Qwen3.5-24B-A3B-REAP-0.32-GGUF

Добавлено:
sandeshrajx/Qwen3.5-24B-A3B-REAP-0.32-GGUF

𓌳 REAP𓌳 Эксперты: почему сокращение преобладает при однократном сжатии MoE Представляем Qwen3.5-24B-A3B-REAP-0.32, сжатый вариант Qwen3.5-35B-A3B с эффективным использованием памяти, который сохраняет основные возможности архитектуры по рассуждению и кодированию, будучи на 32% легче. Эта модель была создана с использованием REAP (router-weighted Expert Activation Pruning), нового метода сокращения экспертов, который выборочно удаляет лишних экспертов, сохраняя при этом независимый контроль маршрутизатора над оставшимися экспертами. Ключевые особенности: — Агрессивное сжатие: количество экспертов уменьшено на 32%, в результате чего общее количество параметров уменьшено примерно до 24Б. — Активные параметры 3B: поддерживают ту же эффективность вычислений во время вывода, что и исходная модель (параметры 3B активируются для каждого токена). — Высокоточный GGUF: включает оптимизированные количественные параметры с использованием матрицы важности (imatrix) и пользовательских рецептов точности тензоров. — Совместимость с прямым подключением: полностью совместим с новейшими трансформаторами (из источника) и vLLM. — Сценарии оркестровки: полный конвейер доступен по адресу sandeshrajbhandari/reap-qwen3.5-modal. — Qwen3.5-24B-A3B-REAP-0.32-IQ4KM.gguf: Высокоточный 4-битный количественный анализ с использованием рецепта в стиле Unsloth (imatrix +…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: sandeshrajx
Теги: gguf, qwen, MOE, pruning, compression, GGUF, en, endpoints_compatible
Лайков: 12  |  Загрузок: 646

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.