deucebucket/Qwen3.5-122B-A10B-Cerebellum-GGUF - Каталог нейросетей
Генерация текста

deucebucket/Qwen3.5-122B-A10B-Cerebellum-GGUF

Добавлено:
deucebucket/Qwen3.5-122B-A10B-Cerebellum-GGUF

Квантование смешанной точности с учетом чувствительности Qwen/Qwen3.5-122B-A10B. 122 миллиарда параметров, 10 миллиардов активных на каждый токен. Гибридная архитектура SSM/внимания MoE с 256 экспертами на каждом уровне, 8 активных. Сжат с 228 ГБ (BF16) до 32,7 ГБ по 2,30 бита на вес. Работает на одном RTX 3090 (24 ГБ видеопамяти + 34 ГБ системной памяти) со скоростью 25 токенов в секунду. Один проход из безопасных тензоров BF16 с использованием llama.cpp llama-quantize: — База: IQ2XXS для всех тензоров — Повышение: ffndownexps повышен до Q2K (они несут фактические экспертные вычисления) — Никаких понижений — IQ1_S на экспертных весах разрушает качество маршрутизации MoE. Это нацелено на проекционные веса, которые наиболее важны для качества вывода, сохраняя при этом модель достаточно маленькой для потребительского оборудования. Измерено непосредственно на этом GGUF с помощью llama.cpp на RTX 3090. Метаданные индекса модели во лицевой части этой карты отражают эти цифры. Неквантованный базовый уровень Qwen 3.5 122B-A10B для сравнения: HellaSwag ~95%, ARC ~97% (оценено на основе опубликованных Qwen результатов по аналогичным тестам). Способность рассуждать хорошо сохранена; генерация кода принимает ожидаемый результат с точностью до 2 бит. Температура: 0,6 для общего использования, 0,0 для тестов и детерминированных задач.…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: deucebucket
Теги: gguf, quantized, cerebellum, moe, en, zh, model-index, endpoints_compatible
Лайков: 5  |  Загрузок: 550

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.