> [!TIP] > Квантование KV-кэша без какого-либо разветвления (рекомендуется, 2026 г.): восходящий поток > llama.cpp/Ollama теперь покрывает это изначально — используйте -ctk q80 -ctv q80 > (~половина памяти KV, незначительная потеря качества: недоумение +0,002–0,05) или > -ctk q40 -ctv q40 (~четверть памяти, ≈7,6% увеличение недоумения). В > Оллама: OLLAMAKVCACHETYPE=q80 с OLLAMAFLASHATTENTION=1. Сохраняйте > типы K и V симметричными, чтобы оставаться на пути быстрого плавного внимания. > С апреля 2026 года основная ветка llama.cpp также применяет ротацию Адамара к > активациям KV (PR #21038), > что значительно улучшает качество низкобитового KV (отказ: > LLAMAATTNROTDISABLE=1). > > Приведенный ниже поток ветвления RotorQuant/TurboQuant является экспериментальным/устаревшим**: PR TurboQuant llama.cpp был закрыт без слияния (июнь 2026 г.), а вилка > не поддерживается по отношению к основной ветке. НЕ ОБЯЗАТЕЛЬНО использовать данную модель. 4-битная версия MLX с квантованием по весу Qwen/Qwen3.6-35B-A3B с устаревшей вилкой RotorQuant KV-кэша (заменена восходящими опциями KV llama.cpp). Оптимизирован для вывода Apple Silicon через платформу MLX. Хороший баланс между качеством модели и эффективностью памяти. На каждый токен активны только 3B параметров, несмотря на общее количество 35B, что делает эту модель…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: majentik
Теги: mlx, qwen3_5_moe, rotorquant, kv-cache-quantization, qwen, qwen-3.6, qwen3.6, moe
Лайков: 5 | Загрузок: 1,121
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.