4-битное базовое квантование смешанной точности Qwen/Qwen3.6-35B-A3B для Apple Silicon с использованием стратегии квантования Unsloth Dynamic через mlx-node. Проведено тестирование на Apple M3 Max 128 ГБ с помощью файла example/lm.ts (наилучший ток декодирования в секунду на этапах 2–4, в устойчивом состоянии). Стационарное декодирование: 55,1 ток/с на Apple M3 Max 128 ГБ (лучший из ходов 2–4, примеры/lm.ts в чате с заглавными буквами и аргументированное усилие: «низкое»). Декодирование привязано к пропускной способности памяти Apple Silicon — меньшее количество байтов на токен напрямую приводит к более высокой пропускной способности. Архитектура MoE активирует только 8 из 256 экспертов на каждый токен (~3B активных из 35,9B), а скомпилированный прямой граф C++ объединяет диспетчеризацию каждого уровня. На основе потензорного анализа KLD Unsloth Dynamic 2.0. Чувствительные слои получают более высокие биты с коррекцией AWQ, в то время как основная часть экспертных весов FFN агрессивно квантуется. Предварительное масштабирование imatrix AWQ усиливает важные весовые каналы и объединяет обратные масштабы с нормами предыдущего уровня (нулевые издержки вывода). Корректируемые AWQ проекции (q/k/v, inprojqkv/z) квантуются в 6 бит с помощью inputlayernorm. Прогнозы, не поддающиеся корректировке AWQ (oproj, out_proj), сохраняются на уровне bf16 — их входные данные основаны на расчете внимания/GDN, а не на основе нормы…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Brooooooklyn
Теги: mlx-node, qwen3_5_moe, mlx, quantized, awq, 4-bit, qwen3.6, moe
Лайков: 8 | Загрузок: 1,592
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.