4-битное базовое квантование смешанной точности Qwen/Qwen3.5-35B-A3B для Apple Silicon с использованием стратегии квантования Unsloth Dynamic через mlx-node. Проведено тестирование на Apple M3 Max 128 ГБ, многооборотный чат (декодирование Turn 4, устойчивый режим). Декодирование привязано к пропускной способности памяти Apple Silicon — меньшее количество байтов на токен напрямую приводит к более высокой пропускной способности. Архитектура MoE активирует только 8 из 256 экспертов на каждый токен (~3 млрд активных из 35,9 млрд). На основе потензорного анализа KLD Unsloth Dynamic 2.0. Чувствительные слои получают более высокие биты с коррекцией AWQ, в то время как основная часть экспертных весов FFN агрессивно квантуется. Предварительное масштабирование imatrix AWQ усиливает важные весовые каналы и объединяет обратные масштабы с нормами предыдущего уровня (нулевые издержки вывода). Корректируемые AWQ проекции (q/k/v, inprojqkv/z) квантуются в 6 бит с помощью inputlayernorm. Некорректируемые прогнозы (oproj, out_proj) сохраняются на уровне bf16 — их входные данные поступают из вычислений внимания/GDN, а не из уровня норм. — Unsloth — стратегия квантования, основанная на послойных тестах KLD и методологии Dynamic 2.0. — Команда Qwen — для семейства моделей Qwen3.5. — Apple MLX — для платформы машинного обучения с металлическим ускорением.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Brooooooklyn
Теги: mlx-node, qwen3_5_moe, mlx, quantized, awq, 4-bit, qwen3.5, moe
Лайков: 5 | Загрузок: 227
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.