6-битное базовое квантование смешанной точности Qwen/Qwen3.6-27B для Apple Silicon с использованием стратегии квантования Unsloth Dynamic через mlx-node. Проведено тестирование на Apple M3 Max 128 ГБ с помощью файла example/lm.ts (наилучший ток декодирования в секунду на этапах 2–4, в устойчивом состоянии). Стационарное декодирование: 12,4 ток/с на Apple M3 Max 128 ГБ (лучший из ходов 2–4, примеры/lm.ts заглавными буквами в чате с рассуждением. Усилие: «низкое»). Декодирование привязано к пропускной способности памяти Apple Silicon — меньшее количество байтов на токен напрямую приводит к более высокой пропускной способности. На основе потензорного анализа KLD Unsloth Dynamic 2.0. Чувствительные слои получают более высокие биты с коррекцией AWQ, в то время как основная часть весов FFN агрессивно квантовается. Предварительное масштабирование imatrix AWQ усиливает важные весовые каналы и объединяет обратные масштабы с нормами предыдущего уровня (нулевые издержки вывода). Корректируемые AWQ проекции (q/k/v, inprojqkv/z) квантуются в 8 бит с помощью inputlayernorm. Некорректируемые AWQ проекции (oproj, out_proj) сохраняются на уровне bf16 — их входные данные поступают из вычислений внимания/GDN, а не из уровня нормы. — Unsloth — Стратегия квантования, основанная на поуровневых тестах KLD и методологии Dynamic 2.0. — Команда Qwen — Для семейства моделей Qwen3.6. — Apple MLX — Для…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Brooooooklyn
Теги: mlx-node, qwen3_5, mlx, quantized, awq, 6-bit, qwen3.6, hybrid-attention
Лайков: 8 | Загрузок: 1,074
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.