— 4-битная базовая линия с важными слоями на уровне 8 бит и BF16. — Этот квант не поддерживает ввод изображений. В итоге я выбрал двух победителей из своих испытаний. Это версия качество+, а вот версия скорость+. метрика | mlx-сообщество/ Qwen3.6-35B-A3B-4bit | mlx-сообщество/ Qwen3.6-35B-A3B-4.4bit-msq | 4,8 бит | 5,4 бит (эта модель) bpw | 4.503 | 4,787 | 4,788 | 5,438 пиковой памяти (1024/512) | 20,683 | 21,922 | 21,928 | 24.741 подсказка ток/с (1024) | 2719,4470 ± 15,2250 | 2695,9370 ± 12,5260 | 2734,5260 ± 3,8810 | 2665,3060 ± 11,4520 ген ток/с (512) | 108,4990 ± 0,4910 | 94,2940 ± 0,3650 | 97,2820 ± 0,0800 | 89,4920 ± 0,2610 кл расхождения | 0,0838 ± 0,0008 | 0,1689 ± 0,0015 | 0,0244 ± 0,0004 | 0,0189 ± 0,0003 недоумение | 4,6150 ± 0,0320 | 4,2490 ± 0,0280 | 4,6410 ± 0,0320 | 4,6440 ± 0,0320 хелласваг | 0,5560 ± 0,0220 | 0,5780 ± 0,0220 | 0,5440 ± 0,0220 | 0,5370 ± 0,0110 пика | 0,7940 ± 0,0180 | 0,7920 ± 0,0180 | 0,7920 ± 0,0180 | 0,7980 ± 0,0180 виногранде | 0,7260 ± 0,0200 | 0,7400 ± 0,0200 | 0,7120 ± 0,0200 | 0,7100 ± 0,0200 Я перешел к использованию скорости + расхождения KL в качестве основных показателей оптимизации. Однако Хелласваг, PIQA, Виногранде и недоумение используются в качестве проверки здравомыслия…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: spicyneuron
Теги: mlx, qwen3_5_moe, conversational, 4-bit
Лайков: 7 | Загрузок: 402
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.