oQ4 (смешанная точность на основе данных, ≈4,6 бит в секунду) MLX-квантование Qwen/Qwen-AgentWorld-35B-A3B, созданное с помощью quantizeoqstreaming oMLX. Для Apple Silicon. Работает в mlx-lm, oMLX или любом приложении MLX. Братья и сестры: oQ3.5 (меньше/быстрее, ≈3,5 бит в секунду) и bf16 (полная точность). — Только текст. Базовая контрольная точка объявляет головки Visionconfig и MTP в config.json, но не отправляет ни Vision, ни MTP. веса (693 тензора, 0 зрения, 0 MTP) — оба являются рудиментарным скелетом, унаследованным от базы Qwen3.5. Этот квант является точной языковой моделью; ничего мультимодального не было отброшено. — ≈19 ГБ** на диске (из ≈69 ГБ bf16). Пиковая память ≈20 ГБ генерации. — Смешанная точность: распределение битов по слоям на основе измерения чувствительности oQ; большинство весов относятся к 4-битному классу с усиленными чувствительными слоями. Измерено с использованием oMLX (автоматический движок) на M5 Max (40-ядерный графический процессор, 128 ГБ ОЗУ). Одиночный запрос: Непрерывная пакетная обработка (pp1024/tg128): 1×→136 · 2×→181 · 4×→252 · 8×→325 совокупного декодирования ток/с (2,40× при 8 одновременных запросах). Вывод: oQ4 обеспечивает ≈1,8× пропускную способность декодирования одного запроса при ≈⅓ памяти (20 ГБ против 66 ГБ) и масштабируется до 2,40× при 8-процессной пакетной обработке. Быстрая нерепрезентативная проверка работоспособности — образцы из 100 вопросов для каждого теста…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: mlx-community
Теги: mlx, qwen3_5_moe, qwen, world-model, agent, environment-simulation, quantized, oq
Лайков: 6 | Загрузок: 1,888
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.