35B-параметр MoE сжат до 15 ГБ с помощью квантования смешанной точности Config-I. Стандартный формат MLX — работает со стандартными mlxlm и mlx-swift-lm`. Никаких специальных загрузчиков не требуется. Квантование Config-I Qwen/Qwen3.6-35B-A3B (всего 35B, 256 экспертов, топ-8 активных, ~3B активных на токен). Политика применяет агрессивное 2-битное сжатие к экспертным MLP (к которым MoE наиболее толерантен), защищает внимание на 4-битном уровне и защищает пограничные слои и маршрутизацию с полной точностью. См. документ Config-I для получения информации о политике. > Статус: Доступно для тестирования. Ожидаются тесты качества (PPL, MMLU, NIAH) и проверки многоконтекстной согласованности. Используйте на свой страх и риск. 256 экспертов, топ-8 активных на каждый токен. 40 слоев с гибридным вниманием (GatedDeltaNet + полное внимание). Config-I — это политика сжатия веса с учетом тензорных ролей от TurboQuant+. Благодаря систематической изоляции A/B было обнаружено, что тензоры внимания, проекции чтения FFN (ворота/вверх), проекции обратной записи FFN (вниз) и пограничные слои имеют совершенно разную чувствительность к сжатию. Ключевой вывод: политика сжатия имеет большее значение, чем математика сжатия — какие тензоры сжимать, какие защищать и насколько агрессивно. Для МО…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: thetom-ai
Теги: mlx, qwen3_5_moe, turboquant, turboquant-plus, config-i, moe, apple-silicon, conversational
Лайков: 8 | Загрузок: 436
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.