thetom-ai/Qwen3.6-27B-ConfigI-MLX - Каталог нейросетей
Генерация текста

thetom-ai/Qwen3.6-27B-ConfigI-MLX

Добавлено:
thetom-ai/Qwen3.6-27B-ConfigI-MLX

Плотная модель с 27B параметрами и квантованием смешанной точности Config-I. Стандартный формат MLX — работает со стандартными mlxlm и mlx-swift-lm`. Никаких специальных загрузчиков не требуется. Квантование Config-I Qwen/Qwen3.6-27B (плотное 27B, 64 слоя, гибрид GatedDeltaNet + полное внимание). Политика применяет 4-битные уровни к средним уровням, защищает пограничные слои на 8-битных уровнях и защищает встраивания с полной точностью. См. документ Config-I для получения информации о политике. vllm-swift — это собственный бэкэнд Swift/Metal для vLLM. Установка с помощью Homebrew: это дает вам OpenAI-совместимый API по адресу http://localhost:8000 с поддержкой вызовов инструментов и сжатием кэша 3,2x KV. vllm-swift на 20 % быстрее, чем Python mlx-lm при декодировании с помощью одного запроса. Рекомендация: турбо4 симметричный (К4В4). Лучший PPL (+11% по сравнению с fp16) со сжатием 3,2x и стоимостью декодирования всего -9%. Все схемы пригодны для использования — даже турбо3 при +26% PPL все еще работает (PPL 1,46 низкий). 64 уровня с гибридным вниманием (GatedDeltaNet + полное внимание на каждом 4-м уровне). Config-I — это политика сжатия веса с учетом тензорных ролей от TurboQuant+. Благодаря систематической изоляции A/B было обнаружено, что тензоры внимания, проекции чтения FFN (ворота/вверх), обратная запись FFN…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: thetom-ai
Теги: mlx, qwen3_5, turboquant, config-i, conversational, 4-bit
Лайков: 5  |  Загрузок: 120

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.