Этот репозиторий содержит квантованные веса составителя Multi-Token Prediction (MTP), отделенные от Qwen/Qwen3.6-35B-A3B для использования со спекулятивным декодированием mlx-vlm. Это не отдельный чат или модель генерации текста. Загрузите его как черновую модель вместе с совместимой целевой контрольной точкой Qwen3.6 35B-A3B. — Тип модели: qwen35mtp — Размер блока MTP: 2 — Целевая архитектура: Qwen3.6 35B-A3B — Точность: 5-битное аффинное квантование MLX, размер группы 64 — Среда выполнения: MLX / mlx-vlm — Формат: Safetensor с MLX-совместимыми файлами конфигурации и токенизатора. Сохраненные тензоры используют аффинное квантование MLX, как описано в config.json. Используйте этот репозиторий только как спекулятивный составитель декодирования для совместимых контрольных точек Qwen3.6 35B-A3B. Целевая модель проверяет составленные токены, а эта модель MTP предлагает токены-кандидаты на каждом этапе декодирования. Для этой контрольной точки требуется поддержка во время выполнения черновых моделей Qwen MTP в mlx-vlm. Ожидается, что стандартное автономное создание с помощью общих API-интерфейсов Transformers не будет работать с этим репозиторием само по себе. Ограничения на использование модели см. в карточке модели Qwen/Qwen3.6-35B-A3B и условиях лицензии.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: mlx-community
Теги: mlx, qwen3_5_mtp, mlx-vlm, qwen3.6, qwen3.6-35b-a3b, qwen, moe, mtp
Лайков: 5 | Загрузок: 1,223
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.