ZAYA не является стандартной архитектурой mlxlm. Он чередует уровни внимания CCA и уровни MoE верхнего уровня 1. Используйте этот пакет только со средой выполнения, реализующей государственный контракт ZAYA CCA и преобразованный предварительно составленный экспертный макет. Используйте сборку vmlx-swift-lm, включающую среду выполнения ZAYA Swift (Libraries/MLXLLM/Models/Zaya.swift + MLXLMCommon/Cache/ZayaCCACache.swift + BatchEngine/BatchZayaCCACache.swift). Первый проверенный пин — коммит b9da180 или новее. — 80 слоев декодера: чередующееся внимание CCA и верхний 1 MoE — Скрытый размер 2048, 16 головок запроса, 2 головки KV, размер головы 128 — Состояние CCA на каждый уровень внимания: стандартный KV плюс convstate [B,1280,2] и prevhs [B,2048] — 16 маршрутизируемых экспертов на каждый уровень MoE, маршрутизация верхнего уровня 1 с пропуском маршрута MOD — Длина контекста 131072,roptheta=5000000` 4-битные эксперты с маршрутизацией MXTQ + 8-битные аффинные немаршрутизируемые тензоры. — convqk., temp,norms, остаточное масштабирование, путь маршрутизатора, смещения и смещения балансировки сохраняются в виде тензоров с плавающей запятой. — Встраивания и lmhead используют 8-битный affine в подготовленных пакетах. — jangtqruntime.safetensors` включен: true. — Сканированы заголовки Safetensor. — Проверено покрытие тензора источника. — Конвертированные пакеты проверены на предмет удаления localexperts. — Преобразованный…
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат Вызов функций (Tool use)
Задача: Генерация текста
Автор: JANGQ-AI
Теги: mlx, zaya, mixture-of-experts, hybrid-attention, cca-attention, apple-silicon, reasoning, tool-use
Лайков: 5 | Загрузок: 68
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.