DeepSeek-V4-Flash — 79,6 ГБ на диске (по сравнению с 149 ГБ источника FP4+FP8) — единообразное 2-битное квантование JANGTQ на маршрутизируемых экспертах + 8-битное аффинное на всем остальном + сохраненная голова MTP. — Источник: deepseek-ai/DeepSeek-V4-Flash (43 слоя преобразователя + 1 головка MTP, 256 маршрутизируемых экспертов топ-6 + 1 общий эксперт, 3 хэш-слоя, остатки MLA + mHC, всего ~284 Б) — Квантование: единый 2-битный MXTQ на маршрутизированном экспертном MLP + 8-битный аффинный по вниманию (wqa/wqb/wkv/woa/wob) /общий эксперт/Компрессор/Индексатор/встроить/lmhead/MTP. RMSNorms, шлюз маршрутизатора, матрицы mHC fn, attnsink, сквозной проход ape Stay fp16/fp32. — Вариант: std (сохраняет уровень MTP 43; один токен на пересылку до тех пор, пока среда выполнения JANG не отправит цикл принятия/отклонения спекулятивного декодирования). В сопутствующем варианте DeepSeek-V4-Flash-JANGTQ-K отсутствует MTP за меньший пакет. — Макет Routed-expert: предварительно уложен по оси 0 в ffn.experts.switchmlp.{{gateproj, upproj, downproj}} в соответствии со стандартом JANGTQ-PRESTACK. Sidecar jangtqruntime.safetensors (~24 КБ) поставляется как (in=2048, биты=2), так и (in=4096, биты=2) кодовые книги + векторы смены знака для сред выполнения Swift. — Размер пакета: ~79,6 ГБ на диске. — Работает на:** M4 Max 128 ГБ / M5 Max 128 ГБ / Mac Studio 192 ГБ+…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: OsaurusAI
Теги: mlx, deepseek_v4, jang, jangtq, jangtq2, jangtq-prestack, mxtq, deepseek
Лайков: 12 | Загрузок: 6,409
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.