JANGQ-AI/MiniMax-M3-REAP40-JANG_2L - Каталог нейросетей
Генерация текста

JANGQ-AI/MiniMax-M3-REAP40-JANG_2L

Добавлено:
JANGQ-AI/MiniMax-M3-REAP40-JANG_2L

> ## ⚠️ Требуется vMLX ≥ v1.5.62 > Более ранние сборки vMLX содержат ошибку кэша времени выполнения, которая вызывает циклы повторения при выводе long >. Это проблема движка, а не проблемы с весами — обновите vMLX до версии 1.5.62 или более поздней, прежде чем запускать эту модель. На v1.5.62+ генерация чистая. Компактный пакет MiniMax-M3 для Apple Silicon: экспертное сокращение REAP на 40 % + квантование смешанной точности JANG2L, ~95 ГБ** — меньший аналог REAP-32 с меньшим объемом оперативной памяти (больше сокращения, меньше резидентной памяти). Удобно работает на одном Mac с памятью 128 ГБ через vMLX/MLX. — База: MiniMax-M3 (modeltype=minimaxm3vl) — МО, GQA-4, индексатор молний MSA, обзорная башня. — Сокращение: сокращение значимости REAP, удаление 40 % перенаправленных экспертов (77 из 128 сохраняются на каждом уровне MoE), оставление экспертов с самой высокой значимостью. — Квантование (JANG2L, аффинное, размер группы 64): downproj сохраняется на уровне 3 бит (остальные маршрутизируемые эксперты являются 2-битными) для стабильной когерентности длинной формы. Полная битовая карта для каждого модуля записывается в config.json (quantization`) и автоматически применяется загрузчиком. — REAP-40 (этот репозиторий, ~95 ГБ): меньше, меньше резидентной оперативной памяти, больше места. — REAP-32 (~105 ГБ): сохраняет больше экспертов; более качественный потолок, ближе к лимиту ОЗУ в 128 ГБ…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: JANGQ-AI
Теги: mlx, minimax_m3_vl, minimax, minimax-m3, moe, jang, vmlx, 2-bit
Лайков: 5  |  Загрузок: 642

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.