Высокоточные кванты GGUF модели MiniMax-M2.5 (параметры 230В) Смесь экспертов. Эти версии специально оптимизированы для локального вывода на установках с большим объемом оперативной памяти, особенно Apple Silicon (M3 Max/Ultra). Результат: квантование Q3KL сохраняет высокую логическую когерентность, одновременно увеличивая скорость до 28,7 т/с. Минимальное ухудшение при уменьшении размера примерно на 20 ГБ по сравнению с четвертым кварталом. Архитектура: MiniMax-M2 (Mixture of Experts) с 256 экспертами (8 активных на каждый токен). Параметры: всего ~230B. Процесс квантования. В отличие от автоматизированных сценариев, эти квантования были сгенерированы из полного мастера F16 GGUF (457 ГБ), чтобы минимизировать накопление ошибок во время процесса K-Quant. Контекстное окно: до 196 тыс. токенов (встроенная поддержка). Шаблон чата: включает официальный шаблон Jinja для правильной обработки чередующихся тегов `, отделяющих рассуждения от окончательного ответа. bash ./llama-cli -m minimax-m2.5-Q3KL.gguf -n -1 \ -c 262000 \ -ngl 99 -fa on -ctk q40 -ctv q4_0 -b 2048 -ub 1024 —port 8080 —jinja —verbose -sm none —draft 16 -ncmoe 0 —cache-reuse 1024 —draft-p-мин 0,5
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат
Задача: Генерация текста
Автор: ox-ox
Теги: gguf, moe, minimax, llama.cpp, applesilicon, reasoning, conversational, endpoints_compatible
Лайков: 19 | Загрузок: 277
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.