Пакет спекулятивного декодирования для google/gemma-4-26B-A4B-it с использованием официального средства разработки MTP Google (gemma-4-26B-A4B-it-assistant), упакованного для llama.cpp и LM Studio. Пропускная способность примерно в 1,55 раза выше по сравнению с отсутствием MTP на Apple M5 Max (разработчик Q2_K, n=3, в раздумьях). Цель повторно размещена из unsloth/gemma-4-26B-A4B-it-GGUF (Quant Unsloth Dynamic 2.0, Apache-2.0). Drafter создан на основе google/gemma-4-26B-A4B-it-assistant с помощью llama.cpp PR #23398 (am17an, WIP). llama.cpp создан на основе ветки gemma4-mtp am17an — MTP Gemma-4 еще не объединен с мастер-версией. 1. Найдите этот репозиторий, загрузите target + Drafter. 2. Загрузите цель. 3. Загрузите настройки → Спекулятивное декодирование → выберите файл чертежника. (Требуется LM Studio с объединенным PR am17an или пользовательской средой выполнения llama.cpp. По состоянию на 2026-05 г. основная среда выполнения LM Studio еще не имеет Draft-MTP для Gemma-4 — отслеживайте восходящее слияние.) Enablethinking: false пропускает мыслительный блок. +12% пропускная способность**, +9 процент приема сообщений, прямой ответ. Для задач на рассуждение (математика, проверка кода) включите мышление — медленнее, но лучше. Меньший квант составителя = быстрее (меньшая пропускная способность) и, как ни странно, более высокий прием (квантование округляется до целевого argmax). Hermes использует собственный файл /api/v1/models LM Studio для моделирования…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: ironbcc
Теги: gguf, gemma4, mtp, speculative-decoding, moe, en, endpoints_compatible
Лайков: 5 | Загрузок: 3,159
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.