Это экспертная версия Gemma-4 26B-A4B-it от Google на 20 % с использованием Cerebras REAP (экспертная обрезка активации с учетом маршрутизатора). REAP удаляет 20% экспертов MoE (25 из 128 на каждый уровень), сохраняя при этом поведение маршрутизации модели. Количество активных параметров на токен не меняется, поскольку маршрутизатор по-прежнему выбирает 8 экспертов на токен из оставшегося пула. — 30 слоев преобразователя — Скользящее внимание (окно = 1024) для 25 слоев, полное внимание каждый 6-й уровень — MoE FFN с 103 экспертами на слой, 8 активных на токен — Модель мышления — использует каналы мысли/ответа — Мультимодальная — поддерживает входные данные текста и изображения — Контекстное окно: 262 144 токена Качество генерации «по существу неотличимо от оригинала», по словам авторов REAP. – Исходная модель: google/gemma-4-26b-a4b-it – Сокращение REAP: 0xSero/gemma-4-21b-a4b-it-REAP – Документ REAP: arxiv.org/abs/2510.13999 – Преобразование GGUF: Ayodele01
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Ayodele01
Теги: gguf, gemma, gemma-4, moe, pruning, reap, llama-cpp, en
Лайков: 5 | Загрузок: 94
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.