REAP удаляет 30% экспертов MoE (38 из 128 на каждый уровень), сохраняя при этом поведение маршрутизации модели. Количество активных параметров на токен не меняется, поскольку маршрутизатор по-прежнему выбирает 8 экспертов на токен из оставшегося пула. Это дает сокращение общего объема диска/памяти примерно на 31%. Мы прогнали полную модель Gemma 4 26B-A4B-it на тщательно подобранном наборе калибровочных данных, чтобы записать экспертные шаблоны активации на всех слоях. 30% экспертов с наименьшим количеством баллов (38 на уровень) удаляются на основе комбинированных значений шлюзов маршрутизатора, норм активации и значимости, взвешенной по частоте. Логиты маршрутизатора перенормируются после сокращения. Оценивалось с помощью генеративных задач lm-eval с —applychattemplate и thinkendtoken= для правильной обработки режима мышления Gemma 4. Задачи со сбоями извлечения. Реальная точность, вероятно, выше.* Резюме: При сокращении на 30% модель сохраняет высокие показатели по элементарной математике (88%) и программированию (68% по предметам колледжа). В наукоемких задачах, таких как философия и мировые религии, наблюдается умеренное снижение. Вариант с 30% меняет ~18 очков по философии и ~42 балла по мировым религиям на модель на 31% меньше. Ноль циклов, нулевой коллапс в программировании, математике и философии. Модель REAP 0.30…
Модальности:
Генерация текста
Области применения:
Диалог / чат Генерация кода
Задача: Генерация текста
Автор: coder3101
Теги: gemma4, image-text-to-text, moe, pruning, reap, cerebras, expert-pruning, heretic
Лайков: 5 | Загрузок: 27
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.