Мы вводим три типа экспертов с нулевыми вычислениями: нулевой эксперт, эксперт копирования и постоянный эксперт, которые соответствуют операциям отбрасывания, пропуска и замены соответственно. Более того, мы используем остатки гейтирования, позволяя каждому токену учитывать путь, пройденный на предыдущем уровне, при выборе соответствующих экспертов. Для модели MoE++ ее вычислительная сложность всегда меньше, чем у моделей MoE с тем же количеством параметров. Обширные экспериментальные результаты показывают, что MoE++ достигает более высокой производительности, обеспечивая экспертную пропускную способность прямой передачи в 1,1–2,1 раза по сравнению с базовой моделью MoE того же размера, что закладывает прочную основу для разработки передовых и эффективных моделей, связанных с MoE. Учитывая, что параметры экспертов с нулевыми вычислениями незначительны, мы можем разместить всех экспертов с нулевыми вычислениями на каждом графическом процессоре, устраняя значительные накладные расходы на связь и дисбаланс экспертной нагрузки, связанный с экспертами FFN, распределенными по разным графическим процессорам. MoE++ позволяет простым токенам использовать меньше экспертов FFN, освобождая больше экспертов FFN для работы над сложными токенами. Это приводит как к сокращению вычислений, так и к повышению производительности. Глаголы имеют тенденцию активировать…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Chat-UniVi
Теги: MoE++, custom_code
Лайков: 5 | Загрузок: 22
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.