Точная настройка моделей большого языка (LLM) — обычная практика адаптации предварительно обученных моделей для конкретных приложений. Хотя такие методы, как LoRA, эффективно устраняют ограничения памяти графического процессора во время тонкой настройки, их производительность часто оказывается недостаточной, особенно в многозадачных сценариях. Напротив, модели Mixture-of-Expert (MoE), такие как Mixtral 8x7B, демонстрируют замечательную производительность в сценариях многозадачного обучения, сохраняя при этом уменьшенное количество параметров. Однако требования к ресурсам этих MoE остаются сложными, особенно для графических процессоров потребительского уровня с объемом памяти менее 24 ГБ. Для решения этих проблем мы предлагаем MixLoRA — подход к построению ресурсоэффективной разреженной модели MoE на основе LoRA. На рисунке выше показана архитектура блока трансформатора MixLoRA. MixLoRA вставляет несколько экспертов на основе LoRA в сетевой блок прямой связи замороженной предварительно обученной плотной модели и использует широко используемый маршрутизатор top-k. В отличие от других методов MoE на основе LoRA, MixLoRA повышает производительность модели за счет использования независимых адаптеров LoRA уровня внимания. Кроме того, для решения проблемы дисбаланса маршрутизатора используется вспомогательная потеря баланса нагрузки. Наш…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: TUDB-Labs
Теги: endpoints_compatible
Лайков: 4 | Загрузок: 0
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.