Этот репозиторий содержит веса адаптеров LoRA для моделей, точно настроенных в рамках документа «Адаптация внимания к скользящему окну». Механизм самообслуживания в моделях большого языка (LLM) на основе преобразователей масштабируется квадратично в зависимости от длины входных данных, что делает вывод в длинном контексте дорогостоящим. Внимание скользящего окна (SWA) снижает эти затраты до линейной сложности, но наивное включение полного SWA во время вывода для моделей, предварительно обученных с полным вниманием (FA), приводит к серьезному снижению производительности в длительном контексте из-за несоответствия обучения и вывода. В данной статье это исследуется, предлагая адаптацию внимания со скользящим окном (SWAA), набор практических рецептов, которые сочетают в себе пять методов лучшей адаптации: (1) применение SWA только во время предварительного заполнения; (2) сохранение токенов «приемника»; (3) чередование уровней FA/SWA; (4) цепочка мыслей (ЦТ); и (5) точная настройка. Эксперименты показывают, что адаптация SWA возможна, хотя и нетривиальна: ни одного метода недостаточно, однако конкретные синергетические комбинации эффективно восстанавливают исходную производительность в длительном контексте. Код: https://github.com/yuyijiong/sliding-window-attention-adaptation Эта модель оснащена адаптерами LoRA, предназначенными для установки поверх…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: yuyijiong
Теги: en, zh, endpoints_compatible
Лайков: 5 | Загрузок: 0
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.