Авторы: Давэй Чжу, Нань Ян, Лян Ван, Ифань Сун, Вэньхао Ву, Фуру Вэй, Суцзянь Ли > Примечание. Мы обнаружили, что модель LLaMA2-7B-PoSE-YaRN-16k, загруженная 11 октября 2023 г., несовместима с файломposemodelingllama.py, представленным в репозитории, что приводит к неоптимальной производительности. Поэтому мы перезалили КПП LLaMA2-7B-PoSE-YaRN-16k 27.11.2023. Модели большого языка (LLM) обучаются с использованием заранее определенной длины контекста, что ограничивает их использование в сценариях, требующих длинных входных данных. Предыдущие попытки адаптировать LLM к более длинной длине обычно требуют точной настройки этой целевой длины (точная настройка полной длины), что требует больших затрат на обучение. Чтобы отделить длину поезда от целевой длины для эффективного расширения контекстного окна, мы предлагаем обучение позиционному пропуску (PoSE), которое разумно имитирует длинные входные данные с использованием фиксированного контекстного окна. Это достигается за счет разделения исходного контекстного окна на несколько фрагментов, а затем разработки отдельных элементов смещения пропуска для управления индексами позиции каждого фрагмента. Эти члены смещения и длина каждого фрагмента изменяются для каждого обучающего примера, что позволяет модели адаптироваться ко всем позициям в пределах целевой длины.…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: dwzhu
Теги: llama, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 6
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.