— Введение — Описание — Основные моменты реализации — Архитектура модели — Начало работы — Использование — Результаты — Участие — Цитирование В документе представлен LongRoPE, метод расширения контекстного окна больших языковых моделей (LLM) за пределы 2 миллионов токенов. — Идентифицировать и использовать две формы неоднородностей в позиционных вложениях, чтобы минимизировать потери информации во время интерполяции. Это обеспечивает 8-кратное расширение контекста без тонкой настройки. — Используйте эффективную стратегию прогрессивного расширения с точной настройкой 256 КБ для достижения контекста 2048 КБ вместо прямой тонкой настройки чрезвычайно большого контекста. — Отрегулируйте встраивания для более коротких контекстов, чтобы восстановить производительность в пределах исходного размера окна. Метод применяется к LLaMA2 и Mistral. Эксперименты с различными задачами демонстрируют эффективность LongRoPE в поддержании производительности при длине контекста от 4 КБ до 2048 КБ. Архитектура Transformer борется с квадратичной вычислительной сложностью самообслуживания и отсутствием обобщения для позиций токенов, невидимых во время обучения. Чтобы масштабировать вычисление собственного внимания в большом контексте, были предложены различные методы, такие как RoPE, AliBi, приемники внимания и т. д.…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: jshuadvd
Теги: large-language-models, context-extension, transformer-models, fine-tuning, long-contexts, natural-language-processing, context-window, context-length
Лайков: 6 | Загрузок: 0
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.