DAMO-NLP-SG/CLEX-LLaMA-2-7B-64K - Каталог нейросетей
Генерация текста

DAMO-NLP-SG/CLEX-LLaMA-2-7B-64K

Добавлено:
DAMO-NLP-SG/CLEX-LLaMA-2-7B-64K

— Просто и понятно: МИНИМАЛЬНЫЕ изменения кода и архитектуры. Введен только один слой проекции вверх-вниз, без необходимости кэширования рекуррентной памяти или недостаточного внимания. — Train Short, Test Long: нет снижения производительности на последовательностях в 4x~8x дольше, чем на тренировочных (см. здесь). — Непрерывная экстраполяция длины: явное моделирование непрерывной динамики размера контекстного окна во время экстраполяции длины. Если у вас есть какие-либо вопросы, свяжитесь с нами. (Электронные письма: guanzzh.chen@gmail.com, lixin4ever@gmail.com) Вот оценочные PPL базовых моделей, обученных с помощью CLEX. Мы применяем обучение и оценку на подмножестве 2B токенов из корпуса RedPajama-Book, где обучающие и тестовые наборы разделены на 99:1. Если вы считаете наш проект полезным, надеюсь, вы сможете отметить наш репозиторий и процитировать нашу статью следующим образом:

Модальности:
Генерация текста


Задача: Генерация текста
Автор: DAMO-NLP-SG
Теги: llama, custom_code, en, text-generation-inference, endpoints_compatible
Лайков: 3  |  Загрузок: 28

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.