DAMO-NLP-SG/CLEX-Mixtral-8x7B-32K - Каталог нейросетей
Генерация текста

DAMO-NLP-SG/CLEX-Mixtral-8x7B-32K

Добавлено:
DAMO-NLP-SG/CLEX-Mixtral-8x7B-32K

— Просто и понятно: МИНИМАЛЬНЫЕ изменения кода и архитектуры. Введен только один слой проекции вверх-вниз, без необходимости кэширования рекуррентной памяти или недостаточного внимания. — Train Short, Test Long: нет снижения производительности на последовательностях в 4x~8x дольше, чем на тренировочных (см. здесь). — Непрерывная экстраполяция длины: явное моделирование непрерывной динамики размера контекстного окна во время экстраполяции длины. Если у вас есть какие-либо вопросы, свяжитесь с нами. (Электронная почта: guanzzh.chen@gmail.com, lixin4ever@gmail.com) CLEX-Phi-2-2.7B и CLEX-Mixtral-8x7B обучаются на LongCorpus-2.5B, где результаты испытаний приведены ниже. Если вы считаете наш проект полезным, надеюсь, вы сможете отметить наш репозиторий и процитировать нашу статью следующим образом:

Модальности:
Генерация текста


Задача: Генерация текста
Автор: DAMO-NLP-SG
Теги: mixtral, custom_code, text-generation-inference, endpoints_compatible
Лайков: 3  |  Загрузок: 33

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.