TLDR | Обзор | Результаты | Использование | Авторы | Цитирование | Лицензия | Благодарности Этот репозиторий содержит исследовательскую предварительную версию LongLLaMA, большой языковой модели, способной обрабатывать длинные контексты из 256 тысяч токенов или даже больше. LongLLaMA-Code имеет улучшенные возможности рассуждения по сравнению с CodeLlama, в частности, мы улучшаем математические рассуждения GSM8K с 13% до 17,4% после продолжения предварительного обучения, без тонкой настройки при распространении. Сфокусированный преобразователь: контрастное обучение масштабированию контекста (FoT) представляет собой простой метод наделения языковых моделей способностью обрабатывать контекст, состоящий, возможно, из миллионов токенов, при обучении на значительно более коротких входных данных. FoT позволяет подмножеству уровней внимания получать доступ к кешу памяти пар (ключ, значение) для увеличения длины контекста. Отличительным аспектом FoT является процедура обучения, основанная на контрастном обучении. В частности, мы намеренно подвергаем уровни внимания памяти как релевантным, так и нерелевантным ключам (например, отрицательным образцам из несвязанных между собой документов). Эта стратегия стимулирует модель различать ключи, связанные с семантически разными значениями, тем самым улучшая их структуру. Это, в свою очередь,…
Модальности:
Генерация текста
Области применения:
Генерация кода
Задача: Генерация текста
Автор: syzymon
Теги: longllama, code, text-generation-inference, custom_code, model-index
Лайков: 31 | Загрузок: 24
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.