winglian/Llama-3-8b-64k-PoSE - Каталог нейросетей
Генерация текста

winglian/Llama-3-8b-64k-PoSE

Добавлено:
winglian/Llama-3-8b-64k-PoSE

Эта модель использует PoSE для увеличения длины контекста Llama с 8 КБ до 64 КБ при @rop_theta: 500000.0. Мы использовали PoSE с постоянным предварительным обучением на 300 млн токенов из набора данных RedPajama V1, используя данные между 6–8 тыс. токенов. После продолжения предварительной подготовки мы также установили для rock_theta значение 2M, чтобы потенциально расширить контекст за пределы 64k. Это было обучено на подмножестве набора данных RedPajama v1 с текстом в контексте 6–8 тысяч. Мы обучили LoRA со стабилизированным рангом ранга 256. WandB Meta разработала и выпустила семейство больших языковых моделей (LLM) Meta Llama 3 — коллекцию предварительно обученных и настроенных генеративных текстовых моделей размером 8 и 70B. Модели Llama 3, настроенные на инструкции, оптимизированы для сценариев использования диалога и превосходят многие доступные модели чата с открытым исходным кодом по общим отраслевым тестам. Кроме того, при разработке этих моделей мы уделили большое внимание оптимизации полезности и безопасности. Вариации Llama 3 выпускается в двух размерах — с параметрами 8B и 70B — в предварительно обученных и настроенных по инструкциям вариантах. Архитектура модели Llama 3 — это авторегрессионная языковая модель, использующая оптимизированную архитектуру преобразователя. В настроенных версиях используется контролируемая точная настройка (SFT) и…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: winglian
Теги: llama, facebook, meta, llama-3, axolotl, en, text-generation-inference, endpoints_compatible
Лайков: 76  |  Загрузок: 831

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.