winglian/llama-3-8b-256k-PoSE - Каталог нейросетей
Генерация текста

winglian/llama-3-8b-256k-PoSE

Добавлено:
winglian/llama-3-8b-256k-PoSE

Эта модель использует PoSE для увеличения длины контекста Llama с 8 КБ до 256 КБ и выше @roptheta: 500000.0. Для этой модели мы основываемся на нашей модели 64 тыс. с 75 млн токенов продолжающихся данных предварительного обучения от SlimPajama, чтобы расширить контекст до 256 тыс. @roptheta: 500 тыс. Нам не удалось протестировать иглу в стоге сена из-за проблем с выводом в таких длинных контекстах. Спасибо Crusoe Energy за вычислительную поддержку этой модели. Компания Meta разработала и выпустила семейство больших языковых моделей (LLM) Meta Llama 3 — коллекцию предварительно обученных и настроенных генеративных текстовых моделей размером 8 и 70B. Модели Llama 3, настроенные на инструкции, оптимизированы для сценариев использования диалога и превосходят многие доступные модели чата с открытым исходным кодом по общим отраслевым тестам. Кроме того, при разработке этих моделей мы уделили большое внимание оптимизации полезности и безопасности. Вариации Llama 3 выпускается в двух размерах — с параметрами 8B и 70B — в предварительно обученных и настроенных по инструкциям вариантах. Архитектура модели Llama 3 — это авторегрессионная языковая модель, использующая оптимизированную архитектуру преобразователя. В настроенных версиях используются контролируемая точная настройка (SFT) и обучение с подкреплением с обратной связью от человека (RLHF), чтобы…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: winglian
Теги: llama, facebook, meta, llama-3, axolotl, en, text-generation-inference, endpoints_compatible
Лайков: 42  |  Загрузок: 15

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.