Эта модель использует PoSE для потенциального увеличения длины контекста Llama с 8 КБ до 1 М и выше @roptheta: 500000.0. Для этой модели мы основываемся на модели 64k и последующих 256k с дополнительными 225M токенов продолжающихся данных предварительного обучения от SlimPajama, чтобы расширить контекст до 1M @roptheta: 500k. Нам не удалось протестировать иглу в стоге сена из-за проблем с выводом в таких длинных контекстах. WandB: https://wandb.ai/oaaic/llama-3-pose-extension/runs/fiims852 Спасибо Crusoe Energy за вычислительную поддержку этой модели. Компания Meta разработала и выпустила семейство больших языковых моделей (LLM) Meta Llama 3 — коллекцию предварительно обученных и настроенных генеративных текстовых моделей размером 8 и 70B. Модели Llama 3, настроенные на инструкции, оптимизированы для сценариев использования диалога и превосходят многие доступные модели чата с открытым исходным кодом по общим отраслевым тестам. Кроме того, при разработке этих моделей мы уделили большое внимание оптимизации полезности и безопасности. Вариации Llama 3 выпускается в двух размерах — с параметрами 8B и 70B — в предварительно обученных и настроенных по инструкциям вариантах. Архитектура модели Llama 3 — это авторегрессионная языковая модель, использующая оптимизированную архитектуру преобразователя.…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: winglian
Теги: llama, facebook, meta, llama-3, axolotl, en, text-generation-inference, endpoints_compatible
Лайков: 7 | Загрузок: 3
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.