Llama 3.1 Swallow — это серия больших языковых моделей (8B, 70B), созданных путем постоянного предварительного обучения на моделях Meta Llama 3.1. Llama 3.1 Swallow расширила возможности японского языка по сравнению с оригинальной Llama 3.1, сохранив при этом возможности английского языка. Для постоянного предварительного обучения мы используем около 200 миллиардов токенов, которые были выбраны из большого японского веб-корпуса (Swallow Corpus Version 2), статей японской и английской Википедии, а также математического контента и содержания кодирования и т. д. (см. раздел «Наборы обучающих данных»). Модели, настроенные по инструкциям (Instruct), были построены методом контролируемой точной настройки (SFT) на синтетических данных, специально созданных для японского языка. См. раздел «Указатель моделей Swallow», чтобы найти другие варианты моделей. — 8 октября 2024 г.: выпущены Llama-3.1-Swallow-8B-v0.1, Llama-3.1-Swallow-8B-Instruct-v0.1, Llama-3.1-Swallow-70B-v0.1 и Llama-3.1-Swallow-70B-Instruct-v0.1. На веб-сайте https://swallow-llm.github.io/ представлены большие языковые модели, разработанные командой Swallow. Тип модели: Подробную информацию об архитектуре модели см. в Llama 3.1 MODELCARD. Язык(и): Японский Английский Библиотека: Токенизатор Megatron-LM: Пожалуйста, обратитесь к блогу Llama 3.1 за…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: tokyotech-llm
Теги: llama, en, ja, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 7
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.