Llama 3.3 Swallow — это большая языковая модель (70B), созданная путем постоянного предварительного обучения на модели Meta Llama 3.3. Llama 3.3 Swallow расширила возможности японского языка по сравнению с оригинальной Llama 3.3, сохранив при этом возможности английского языка. Для непрерывного предварительного обучения мы используем около 315 миллиардов токенов, которые были выбраны из большого японского веб-корпуса (Swallow Corpus Version 2), статей японской и английской Википедии, а также математического содержания и содержания кодирования и т. д. (см. раздел «Наборы обучающих данных» базовой модели). Модели, настроенные по инструкциям (Instruct), были построены методом контролируемой точной настройки (SFT) на синтетических данных, специально созданных для японского языка. См. раздел «Указатель моделей Swallow», чтобы найти другие варианты моделей. — 10 марта 2025 г.: выпущены Llama-3.3-Swallow-70B-Instruct-v0.4 и Llama-3.3-Swallow-70B-v0.4. — 30 декабря 2024 г.: выпущена версия Llama-3.1-Swallow-70B-Instruct-v0.3. — 23 декабря 2024 г.: выпущена версия Llama-3.1-Swallow-8B-Instruct-v0.3. — 11 ноября 2024 г.: выпущены Llama-3.1-Swallow-8B-v0.2 и Llama-3.1-Swallow-8B-Instruct-v0.2. — 8 октября 2024 г.: выпущены Llama-3.1-Swallow-8B-v0.1, Llama-3.1-Swallow-8B-Instruct-v0.1, Llama-3.1-Swallow-70B-v0.1 и…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: tokyotech-llm
Теги: llama, en, ja, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 57
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.