bkai-foundation-models/vietnamese-llama2-7b-120GB - Каталог нейросетей
Генерация текста

bkai-foundation-models/vietnamese-llama2-7b-120GB

Добавлено:
bkai-foundation-models/vietnamese-llama2-7b-120GB

Мы усовершенствовали наш предыдущий токенизатор vietnamese-llama2-7b-40GB, обучая SentencePiece более обширной коллекции чистых вьетнамских документов, охватывающих различные области, такие как новости, книги, акции, финансы и законы. В отличие от предыдущей версии, мы следуем исходной статье LLaMA-2, чтобы разбить все числа на отдельные цифры. Опять же, обновленный токенизатор заметно улучшает кодировку вьетнамского текста, сокращая количество токенов на 50% по сравнению с ChatGPT и примерно на 70% по сравнению с исходным Llama2. Вот наши источники данных: — 53 ГБ NewsCorpus (чистый + дедупированный NewsCorpus binhvq в сочетании с нашими данными, просканированными самостоятельно, до октября 2023 года). Спасибо iambestfeed за его отличную работу по сканированию новостных данных. — 1,3 ГБ Вьетнамская Википедия (обновлена до октября 2023 г.) — 8,5 ГБ вьетнамские книги — 4,8 ГБ вьетнамские юридические документы (чистые и дедупированные) — 1,6 ГБ биржевые новости (чистые и дедупированные) — 43 ГБ текста на вьетнамском языке (выборка из Culturax-vi) — 2,3 ГБ английских книг (выборка из стр. 19) — 2,2 ГБ английской Википедии — Текст на английском языке объемом 16 ГБ (выборка из Culturax-en). Затем мы объединяем все источники данных и выполняем последнюю дедупликацию, в результате чего получаем окончательный набор данных для предварительного обучения…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: bkai-foundation-models
Теги: llama, vi, en, text-generation-inference, endpoints_compatible
Лайков: 36  |  Загрузок: 0

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.