Мы использовали SentencePiece для переобучения вьетнамского токенизатора с размером словарного запаса 20 000. Сегментация вьетнамских слов не использовалась. Затем мы объединили этот словарь с исходным словарем Llama2, удалив повторяющиеся токены. Новый токенизатор значительно улучшает кодирование вьетнамского текста, сокращая количество токенов на 50 % по сравнению с ChatGPT и примерно на 70 % по сравнению с исходным Llama2. Мы провели однопериодическое непрерывное предварительное обучение, также известное как инкрементальное предварительное обучение, с использованием модели Llama2-chat 7B на смешанном наборе данных общим объемом 40,5 ГБ, состоящем из: — NewsCorpus — 19 ГБ — вьетнамской Википедии — 1,1 ГБ — вьетнамских книг — 1,6 ГБ — юридических документов на вьетнамском языке — 4,5 ГБ (отсканированных с thuvienphapluat и обработанных нами самостоятельно) — вьетнамского языка — 2,1 ГБ Юридический текст (из C4-vi) — 1,1 ГБ Книги на английском языке (выборка из стр.19) — 1,1 ГБ Английская Википедия (выборка из Википедии 20220301.en) — 10 ГБ Текст на английском языке (выборка из C4-en) Мы обучали модель на системе DGX A100, используя четыре графических процессора A100 за 10 дней (около 1000) часы работы графического процессора). Гиперпараметры установлены следующим образом: — Режим обучения: смешанная точность BFloat16 — Lora Config: мы также предоставляем часть LoRA, чтобы вы могли…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: bkai-foundation-models
Теги: llama, vi, en, text-generation-inference, endpoints_compatible
Лайков: 46 | Загрузок: 4
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.