GPT2-Spanish — это модель генерации языка, обученная с нуля с использованием 11,5 ГБ испанских текстов и токенизатора кодирования пар байтов (BPE), который был обучен для этой цели. Используемые параметры такие же, как и у средней версии исходной модели OpenAI GPT2. Эта модель была обучена на корпусе из 11,5 ГБ текстов, соответствующем 3,5 ГБ статей Википедии и 8 ГБ книг (повествование, рассказы, театр, поэзия, эссе и популяризация). Тексты маркируются с использованием байтовой версии кодировки пар байтов (BPE) (для символов Юникода) и размера словаря 50257. Входные данные представляют собой последовательности из 1024 последовательных токенов. Этот токенизатор был обучен с нуля на корпусе испанского языка, поскольку было доказано, что токенизатор английских моделей имеет ограничения для отражения семантических отношений испанского языка из-за морфосинтаксических различий между обоими языками. Помимо специального токена «» для окончания текста в моделях OpenAI GPT-2, были включены токены «», «», «» (..)»», чтобы они могли служить подсказками при дальнейшем обучении. Модель и токенизатор были обучены с использованием библиотек Hugging Face с графическим процессором Nvidia Tesla V100 с памятью 16 ГБ на…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: DeepESP
Теги: tf, jax, gpt2, GPT-2, Spanish, ebooks, nlg, es
Лайков: 9 | Загрузок: 2,973
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.