Этот репозиторий содержит небольшую модель GPT2, обученную на наборе данных японской Википедии. Набор данных японской Википедии по состоянию на 20 августа 2021 г., выпущенный под лицензией Creative Commons Attribution-ShareAlike 3.0, используется как для токенизатора, так и для модели GPT-2. Мы разделили набор данных на три подмножества — обучающий, действительный и тестовый наборы. И токенизатор, и модель обучались на наборе поездов. Набор поездов содержит около 540 миллионов жетонов. Архитектура модели такая же, как у небольшой модели GPT-2 (nctx: 1024, nembd 768, nhead: 12, nlayer: 12), за исключением размера словаря. Размер словаря установлен на 32 000 вместо исходного размера 50 257. Transformers.GPT2LMHeadModel используется для обучения. Мы использовали 1 000 000 предложений из набора поездов. Размер словарного запаса составил 32 000. Для параметра adddummyprefix установлено значение True, поскольку японские слова не разделяются пробелами. После обучения модель токенизатора была импортирована как Transformers.BERTGenerationTokenizer, поскольку она поддерживает модели SentencePiece и не добавляет никаких специальных токенов по умолчанию, что особенно полезно для задач генерации текста. Модель обучалась на наборе поездов в течение 30 эпох с размером пакета 32. Каждая выборка содержала 1024 токена. Мы использовали Адама…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: colorfulscoop
Теги: tf, gpt2, ja, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 54
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.