Это японский GPT2 с примерно 1,5 млрд параметров, предварительно обученных на японской Википедии и CC-100. Архитектура модели основана на Radford+ 2019. Вы можете использовать необработанную модель для генерации текста или точно настроить ее для последующей задачи. Обратите внимание, что тексты следует заранее разбить на слова с помощью Juman++. Вы можете использовать эту модель напрямую с конвейером для генерации текста. Поскольку генерация основана на некоторой случайности, мы задаем начальное значение для воспроизводимости: тексты нормализуются с помощью neologdn, сегментируются на слова с помощью Juman++ и токенируются с помощью BPE. Для предварительного обучения использовался Juman++ 2.0.0-rc3. Эта работа поддерживалась Совместным центром использования / исследования междисциплинарных крупномасштабных информационных инфраструктур (JHPCN) в рамках общего проекта сотрудничества №. jh221004, «Разработка платформы для создания и обмена крупномасштабными моделями японского языка». Для обучения моделей мы использовали mdx: платформу будущего, основанного на данных.
Модальности:
Генерация текста
Задача: Генерация текста
Автор: nlp-waseda
Теги: tensorboard, gpt2, ja, text-generation-inference, endpoints_compatible
Лайков: 11 | Загрузок: 18
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.