Это большая языковая модель GPT-2 на уровне японских символов (717M параметров), предварительно обученная на японской Википедии, японской части CC-100 и японской части OSCAR. Вы можете использовать эту модель напрямую с конвейером для генерации текста. Вы также можете использовать эту модель, чтобы получить характеристики данного текста. Используется словарь уровня символов размером 6 КБ. Точнее, редкие символы можно разделить на байты, поскольку используется кодирование пар байтов на уровне байтов (BPE). Токенизатор BPE был обучен на небольшом подмножестве обучающих данных. Поскольку данные были преобразованы в формат «один символ в строке», операции слияния никогда не выходят за границы символов. Обратите внимание, что токенизатор сопоставляет U+0020 с [UNK], поскольку предварительная обработка исключила пробельные символы (U+0020) из обучающих данных. Вместо этого используйте U+3000 (идеографическое пространство). — Японская Википедия (по состоянию на 2022–1020 гг., 3,2 ГБ, 27 млн предложений, 1,3 млн документов) — Японская часть CC-100 (85 ГБ, 619 млн предложений, 66 млн документов) — Японская часть OSCAR (54 ГБ, 326 млн предложений, 25 млн документов). Обратите внимание, что мы отфильтровали документы с аннотациями «заголовок», «нижний колонтитул» или «шум». теги в ОСКАР. Также обратите внимание, что японская Википедия дублировалась 10 раз…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: ku-nlp
Теги: gpt2, ja, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 61
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.