Это японская языковая модель GPT-2 среднего уровня (параметры 310 М), предварительно обученная в японской Википедии, японской части CC-100 и японской части OSCAR. Эту модель можно использовать непосредственно с конвейером для генерации текста. Вы также можете использовать эту модель для получения особенностей данного текста. Используется словарь на уровне символов размером 6K. Если быть точным, редкие символы могут быть разделены на байты, поскольку используется кодирование байт-пары на уровне байтов (BPE). Токенизатор BPE был обучен на небольшом подмножестве обучающих данных. Поскольку данные были преобразованы в односимвольный формат, операции слияния никогда не выходят за рамки символов. Обратите внимание, что токенизатор отображает U 0020 на [UNK], поскольку предварительная обработка устраняет пробельные символы (U 0020) из обучающих данных. Вместо этого используйте U 3000 (Ideographic Space). — Japanese Wikipedia (as of 20221020, 3.2GB, 27M sentences, 1.3M documents) — Japanese portion of CC-100 (85GB, 619M sentences, 66M documents) — Japanese portion of OSCAR (54GB, 326M sentences, 25M documents) Note that we filtered out documents annotated with «header», «footer», or «noisy» tags in OSCAR. Also note that Japanese Wikipedia was duplicated 10 times…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: ku-nlp
Теги: gpt2, ja, text-generation-inference, endpoints_compatible
Лайков: 3 | Загрузок: 121
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.