Эта модель предварительно обучена на наборе данных непальского текста, состоящем из более чем 13 миллионов текстовых последовательностей на непальском языке, с использованием цели причинно-следственного моделирования языка (CLM). Наш подход обучает модель фрагмента предложения (SPM) для токенизации текста, аналогичную XLM-ROBERTa, и обучает distilgpt2 для языкового моделирования. Эту необработанную модель можно использовать для генерации текста на непальском языке, и ее предполагается доработать для последующих задач, ориентированных на непальский язык. Языковая модель, обучаемая на данных с текстами, сгруппированными в блок размером 512, обрабатывает текстовые последовательности длиной до 512 токенов и может не работать удовлетворительно на более коротких последовательностях. Эту модель можно использовать непосредственно с конвейером для генерации текста. Поскольку генерация основана на некоторой случайности, мы задаем начальное значение для воспроизводимости: Вот как мы можем использовать модель для получения характеристик данного текста в PyTorch: Эта модель обучается на наборе данных моделирования языка непалитекста, который объединяет наборы данных: OSCAR, cc100 и набор очищенных непальских статей в Википедии. Что касается обучения языковой модели, тексты токенизированы с использованием Sentence Piece Model (SPM), размер словаря составляет 24 576, а тексты группируются в блок из 512 токенов. Модель обучена с тем же…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: Sakonii
Теги: gpt2, generated_from_trainer, text-generation-inference, endpoints_compatible
Лайков: 7 | Загрузок: 1,195
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.