Предварительно обученная модель gpt на вьетнамском языке с использованием цели причинного языкового моделирования (CLM). Он был представлен в этой статье и впервые опубликован на этой странице. ~~~~ импортировать факел из трансформаторов import GPT2Tokenizer, GPT2LMHeadModel tokenizer = GPT2Tokenizer.frompretrained(‘NlpHUST/gpt2-vietnamese’) model = GPT2LMHeadModel.frompretrained(‘NlpHUST/gpt2-vietnamese’) text = «Вьетнам là quốc gia có» inputids = tokenizer.encode(text, returntensors=’pt’) max_length = 100 sampleoutputs = model.generate(inputids,padtokenid=tokenizer.eostokenid, dosample=True, maxlength=maxlength, minlength=maxlength, topk=40, numbeams=5, Earlystopping=True, norepeatngramsize=2, numreturn_sequences=3) для i, sampleoutput in enumerate(sampleoutputs): print(«>> Сгенерированный текст {}nn{}».format(i+1, tokenizer.decode(sample_output.tolist()))) print(‘n—‘) ~~~~ 12-слойная языковая модель на основе преобразователя со скрытым размером 768 пикселей. Модель обучалась на вьетнамском наборе данных Oscar (32 ГБ) для оптимизации традиционной задачи моделирования языка на TPU v3-8 в течение примерно 6 дней. На выбранном проверочном наборе от Оскара он достигает около 13,4. В следующем примере выполняется тонкая настройка GPT-2 в WikiText-2. Мы используем сырое…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: NlpHUST
Теги: jax, gpt2, vi, vietnamese, lm, nlp, text-generation-inference, endpoints_compatible
Лайков: 29 | Загрузок: 5,792
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.