Мы проводим постоянное предварительное обучение llama2-7b на токенах 40B из смеси японских и английских наборов данных. Постоянная предварительная подготовка значительно улучшает производительность модели при выполнении японских задач. Имя юри происходит от японского слова 妖狸/ようり/Юри, которое представляет собой разновидность японского мифического существа (妖怪/ようかい/Ёкай). Модель обучалась с использованием кода на базе EleutherAI/gpt-neox. 32-слойная языковая модель на основе преобразователя со скрытым размером 4096 пикселей. Подробности архитектуры см. в статье llama2. Модель была инициализирована с помощью модели llama2-7b и постоянно обучалась примерно на 40 миллиардах токенов из смеси следующих корпусов: японский CC-100, японский C4, японский OSCAR, The Pile, Wikipedia, японский набор данных, курируемый Ринной. ~~~~python import torch from Transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.frompretrained(«rinna/youri-7b») model = AutoModelForCausalLM.frompretrained(«rinna/youri-7b») text = «西田幾多郎は、» tokenids = tokenizer.encode(text, addspecialtokens=False, returntensors=»pt») с torch.nograd(): outputids = model.generate( tokenids.to(model.device), maxnewtokens=200, minnewtokens=200, dosample=True, температура=1,0, topp=0,95,…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: rinna
Теги: llama, ja, en, model-index, text-generation-inference
Лайков: 21 | Загрузок: 2,653
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.