Мы проводим постоянное предварительное обучение google/gemma-2-2b на токенах 80B из смеси японских и английских наборов данных. Постоянное предварительное обучение улучшает производительность модели при выполнении японских задач. Название «баку» происходит от японского слова 獏/ばく/Баку, которое представляет собой разновидность японского мифического существа (妖怪/ようかい/Ёкай). Модель была обучена с использованием кода на базе Lightning-AI/litgpt. 26-слойная языковая модель на основе преобразователя скрытого размера с 2304 уровнями. Подробную информацию об архитектуре модели можно найти в карточке модели Gemma 2. Модель была инициализирована с помощью модели google/gemma-2-2b и постоянно обучалась примерно на 80 миллиардах токенов из смеси следующих корпусов: японский CC-100 — японский C4 — японский OSCAR — The Pile — Википедия — японский набор данных, курируемый rinna. Авторы** — Тошиаки Вакацуки — Синьци Чен — Кей Савада modelid = «rinna/gemma-2-baku-2b» конвейер = Transformers.pipeline( «text-generation», model=modelid, modelkwargs={«torchdtype»: torch.bfloat16, «attnimplementation»: «eager»}, devicemap=»auto» ) выход = конвейер( «西田幾多郎は、», maxnewtokens=256, dosample=True ) print(output[0][«generatedtext»]) ~~~ При проведении…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: rinna
Теги: gemma2, ja, en, text-generation-inference
Лайков: 7 | Загрузок: 32
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.