Мы проводим постоянное предварительное обучение Qwen/Qwen2.5-32B на 18B токенах из смеси японских и английских наборов данных. Постоянное предварительное обучение улучшает производительность модели при выполнении японских задач. Название бакэнэко происходит от японского слова 化け猫/ばけねこ/Бакэнэко, которое представляет собой разновидность японского мифического существа (妖怪/ようかい/Ёкай). Модель была обучена с использованием кода на базе Lightning-AI/litgpt. 64-слойная языковая модель на основе преобразователя скрытого размера 5120. Подробную информацию об архитектуре модели можно найти в техническом отчете Qwen2.5. Модель была инициализирована с помощью модели Qwen/Qwen2.5-32B и постоянно обучалась примерно на 18B токенах из смеси следующих корпусов — японский CC-100 — японский C4 — японский OSCAR — The Pile — Википедия — японский набор данных курировал rinna Авторы** — Тошиаки Вакацуки — Синьци Чен — Кей Савада
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: rinna
Теги: qwen2, conversational, ja, en, text-generation-inference
Лайков: 7 | Загрузок: 32
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.