rinna/nekomata-7b - Каталог нейросетей
Генерация текста

rinna/nekomata-7b

Добавлено:

Мы проводим постоянное предварительное обучение qwen-7b на токенах 30B из смеси японских и английских наборов данных. Постоянная предварительная подготовка значительно улучшает производительность модели при выполнении японских задач. Он также обладает следующими замечательными функциями оригинальной модели Qwen. Инклюзивный словарь Qwen (размер словаря > 150 тыс.) позволяет модели обрабатывать японские тексты гораздо эффективнее, чем ранее выпущенная серия youri. Модель поддерживает максимальную длину последовательности 32768. Название некомата происходит от японского слова 猫又/ねこまた/Nekomata, которое является разновидностью японского мифического существа (妖怪/ようかい/Ёкай). Модель обучалась с использованием кода на базе EleutherAI/gpt-neox. 32-слойная языковая модель на основе трансформатора со скрытыми размерами 4096. Подробности архитектуры см. в документе Qwen. Модель была инициализирована с помощью модели qwen-7b и постоянно обучалась примерно на 30 миллиардах токенов из смеси следующих корпусов: японский CC-100, японский C4, японский OSCAR, The Pile, википедия, японский набор данных, курируемый Ринной. ~~~~python import torch из трансформаторов import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.frompretrained(«rinna/nekomata-7b»,…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: rinna
Теги: qwen, custom_code, ja, en
Лайков: 7  |  Загрузок: 13

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.