rinna/nekomata-14b - Каталог нейросетей
Генерация текста

rinna/nekomata-14b

Добавлено:

Мы проводим постоянное предварительное обучение qwen-14b на токенах 66B из смеси японских и английских наборов данных. Постоянная предварительная подготовка значительно улучшает производительность модели при выполнении японских задач. Он также обладает следующими замечательными функциями оригинальной модели Qwen. Инклюзивный словарь Qwen (размер словаря > 150 тыс.) позволяет модели обрабатывать японские тексты гораздо эффективнее, чем ранее выпущенная серия youri. Модель поддерживает максимальную длину последовательности 8192. Название некомата происходит от японского слова 猫又/ねこまた/Nekomata, которое является разновидностью японского мифического существа (妖怪/ようかい/Ёкай). Модель была обучена с использованием кода на основе aws-neuron/neuronx-nemo-megatron. 40-слойная языковая модель на основе преобразователя скрытого размера 5120. Подробности архитектуры см. в документе Qwen. Модель была инициализирована с помощью модели qwen-14b и постоянно обучалась примерно на 66B токенах из смеси следующих корпусов: японский CC-100, японский C4, японский OSCAR, The Pile, Википедия, японский набор данных, курируемый Ринной. Некомата-14B обучалась на 16 узлах экземпляра Amazon EC2 trn1.32xlarge на базе специального ускорителя машинного обучения AWS Trainium.

Модальности:
Генерация текста


Задача: Генерация текста
Автор: rinna
Теги: qwen, custom_code, ja, en
Лайков: 19  |  Загрузок: 2,044

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.