Qwen1.5-Wukong-0.5B — это усовершенствованная версия оригинальной фантастической модели Qwen1.5-0.5B, созданная командой Qwen. Эта модель была обучена на наборе данных teknium OpenHeremes-2.5 и некоторых дополнительных наборах данных от Cognitive Computations https://erichartford.com/dolphin. 🐬 Qwen1.5 — это бета-версия Qwen2, языковой модели только для декодера на основе преобразователя, предварительно обученной на большом объеме данных. По сравнению с предыдущим выпущенным Qwen, улучшения включают: 6 типоразмеров модели, включая 0,5В, 1,8В, 4В, 7В, 14В и 72В; Значительное улучшение производительности моделей чата; Многоязычная поддержка как базовой модели, так и модели чата; Стабильная поддержка длины контекста 32 КБ для моделей всех размеров. Нет необходимости в TrustRemotecode`. Более подробную информацию можно найти в нашем блоге и репозитории GitHub. Qwen1.5 — это серия языковых моделей, включающая языковые модели декодеров разных размеров. Для каждого размера мы выпускаем модель базового языка и согласованную модель чата. Он основан на архитектуре Transformer с активацией SwiGLU, смещением внимания QKV, вниманием к групповым запросам, сочетанием внимания скользящего окна и полного внимания и т. д. Кроме того, у нас есть улучшенный токенизатор, адаптивный к множеству…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: RESMPDEV
Теги: qwen2, conversational, en, zh, model-index, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 60
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.