Qwen1.5 — это бета-версия Qwen2, языковой модели только для декодера на основе трансформатора, предварительно обученной на большом количестве данных. По сравнению с предыдущим выпуском Qwen, улучшения включают в себя: 8 размеров моделей, включая плотные модели 0.5B, 1.8B, 4B, 7B, 14B, 32B и 72B, и модель MoE 14B с активированным 2.7B; Значительное улучшение производительности в предпочтении человека для моделей чата; Многоязычная поддержка как базовых, так и моделей чата; Стабильная поддержка длины контекста 32K для моделей всех размеров Нет необходимости в trustremotecode`. Для получения более подробной информации, пожалуйста, обратитесь к нашему сообщению в блоге и репозиторию GitHub. Qwen1.5 — это серия языковых моделей, включающая языковые модели декодера разных размеров. Для каждого размера мы выпускаем базовую языковую модель и выровненную модель чата. Он основан на архитектуре Transformer с активацией SwiGLU, смещением внимания QKV, групповым запросом внимания, смесью внимания скользящего окна и полного внимания и т. д. Кроме того, у нас есть улучшенный токенизатор, адаптированный к нескольким естественным языкам и кодам. Для бета-версии мы временно не включили GQA (кроме 32B) и смесь SWA и полного внимания. Мы предварительно обучили модели с большим…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Qwen
Теги: qwen2, chat, conversational, en, text-generation-inference, endpoints_compatible, 4-bit, awq
Лайков: 3 | Загрузок: 461
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.