QwQ — это модель рассуждения из серии Qwen. По сравнению с обычными моделями, настроенными на инструкции, QwQ, способный мыслить и рассуждать, может значительно повысить производительность в последующих задачах, особенно в сложных задачах. QwQ-32B — это модель рассуждения среднего размера, которая способна достичь конкурентоспособной производительности по сравнению с современными моделями рассуждения, например, DeepSeek-R1, o1-mini. Этот репозиторий содержит 4-битную модель QwQ 32B, квантованную AWQ, которая имеет следующие функции: — Тип: причинные языковые модели — Этап обучения: предварительное обучение и постобучение (контролируемая точная настройка и обучение с подкреплением) — Архитектура: преобразователи с RoPE, SwiGLU, RMSNorm и смещением QKV внимания — Количество параметров: 32.5B — Количество параметров (Без встраивания): 31.0B — Количество слоев: 64 — Количество заголовков внимания (GQA): 40 для Q и 8 для KV — Длина контекста: полные 131 072 токена — Для подсказок, длина которых превышает 8 192 токена, необходимо включить YaRN, как описано в этом разделе. — Квантование: AWQ 4-бит. Более подробную информацию можно найти в нашем блоге, на GitHub и в документации. QwQ основан на Qwen2.5, код которого использовался в последних трансформерах Hugging Face. Мы советуем…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Qwen
Теги: qwen2, chat, conversational, en, 4-bit, awq
Лайков: 133 | Загрузок: 280,584
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.