QwQ — это модель рассуждения из серии Qwen. По сравнению с обычными моделями, настроенными на инструкции, QwQ, способный мыслить и рассуждать, может значительно повысить производительность в последующих задачах, особенно в сложных задачах. QwQ-32B — это модель рассуждения среднего размера, которая способна достичь конкурентоспособной производительности по сравнению с современными моделями рассуждения, например, DeepSeek-R1, o1-mini. Этот репозиторий содержит модель QwQ 32B в формате GGUF, которая имеет следующие функции: — Тип: причинные языковые модели — Этап обучения: предварительное обучение и постобучение (контролируемая точная настройка и обучение с подкреплением) — Архитектура: преобразователи с RoPE, SwiGLU, RMSNorm и смещением QKV внимания — Количество параметров: 32,5B — Количество параметров (без внедрения): 31.0B — Количество слоев: 64 — Количество заголовков внимания (GQA): 40 для Q и 8 для KV — Длина контекста: полные 131 072 токена — Квантование: q4KM, q50, q5KM, q6K, q8_0. Для получения более подробной информации обратитесь к нашему блогу, GitHub и документации. QwQ основан на Qwen2.5, код которого использовался в последних трансформерах Hugging Face. Советуем использовать последнюю версию трансформеров. Мы советуем вам клонировать llama.cpp и…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Qwen
Теги: gguf, chat, en, endpoints_compatible, conversational
Лайков: 208 | Загрузок: 3,482
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.