sanbanfu/Qwen3.8-27B-ShortThink-NVFP4-GGUF - Каталог нейросетей
Генерация текста

sanbanfu/Qwen3.8-27B-ShortThink-NVFP4-GGUF

Добавлено:
sanbanfu/Qwen3.8-27B-ShortThink-NVFP4-GGUF

> 短思考版 Qwen3.8-27B —— 保留推理质量,压缩思考长度 > Short-thinking Qwen3.8-27B — keep reasoning quality, compress thinking length ShortThink is a short-thinking post-trained version of Qwen3.8-27B. It addresses a pain point of Qwen3.8: xhigh reasoning is high-quality but verbose; medium drops quality noticeably. MLP → NVFP4(4-bit,MSE 校准 128 条,W4A16,Blackwell FP4 张量核心加速) Attention → Q4K / Q5K / Q6K / Q80(多档可选) lmhead / embeddings / MTP 末层 → Q80(保两头质量) GDN 核心(ssmalpha/beta)→ F16**(注意力质量关键) MLP → NVFP4 (4-bit, MSE-calibrated 128 samples, W4A16, Blackwell FP4 tensor core) Attention → Q4K / Q5K / Q6K / Q80 (multiple tiers) lmhead / embeddings / MTP last layer → Q80 (preserve quality at both ends) GDN core (ssmalpha/beta) → F16** (critical for attention quality) 支持 reasoningeffort` 档位(low/ Base model Qwen3.8-27B is Apache-2.0…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: sanbanfu
Теги: llama.cpp, gguf, qwen3.5, qwen3.8, short-thinking, efficient-reasoning, nvfp4, quantization
Лайков: 4  |  Загрузок: 1,866

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.