nerkyor/Qwen3.6-27B-DSV4Pro-Thinking-Distill-FP8 - Каталог нейросетей
Генерация текста

nerkyor/Qwen3.6-27B-DSV4Pro-Thinking-Distill-FP8

Добавлено:
nerkyor/Qwen3.6-27B-DSV4Pro-Thinking-Distill-FP8

> MTP дает ~2 × одиночный поток (базовая скорость 7,7 → 15 ток/с, до ~19 / акцепт 0,89 для предсказуемого кода). Все измерено на этом дистиллированном FP8 (SGLang dev-cu13, EAGLE topk=1/3 Draft/mamba extrabuffer); поколение правильное, никаких повреждений FP8. Сопутствующая фигура взята из структурно идентичного официального Qwen/Qwen3.6-27B-FP8` (дистиллируемый аналог, отдельно не оцениваемый). > Где выигрывает FP8+MTP: одиночный поток в блоке с ограниченной полосой пропускания не является его ареной (Q4KM-imatrix GGUF там быстрее ~25 ток/с) — Сила FP8+MTP в параллельном обслуживании: тензорные ядра FP8 + пакетная обработка + качество практически без потерь. На Blackwell RTX-50 (более быстрый FP8) еще быстрее. И этот дистиллированный FP8, и официальная базовая FP8 (Qwen/Qwen3.6-27B-FP8) запускались через один и тот же потоковый жгут на DGX Spark (SGLang dev-cu13, в размышлениях, температура 0,6 / topp 0,95, контекст 36864`): GPQA-Diamond full-198 и MMLU-500 5-shot. Дистиллированный FP8 имеет +15,65 баллов по GPQA по сравнению с недистиллированным базовым — и заголовок — это конвергенция: 0 усечений длины по сравнению с базовыми 12. В сложных вопросах GPQA недистиллированная база позволяет своей цепочке мыслей ускользать, пока не врезается в потолок токенов (эти 12 незавершенных ответов оцениваются…

Модальности:
Генерация текста

Области применения:
Логика и рассуждение Диалог / чат


Задача: Генерация текста
Автор: nerkyor
Теги: qwen3_5, qwen3, dense, distillation, reasoning, thinking, agentic, mtp
Лайков: 5  |  Загрузок: 274

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.