mconcat/Qwopus3.5-27B-v3-NVFP4 - Каталог нейросетей
Генерация текста

mconcat/Qwopus3.5-27B-v3-NVFP4

Добавлено:
mconcat/Qwopus3.5-27B-v3-NVFP4

Квантованная версия Jackrong/Qwopus3.5-27B-v3 смешанной точности (NVFP4/FP8/BF16). Эта контрольная точка сохраняет гибридную архитектуру Qwen3.5 DeltaNet + softmax и головку MTP (Multi-Token Prediction) из источника BF16, применяя послойный рецепт смешанной точности, который балансирует сжатие с качеством вывода. Локальный вывод был проверен 7 апреля 2026 г. на одной NVIDIA RTX PRO 6000 Blackwell Workstation Edition (96 ГБ) с: — vllm==0.17.1 — Transformers==5.3.0 — llm-compressor==0.14.1.dev24 — Экспорт смешанной точности успешно завершен через llm-compressor — Веса MTP включены в основной файл защитных тензоров — контрольная точка загружает и генерирует правильный вывод в vLLM. На графических процессорах Blackwell (RTX 5090, RTX PRO 6000) могут потребоваться два исправления: 2. Серверная часть NVFP4 GEMM: ядро FlashInfer FP4 GEMM содержит известную ошибку на SM120 (потребительский Blackwell). Вместо этого используйте серверную часть CUTLASS: Неравномерное квантование смешанной точности с использованием llm-compressor: — modeltype=qwen35 — 64 текстовых слоя (гибрид DeltaNet + softmax, fullattentioninterval=4) — mtpnumhiddenlayers=1 — maxpositionembeddings=262144 — Hiddensize=5120, промежуточный размер=17408 — vocabsize=248320 — Это наименьший квантованный вариант…

Модальности:
Генерация текста

Области применения:
Логика и рассуждение Диалог / чат


Задача: Генерация текста
Автор: mconcat
Теги: qwen3_5, image-text-to-text, qwen3.5, reasoning, quantized, fp8, nvfp4, mixed-precision
Лайков: 5  |  Загрузок: 114

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.