ShinePixelOrg/Qwopus3.5-27B-v3-NVFP4 - Каталог нейросетей
Генерация текста

ShinePixelOrg/Qwopus3.5-27B-v3-NVFP4

Добавлено:
ShinePixelOrg/Qwopus3.5-27B-v3-NVFP4

Квантованная версия ShinePixelOrg/Qwopus3.5-27B-v3 со смешанной точностью. Эта контрольная точка сохраняет ту же гибридную архитектуру Qwen3.5 DeltaNet + softmax и головку Qwen3.5 MTP, что и источник BF16, но применяет смешанный рецепт NVFP4/FP8/BF16, который работает хорошо. Опубликованная папка включает в себя: — model.safetensors — config.json — рецепт.yaml — tokenizer.json — tokenizerconfig.json -processorconfig.json — preprocessorconfig.json — videopreprocessorconfig.json -generationconfig.json -chattemplate.jinja` Локальный вывод был проверен на одной NVIDIA RTX PRO 6000 Blackwell Workstation Edition (96 ГБ) с: — Старый однострочный патч vllm v1 для проблема Blackwell/TMA может потребоваться, если вы столкнетесь с той же проблемой. — Если ваша локальная сборка vllm еще не включает это исправление, примените однострочное исправление. — сервер запустился чисто — GET /health возвратил 200 — GET /v1/models возвратил модель — POST /v1/chat/completions возвратил 200 — MTP/спекулятивное декодирование было активным и сообщило о приемочных метриках в журналах сервера Неравномерное квантование смешанной точности с использованием llm-compressor: — modeltype=qwen35 — 64 текстовых слоя — fullattentioninterval=4 — mtpnumhiddenlayers=1 -…

Модальности:
Генерация текста

Области применения:
Логика и рассуждение Диалог / чат


Задача: Генерация текста
Автор: ShinePixelOrg
Теги: qwen3_5, image-text-to-text, qwen3.5, reasoning, quantized, fp8, nvfp4, mixed-precision
Лайков: 5  |  Загрузок: 14

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.