Квантованная версия Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled со смешанной точностью — модель Qwen3.5-27B, очищенная от рассуждений Claude 4.6 Opus. ~25 ГБ на диске (~23,7 ГБ во видеопамяти). Рекомендуемый графический процессор: NVIDIA RTX PRO 6000 (96 ГБ), который без дополнительной настройки работает в полном контексте 262 КБ. Репозиторий также включает preprocessorconfig.json, videopreprocessorconfig.json, исправленные метаданные токенизатора и дополнительный модуль MTP Qwen3.5 (model.mtp.safetensors). На одном RTX 5090 (32 ГБ) эта контрольная точка была локально проверена 19 марта 2026 г. с vLLM 0.17.1, преобразователями 5.3.0 и только патчем SM120 TMA из PR № 36325; Спекулятивное декодирование MTP запущено и согласованно генерируется до полностью настроенного контекста 262 144 без —enforce-eager`. > Если у вас графический процессор с видеопамятью >= 48 ГБ (RTX PRO 6000, A100, H100 и т. д.), пропустите этот раздел. — vllm==0.17.1 — Transformers==5.3.0 — только патч SM120 TMA из PR #36325 — нет установки ветки PR — нет —enforce-eager — проверено на одном RTX 5090 с CUDADEVICEORDER=PCIBUSID и CUDAVISIBLEDEVICES=1 Точный патч, использованный в проверенном запуске, ограничивает путь TMA Triton к Hopper и удерживает его отключенным в Блэквелле: > Примечания: > — —gpu-memory-utilization 0.85,…
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат
Задача: Генерация текста
Автор: mconcat
Теги: qwen3_5, image-text-to-text, qwen3.5, reasoning, quantized, fp8, nvfp4, mixed-precision
Лайков: 37 | Загрузок: 20,990
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.