scottgl/Qwen3.5-122B-A10B-NVFP4-GB10 - Каталог нейросетей
Генерация текста

scottgl/Qwen3.5-122B-A10B-NVFP4-GB10

Добавлено:
scottgl/Qwen3.5-122B-A10B-NVFP4-GB10

Qwen3.5-122B-A10B оптимизирован для NVIDIA DGX Spark (GB10, SM12.1) — все квантования встроены. Эта контрольная точка получена из Sehyo/Qwen3.5-122B-A10B-NVFP4 с дополнительными пост-квантованиями, которые применяются и постоянно сохраняются в весах. Результат загружается и немедленно передается на GB10 без каких-либо затрат на квантование во время выполнения. Протестировано на: NVIDIA DGX Spark (ASUS Ascent GX10), GB10 Grace Blackwell, SM12.1, унифицированной памяти 128 ГБ. Требования: — SM12.1 (GB10) — ядра Marlin FP4 специфичны для SM12.1 — scottgl9/sglang-spark-gb10-optimizations SGLang fork — CUDA 13.x НЕ будет работать на: — Standard H100/A100 — ядра Marlin FP4 требуют Blackwell SM12.1 — Apple Silicon — только Metal, без пути CUDA — Base квантование: Sehyo/Qwen3.5-122B-A10B-NVFP4 — Исходная модель: Qwen/Qwen3.5-122B-A10B — Вилка SGLang GB10: scottgl9/sglang-spark-gb10-optimizations

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: scottgl
Теги: qwen3_5_moe, image-text-to-text, qwen3.5, moe, nvfp4, fp8, quantized, compressed-tensors
Лайков: 5  |  Загрузок: 1,125

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.