patrickbdevaney/Qwen3.5-122B-A10B-NVFP4-vllm-docker-jetson-agx-thor - Каталог нейросетей
Генерация текста

patrickbdevaney/Qwen3.5-122B-A10B-NVFP4-vllm-docker-jetson-agx-thor

Добавлено:
patrickbdevaney/Qwen3.5-122B-A10B-NVFP4-vllm-docker-jetson-agx-thor

Первое подтвержденное развертывание Qwen3.5-122B-A10B с точностью NVFP4 на одном NVIDIA Jetson AGX Thor (унифицированная память 128 ГБ). В этом репозитории хранятся сжатые архивы образов Docker, необходимые для запуска сервера вывода vLLM для Qwen3.5-122B-A10B на Jetson AGX Thor. Полную документацию, сценарии воспроизведения, исправления и файл Dockerfile можно найти в сопутствующем репозитории GitHub: > 📦 GitHub (скрипты, исправления, документация): patrickbdevaney/qwen-3.5-122b-a10b-jetson-thor > Вес модели не включен. Грузы Qwen3.5-122B-A10B-NVFP4 необходимо поставить отдельно. См. репозиторий GitHub для сценария перешардинга (01reshardnvfp4.sh). > ⚠️ Этот образ предназначен только для aarch64 и требует графического процессора с архитектурой Blackwell для выполнения NVFP4. Он не будет работать на платформах x86 или более ранних версиях Jetson. При использовании —enforce-eager каждый прямой проход проходит через диспетчеризацию Python без оптимизации графа CUDA. Для 94-уровневой модели MoE это приводит к TTFT ~120 с при запросах ~900 токенов. Снимите флаг и разрешите прогрев графа CUDA при запуске. Первый запуск после снятия флага займет на 10–20 минут больше, пока графики будут записаны и кэшированы в ~/thor-vllm-cache. Значения выше 0,72 вызывают OOM во время профилирования кэша KV на модели…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: patrickbdevaney
Теги: vllm, qwen, moe, fp4, nvfp4, jetson, aarch64, inference
Лайков: 5  |  Загрузок: 0

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.