См. наши тесты квантования в Unsloth Dynamic 2.0 GGUF. Выберите целевой каталог на томе со свободным объемом ≥70 ГБ (модель ~62 ГБ). Примечания: > — Загрузка hf возобновляется — повторно запустите ту же команду, если соединение прервется. > — —max-workers 8 распараллеливает загрузки; настроиться на быстрые сети. > — Дополнительная опция hfxet позволяет осуществлять передачу данных по протоколу Xet для репозиториев, поддерживаемых Xet; нет необходимости в git-xet или git-lfs при использовании hf download`. Spark использует единую память LPDDR5X (~ 128 ГБ, совместно используемую процессором и графическим процессором), а не отдельные пулы системы и видеопамяти. Два рычага в порядке воздействия: 1. Уменьшите —gpu-memory-utilization с 0,85 → 0,70, чтобы освободить ~19 ГБ обратно в ОС и повторно включить предварительную выборку веса. Стоимость: меньший бюджет кэша KV. 2. Уменьшите —max-model-len, чтобы уменьшить выделение кэша KV (например, уменьшение вдвое контекстного окна уменьшает вдвое кэш KV при —max-num-seqs=1). Комбинированное переопределение: вариант этой модели BF16 поддерживается в SGLang со следующими образами: CUDA 13.0: lmsysorg/sglang:dev-cu13-nemotronh-nano-omni-reasoning-v3 CUDA 12.9: lmsysorg/sglang:dev-nemotronh-nano-omni-reasoning-v3 Сначала необходимо установить librosa: pip install librosa —break-system-packages Для обслуживания: сленг-служить —model-path…
Модальности:
Генерация текста Мультимодальность
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: unsloth
Теги: NemotronH_Nano_Omni_Reasoning_V3, nvidia, unsloth, nemotron-3, multimodal, conversational, custom_code, en
Лайков: 14 | Загрузок: 1,650
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.