unsloth/NVIDIA-Nemotron-3-Nano-Omni-30B-A3B-Reasoning - Каталог нейросетей
Генерация текста

unsloth/NVIDIA-Nemotron-3-Nano-Omni-30B-A3B-Reasoning

Добавлено:
unsloth/NVIDIA-Nemotron-3-Nano-Omni-30B-A3B-Reasoning

См. наши тесты квантования в Unsloth Dynamic 2.0 GGUF. Выберите целевой каталог на томе со свободным объемом ≥70 ГБ (модель ~62 ГБ). Примечания: > — Загрузка hf возобновляется — повторно запустите ту же команду, если соединение прервется. > — —max-workers 8 распараллеливает загрузки; настроиться на быстрые сети. > — Дополнительная опция hfxet позволяет осуществлять передачу данных по протоколу Xet для репозиториев, поддерживаемых Xet; нет необходимости в git-xet или git-lfs при использовании hf download`. Spark использует единую память LPDDR5X (~ 128 ГБ, совместно используемую процессором и графическим процессором), а не отдельные пулы системы и видеопамяти. Два рычага в порядке воздействия: 1. Уменьшите —gpu-memory-utilization с 0,85 → 0,70, чтобы освободить ~19 ГБ обратно в ОС и повторно включить предварительную выборку веса. Стоимость: меньший бюджет кэша KV. 2. Уменьшите —max-model-len, чтобы уменьшить выделение кэша KV (например, уменьшение вдвое контекстного окна уменьшает вдвое кэш KV при —max-num-seqs=1). Комбинированное переопределение: вариант этой модели BF16 поддерживается в SGLang со следующими образами: CUDA 13.0: lmsysorg/sglang:dev-cu13-nemotronh-nano-omni-reasoning-v3 CUDA 12.9: lmsysorg/sglang:dev-nemotronh-nano-omni-reasoning-v3 Сначала необходимо установить librosa: pip install librosa —break-system-packages Для обслуживания: сленг-служить —model-path…

Модальности:
Генерация текста Мультимодальность

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: unsloth
Теги: NemotronH_Nano_Omni_Reasoning_V3, nvidia, unsloth, nemotron-3, multimodal, conversational, custom_code, en
Лайков: 14  |  Загрузок: 1,650

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.