RedHatAI/NVIDIA-Nemotron-Nano-9B-v2-quantized.w4a16 - Каталог нейросетей
Генерация текста

RedHatAI/NVIDIA-Nemotron-Nano-9B-v2-quantized.w4a16

Добавлено:
RedHatAI/NVIDIA-Nemotron-Nano-9B-v2-quantized.w4a16

— Архитектура модели: NemotronHForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Весовое квантование: INT4 — Дата выпуска: 22.10.2025 — Версия: 1.0 — Разработчики модели: RedHat (Neural Magic) — URI хранилища ModelCar: oci://registry.redhat.io/rhelai1/modelcar-nvidia-nemotron-nano-9b-v2-quantized.w4a16:1.5 — проверено в RHOAI 2.25: quay.io/modh/vllm:rhoai-2.25-cuda — проверено в RHAIIS 3.2.2: http://registry.redhat.io/rhaiis/vllm-cuda-rhel9:3.2.2 — Проверено на vLLM: 0.10.1.1 Эта модель была получена путем квантования весов NVIDIA-Nemotron-Nano-9B-v2 до типа данных INT4. Эта оптимизация уменьшает количество бит на параметр с 16 до 4, уменьшая размер диска и требования к памяти графического процессора примерно на 75%. Квантуются только веса линейных операторов внутри блоков преобразователей. Веса квантуются с использованием симметричной схемы для каждой группы с размером группы 64. Для квантования применяется алгоритм GPTQ, реализованный в библиотеке llm-compressor. Эту модель можно эффективно развернуть с помощью серверной части vLLM, как показано в примере ниже. vLLM также поддерживает обслуживание, совместимое с OpenAI. Более подробную информацию смотрите в документации. Детали создания Это…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: RedHatAI
Теги: nemotron_h, nvidia, int4, quantized, llm-compressor, compressed-tensors, red hat, conversational
Лайков: 5  |  Загрузок: 452

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.