— Архитектура модели: DeepseekV3ForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Квантование активации: нет — Квантование веса: INT4 — Дата выпуска: 30 мая 2025 г. — Версия: 1.0 — Проверено на: RHOAI 2.24, RHAIIS 3.2.1 — Разработчики модели: Red Hat (Neural Magic) — URI ModelCar Storage: oci://registry.redhat.io/rhelai1/modelcar-deepseek-r1-0528-quantized-w4a16:1.5 — проверено в RHOAI 2.24: quay.io/modh/vllm:rhoai-2.24-cuda — проверено в RHAIIS 3.2.1: http://registry.redhat.io/rhaiis/vllm-cuda-rhel9:3.2.1 — проверено на vLLM: 0.10.0. Эта модель была получена путем квантования весов DeepSeek-R1-0528 до типа данных INT4. Эта оптимизация уменьшает количество битов, используемых для представления весов, с 8 до 4, уменьшая требования к памяти графического процессора (примерно на 50%). Весовое квантование также снижает требования к размеру диска примерно на 50%. Эту модель можно эффективно развернуть с помощью серверной части vLLM, как показано в примере ниже. vLLM также поддерживает обслуживание, совместимое с OpenAI. Более подробную информацию смотрите в документации. Мы создали эту модель с помощью MoE-Quant, библиотеки, разработанной совместно с ISTA и предназначенной для квантования очень больших моделей Mixture-of-Experts (MoE).…
Модальности:
Генерация текста
Области применения:
Диалог / чат Логика и рассуждение
Задача: Генерация текста
Автор: RedHatAI
Теги: deepseek_v3, deepseek, neuralmagic, redhat, llmcompressor, quantized, INT4, GPTQ
Лайков: 13 | Загрузок: 607
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.