RedHatAI/DeepSeek-R1-quantized.w4a16 - Каталог нейросетей
Генерация текста

RedHatAI/DeepSeek-R1-quantized.w4a16

Добавлено:
RedHatAI/DeepSeek-R1-quantized.w4a16

— Архитектура модели: DeepseekV3ForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Квантование активации: нет — Квантование веса: INT4 — Дата выпуска: 15.04.2025 — Версия: 1.0 — Разработчики модели: Red Hat (Neural Magic) Эта модель была получена путем квантования весов от DeepSeek-R1 до типа данных INT4. Эта оптимизация уменьшает количество битов, используемых для представления весов, с 8 до 4, уменьшая требования к памяти графического процессора (примерно на 50%). Весовое квантование также снижает требования к размеру диска примерно на 50%. Эту модель можно эффективно развернуть с помощью серверной части vLLM, как показано в примере ниже. vLLM также поддерживает обслуживание, совместимое с OpenAI. Более подробную информацию смотрите в документации. Мы создали эту модель с использованием MoE-Quant, библиотеки, разработанной совместно с ISTA и предназначенной для квантования очень больших моделей Mixture-of-Experts (MoE). Модель оценивалась в задаче таблицы лидеров OpenLLM (v1) с помощью lm-evaluation-harness и на популярных задачах рассуждения (AIME 2024, MATH-500, GPQA-Diamond) с помощью LightEval. Для обоснования оценок мы оцениваем pass@1 на основе 10 прогонов с разными начальными числами.

Модальности:
Генерация текста

Области применения:
Логика и рассуждение


Задача: Генерация текста
Автор: RedHatAI
Теги: vllm, deepseek, neuralmagic, redhat, llmcompressor, quantized, INT4, GPTQ
Лайков: 7  |  Загрузок: 16,241

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.