QuantTrio/DeepSeek-R1-0528-GPTQ-Int4-Int8Mix-Compact - Каталог нейросетей
Генерация текста

QuantTrio/DeepSeek-R1-0528-GPTQ-Int4-Int8Mix-Compact

Добавлено:
QuantTrio/DeepSeek-R1-0528-GPTQ-Int4-Int8Mix-Compact

Этот репозиторий предоставляет модель Int4 + выборочно-Int8 GPTQ DeepSeek-R1-0528: только слои, которые очень чувствительны к квантованию, остаются в Int8, а остальные остаются в Int4, сохраняя качество генерации с минимальными издержками на размер файла. Предварительные испытания показывают, что преобразование всей модели в чистый Int4 (AWQ/GPTQ) с использованием схемы квантования, используемой в текущей реализации DeepSeek-R1 от vLLM, снижает точность вывода и может привести к ошибочным выводам. Послойное мелкозернистое квантование существенно смягчает эту проблему. Временное исправление: vLLM == 0.9.0 еще не поддерживает послойное квантование для модулей MoE. Мы добавили метод getmoequantmethod в gptqmarlin.py в качестве временного исправления. Пока восходящий PR не будет объединен, замените исходный файл файлом, представленным в этом репозитории. Выберите вариант, который лучше всего соответствует вашим требованиям к оборудованию и качеству. В настоящее время в vllm==0.9.0 отсутствует поддержка послойных конфигураций квантования для модуля moe, что приведет к ошибкам при загрузке модели. Я реализовал простое исправление, добавив функцию getmoequantmethod в файл gptqmarlin.py. Пока PR не будет объединен, замените файл gptq_marlin.py в своем…

Модальности:
Генерация текста

Области применения:
Диалог / чат Логика и рассуждение


Задача: Генерация текста
Автор: QuantTrio
Теги: deepseek_v3, DeepSeek-R1-0528, GPTQ, Int4-Int8Mix, 量化修复, vLLM, conversational, custom_code
Лайков: 5  |  Загрузок: 8

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.