Эта модель была получена путем квантования весов deepseek-ai/DeepSeek-R1-0528 к типу данных INT4. Эта оптимизация уменьшает количество бит на параметр с 8 до 4, уменьшая размер диска и требования к памяти графического процессора примерно на 50%. Сжимаются только несовместные эксперты внутри блоков трансформаторов. Веса квантуются с использованием симметричной схемы для каждой группы с размером группы 128. Для квантования применяется алгоритм GPTQ. Эта модель была оценена на задачах рассуждения (AIME-24, GPQA-Diamond, MATH-500). Для задач рассуждения мы оцениваем pass@1 на основе 10 прогонов с разными начальными числами и температурой = 0,6, topp = 0,95 и maxnewtokens = 65536`. Денис Кузнеделев (Яндекс), Эльдар Куртич (Red Hat AI и ISTA) и Дэн Алистарх (Red Hat AI и ISTA).
Модальности:
Генерация текста
Области применения:
Диалог / чат Логика и рассуждение
Задача: Генерация текста
Автор: ISTA-DASLab
Теги: deepseek_v3, conversational, custom_code, text-generation-inference, endpoints_compatible, compressed-tensors
Лайков: 5 | Загрузок: 14
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.