Тип данных INT8 удобен и эффективен для большинства аппаратных платформ. При бенчмаркинге мы не наблюдаем потери точности и повышения производительности до 33%. Благодаря нашему объединенному PULL REQUEST SGLang теперь поддерживает операцию поблочного квантования INT8. Масштабы квантования определяются путем деления блочного максимума значений элемента на максимум типа INT8. Чтобы сгенерировать этот вес, запустите предоставленный скрипт в каталоге ./inference: python3 bf16castblockint8.py —input-bf16-hf-path /path/to/bf16-weights/ —output-int8-hf-path /path/to/save-int8-weight/ « Перед выводом вы должны подтвердить «quantizationconfig» config.json в /path/to/save-int8-weight/` должно быть: «quantizationconfig»: { «activationscheme»: «dynamic», «quantmethod»: «blockwiseint8», «weightblocksize»: [ 128, 128 ] } Пост-обучение: крупномасштабное обучение с подкреплением на базовой модели. Мы напрямую применяем обучение с подкреплением (RL) к базовой модели, не полагаясь на контролируемую точную настройку (SFT) в качестве предварительного шага. Этот подход позволяет модели исследовать цепочку мыслей (CoT) для решения сложных проблем, что привело к разработке DeepSeek-R1-Zero. ДипСик-Р1-Ноль…
Модальности:
Генерация текста
Области применения:
Диалог / чат Логика и рассуждение
Задача: Генерация текста
Автор: meituan
Теги: deepseek_v3, conversational, custom_code, text-generation-inference, endpoints_compatible, blockwise_int8
Лайков: 49 | Загрузок: 1,549
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.