Эта квантованная модель была создана с использованием AutoAWQ версии 0.2.8 с quantconfig`: Мы представляем наши модели рассуждения первого поколения, DeepSeek-R1-Zero и DeepSeek-R1. DeepSeek-R1-Zero, модель, обученная с помощью крупномасштабного обучения с подкреплением (RL) без контролируемой точной настройки (SFT) в качестве предварительного шага, продемонстрировала замечательные результаты в рассуждениях. Вместе с RL естественным образом появился DeepSeek-R1-Zero с множеством мощных и интересных способов рассуждения. Однако DeepSeek-R1-Zero сталкивается с такими проблемами, как бесконечное повторение, плохая читаемость и смешение языков. Чтобы решить эти проблемы и еще больше повысить производительность рассуждений, мы представляем DeepSeek-R1, который включает данные холодного запуска перед RL. DeepSeek-R1 обеспечивает производительность, сравнимую с OpenAI-o1, при выполнении математических, программных и логических задач. Для поддержки исследовательского сообщества у нас есть открытый исходный код DeepSeek-R1-Zero, DeepSeek-R1 и шесть плотных моделей, полученных из DeepSeek-R1, на основе Llama и Qwen. DeepSeek-R1-Distill-Qwen-32B превосходит OpenAI-o1-mini в различных тестах, достигая новых современных результатов для плотных моделей. — Мы демонстрируем, что закономерности рассуждений более крупных моделей можно свести к…
Модальности:
Генерация текста
Области применения:
Диалог / чат Логика и рассуждение
Задача: Генерация текста
Автор: Valdemardi
Теги: llama, conversational, text-generation-inference, endpoints_compatible, 4-bit, awq
Лайков: 20 | Загрузок: 2,750
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.