ahz-r3v/DeepSeek-R1-Distill-Qwen-7B-rk3588-rkllm-1.1.4 - Каталог нейросетей
Генерация текста

ahz-r3v/DeepSeek-R1-Distill-Qwen-7B-rk3588-rkllm-1.1.4

Добавлено:
ahz-r3v/DeepSeek-R1-Distill-Qwen-7B-rk3588-rkllm-1.1.4

Мы представляем наши модели рассуждения первого поколения: DeepSeek-R1-Zero и DeepSeek-R1. DeepSeek-R1-Zero, модель, обученная с помощью крупномасштабного обучения с подкреплением (RL) без контролируемой точной настройки (SFT) в качестве предварительного шага, продемонстрировала замечательные результаты в рассуждениях. Вместе с RL естественным образом появился DeepSeek-R1-Zero с множеством мощных и интересных способов рассуждения. Однако DeepSeek-R1-Zero сталкивается с такими проблемами, как бесконечное повторение, плохая читаемость и смешение языков. Чтобы решить эти проблемы и еще больше повысить производительность рассуждений, мы представляем DeepSeek-R1, который включает данные холодного запуска перед RL. DeepSeek-R1 обеспечивает производительность, сравнимую с OpenAI-o1, при выполнении математических, программных и логических задач. Для поддержки исследовательского сообщества у нас есть открытый исходный код DeepSeek-R1-Zero, DeepSeek-R1 и шесть плотных моделей, полученных из DeepSeek-R1, на основе Llama и Qwen. DeepSeek-R1-Distill-Qwen-32B превосходит OpenAI-o1-mini в различных тестах, достигая новых современных результатов для плотных моделей. — Мы демонстрируем, что шаблоны рассуждений более крупных моделей можно разделить на более мелкие модели, что приводит к повышению производительности по сравнению с шаблонами рассуждений…

Модальности:
Генерация текста

Области применения:
Диалог / чат Логика и рассуждение


Задача: Генерация текста
Автор: ahz-r3v
Теги: qwen2, conversational, endpoints_compatible
Лайков: 5  |  Загрузок: 4

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.