Эта версия DeepSeek-R1-Distill-Qwen-1.5B была преобразована для работы на NPU Axera с использованием квантования w8a16 и w4a16. — Поддержка более длинных контекстов, в этом примере это 2k. — Поддержка контекстного диалога. — Поддерживается системное приглашение kvcache. Для тех, кто заинтересован в преобразовании модели, вы можете попробовать экспортировать модель axmodel через исходный репозиторий: https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B и https://huggingface.co/jakiAJK/DeepSeek-R1-Distill-Qwen-1.5B_GPTQ-int4 Ссылка на Pulsar2, как конвертировать LLM из Huggingface в axmodel Ниже показано, как конвертировать DeepSeek-R1-Distill-Qwen-1.5B — AX650 — AX650N DEMO Board — M4N-Dock (爱芯派Pro) — Карта ускорителя M.2 — AX630C — TBD — Системное приглашение можно предварительно настроить с помощью файла конфигурации из —systemprompt — Системное приглашение можно кэшировать в виде кэша kv в указанную папку для быстрой загрузки при следующем запуске из —kvcachepath — Эту папку необходимо создать вручную перед запуском, например mkdir kvcache
Модальности:
Генерация текста
Области применения:
Логика и рассуждение
Задача: Генерация текста
Автор: AXERA-TECH
Теги: Context, DeepSeek-R1-Distill-Qwen-1.5B, zh, en, endpoints_compatible
Лайков: 5 | Загрузок: 24
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.