В этом репозитории размещены оптимизированные версии DeepSeek-R1-Distill-Qwen-1.5B и DeepSeek-R1-Distill-Qwen-7B для ускорения вывода с помощью ONNX Runtime. Здесь публикуются оптимизированные модели в формате ONNX для работы с ONNX Runtime на ЦП и ГП на всех устройствах, включая серверные платформы, настольные компьютеры Windows, Linux и Mac, а также мобильные ЦП, с точностью, наиболее подходящей для каждой из этих целей. Чтобы легко начать работу с моделью, вы можете использовать наш API-интерфейс ONNX Runtime Generate(). Инструкции см. здесь. Вот некоторые из добавленных нами оптимизированных конфигураций: 1. Модель ONNX для ЦП и мобильных устройств с использованием квантования int4 через RTN. 2. Модель ONNX для графического процессора с использованием квантования int4 через RTN. ONNX позволяет запускать модели на устройстве с помощью ЦП, графического процессора и NPU. С помощью ONNX вы можете запускать свои модели на любой машине любого типа (Qualcomm, AMD, Intel, Nvidia и т. д.). В таблице ниже приведены некоторые ключевые тесты для устройств Windows GPU и CPU, на которых тестировались модели ONNX. — onnxruntime-genai==0.6.0-dev — Transformers==4.46.2 — onnxruntime==1.20.01 — onnxruntime-genai-cuda==0.6.0-dev — Transformers==4.46.2 — onnxruntime-gpu==1.20.1 — Разработчик: ONNX Runtime — Тип модели: ONNX — Язык(и) (НЛП):…
Модальности:
Генерация текста
Области применения:
Логика и рассуждение
Задача: Генерация текста
Автор: onnxruntime
Теги: onnx, ONNX, ONNXRuntime, endpoints_compatible
Лайков: 9 | Загрузок: 22
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.