Этот репозиторий содержит файлы моделей Nous-Hermes-2-Yi-34B, оптимизированные для nm-vllm, высокопроизводительного механизма обслуживания сжатых LLM. Эта модель была квантована с помощью GPTQ и сохранена в формате Marlin для эффективного 4-битного вывода. Marlin — высокооптимизированное ядро вывода для 4-битных моделей. Для получения подробной информации о том, как эта модель была квантована и преобразована в формат Marlin, запустите сценарий quantization/applygptqsavemarlin.py`: Для дальнейшей поддержки и обсуждения этих моделей и искусственного интеллекта в целом присоединяйтесь к сообществу Slack Neural Magic.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: RedHatAI
Теги: llama, nm-vllm, marlin, int4, conversational, text-generation-inference, endpoints_compatible, 4-bit
Лайков: 5 | Загрузок: 6
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.