Это квантованная версия NousResearch/Hermes-4.3-36B FP8, созданная с использованием llmcompressor (Neural Magic). Основные преимущества: — Размер модели меньше примерно на 47% (36 ГБ против 68 ГБ) — Собственный вывод FP8 на графических процессорах Ada Lovelace, Hopper и Blackwell — Развертывание одного графического процессора на картах емкостью более 48 ГБ (RTX 6000 Ada, A100-40GB+) — Встроенная поддержка vLLM и SGLang с вызовом инструментов — Минимальная потеря качества при динамическом квантовании FP8 Hermes 4.3 36B современная модель следования инструкциям с: — Гибридное рассуждение: … блоки для совещательного рассуждения при необходимости — Собственный вызов инструментов: использование инструментов формата Hermes с тегами — SOTA RefusalBench: 74,6% (лучший среди неуничтоженных моделей) — Строгая математика/код: MATH-500 93,8%, конкурентоспособная производительность контекста AIME — 524K**: Расширенное контекстное окно для длинных документов Самый простой способ для запуска этой модели. Никакой настройки не требуется — только Docker со средой выполнения NVIDIA. Это модель плотного трансформатора, основанная на архитектуре ByteDance Seed-OSS: кэш KV рассчитан для GQA с 8 головками KV, 128 headdim, 64 уровня, FP16 KV* Проведено тестирование 07 декабря 2025 г. на RTX PRO 6000 Blackwell (96 ГБ, PCIe Gen5 x16) с использованием lm-evaluation-harness с vLLM 0.12.0, —applychattemplate`* Протестировано 6 декабря 2025 г. на Doradus…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Doradus-AI
Теги: seed_oss, hermes, nous-research, tool-calling, hybrid-reasoning, fp8, quantized, vllm
Лайков: 5 | Загрузок: 3,176
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.