NEO Imatrix Quants новой модели «Qwen 3 — 32B» с MAX «выходным тензором» на BF16 для улучшения рассуждений/генерации выходных данных. Длина контекста скорректирована до 128 КБ согласно техническим примечаниям в репозитории Qwen. Эффект Imatrix будет тем сильнее, чем меньший квант вы используете, поскольку IQ4XS/IQ4NL является наиболее сбалансированным количественным показателем по качеству и эффекту Imatrix. Эти кванты также будут наиболее эффективны для творческих случаев использования. Максимизируется только квант Q8_0, поскольку Imatrix не влияет на этот квант. Если у вас возникли проблемы с «автошаблоном» Jinja, используйте шаблон CHATML. Обновите шаблон Jinja (перейдите на этот сайт, шаблон-> скопируйте «шаблон Jinja», а затем вставьте его). Это может вам понадобиться, а может и не понадобиться, поскольку в большинстве случаев Qwen3 генерируют свои собственные блоки рассуждения/мышления. См. документ «Максимизация модели-производительности-все…» ниже, чтобы узнать, как «установить» системную роль в различных приложениях LLM/AI ниже. Настройки высочайшего качества / Руководство по оптимальной эксплуатации / Параметры и семплеры Для всех настроек, используемых для этой модели (включая особенности ее «класса»), включая генерацию примеров и руководство по расширенным настройкам (которое многократно решает любые проблемы модели), включая методы улучшения производительности модели для всех вариантов использования, а также чат,…
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат
Задача: Генерация текста
Автор: DavidAU
Теги: gguf, horror, 128 k context, reasoning, thinking, qwen3, endpoints_compatible, imatrix
Лайков: 5 | Загрузок: 340
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.