Квантование ASHQ1 Ornith-1.0-9B с явной обработкой MTP (многотокенное предсказание) — головки MTP сохраняются на уровне Q8_0 и исключаются из бюджета классификатора, сохраняя их качество, в то время как очередь приоритетов оптимизирует основные уровни преобразователя. Огромное спасибо protoLabsAI/Ornith-1.0-9B-MTP-GGUF за предоставление источника BF16 с головками MTP — мы адаптировали его с помощью ASHQ1, чтобы обеспечить как скорость, так и качество. > Примечание. Имена файлов содержат «BF16» для совместимости с парсером HuggingFace — это кванты ASHQ1, а не BF16. Все сравнения проводятся с квантами i1 (равномерное квантование с иматрикой Орнита Бартовского). ASHQ1 постоянно превосходит их при меньших размерах: очередь приоритетов распределяет биты там, где они наиболее важны. См. wepiqx/ASHQ1 для получения полных тестов для разных архитектур. Головки MTP развертываются в Q8_0 и исключаются из бюджета классификатора. > Примечание. Вариант 4850 использует уровни IQ через —allow-q3-или ниже, чтобы соответствовать ограниченному бюджету — качество примерно на уровне Q4KS, а 5500+ обеспечивает значительный шаг вперед. Он лучше всего подходит для более легких задач, тогда как кодирование и агентские рабочие нагрузки могут предпочесть 5500+. Не стесняйтесь попробовать в любом случае. Полный метод, исходный код и тесты см. в wepiqx/ASHQ1…
Модальности:
Генерация текста
Области применения:
Генерация кода Диалог / чат
Задача: Генерация текста
Автор: wepiqx
Теги: gguf, qwen, qwen3.5, 9b, ornith, coding, agent, deepreinforce
Лайков: 5 | Загрузок: 416
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.