Наш последний метод квантования вводит прецизионно-адаптивное квантование для сверхнизкоразрядных моделей (1-2 бита) с проверенными улучшениями на Llama-3-8B. Этот подход использует стратегии, зависящие от уровня, для сохранения точности при сохранении экстремальной эффективности памяти. Все тесты, проведенные на Llama-3-8B-Instruct с использованием: — стандартного конвейера оценки недоумения — контекстного окна 2048-токенов — одинакового набора подсказок для всех квантований — динамического распределения точности: — первого/последнего 25% слоев IQ4XS → (выбранные слои) — среднего 50% IQ2XXS→/IQ3S (повышение эффективности) — защиты критических компонентов: — встраивания/выходные слои используют Q5K — уменьшает распространение ошибок на 38% по сравнению со стандартным 1-2-битным ключом: — PPL = недоумение (чем ниже, тем лучше) — Δ PPL = процент
Модальности:
Генерация текста
Области применения:
Генерация кода Математика Логика и рассуждение Диалог / чат
Задача: Генерация текста
Автор: Mungert
Теги: gguf, phi, nlp, math, code, chat, conversational, reasoning
Лайков: 4 | Загрузок: 164
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.