> Создан на основе mlx-optiq, собственного набора инструментов MLX для квантования, точной настройки и обслуживания LLM локально на Apple Silicon, без PyTorch и без облака. Все кванты OptiQ · Документация 4-битный MLX-квант смешанной точности, управляемый чувствительностью, для OpenAI gpt-oss-20b, созданный mlx-optiq. OptiQ измеряет чувствительность к квантованию каждого слоя и назначает каждому слою разрядность (4 или 8) в соответствии с целевым бюджетом вместо того, чтобы квантовать каждый слой с одинаковой шириной. gpt-oss изначально поставляется в MXFP4 (его эксперты уже 4-битные). Это делает простое равномерное 4-битное повторное квантование необычно большим с потерями, поскольку оно усугубляет ошибку поверх весов, которые уже находятся на 4-битном уровне. OptiQ сохраняет важные слои в 8-битном формате, поэтому восстанавливает большую часть того, что отбрасывается Uniform-4. Среднее значение по шести критериям (MMLU, GSM8K, IFEval, BFCL, HumanEval, HashHop), измеренное по сравнению с настоящей однородной 4-битной базовой линией, построенной на основе тех же весов. OptiQ побеждает во всех шести. Самый большой пробел — это HashHop (многоскачковый поиск на большом расстоянии), где Uniform-4 падает до 19%, тогда как OptiQ удерживает 78%: Uniform 4-бит подрывает точность внимания на большом расстоянии, от которой зависит извлечение, а смешанная точность OptiQ сохраняет эти слои на уровне 8-бит. gpt-oss нужен mlx-lm и import optiq…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: mlx-community
Теги: mlx, gpt_oss, openai, gpt-oss, quantized, 4bit, mixed-precision, optiq
Лайков: 6 | Загрузок: 1,894
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.