mlx-community/gpt-oss-20b-OptiQ-4bit - Каталог нейросетей
Генерация текста

mlx-community/gpt-oss-20b-OptiQ-4bit

Добавлено:
mlx-community/gpt-oss-20b-OptiQ-4bit

> Создан на основе mlx-optiq, собственного набора инструментов MLX для квантования, точной настройки и обслуживания LLM локально на Apple Silicon, без PyTorch и без облака. Все кванты OptiQ · Документация 4-битный MLX-квант смешанной точности, управляемый чувствительностью, для OpenAI gpt-oss-20b, созданный mlx-optiq. OptiQ измеряет чувствительность к квантованию каждого слоя и назначает каждому слою разрядность (4 или 8) в соответствии с целевым бюджетом вместо того, чтобы квантовать каждый слой с одинаковой шириной. gpt-oss изначально поставляется в MXFP4 (его эксперты уже 4-битные). Это делает простое равномерное 4-битное повторное квантование необычно большим с потерями, поскольку оно усугубляет ошибку поверх весов, которые уже находятся на 4-битном уровне. OptiQ сохраняет важные слои в 8-битном формате, поэтому восстанавливает большую часть того, что отбрасывается Uniform-4. Среднее значение по шести критериям (MMLU, GSM8K, IFEval, BFCL, HumanEval, HashHop), измеренное по сравнению с настоящей однородной 4-битной базовой линией, построенной на основе тех же весов. OptiQ побеждает во всех шести. Самый большой пробел — это HashHop (многоскачковый поиск на большом расстоянии), где Uniform-4 падает до 19%, тогда как OptiQ удерживает 78%: Uniform 4-бит подрывает точность внимания на большом расстоянии, от которой зависит извлечение, а смешанная точность OptiQ сохраняет эти слои на уровне 8-бит. gpt-oss нужен mlx-lm и import optiq…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: mlx-community
Теги: mlx, gpt_oss, openai, gpt-oss, quantized, 4bit, mixed-precision, optiq
Лайков: 6  |  Загрузок: 1,894

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.