> Создан на основе mlx-optiq, собственного набора инструментов MLX для квантования, точной настройки и обслуживания LLM локально на Apple Silicon, без PyTorch и без облака. Попробуйте лабораторную работу · Все кванты OptiQ · Документы 4-битный квант MLX смешанной точности GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking, усовершенствованная версия MiniCPM5-1B. Чувствительные слои сохраняются на уровне 8 бит, а надежные — на уровне 4 бит. 2,0 ГБ bf16 превращаются в 874 МБ, что достаточно мало для комфортной работы на любом Apple Silicon Mac. Мы следуем тому же соглашению об именах, которое llama.cpp использует для Q4KM и подобных квантов смешанной точности: метка «4 бита» представляет собой преобладающую точность, а не средневзвешенное значение. При параметрах 1B требуется меньше избыточности, поэтому оптимизатор сохраняет больше слоев в 8-битном режиме, а средневзвешенное значение оказывается выше, чем в более крупной модели. Распределение по слоям переносится из mlx-community/MiniCPM5-1B-OptiQ-4bit, где оно было получено путем развертки чувствительности KL-дивергенции по эталону bf16 на калибровочной смеси из шести доменов. Эта модель представляет собой доработанную версию openbmb/MiniCPM5-1B с неизмененной архитектурой, поэтому все 169 квантоваемых слоев отображаются точно, и при повторном вычислении распределение оказывается с теми же 5,805 битами на вес…
Модальности:
Генерация текста
Области применения:
Генерация кода Диалог / чат Вызов функций (Tool use)
Задача: Генерация текста
Автор: mlx-community
Теги: mlx, llama, quantized, mixed-precision, 4bit, 8bit, optiq, apple-silicon
Лайков: 5 | Загрузок: 1,721
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.