> Создан на основе mlx-optiq, собственного набора инструментов MLX для квантования, точной настройки и обслуживания LLM локально на Apple Silicon, без PyTorch и без облака. Попробуйте лабораторную работу · Все кванты OptiQ · Документы 4-битный квант MLX смешанной точности, созданный компанией mlx-optiq и построенный на базе Gemma-4 с поддержкой квантования (QAT) от Google. Это флагман семейства: плотная Gemma-4 31B и самый сильный квант OptiQ по шкале возможностей. Послойное распределение битов OptiQ с учетом чувствительности применяется поверх весов, уже обученных выдерживать низкобитное квантование, и оно по-прежнему превосходит однородный 4-битный квант той же базы QAT на +1,65 балла оценки возможностей. Это квант google/gemma-4-31B-it-qat-q4_0-неквантованный. Разрядность каждого слоя получается в результате прохода чувствительности KL-дивергенции в калибровочном миксе из шести доменов (проза, рассуждения, код, агент, вызов инструмента, инструкции, несущие ограничения). Чувствительные слои переходят на 8-битные, надежные остаются на 4-битных. Среднее шестиметрическое значение (MMLU, GSM8K, IFEval, BFCL, HumanEval, HashHop), рассчитанное по единообразному 4-битному кванту той же базы QAT. Это сравнение изолирует то, что добавляет распределение смешанной точности, сохраняя базу фиксированной. OptiQ прибавляет +1,65 балла по сравнению с однородным 4-битным процессором в этом QAT…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: mlx-community
Теги: mlx, gemma4, quantized, mixed-precision, 4bit, 8bit, optiq, qat
Лайков: 6 | Загрузок: 4,672
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.