Сборка MLX смешанной точности Qwen/Qwen3.6-27B, подготовленная baa.ai. В соответствии с нашей внутренней политикой оценки в обоих режимах декодирования сообщается, что выбор декодирования может существенно изменить точность каждой задачи на квантованных контрольных точках (см. Примечания). Выборочное декодирование увеличивает общую точность GPQA на этой контрольной точке примерно на 5 пунктов и меняет порядок производительности для каждого субъекта по сравнению с жадным. В частности, рейтинг по каждому предмету между этой сборкой объемом 16 ГБ и сопутствующей сборкой объемом 28 ГБ инвертируется при выборке T = 0,3 по биологии (жадный: 16 ГБ выигрывает на 16 пунктов; выборка: 28 ГБ выигрывает на 11 пунктов). Обе контрольные точки являются общедоступными по двум причинам: (а) инверсия представляет собой интересную эмпирическую демонстрацию того, что квантование × декодирование производит связанные эффекты, которые мы все еще описываем, и (б) физическая точность этой сборки объемом 16 ГБ при дискретном декодировании (54,7%) превышает сборку объемом 28 ГБ в любом режиме, поэтому эта контрольная точка действительно выигрывает по крайней мере в одной задаче, по крайней мере, в одном режиме. Мы рекомендуем сравнить вашу конкретную конфигурацию декодирования развертывания, прежде чем переходить к тому или иному варианту.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: baa-ai
Теги: mlx, qwen3_5, quantized, mixed-precision, qwen, qwen3, conversational, en
Лайков: 5 | Загрузок: 207
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.