Квантование Jackrong/Qwopus3.6-27B-v2 в формате AutoAWQ INT4 (W4A16), точная настройка Qwen 3.6 27B, основанная на рассуждениях Клода Опуса. Гибридная архитектура внимания DeltaNet + softmax сохраняется, для спекулятивного декодирования включена однослойная головка MTP, а метаданные мультимодального процессора сохраняются нетронутыми. Защита кромок в стиле APEX сохраняет первый и последний слои из BF16 для обеспечения качества. Оценено с помощью lm-evaluation-harness на одном NVIDIA B300 SXM6, 100 выборок на задачу, 0-shot CoT, maxgentoks=4096: квантование сохраняет точность в пределах стандартной ошибки источника BF16 для каждой задачи и соответствует источнику на TruthfulQA. Прирост рассуждений Клода Опуса над базой Qwen 3.6 (+20 п.п. по GSM8K) сохранен. Измерено на одном NVIDIA B300 SXM6 с vLLM 0.21.0 и включенным torch.compile: спекулятивное декодирование MTP достигает среднего коэффициента принятия черновика ~77 % (на позицию: 0,92 / 0,79 / 0,65) со средней длиной принятия ~3,3, измеренной на основе смешанного рассуждения + подсказки кода, установленного при жадном декодировании. Самопроверка вызова инструмента с помощью —tool-call-parser qwen3coder: успешно (модель выдает правильно сформированный синтаксис …`). В списке пропуска AWQ также указаны названия всех mtp. линейный модуль явно, поэтому MTP…
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат
Задача: Генерация текста
Автор: mconcat
Теги: qwen3_5, image-text-to-text, qwen3.5, qwen3.6, qwopus, reasoning, quantized, awq
Лайков: 7 | Загрузок: 16,553
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.