ManniX-ITA/Qwen3.6-27B-A3B-Coder - Каталог нейросетей
Генерация текста

ManniX-ITA/Qwen3.6-27B-A3B-Coder

Добавлено:
ManniX-ITA/Qwen3.6-27B-A3B-Coder

Уменьшение числа экспертов-специалистов по коду из Qwen3.6-35B-A3B: количество экспертов MoE уменьшено с 256 до 184 (72 удалено на уровень, ~35B → 27B, все еще активен A3B) с использованием карты компетенций, ориентированной на код (классы компетенций LiveCodeBench + MultiPL-E). Тот же маршрутизатор, внимание, нормы, головка MTP и башня обзора, что и базовая — меняется только экспертный набор настроек. Подается в топ-10 (numexpertspertok = 10, запекается по умолчанию). Это рычаг восстановления маршрутизации: после сокращения до 184 экспертов активация топ-10 (по сравнению с базовыми топ-8) восстанавливает следование инструкциям без затрат на код** (см. ниже). Никакой тонкой настройки, никакой дистилляции — чистый экспертный отбор + набор ширины трассировки. 1. Карта компетенций: преподаватель 256e профилируется по каждому эксперту в сбалансированном корпусе + целевых классах LiveCodeBench и MultiPL-E (Rust/Java/JS) PASS-ответ. 2. Карта удаления: агрегация wmax с классами LCB + MPE с повышенным весом (1,5) → 72/256 экспертов удаляются на уровень, защищая экспертов, владеющих кодом. 3. Маршрутизация Top-10 (numexpertspertok = 10), зашитая в конфиг → поставляется по умолчанию. Передайте —override-kv qwen35moe.expertusedcount=int:8` любому инструменту llama.cpp для A/B обратно в исходную топ-8. Основные характеристики: лучший профиль кода среди всех черносливов —…

Модальности:
Генерация текста

Области применения:
Генерация кода Диалог / чат


Задача: Генерация текста
Автор: ManniX-ITA
Теги: qwen3_5_moe, image-text-to-text, moe, code, expert-pruning, qwen3.6, conversational, endpoints_compatible
Лайков: 5  |  Загрузок: 607

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.