> Qwen3.5-27B Плотный | 27B Параметры | Режим мышления | 262K Контекст | 201 язык | БФ16 | Apache 2.0 > Нулевое обучение. Ноль данных. Один графический процессор. 2 часа. Превзошел базовую модель. Модель 27B, произведенная без какой-либо подготовки, превосходит GLM-5.1 (744B), Qwen3.5-122B (122B) и своего прародителя Qwen3.5-27B. Это представляет собой коэффициент эффективности параметра, превышающий 27× по сравнению с GLM-5.1. Оба родителя имеют идентичную архитектуру: скрытый размер = 4096, промежуточный размер = 17408, 64 слоя, что обеспечивает 100% структурную совместимость для скрещивания FFN. Слева: Отец (Qwen3.5-27B) — Широкая, сбалансированная активация в областях рассуждений и знаний. Сильные математические и научные следы рассуждений на более глубоких уровнях. Справа: Мать (Клод-4.6-Опус-Рассуждение-Дистиллированный) — Усиленная концентрация рассуждений в результате дистилляции Клода. Усовершенствованные структурированные модели цепочки мыслей, видимые на средних и поздних уровнях, с характерными «горячими точками» рассуждений. Прохождение 1 — Жадный базовый уровень — Все 198 вопросов, детерминированное декодирование (dosample=False) — Стандартный формат подсказки Epoch AI — Результат: 148/198 = 74,7%** Прохождение 2 — Выборочная повторная попытка с проверкой — Только 50 вопросов с неверными ответами — 8 независимых…
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат Мультиязычность
Задача: Генерация текста
Автор: FINAL-Bench
Теги: qwen3_5, image-text-to-text, darwin-v6, evolutionary-merge, mri-guided, dare-ties, qwen3.5, reasoning
Лайков: 25 | Загрузок: 68
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.