27B гибридная модель линейного внимания | BF16 полная точность | Видение + Текст | Спекулятивное декодирование DFlash Это делает модель с плотностью 27 байт быстрее, чем модель MoE 122 байт на одном DGX Spark, обеспечивая при этом качественные преимущества плотной архитектуры. DFlash превращает DGX Spark из «он может работать с моделью 27B» в «он хорошо работает с моделью 27B». Qwen3.5-27B использует гибридную архитектуру, сочетающую два типа внимания на 64 уровнях: — Линейное внимание (GDN) — уровни Gated Delta Network для эффективной обработки длинного контекста с состоянием O(1) для каждого токена (48 уровней) — Полное внимание — стандартное многоголовое внимание на каждом четвертом уровне для глобального захвата контекста (16 уровней). Это обеспечивает почти линейное масштабирование с длиной последовательности, сохраняя при этом качество полного внимания на ключевых интервалах. Включает 27-уровневый кодировщик изображений ViT (460 миллионов параметров) со слиянием, которое проецирует визуальные функции в скрытое пространство языковой модели. Поддерживает понимание изображений наряду с генерацией текста. Соединитесь с z-lab/Qwen3.5-27B-DFlash — 2B-редактором диффузии блоков, который генерирует все спекулятивные токены одновременно за один этап диффузии. Контейнер автоматически загружает и настраивает это. Создано с использованием ортогональной проекции…
Модальности:
Генерация текста Компьютерное зрение Мультимодальность
Области применения:
Генерация кода Логика и рассуждение Следование инструкциям Диалог / чат Вызов функций (Tool use)
Задача: Генерация текста
Автор: AEON-7
Теги: qwen3_5, image-text-to-text, 27b, abliterated, aeon, aeon-7, agentic, bf16
Лайков: 5 | Загрузок: 44
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.