Это совместный выпуск Z-Lab, Modal и SGLang. Черновая модель отображается в следующих репозиториях Hugging Face: — z-lab/Qwen3.5-397B-A17B-DFlash — modal-labs/Qwen3.5-397B-A17B-DFlash — lmsys/Qwen3.5-397B-A17B-DFlash Этот репозиторий содержит черновой вариант модели DFlash для Qwen/Qwen3.5-397B-A17B. Это не отдельная языковая модель. Он предназначен для сопряжения с целевой моделью на сервере спекулятивного декодирования. DFlash использует упрощенную черновую модель диффузии блоков для параллельного предложения нескольких токенов. Целевая модель проверяет эти предложения, улучшая пропускную способность обслуживания при сохранении распределения выходных данных целевой модели. Для обслуживания DFlash требуется последняя сборка SGLang. Мы рекомендуем устанавливать SGLang из коммита ec36dde58083aca8f26c3740332498a11a06debf или после него, который включает в себя планирование перекрытия DFlash v2, предупреждение о черновиках скользящего окна DFlash и необходимую интеграцию FlashInfer. Для производственного обслуживания используйте образ CUDA с поддержкой Blackwell, например lmsysorg/sglang:v0.5.13-cu130, и установите закрепленный коммит SGLang внутри образа. Эту модель следует использовать с сервером вывода, который поддерживает спекулятивное декодирование DFlash. …
Модальности:
Генерация текста
Задача: Генерация текста
Автор: z-lab
Теги: qwen3, image-feature-extraction, dflash, speculative-decoding, speculative-decoding-draft, block-diffusion, draft-model, diffusion-language-model
Лайков: 7 | Загрузок: 4,290
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.