z-lab/Qwen3.6-35B-A3B-DFlash - Каталог нейросетей
Генерация текста

z-lab/Qwen3.6-35B-A3B-DFlash

Добавлено:
z-lab/Qwen3.6-35B-A3B-DFlash

Эта модель проекта все еще находится на стадии обучения (2000 шагов). Не стесняйтесь опробовать его и оставить отзыв, который будет очень полезен для нас в дальнейшем улучшении этой черновой модели DFlash. DFlash — это спекулятивный метод декодирования, который использует облегченную модель диффузии блоков для параллельного создания нескольких токенов. Это модель чертежника, которую необходимо использовать в паре с Qwen/Qwen3.6-35B-A3B. > Совет: Для длинных контекстных или агентских рабочих нагрузок добавьте —speculative-dflash-draft-window-size WINDOWSIZE`, чтобы включить внимание разработчика к скользящему окну. — Мышление: включено — Максимальное количество новых токенов: 4096 — Размер блока: 16 — Результаты SGLang. Результаты vLLM могут быть разными. Особая благодарность Дэвиду Вангу за его выдающуюся инженерную поддержку этого проекта. Мы также благодарны Modal, InnoMatrix и Yotta Labs за предоставление вычислительных ресурсов, использованных для обучения этого проекта модели. Если вы считаете DFlash полезным, процитируйте нашу работу. Чтобы поделиться отзывом о DFlash или запросить поддержку новой модели, заполните эту форму: DFlash Feedback.

Модальности:
Генерация текста


Задача: Генерация текста
Автор: z-lab
Теги: qwen3, feature-extraction, dflash, speculative-decoding, block-diffusion, draft-model, efficiency, qwen
Лайков: 23  |  Загрузок: 2,156

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.