DFlash — это новый метод спекулятивного декодирования, в котором для черчения используется облегченная модель диффузии блоков. Это обеспечивает эффективное, высококачественное параллельное черчение, расширяющее границы скорости вывода. Эта модель служит компонентом чертежника и содержит параметры 0,8B. Его необходимо использовать вместе с целевой моделью openai/gpt-oss-120b. gpt-oss-120b-DFlash обучен на 800 тысячах образцов, взятых из: — nvidia/Nemotron-Post-Training-Dataset-v2 — theblackcat102/evol-codealpaca-v1 Для всех образцов часть ответа была регенерирована с использованием целевой модели openai/gpt-oss-120b. Черновая модель обучается с размером блока 10. Во время оценки мы используем три настройки: — Размер блока = 4 (3 черновых токена) — Размер блока = 6 (5 черновых токенов) — Размер блока = 10 (9 черновых токенов) Все эксперименты проводятся с использованием SGLang на одном графическом процессоре H200. Заявленное ускорение является сквозным, включая время предварительного заполнения. Ускорение чистого декодирования выше. Для всех задач усилие рассуждения установлено на средний уровень. Использование небольших усилий по рассуждению еще больше увеличит продолжительность принятия. Мы благодарны Yotta Labs за вычислительную поддержку при обучении этого проекта модели. Если вы считаете DFlash полезным…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: z-lab
Теги: qwen3, feature-extraction, dflash, speculative-decoding, diffusion, efficiency, flash-decoding, diffusion-language-model
Лайков: 11 | Загрузок: 4,026
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.