SJTU-DENG-Lab/D2F_LLaDA_Instruct_8B_Lora - Каталог нейросетей
Генерация текста

SJTU-DENG-Lab/D2F_LLaDA_Instruct_8B_Lora

Добавлено:
SJTU-DENG-Lab/D2F_LLaDA_Instruct_8B_Lora

Этот репозиторий содержит адаптер LoRA для модели GSAI-ML/LLaDA-8B-Instruct, обученный с использованием метода дискретного диффузионного форсирования (D2F). Этот адаптер позволяет диффузионному LLM LLaDA-8B-Instruct (dLLM) достигать скорости вывода, которая значительно выше, чем у его исходной версии и ведущих моделей авторегрессии (AR), таких как LLaMA3, сохраняя при этом сопоставимое качество вывода. Метод D2F и его результаты подробно описаны в статье: D2F: Диффузионные LLM могут выполнять вывод быстрее, чем AR, посредством дискретного диффузионного воздействия. — Официальный код: репозиторий D2F GitHub — Демо-пространство: D2F-LLaDA-Instruct-8B Диффузные LLM (dLLM) уже давно обещают сверхбыстрое параллельное декодирование, но исторически этот потенциал был ограничен двумя основными узкими местами: 1. Несовместимость KV-кэша: их механизм двунаправленного внимания препятствовал использованию кэша ключей-значений, критической оптимизации в моделях AR. 2. Строгая межблочная зависимость. Предыдущие попытки генерации на основе блоков требовали, чтобы каждый блок был полностью сгенерирован перед началом следующего, что предотвращало настоящий параллелизм. 1. Гибридная архитектура: D2F переосмысливает генерацию текста как процесс блочной авторегрессии. Внутри блока: Внимание…

Модальности:
Генерация текста

Области применения:
Следование инструкциям


Задача: Генерация текста
Автор: SJTU-DENG-Lab
Теги: d2f, diffusion-llm, llada, lora, en, endpoints_compatible
Лайков: 5  |  Загрузок: 0

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.