codelion/dhara-70m - Каталог нейросетей
Генерация текста

codelion/dhara-70m

Добавлено:
codelion/dhara-70m

Языковая модель диффузии параметров с 70 миллионами параметров, оптимизированная для высокопроизводительной генерации текста с превосходной фактологией. — Описание модели — Данные обучения — Детали обучения — Результаты тестирования — Использование — Ключевые выводы — Ограничения — Цитирование Dhara-70M — это новая модель диффузного языка, которая обеспечивает: — пропускную способность в 3,8 раза выше, чем у авторегрессионных моделей — лучшую в своем классе фактологию на TruthfulQA (47,50%) — 10-кратную эффективность обучения посредством преобразования WSD (Warmup-Stable-Decay) Этап 1: предварительное обучение AR (1B токенов) — 40% FinePDF (400M токенов) — 30% DCLM Baseline (300M токенов) — 30% FineWeb-Edu (300M токенов) Этап 2: Преобразование WSD (100M токенов) — Прогрессивная разминка размера блока (1→4→32→64→1024) — Цель распространения MDLM 1. Пропускная способность против точности Компромисс: средняя точность Dhara составляет 1,33% за увеличение пропускной способности в 3,8 раза, что делает ее идеальной для задач пакетной обработки. 2. Превосходная фактичность: Dhara превосходит TruthfulQA (+1,67% по сравнению с GPT-2), предполагая, что модели диффузии могут уменьшить галлюцинации за счет двунаправленного контекста. 3. Преимущество в рассуждении: ARC-Challenge +2,56% указывает на хорошие результаты в задачах на рассуждение. 4. Эффективность WSD: преобразование модели AR в распространение через WSD использует в 10 раз меньше токенов, чем…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: codelion
Теги: dhara, feature-extraction, diffusion, language-model, causal-lm, custom_code, en, model-index
Лайков: 47  |  Загрузок: 236

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.