hudsongouge/DAT-Byte-Small - Каталог нейросетей
Генерация текста

hudsongouge/DAT-Byte-Small

Добавлено:
hudsongouge/DAT-Byte-Small

DAT Byte — это семейство преобразователей дифференциального внимания на уровне байтов, обученных с нуля на RTX 5090. Эта модель является самой маленькой в ​​семействе и содержит примерно 200 миллионов параметров. Он был обучен на наборе данных чата Discord, общедоступных книгах и английских переводах Библии. Более крупные модели семейства получили более крупный и разнообразный тренировочный набор. Эта модель соответствует структуре, предложенной в книге «Дифференциальный преобразователь» (Ye et al., 2024), которая вводит дифференциальное внимание. Дифференциальное внимание особенно полезно при создании LLM на уровне байтов, поскольку оно уменьшает шум внимания и позволяет модели лучше уловить семантическое значение при такой высокой степени детализации. — Тип модели: преобразователь только для декодера — Позиционное кодирование: RoPE (вращающееся позиционное встраивание) — Нормализация: Pre-layernorm (LayerNorm перед блоками внимания и MLP) — Скрытый размер: 768 — Размер FFN: 3072 — Заголовки внимания: 12 — Слои: 28 — Размер словаря: 259 (256-байтовые токены + 3 специальных) токены) 1. git clone https://huggingface.co/hudsongouge/DAT-Byte-Small 2. python3 run.py -c Вот и все! Теперь вы находитесь в интерактивном чате с моделью! Если вы используете DAT Byte Small в своих исследованиях, настройте его или…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: hudsongouge
Теги: en
Лайков: 5  |  Загрузок: 12

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.

Теги: #en