TokenFormer — это архитектура, полностью основанная на внимании, которая унифицирует вычисления взаимодействий токен-токен и токен-параметр, полностью используя механизм внимания и максимизируя гибкость нейронной сети (см. статью). Он содержит четыре модели размеров 150М, 450М, 900М, 1,5В. Для каждого размера он обучается на основе кода gpt-neox и использует Pile с 300B токенами. Все четыре размера модели обучаются на одних и тех же данных и в одном и том же порядке. — Разработчик: Haiyang Wang — Тип модели: Языковая модель на основе TokenFormer — Язык: английский — Дополнительная информация: репозиторий TokenFormer на GitHub для процедур обучения, файлов конфигурации и подробностей по использованию. Дополнительные сведения об оценках и реализации см. в документе. — Библиотека: GPT-NeoX — Лицензия: Apache 2.0 — Контактная информация: чтобы задать вопросы об этой модели, отправьте электронное письмо Хайяну Вану. The Pile — это набор данных общего назначения объемом 825 ГБ на английском языке. Он был создан компанией EleutherAI специально для обучения больших языковых моделей. Он содержит тексты из 22 различных источников, грубо разбитых на пять категорий: научные статьи (например, arXiv), Интернет (например, CommonCrawl), проза (например, Project Gutenberg), диалоги (например, субтитры YouTube) и…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: Haiyang-W
Лайков: 13 | Загрузок: 3
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.