Модель была доработана на OpenWebText для ~500M токенов (1000 итераций размера пакета ~488 при длине контекста 1024) с постепенным отключением слоев LayerNorm. Доступно 5 аналогичных моделей (версии 1–5), обученных с использованием различных графиков тонкой настройки. Подробную информацию можно найти в статье или сообщении в блоге; код обучения доступен здесь. Лучшая модель (v4) используется по умолчанию по состоянию на 6 сентября 2024 г. (ранее по умолчанию использовалась версия 2). Модель представляет собой GPT2LMHeadModel (чтобы избежать необходимости использования TrustRemotecode), которая технически содержит блоки LayerNorm. Однако все значения эпсилон установлены на 1e12, поэтому LayerNorm не имеет никакого эффекта. Масштаб LN установлен на 1e6 (для противодействия эпсилону 1e12), а смещение равно 0. Окончательный LayerNorm также имеет 1e12 как эпсилон, но веса и смещения не равны единице. Это связано с тем, что матрица внедрения и извлечения проверяется (и нет смещения извлечения), поэтому параметры LN не могут быть свернуты в эту матрицу. Вы можете полностью удалить все LN, просто заменив модули ln1 и ln2 идентификаторами и заменив lnf` модификациями невстроенной матрицы и смещения невстраивания. Вы можете загрузить модель с помощью преобразователей или одной из библиотек интерпретируемости…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: apollo-research
Теги: gpt2, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 84
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.