Эта модель была инициализирована на основе весов модели трансформатора Мистраль-7Б и преобразована в линейную RNN. Это сопутствующая модель к нашей статье «Линеаризация моделей большого языка», в которой мы подробно описываем процесс преобразования преобразователя softmax в линейный преобразователь, который во время вывода может функционировать как преобразователь, так и рекуррентная модель. Наш код линейного внимания можно найти по адресу https://github.com/TRI-ML/linearopenlm/. Разработан: Научно-исследовательским институтом Toyota. Тип модели: это авторегрессионная языковая модель, инициализированная из Mistral-7B и преобразованная в линейную модель на основе архитектуры SUPRA. — Набор данных: инициализирован с Мистраля-7Б. Обучался на 100B токенах RefinedWeb. — Токенизатор: mistralai/Mistral-7B-v0.1 — Библиотека: OpenLM (мы используем ответвление OpenLM, поддерживающее линейное внимание) — Лицензия: Эта модель распространяется по лицензии Apache, версия 2.0. — Обучение Mistral-SUPRA проводилось с использованием AWS SageMaker на 128 графических процессорах H100 80 ГБ. — Обучение на токенах 100B завершилось за 1,5 дня. Эта модель была обучена с использованием OpenLM. Веса были преобразованы для совместимости с HuggingFace. Чтобы использовать модель, вам необходимо сначала установить нашу вилку OpenLM. …
Модальности:
Генерация текста
Задача: Генерация текста
Автор: TRI-ML
Теги: openlm, linear, mistral, en, model-index
Лайков: 12 | Загрузок: 6
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.