MPT-30B — это трансформатор в стиле декодера, предварительно обученный с нуля на токенах 1T английского текста и кода. Эта модель была обучена MosaicML. MPT-30B является частью семейства моделей Mosaic Pretrained Transformer (MPT), в которых используется модифицированная архитектура трансформатора, оптимизированная для эффективного обучения и вывода. MPT-30B поставляется с особыми функциями, которые отличают его от других LLM, включая окно контекста маркера 8k (которое может быть дополнительно расширено с помощью тонкой настройки; см. MPT-7B-StoryWriter), поддержку экстраполяции длины контекста через ALiBi и эффективное обучение логическому выводу через FlashAttention. Он также обладает сильными способностями к кодированию благодаря своему предтренировочному миксу. Модели MPT также могут эффективно обслуживаться как стандартными конвейерами HuggingFace, так и FasterTransformer от NVIDIA. Размер MPT-30B также был специально выбран для упрощения развертывания на одном графическом процессоре — либо 1xA100-80 ГБ с 16-разрядной точностью, либо 1xA100-40 ГБ с 8-разрядной точностью. Эта модель использует кодовую базу MosaicML LLM, которую можно найти в репозитории llm-foundry. Он был обучен командой НЛП MosaicML на платформе MosaicML для предварительного обучения LLM, тонкой настройки и вывода. MPT-30B: Лицензировано для возможности…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: Abzu
Теги: mpt, Composer, MosaicML, llm-foundry, StreamingDatasets, custom_code, text-generation-inference, 8-bit
Лайков: 3 | Загрузок: 27
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.