ProtGPT2 (рецензируемая статья) — это языковая модель, которая говорит на языке белков и может использоваться для проектирования и разработки белков de novo. Последовательности, генерируемые ProtGPT2, сохраняют важные характеристики природных белков (склонность к аминокислотам, содержание вторичной структуры и глобулярность), одновременно исследуя невидимые области белкового пространства. ProtGPT2 основан на архитектуре GPT2 Transformer и содержит 36 слоев с размерностью модели 1280, что в сумме составляет 738 миллионов параметров. ProtGPT2 — это модель преобразователя, предназначенная только для декодера, предварительно обученная в пространстве белков, база данных UniRef50 (версия 202104). Предварительное обучение проводилось на необработанных последовательностях без заголовков FASTA. Подробности обучения и наборы данных можно найти здесь: https://huggingface.co/datasets/nferruz/UR502021_04 ProtGPT2 обучался методом самоконтроля, т. е. во время обучения использовались необработанные данные последовательности без включения аннотации последовательностей. В частности, ProtGPT2 обучался с использованием цели причинно-следственного моделирования, при которой модель обучается предсказывать следующий токен (или, в данном случае, олигомер) в последовательности. Благодаря этому модель изучает внутреннее представление белков и может говорить…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: nferruz
Теги: gpt2, text-generation-inference, endpoints_compatible
Лайков: 113 | Загрузок: 37,568
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.