Это авторегрессионная языковая модель в стиле GPT2, обученная на ~480 м строках SMILES из базы данных ZINC. Модель имеет ~87 млн параметров и была обучена на 175000 итераций с размером пакета 3072 с потерями при проверке ~0,615. Эта модель полезна для генерации молекул, подобных лекарству, или создания вложений из строк SMILES. Эта модель была обучена с использованием токенов bos и eos вокруг входных данных SMILES. Токенизатор GPT2TokenizerFast НЕ ДОБАВЛЯЕТ специальные токены, даже если addspecialtokens=True. Huggingface говорит, что это намеренное поведение. Для проверки эффективности генерации были созданы соединения длиной 1 м при различных значениях температуры. Полученные соединения проверяли на уникальность и структурную достоверность. процентуникальный обозначает nuniquesmiles/ntotalsmiles процентный валид обозначает nvalidsmiles/nuniquesmiles процентуникальный и действительный обозначает nvalidsmiles/ntotalsmiles Гистограммы свойств, рассчитанные по 1 млн сгенерированных соединений: !гистограммы свойств
Модальности:
Генерация текста
Области применения:
Химия
Задача: Генерация текста
Автор: entropy
Теги: gpt2, chemistry, molecule, drug, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 5,334
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.