Это Silo-PD, впервые представленный в [Silo Language Models]() исследователями из Вашингтонского университета, Калифорнийского университета в Беркли и Института искусственного интеллекта Аллена. Чтобы использовать модель, вам необходимо установить специальную вилку преобразователей: Silo-PD — это языковая модель, предназначенная только для декодера, с параметром 1,3B, обученная на общедоступных данных из Open License Corpus (OLC). Модель основана на архитектуре LLaMA, реализованной в (OpenLM)[]. Мы следуем архитектуре модели LLaMa и используем токенизатор GPT-NeoX-20B с 50432 типами BPE. Во время обучения мы используем 2048 последовательностей токенов, которые упакованы через границы документа, и добавляем токен начала текста к каждому документу. Мы используем снижение веса 0,1, оптимизатор Адама с beta_2 0,95, 2000 шагов прогрева и планировщик скорости обучения косинуса. В частности, он был обучен на следующих пропорциях домена (более подробную информацию об источниках данных для каждого домена см. в репозитории OLC): Мы обучаем с ранней остановкой всего для 60 миллиардов токенов, в общей сложности 2 эпохи обучения для этого подмножества. Поскольку распределение OLC сильно искажено, мы выполняем простую схему повышения веса, в которой мы повышаем выборку всех данных, которые составляют…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: kernelmachine
Теги: openlm, silo, en, endpoints_compatible
Лайков: 4 | Загрузок: 18
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.