Qra — это серия программ LLM, адаптированных к польскому языку, созданная в результате сотрудничества Национального института обработки информации (OPI) и Гданьского технологического университета (PG). Модели обучались на инфраструктуре вычислительного центра PG TASK с использованием 21 карты Nvidia A100. Опубликованные версии моделей Qra были инициализированы с весами английских контрольных точек LLama 2, а затем дополнительно обучены на тщательно очищенном, отфильтрованном и дедуплицированном корпусе польских текстов общим объемом около 90 миллиардов токенов. Исходный корпус состоял в основном из веб-данных, включая дампы CommonCrawl и корпус MADLAD-400. ⚠️ Важно: Qra — это базовые языковые модели, обученные с целью моделирования каузального языка на большом корпусе текстов. Поэтому они не предназначены для диалоговых целей или выполнения инструкций, и их необходимо дополнительно настроить для использования в таких задачах. ⚠️ Конвейер предварительной обработки включал в себя следующие этапы: — Нормализация текста, удаление URL-адресов. — Удаление документов короче 500 символов. — Очистка предложений в документах с использованием набора эвристических правил. Среди прочего, предложения, состоящие в основном из неалфавитных…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: OPI-PG
Теги: llama, text-generation-inference, endpoints_compatible
Лайков: 33 | Загрузок: 1,283
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.