TURNA — это модель турецкого языка, основанная на структуре UL2, которая подходит как для задач понимания, так и для генерации. Оценки трех поколений и пяти задач на понимание на турецком языке показывают, что TURNA превосходит несколько многоязычных моделей и конкурирует с одноязычными турецкими моделями в понимании задач. Модель предоставляется общественности для использования исключительно в некоммерческих академических исследовательских целях. — 36 слоев кодера и декодера — 16 головок внимания — Встраивание токенов имеет 1024 измерения — Многослойные слои перцептрона имеют 2816 скрытых измерений и используют активации Gated GeLu — Параметры входного и классификационного слоев не являются общими — 1.1B параметров — использовался токенизатор подслов в униграмме, обученный на 10 ГБ текста, состоящего из случайных подмножеств OSCAR, OPUS и Wikipedia — Размер словаря: 32 000 токенов + 128 специальных жетонов. Разработано: Отдел компьютерной инженерии Университета Богазичи TABILAB (особая благодарность VNGRS-AI за то, что поделился своим токенизатором). Финансируется: Мы благодарим программу Google TPU Research Cloud за предоставление нам кредитов для предварительного обучения нашей модели на машинах TPU v3-8. Мы благодарны TETAM и BOUN CMPE за предоставленную…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: boun-tabi-LMG
Теги: t5, text2text-generation, tr, text-generation-inference
Лайков: 82 | Загрузок: 168
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.