VBART — это первый LLM, прошедший предварительное обучение на турецких корпусах с нуля в больших масштабах. Она прошла предварительное обучение в VNGRS в феврале 2023 года. При точной настройке модель способна решать задачи условной генерации текста, такие как суммирование текста, перефразирование и генерация заголовков. Он превосходит по производительности свои многоязычные аналоги, хотя и намного меньше других реализаций. Этот репозиторий содержит предварительно обученные веса TensorFlow и Safetensors VBART-Medium-Base. — Разработано: VNGRS-AI — Тип модели: Трансформаторный кодер-декодер на основе архитектуры mBART — Язык(и) (NLP): Турецкий — Лицензия: CC BY-NC-SA 4.0 — Документ: arXiv Базовая модель предварительно обучена на vngrs-web-corpus. Он курируется путем очистки и фильтрации турецких частей наборов данных OSCAR-2201 и mC4. Эти наборы данных состоят из документов неструктурированных данных веб-сканирования. Более подробную информацию о наборе данных можно найти на соответствующих страницах. Данные фильтруются с использованием набора эвристик и определенных правил, описанных в приложении к нашей статье. Эта модель является предварительно обученной базовой моделью и способна моделировать язык в масках. Его цель — служить базовой моделью для точной настройки для последующих задач.…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: vngrs-ai
Теги: tf, mbart, text2text-generation, tr
Лайков: 5 | Загрузок: 12
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.