Kumru-2B — это облегченная версия Kumru LLM с открытым исходным кодом, разработанная с нуля для турецкого языка компанией VNGRS. — Он предварительно обучен на очищенных дедуплицированных корпусах объемом 500 ГБ для токенов 300B и контролируется на 1 млн примеров. — Он поставляется с современным токенизатором, разработанным для турецкого языка, с поддержкой кода, математических вычислений и шаблонов чата. — Kumru по умолчанию имеет длину собственного контекста 8192 токена. — Это доработанная версия инструкции. — Предварительно обученная базовая версия здесь. И Кумру-7Б, и Кумру-2Б оцениваются на тесте Cetvel. Мы видим, что Kumru в целом превосходит значительно более крупные модели, такие как LLaMA-3.3–70B, Gemma-3–27B, Qwen-2–72B и Aya-32B. Он отлично справляется с задачами, связанными с нюансами турецкого языка, такими как исправление грамматических ошибок и обобщение текста. Токенизатор Kumru — это современный токенизатор BPE с размером словаря 50 176, регулярным выражением для предварительной токенизации и шаблоном чата. Другие модели с открытым исходным кодом тратят на 38–98% больше токенов, чем Kumru, но при этом имеют больший размер словарного запаса. Это означает, что Kumru может представлять больше текстов в своем контексте и обрабатывать их быстрее и дешевле. Хотя длина собственного контекста Кумру составляет 8192, его эффективный контекст…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: vngrs-ai
Теги: mistral, conversational, tr, text-generation-inference, endpoints_compatible
Лайков: 114 | Загрузок: 1,035
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.