🏆 4-е место в мире | 🥇 1-е место в Узбекистане по тесту UzLiB, опережая GPT-4o, Claude 3.5 Sonnet и Gemini 2.5 Flash по задачам на узбекском языке —-|:—————:|:——-:|:———-:|:———————:| > Коэффициент рождаемости: Среднее количество жетонов в слове. Чем ниже, тем лучше для эффективности. — Для представления узбекского текста требуется на 22,5% меньше токенов — Более быстрый вывод благодаря более коротким последовательностям — Снижение затрат на API при развертывании — Лучшее использование контекста — размещение большего количества контента в одном контекстном окне 1. Операция токенизатора: расширенный словарный запас с 40 000 оптимизированных для узбекского языка токенов 2. Встраивание инициализации: семантическая инициализация с использованием композиции подслов 3. Непрерывное предварительное обучение: обучение на 2B токенах узбекского и английского текста Корпус 4. Точная настройка инструкций: согласование с использованием наборов инструкций на узбекском и английском языках — 📝 Генерация текста: творческое письмо, создание контента на узбекском языке — ❓ Ответы на вопросы: ответы на вопросы об узбекской культуре, истории и общих знаниях — 📚 Понимание прочитанного: понимание и анализ узбекских текстов — 🔤 Грамматика и орфография: задания на правильность узбекского языка — 🌐 Помощь в переводе: задания на узбекско-английском языке — 💬 Разговорный ИИ:…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: NeuronUz
Теги: uzbek, qwen3, language-model, nlp, central-asia, low-resource, tokenizer-optimization, uz
Лайков: 7 | Загрузок: 558
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.