Qwen3 — это последнее поколение крупных языковых моделей в серии Qwen, предлагающее полный набор моделей плотной и смешанной речи (MoE). Основываясь на обширных достижениях в области данных обучения, архитектуры моделей и методов оптимизации, Qwen3 обеспечивает следующие ключевые улучшения по сравнению с ранее выпущенным Qwen2.5: — Расширенный корпус предварительного обучения более высокого качества: Qwen3 предварительно обучен 36 триллионам токенов на 119 языках — утроив языковой охват Qwen2.5 — с гораздо более богатым набором высококачественных данных, включая кодирование, STEM, рассуждения, книги, многоязычные и синтетические данные. — Методы обучения и архитектура модели: Qwen3 включает в себя ряд методов обучения и архитектурных усовершенствований, включая потерю глобальной пакетной балансировки нагрузки для моделей MoE и qk layernorm для всех моделей, что приводит к повышению стабильности и общей производительности. — Трехступенчатая предварительная подготовка: этап 1 фокусируется на широком языковом моделировании и приобретении общих знаний, этап 2 улучшает навыки рассуждения, такие как STEM, кодирование и логическое рассуждение, а этап 3 улучшает понимание длинного контекста, увеличивая длину последовательности обучения до 32 000 токенов. — Закон масштабирования…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: unsloth
Теги: qwen3, unsloth, text-generation-inference, endpoints_compatible, 4-bit, bitsandbytes
Лайков: 4 | Загрузок: 5,413
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.