Оценено с использованием vllm-project/llm-compressor, nvidia/Llama-Nemotron-Post-Training-Dataset и следующих конфигураций: За последние три месяца мы продолжали масштабировать мыслительные способности Qwen3-4B, улучшая как качество, так и глубину рассуждений. Мы рады представить Qwen3-4B-Thinking-2507 со следующими ключевыми улучшениями: — Значительно улучшена производительность при решении задач рассуждения, включая логические рассуждения, математику, естественные науки, программирование и академические тесты, которые обычно требуют человеческого опыта. — Заметно улучшены общие возможности, такие как следование инструкциям, использование инструментов, генерация текста и согласование с предпочтениями человека. — Улучшены возможности понимания длинного контекста 256K. Qwen3-4B-Thinking-2507 имеет следующие функции: — Тип: причинно-языковые модели — Этап обучения: предварительное обучение и постобучение — Количество параметров: 4.0B — Количество параметров (без внедрения): 3,6B — Количество слоев: 36 — Количество головок внимания (GQA): 32 для Q и 8 для KV — Длина контекста: 262 144 изначально. Кроме того, чтобы обеспечить модельное мышление, шаблон чата по умолчанию автоматически включает файлы . Поэтому выходные данные модели обычно содержат…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: cyankiwi
Теги: qwen3, conversational, text-generation-inference, endpoints_compatible, compressed-tensors
Лайков: 5 | Загрузок: 578
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.