«Мы все в чем-то эксперты, но в чем-то мы все новички». Это модель Qwen3 MoE (Mixture of Experts), которая имеет общее количество параметров 2,4B и 0,6B для каждого из 4 экспертов. Все экспертные модели можно увидеть ниже. Эта модель призвана обеспечить более точные результаты с большей эффективностью и меньшим использованием памяти! perdevicetrainbatchsize = 2 градиента аккумуляции шагов = 4 шага прогрева = 5 numtrainepochs = 1 скорость обучения = 2e-5 optim = «adamw8bit» Weightdecay = 0,01 семя = 3407 Эта модель была полностью настроена с помощью BF16 на первых 20 тыс. строк набора данных nvidia/OpenCodeReasoning за 1 эпоху. Эта модель была полностью настроена с помощью BF16 на всем наборе данных unsloth/OpenMathReasoning-mini за 1 эпоху. Эта модель была полностью доработана с помощью BF16 на первых 20 тысячах строк набора данных FreedomIntelligence/medical-o1-reasoning-SFT за 1 эпоху. Для этого эксперта непосредственно использовалась модель Qwen/Qwen3-0.6B, точная настройка не применялась. Здесь можно найти модель маршрутизатора, которая была обучена версией distilbert/distilbert-base-uncased на 7 различных наборах данных. Этот проект распространяется по лицензии Apache License 2.0. Подробности смотрите в файле ЛИЦЕНЗИИ.
Модальности:
Генерация текста
Области применения:
Генерация кода Математика Логика и рассуждение Следование инструкциям Диалог / чат Медицина
Задача: Генерация текста
Автор: suayptalha
Теги: qwen3moe, moe, qwen3, code, math, reasoning, medical, instruction
Лайков: 33 | Загрузок: 30
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.