II-Medical-8B — это новейшая усовершенствованная модель большого языка, разработанная Intelligent Internet и специально разработанная для улучшения медицинских рассуждений на основе искусственного интеллекта. После положительного приема нашего предыдущего II-Medical-7B-Preview, эта новая итерация значительно расширяет возможности ответа на медицинские вопросы. Мы собрали и создали полный набор наборов данных для рассуждений для медицинской области и выполнили тонкую настройку SFT для модели Qwen/Qwen3-8B. После этого мы дополнительно оптимизировали модель SFT, обучив DAPO на наборе данных для повышения производительности. — Максимальная длина: 16378. — Размер пакета: 128. — Скорость обучения: 5e-5. — Количество эпох: 8. — Максимальная длина подсказки: 2048 токенов. — Максимальная длина ответа: 12288 токенов. — Слишком длинный буфер: включено, 4096 токенов, штрафной коэффициент 1,0. — Коэффициент зажима: низкий 0,2, высокий 0,28. — Размеры пакетов: приглашение поезда 512, приглашение генерации 1536, мини-пакет 32. — Ответов на приглашение: 16. — Температура: 1,0, Top-p: 1,0, Top-k: -1 (развертывание vLLM). — Скорость обучения: 1e-6, шаги разминки: 10, снижение веса: 0,1. — Агрегация потерь: Токен-среднее. — Градиентное отсечение: 1.0. — Коэффициент энтропии: 0. Наша модель II-Medical-8B достигла 40% оценки по…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Intelligent-Internet
Теги: qwen3, conversational, text-generation-inference, endpoints_compatible
Лайков: 204 | Загрузок: 1,217
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.