PRIME-RL/P1-30B-A3B - Каталог нейросетей
Генерация текста

PRIME-RL/P1-30B-A3B

Добавлено:
PRIME-RL/P1-30B-A3B

P1-30B-A3B — это средний вариант серии P1, высокопроизводительной языковой модели с открытым исходным кодом, специализирующейся на физических рассуждениях. Созданный на основе Qwen3-30B-A3B-Thinking-2507 и усовершенствованный посредством многоступенчатого обучения с подкреплением на тщательно подобранных данных соревнований по физике, P1-30B-A3B достигает впечатляющих результатов при сохранении разумных вычислительных требований, что делает его доступным для исследователей, работающих с физическими задачами. — 🥈 Серебряный уровень IPhO 2025: хорошие результаты на международной олимпиаде по физике (18,5/30 баллов) — 🥇 Совершенство HiPhO: 8 золотых медалей, 4 серебряные медали и 1 бронзовая медаль в 13 конкурсах по физике. Помимо физических рассуждений, P1 улучшается во многих областях. Как показано ниже, P1-30B-A3B превосходит свою базовую модель Qwen3-30B-A3B-Thinking-2507 по тестам математики, кодирования и STEM, демонстрируя сильное обобщение физических рассуждений. Мы благодарны сообществу открытого исходного кода за их неоценимый вклад. Особая благодарность: — Qwen3 — за предоставление основополагающих базовых моделей, которые легли в основу наших исследований — slime — за их инновационную работу над эффективной структурой обучения с подкреплением, которая легла в основу нашего процесса обучения — verl — за…

Модальности:
Генерация текста

Области применения:
Логика и рассуждение Диалог / чат Мультиязычность


Задача: Генерация текста
Автор: PRIME-RL
Теги: qwen3_moe, physics, reinforcement-learning, olympiad, reasoning, competition, education, conversational
Лайков: 11  |  Загрузок: 205

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.