> s1.1 — наш преемник s1 с лучшей производительностью рассуждений за счет использования следов рассуждения от r1 вместо Gemini. — Журналы: https://wandb.ai/hashimoto-group/o1/runs/m1ilia77/overview — Репозиторий: simplescaling/s1 — Документ: https://arxiv.org/abs/2501.19393 Эта модель является преемником s1-32B с немного лучшей производительностью. Благодарим компанию Bespoke Labs (Райан Мартен) за помощь в создании трассировок r1 для s1K с помощью Curator. Обратите внимание, что в s1-32B и s1.1-32B в этой таблице используется бюджетное принуждение; в частности, игнорируя окончание обдумывания и добавляя «Подождите» до четырех раз.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: simplescaling
Теги: tensorboard, qwen2, conversational, text-generation-inference, endpoints_compatible
Лайков: 99 | Загрузок: 399
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.