> [!NOTE] > Для получения полной информации ознакомьтесь с статьей доктора Тулу здесь. Это контрольно-пропускной пункт SFT DR Tulu, агента открытых глубоких исследований, обученного на вершине Qwen3-8B. Эта модель прошла обучение SFT на этом наборе данных. Более подробную информацию о DR Tulu можно найти в нашей статье! Эта модель была обучена использованию инструментов с использованием инфраструктуры dr-agent-lib. Таким образом, запуск его «из коробки» с помощью HuggingFace или vLLM не будет работать должным образом! Дополнительные сведения, пояснения к этой таблице и анализ результатов можно найти в статье доктора Тулу! Эта модель распространяется по лицензии Apache 2.0. Он предназначен для исследовательского и образовательного использования в соответствии с Руководством по ответственному использованию Ai2. Во время обучения использовались следующие гиперпараметры: — скорость обучения: 4e-05 — trainbatchsize: 1 — evalbatchsize: 8 — начальное число: 42 — распределенный тип: multi-GPU — numdevices: 8 -gradientaccumulationsteps: 16 — totaltrainbatchsize: 128 — totalevalbatchsize: 64 — оптимизатор: используйте OptimizerNames.ADAMWTORCH с betas=(0.9,0.999) и epsilon=1e-08 иOptimargs=Без дополнительных аргументов оптимизатора — lrschedulertype: cosine — lrschedulerwarmupratio: 0,1 — num_epochs: 5 — 📝 DR Tulu Paper — ⚙️ DR Tulu demo — 💻 DR Tulu code — 🤖 DR…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: rl-research
Теги: qwen3, llama-factory, full, generated_from_trainer, conversational, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 93
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.