Полный отчет о создании основанного на физике конвейера обучения RL для операций центра обработки данных — от индивидуальной среды до SFT, разработанного преподавателями, и GRPO в реальном времени — на одном AMD Instinct MI300X. Окончательная модель: Меликшах/dcopsgrpolora | Набор данных учителя: Меликшах/dc-ops-sft-data | Окружающая среда (пространства HF): Меликшах/dcopsenv | Репозиторий среды: TheDeadcoder/dcops_environment — Обучение модели 7B для управления центром обработки данных — Стек — Оглавление — 1. Почему эта проблема важна — 2. Среда: DC-Ops — 2.1 Сценарии и сложность — 2.2 Набор команд оператора — 2.3 Архитектура вознаграждения — 3. Конвейер обучения — 3.1 Этап 1 — Генерация данных под руководством преподавателя — 3.2 Этап 2. Контролируемая точная настройка. 3.3 Этап 3. GRPO с живым моделированием. 4. Система вознаграждений GRPO. +5.0]](#envrewardfn—физика-симуляция-reward—40-50) — [commandqualityfn — Эвристика с учетом сценариев [-1.5, +1.2]](#commandqualityfn—сценарий-эвристика—15-12) — [norepeatfn — Штраф против зацикливания [-1.0,…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Melikshah
Теги: peft, grpo, lora, trl, unsloth, conversational
Лайков: 11 | Загрузок: 13
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.