Melikshah/dc_ops_grpo_lora - Каталог нейросетей
Генерация текста

Melikshah/dc_ops_grpo_lora

Добавлено:
Melikshah/dc_ops_grpo_lora

Полный отчет о создании основанного на физике конвейера обучения RL для операций центра обработки данных — от индивидуальной среды до SFT, разработанного преподавателями, и GRPO в реальном времени — на одном AMD Instinct MI300X. Окончательная модель: Меликшах/dcopsgrpolora  |  Набор данных учителя: Меликшах/dc-ops-sft-data  |  Окружающая среда (пространства HF): Меликшах/dcopsenv  |  Репозиторий среды: TheDeadcoder/dcops_environment — Обучение модели 7B для управления центром обработки данных — Стек — Оглавление — 1. Почему эта проблема важна — 2. Среда: DC-Ops — 2.1 Сценарии и сложность — 2.2 Набор команд оператора — 2.3 Архитектура вознаграждения — 3. Конвейер обучения — 3.1 Этап 1 — Генерация данных под руководством преподавателя — 3.2 Этап 2. Контролируемая точная настройка. 3.3 Этап 3. GRPO с живым моделированием. 4. Система вознаграждений GRPO. +5.0]](#envrewardfn—физика-симуляция-reward—40-50) — [commandqualityfn — Эвристика с учетом сценариев [-1.5, +1.2]](#commandqualityfn—сценарий-эвристика—15-12) — [norepeatfn — Штраф против зацикливания [-1.0,…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: Melikshah
Теги: peft, grpo, lora, trl, unsloth, conversational
Лайков: 11  |  Загрузок: 13

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.