Адаптер LoRA настроен с помощью DPO на Qwen3.5-9B для гуманизации текста на китайском языке. Это последняя и наиболее функциональная версия, особенно эффективна для академических и технических текстов на китайском языке. Использует подход чистой самостоятельной игры: отклоненные образцы представляют собой выходные данные промежуточной контрольной точки предыдущего этапа обучения, что учит модель последовательно превосходить собственные предыдущие выходные данные. — Научные статьи: сохраняются все цифры, названия моделей, формулы и технические термины — проверено на 10 академических сценариях (по 3 образца в каждом) — Технические отчеты: ведется технический реестр, не похожий на робототехнику — Ежедневный текст: более краткий и естественный, чем в раунде 1 — Данные DPO: 2000 пар — выбрано = академический текст CSL, отклонённый = результаты предыдущих контрольных точек (чистая самостоятельная игра, без случайного смешивания) — бета: 0,2, lr=5e-7 (консервативный, чтобы избежать дрейфа), 2 эпохи (250 шагов) — Отклоненное вознаграждение: оставалось отрицательным и уменьшалось на протяжении всех 250 шагов — нет нестабильности — Дизайн ключа: отклоненная чистая самостоятельная игра дает чистый градиентный сигнал с одним распределением. Протестировано на 10 академических сценариях (по 3 образца в каждом), все ключевые числа сохраняются: > Примечание. Для академических текстов используйте температуру 0,60–0,65. Более высокие температуры иногда вызывают редкие…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: XiangJinYu
Теги: peft, lora, dpo, chinese, humanization, academic-writing, conversational, zh
Лайков: 5 | Загрузок: 48
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.