Новая версия, обученная с помощью GRPO, для более последовательной, качественной и выверенной ролевой игры персонажей. > Добро пожаловать в V2! Я Чун (@chun121), и это следующая эволюция модели ролевой игры Qwen3-4B. Эта версия выходит за рамки стандартной тонкой настройки и использует GRPO (генеративно-реагирующую оптимизацию предпочтений), чтобы привести поведение модели в соответствие с основными принципами отличной ролевой игры. 🎭 💬 🧠 ⚙️ Постоянство характера Высококачественный диалог Намерение Понимание Структурированный формат Поддерживает четкое соответствие личности Подробные, увлекательные нестандартные ответы Понимает вопросы и сценарии пользователей Использует процесс анализа Созданный на основе unsloth/Qwen3-4B-Base, этот LoRA был обучен не только предсказывать текст, но и активно генерировать ответы. вознаграждается за характер, высокое качество и контекстуальную осведомленность. Он предназначен для создателей, которым нужны ИИ-персонажи, которые не только разговорчивы, но и последовательны и глубоко соответствуют их определенным личностям. 🔄 Процесс обучения 📋 Описание 📚 Набор данных Gryphe/Sonnet3.5-Charcard-Roleplay ⬇️ 🏗️ Этап 1: Предварительная точная настройка Обучение пользовательскому формату чата, включая теги и ⬇️ 🎯…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Chun121
Теги: gguf, qwen3, roleplay, Creative, Writing, NSFW, lora, grpo
Лайков: 45 | Загрузок: 9,935
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.