DataPilot/ArrowCanaria-Llama-8B-RL-v0.1 - Каталог нейросетей
Генерация текста

DataPilot/ArrowCanaria-Llama-8B-RL-v0.1

Добавлено:
DataPilot/ArrowCanaria-Llama-8B-RL-v0.1

ArrowCanaria-Llama-8B-RL-v0.1 は、ArrowCanaria-Llama-8B-SFT-v0.1 に対して RLHF(Обучение с подкреплением у человека Обратная связь) SFTモデルは高品質なデータで学習されていますが、モデルの応答が「データに含まれる平Награда Модель)品質や知識応答の正確性・分かりやすさを、SFTの水準からさらに引き上げています。強化学習アルゴリズムには GRPO (Оптимизация относительной политики группы)を採用し、DAPO損失関数による安定した最適化を実現しています。相談応答と知識応答の2フェーズで段階的にRLHFを行うことで、SFTで獲得した雑談・RP・キャラクター対話能力を保持しつつ、応答の質を選択的に向上させています。 — AItuber / AI VTuber: 配信中のリスナーとの雑談・コメント対応 — チャットボット:自然な日本語での日常会話・悩み相談 — ロールプレイ:キャラクターを演じた対話・創作支援 — 汎用アシスタント:知識応答・推論・ツール呼び出しを含む幅広いタスク — 🗣️ 自然な日本語応答 —定型文や翻訳調を排した、人間らしい対話。RLHFによりさらに自然さが向上 — 💬高い雑談・相談性能 —共感・傾聴・具体的助言の品質が報酬モデルによるフィードバックで最適化済み — 🎭 RP・キャラクター対話 — SFTで獲得した一貫した人格・感情表現を保持 — 🧠推論力・知識応答 — 正確で分かりやすい知識応答をRLHFで強化 — 🔧 Использование инструмента / RAG — Функция Звоню・検索拡張生成に対応 — ✍️ クリエイティブ表現 —文学的な比喩・暗喩・情景描写など、豊かな日本語表現力SFT, SDGLOOM, 175 000 фунтов стерлингов**の高品質合成データセットで学習されています。 SFTデータの内訳:知識応答・雑談/相談・Tool Use・RAG・推論・RP・AItuber RP・クリエイティブ表現RLHFでは学習データの回答(ассистент部分)は使用せず、ユーザーの質問(подсказка )のみを用いてモデルに応答を生成させ、外部報酬モデルのスコアに基づいて方策を最適化しています。 — Фаза 1 (5e-6): 相談応答はモデルのEQ中核能力であり、積極的に最適化 — Фаза 2 (3e-6):…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: DataPilot
Теги: llama, llama3, rlhf, grpo, dapo, japanese, aituber, roleplay
Лайков: 7  |  Загрузок: 6

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.