DataPilot/ArrowIdeative-13b-NeoBase-ZERO-llm-jp-v0.1 - Каталог нейросетей
Генерация текста

DataPilot/ArrowIdeative-13b-NeoBase-ZERO-llm-jp-v0.1

Добавлено:
DataPilot/ArrowIdeative-13b-NeoBase-ZERO-llm-jp-v0.1

ArrowIdeative-13b-NeoBase-ZERO-llm-jp は、ベースモデルからGRPO(RL)だけで事後学習を行うことを主軸に設計された、日本語向けLLMです。狙いとしては、典型的な「強い指示追従(Instruct)」に寄せ切らず、ベースモデル寄りの“出力の自由度”を残しつつ、チャット運用に最低限必要な形式順守と、回答品質の底上げを同時に実現することです。 — 「ある程度プロンプトエンジニアリングが効くベースモデル」 — ただし完全なInstructモデルではない(過剰な同調・過剰な定型化を狙っていない) — Набор данных: TeamDelta/bare-ja-v0.1 の質問(プロンプト)部分のみを一部利用 https://huggingface.co/datasets/TeamDelta/bare-ja-v0.1 1.ベースモデル(Сарашина2-70b))で質問/回答のたたき台を生成 2. Microsoft Фи-4-миниで品質キュレーション(選別・整形) 3. Многоязычный E5で多様性フィルタリング(近似質問の除去、重複削減) — 参照:Сарашина2-70b https://www.sbintuitions.co.jp/blog/entry/2024/08/21/144254 — BARE 用プロンプト: https://github.com/foxn2000/sdg/blob/main/prompts/bare.txt 1.チャットテンプレートの順守 — 例:終端トークン(` 等)を適切に出力できるか -強いインセンティブ(例:+6.0 付与) 2. 回答品質(報酬モデル) -テンプレートが守れている場合に限り、報酬モデルのスカラーを最大 +10.0 で加算 -マイナス報酬側は軽減(例:1/2 係数)して学習崩壊を抑制 -ベース寄り:過度に無難な“合意的テンプレ回答”へ収束させることを目的にしていません- プロンプト耐性:命令の書き方で結果が変わりやすい設計(指示の粒度が重要) -出力の個性:SFT偏重で起きやすい均質化を避け、探索性を残す狙い -形式順守は改善しても、厳密な指示追従や安全性の自動担保を保証しません -報酬モデルのバイアス(価値観・スタイル)を受けます -一般的なInstructモデルと同じ評価軸で単純比較すると、用途によっては不利になる場合があります- llm-jp プロジェクト — TeamDelta / bare-ja-v0.1 — サイバーエージェント(ca-reward-3b-ja) — Unsloth / SGLang および関連OSS

Модальности:
Генерация текста


Задача: Генерация текста
Автор: DataPilot
Теги: llama, ja, text-generation-inference, endpoints_compatible
Лайков: 7  |  Загрузок: 4

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.