Llama2-13bに日本語語彙を追加して継続事前学習を行った大喜利言語モデルです。事前学習後に大喜利データでТонкая настройкаしています。 本モデルはAWS LLM支援プログラムの支援を受けております。 継続事前学習ではAWS Trainium Лицензия: LLAMA 2 COMMUNITY LICENSE Библиотека: Neuronx-nemo-megatron Llama2の本来のトークナイザーに含まれる語彙32,000に日本語の語彙をBPEで学習して13,046 или 45,046です。語彙を追加する際、漢字一文字のトークンは、常用漢字と学習データ内で出現頻度が高いものに絞っています。数字と文字がペアのトークンや記号と文字がペアのトークンが学習されないように、予めデータから数字や記号を取り除いています。以下のコーパスを使用して、事前学習を行いました。その際のトークン数は650 億トークンでした。 C4, の日本語データ CC-100,の日本語データ OSCAR,の日本語データВикипедияの日本語ダンプデータと英語ダンプデータ * 自社データAWSのinf2インスタンスはパラメータ数が10Bを超えるモデルをG PUインスタンスと比べ安価に運用できます(24 января 2024現在)).モデルとソースコードはこちらです。以下は大喜利Точная настройкаしたモデルが出力させたボケを、ケータイ大喜利レジェンドに4段階で評価してもらった結果です。圏外:お題を日本語として理解できていない1 часть:お題を理解はできているがボケとして成立していない(面白みがない) 2: ボケとして成立している(面白みがある) 3:面白い(一定以上の面白さがある) -内田 達弥 (УЧИДА, Тацуя) — 小橋 洋平 (КОБАСИ, Ёхей) — 黒木 修弥 (КУРОКИ, Сюя) — 久保田 光 (КУБОТА, Хикару) — 竹之内 大輔(ТАКЕНУТИ, Дайсуке)
Модальности:
Генерация текста
Задача: Генерация текста
Автор: watashiha
Теги: llama, ja, en, text-generation-inference, endpoints_compatible
Лайков: 13 | Загрузок: 18
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.