cyberagent/calm2-7b-chatにcyberagent/chatbot-arena-ja-calm2-7b-chat-experimentalデータセットを用いてDirect Preference Optimization (DPO)をしたモデルです。 DPOにはLow-Rank Adaptation (LoRA)を用いました。以下の文をシステムプロンプト(system_message)としてcalm2-7b-chat-dpoとcalm2-7b-chatの評価を行いました。このシステムプロンプトはstabilityai/japanese-stablelm- instruct-alpha-7bを評価するときに使われるものをそのまま使いました。他のデコーディングパラメータはデフォルトのままです(ランダム性があります)。 Юу Джиннай (jinnai_yu@cyberagent.co.jp), Стоящий на плечах гигантов Юу Джиннай. 2024. Изменяет ли межкультурное выравнивание здравый смысл языковых моделей? В материалах 2-го семинара по межкультурным аспектам НЛП, стр. 48–64, Бангкок, Таиланд. Ассоциация компьютерной лингвистики.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: cyberagent
Теги: llama, ja, en, text-generation-inference, endpoints_compatible
Лайков: 15 | Загрузок: 18
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.