plato-9b — это доработанная версия модели google/gemma-2-9b-it для формирования ответов на русском языке. Эта модель с 9 миллиардами параметров превосходно справляется с диалоговыми задачами, предлагая глубокое контекстное понимание и детальные результаты. Мы применили как контролируемую точную настройку (SFT), так и оптимизацию предпочтений (PO). Для SFT мы использовали набор данных инструкций токенов 8B, из которых 4B токенов состояли из диалогов, а остальные охватывали математику, биологию, химию, программирование и общие знания. Набор данных PO содержит 200 миллионов токенов с общеизвестными инструкциями. Мы обучались на обоих наборах данных в течение нескольких эпох. Для оценки мы применили подход LLM как судьи к академическим задачам. В частности, мы использовали arena-general-ru и arena-hard-ru с gpt4o Judge и базовой линией gpt4o-mini.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: deepvk
Теги: gemma2, conversational, ru, en, text-generation-inference, endpoints_compatible
Лайков: 9 | Загрузок: 13
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.