Finetune Mistral-Nemo-Base-2407 создан для имитации стиля написания моделей символов.ai. — 2 эпохи SFT на данных RP, затем около часа PPO на 8xH100 с POLAR-7B RFT — Немного шатко, если вы имеете дело с более длинными сообщениями, возможно, вам придется снизить температуру — Формат чата ChatML — Обзоры: > обычно хорошо пишет, очень хорошо для 12b, связен в RP, хорошо следует контексту и хорошо начинает разговор > Мне это действительно нравится, его приятно использовать. Когда он дает мне стабильный результат, результат получается высокого качества и соответствует задаче, у него есть маленькая глупая модель, в которой сохраняется базовая логика, но он изобретает вещи или забывает их (может быть, это похоже на маленькое эффективное контекстное окно?), Что, если быть ясным, похоже на это. Прекрасно. Очень хорошо синтезирует и выводит информацию, предоставленную в контексте на более высоком уровне. Это в основном доказательство концепции, демонстрирующее, что модели вознаграждения POLAR могут быть очень полезны для задач «вне распределения», таких как ролевые игры. Если вы работаете над собственными настройками ролевой игры, рассмотрите возможность использования POLAR!
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: wave-on-discord
Теги: mistral, conversational, text-generation-inference, endpoints_compatible
Лайков: 23 | Загрузок: 16
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.