Introducing SOLAR-10.7B-Instruct-Forest-DPO, a LLM fine-tuned with base model upstage/SOLAR-10.7B-Instruct-v1.0, using direct preference optimization. This model showcases exceptional prowess across a spectrum of natural language processing (NLP) tasks. A mixture of the following datasets was used for fine-tuning. 1. Intel/orcadpopairs 2. nvidia/HelpSteer 3. jondurbin/truthy-dpo-v0.1
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: abhishekchohan
Теги: llama, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 3 | Загрузок: 69
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.