Это тонкая настройка ORPO meta-llama/Meta-Llama-3-8B на 1 тыс. образцов mlabonne/orpo-dpo-mix-40k, созданных для этой статьи. Это успешная тонкая настройка, которая следует шаблону ChatML! Попробуйте демо: https://huggingface.co/spaces/mlabonne/OrpoLlama-3-8B Эта модель использует контекстное окно 8k. Обучение проводилось с использованием шаблона ChatML. OrpoLlama-4-8B превосходит Llama-3-8B-Instruct в наборах данных GPT4All и TruthfulQA.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Языки программирования:
Rust
Задача: Генерация текста
Автор: solidrust
Теги: llama, 4-bit, AWQ, autotrain_compatible, endpoints_compatible, orpo, llama 3, rlhf
Лайков: 3 | Загрузок: 23
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.