LLaMA-3-8B-Instruct-TR-DPO — это доработанная версия Meta-LLaMA-3-8B-Instruct, которая была обучена на наборе данных предпочтений, сгенерированном синтетически. — Базовая модель: Meta-LLaMA-3-8B-Instruct — Данные обучения: использовался синтетически сгенерированный набор данных о предпочтениях, состоящий из 10 тысяч выборок. Никакие собственные данные не использовались. — Время обучения: 3 часа на одном RTX 6000 Ada — Конфигурации QLoRA: — lorar: 64 — loraalpha: 32 — loradropout: 0,05 — loratarget_linear: true Целью была тонкая настройка модели для улучшения формата вывода и качества контента для турецкого языка. Он не обязательно умнее базовой модели, но его характеристики более привлекательны и предпочтительны. По сравнению с базовой моделью, LLaMA-3-8B-Instruct-TR-DPO более бегло и связно говорит на турецком языке. Он может генерировать более информативные и подробные ответы на данную инструкцию. Следует отметить, что модель по-прежнему будет генерировать неправильные или бессмысленные выходные данные, поэтому проверьте выходные данные перед их использованием. — MMLUTRV0.2: 49,83% — TruthfulQATRV0.2: 52,32% — ARCTRV0.2: 44,37% — HellaSwagTRV0.2: 45,58% — GSM8KTRV0.2: 54,21% — WinograndeTRV0.2: 55,06% — Среднее**: 50,22% Эти оценки могут отличаться от тех, которые вы получите, когда…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: Metin
Теги: llama, conversational, tr, model-index, text-generation-inference, endpoints_compatible
Лайков: 8 | Загрузок: 13
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.