Демо-версия онлайн-модели: https://huggingface.co/spaces/flydust/Chat-with-Magpie. Эта модель представляет собой согласованную версию мета-llama/Meta-Llama-3-8B. Мы применяем следующий конвейер: — Сначала мы используем набор данных Magpie-Align/Magpie-Pro-MT-300K-v0.1 и выполняем SFT -> Magpie-Align/Llama-3-8B-Magpie-Align-SFT-v0.1 — Затем мы выполняем DPO на наборе данных Princeton-nlp/llama3-ultrafeedback. Общие характеристики даже лучше, чем у официальной модели Llama-3-8B-Instruct! — Alpaca Eval 2 (против GPT-4-Turbo-1106): 38,52 (LC), 38,47 (WR) — Alpaca Eval 2 (против Llama-3-8B-Instruct): 69,37 (LC), 70,05 (WR) — Arena Hard: 32,4 — WildBench: 39,3 ((было) Лучшее, что мы сравниваем Llama-3-8B-Magpie-Совместите с официальными и другими LLM с открытым согласованием, которые были доработаны на основе базовых моделей и опубликовали свои наборы обучающих данных. Результаты следующие: Шаблон разговора: для лучшей производительности используйте официальный шаблон чата Llama 3. Как его использовать, чтобы получить подробные инструкции, просто замените исходный идентификатор модели. Magpie-Align/Llama-3-8B-Magpie-Align-v0.1` Во время обучения использовались следующие гиперпараметры: — скорость обучения: 2e-05 — trainbatchsize: 1 —…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Magpie-Align
Теги: tensorboard, llama, alignment-handbook, axolotl, trl, dpo, sft, generated_from_trainer
Лайков: 10 | Загрузок: 18
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.