Демо-версия онлайн-модели: https://huggingface.co/spaces/flydust/Chat-with-Magpie. Эта модель представляет собой согласованную версию мета-llama/Meta-Llama-3.1-8B. Мы применяем следующий конвейер: Сначала мы выполняем SFT, используя: Magpie-Align/Magpie-Pro-MT-300K-v0.1 и Magpie-Align/Magpie-Reasoning-150K Контрольная точка модели SFT:** Magpie-Align/Llama-3.1-8B-Magpie-Align-SFT-v0.1 Затем мы выполняем DPO на набор данных Princeton-NLP/llama3-ultrafeedback-armorm. Общие характеристики намного лучше, чем у официальной модели Llama-3.1-8B-Instruct! — MT-Bench: 8,375 (1-й ход), 7,650 (второй ход), 8,013 (средний) — Alpaca Eval 2 (GPT-4-Turbo-1106): 45,73 (LC), 52,79 (WR) — Arena Hard: 42,4 Лицензия: следуйте лицензии сообщества Meta Llama 3 (данные) и сообществу Meta Llama 3.1. Лицензия (Модель). Шаблон разговора: для достижения наилучшей производительности используйте официальный шаблон чата Llama 3. Как его использовать? Подробные инструкции можно найти в официальном репозитории Llama 3.1. Просто замените исходный идентификатор модели на этот идентификатор модели. ———-:|:——:|:—-:|:—————:|:—————:|:—————-:|:———- ———:|:—————:|:—————:|:————:|:—————:|:————-:| -…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Magpie-Align
Теги: llama, alignment-handbook, trl, dpo, generated_from_trainer, conversational, en, text-generation-inference
Лайков: 4 | Загрузок: 23
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.