Обновление от 16.01.24: NeuralBeagle14-7B — (вероятно) лучшая модель 7B, которую вы можете найти! 🎉 NeuralBeagle14-7B — это тонкая настройка DPO для mlabonne/Beagle14-7B с использованием набора данных предпочтений argilla/distilabel-intel-orca-dpo-pairs и моего блокнота DPO из этой статьи. Он основан на слиянии следующих моделей с использованием LazyMergekit: fblgit/UNA-TheBeagle-7b-v1 argilla/distilabeled-Marcoro14-7B-slerp Спасибо Argilla за предоставленный здесь набор данных и рецепт обучения. 💪 GGUF**: https://huggingface.co/mlabonne/NeuralBeagle14-7B-GGUF NeuralBeagle14-7B занимает первое место в таблице лидеров Open LLM в категории ~7B. Он имеет тот же средний балл, что и Beagle14-7B («Показать слияния»), что может быть связано с неудачным запуском. Я думаю, что на этом этапе я, возможно, злоупотребляю парами argilla/distilabel-intel-orca-dpo-pair, поскольку этот набор данных или его исходная версия присутствуют в нескольких моделях. Мне нужно найти более качественные данные о предпочтениях для следующего слияния DPO. Обратите внимание, что некоторые модели, такие как udkai/Turdus и nfaheem/Marcoroni-7b-DPO-Merge, к сожалению, намеренно загрязнены (см. очень высокий балл Виногранде). Оценка проводилась с использованием LLM AutoEval в пакете Nous. Это лучшая модель 7В…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: LoneStriker
Теги: mistral, merge, mergekit, lazymergekit, fblgit/UNA-TheBeagle-7b-v1, argilla/distilabeled-Marcoro14-7B-slerp, dpo, rlhf
Лайков: 5 | Загрузок: 3
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.