Эта модель использует равномерное нейронное выравнивание (UNA) для этапов обучения DPO и представляет собой доработанную версию fblgit/zephyr-lora-dpo-b1 в наборе данных HuggingFaceH4/ultrafeedback_binarized. Рекомендуется использовать последнюю версию Juanako, которая значительно превосходит версию v1. В оценочном наборе достигаются следующие результаты: — Потеря: 0,4594 — Награды/выбрано: -1,1095 — Награды/отклонено: -2,3132 — Награды/точность: 0,7964 — Награды/маржи: 1,2037 — Журналы/отклонено: -220,0052 — Логиты/выбрано: -217,5506 — Логиты/отклонено: -2,5535 — Логиты/выбрано: -2,7973 Следовало руководству по выравниванию для выполнения DPO (Фаза 2) по модели Zephyr-SFT. Пожалуйста, не стесняйтесь проводить дополнительные тесты и фиксировать результаты. Также, если вы заинтересованы в участии в научных исследованиях UNA или в спонсорстве GPU для поддержки исследований UNA, не стесняйтесь обращаться к нам. Особая благодарность TheBloke за преобразование модели в несколько форматов и в целом за его огромный вклад в сообщество. Вот модели: juanako-7B-v1-AWQ juanako-7B-v1-GPTQ * juanako-7B-v1-GGUF Кажется, превосходит оригинальный Zephyr в большинстве задач. Я тренировал Хуанако с теми же наборами данных и тренером из Alignment-handbook/zephyr-7b-sft-lora 1…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: fblgit
Теги: mistral, alignment-handbook, generated_from_trainer, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 4
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.