This model is a fine-tuned version of alignment-handbook/zephyr-7b-sft-full on the HuggingFaceH4/ultrafeedback_binarized dataset. It achieves the following results on the evaluation set: — Loss: 0.5042 — Rewards/chosen: -1.0500 — Rewards/rejected: -2.0480 — Rewards/accuracies: 0.7539 — Rewards/margins: 0.9980 — Logps/rejected: -468.1450 — Logps/chosen: -368.4135 — Logits/rejected: 2.3821 — Logits/chosen: 1.6141 The following hyperparameters were used during training: — learningrate: 5e-07 — trainbatchsize: 8 — evalbatchsize: 8 — seed: 42 — distributedtype: multi-GPU — numdevices: 8 — gradientaccumulatio
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: alignment-handbook
Теги: tensorboard, mistral, alignment-handbook, generated_from_trainer, trl, dpo, conversational, text-generation-inference
Лайков: 3 | Загрузок: 55
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.