amazingvince/zephyr-smol_llama-100m-dpo-full - Каталог нейросетей
Генерация текста

amazingvince/zephyr-smol_llama-100m-dpo-full

Добавлено:
amazingvince/zephyr-smol_llama-100m-dpo-full

This model is a fine-tuned version of amazingvince/zephyr-smol_llama-100m-sft-full on the None dataset. It achieves the following results on the evaluation set: — Loss: 0.5465 — Rewards/chosen: -0.0518 — Rewards/rejected: -0.7661 — Rewards/accuracies: 0.7170 — Rewards/margins: 0.7143 — Logps/rejected: -450.2018 — Logps/chosen: -588.7877 — Logits/rejected: -4.9602 — Logits/chosen: -5.2468 The following hyperparameters were used during training: — learningrate: 5e-07 — trainbatchsize: 8 — evalbatchsize: 8 — seed: 42 — distributedtype: multi-GPU — numdevices: 2 — totaltrainbatchsi

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: amazingvince
Теги: tensorboard, llama, generated_from_trainer, conversational, text-generation-inference, endpoints_compatible
Лайков: 3  |  Загрузок: 15

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.