Эта модель представляет собой доработанную версию Llama-3.1-8B с использованием техники RL DPO (прямая оптимизация предпочтений), разработанную для того, чтобы сделать ее более дружелюбной и выразительной с помощью смайликов и шуток. — lr: 2e-5 — эпохи: 1 — размер пакета: 16 — оптимизатор: adamwbnb_8bit
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: suayptalha
Теги: llama, dpo, rl, axolotl, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 12
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.