Оптимизация предпочтений самостоятельного воспроизведения для согласования языковой модели (https://arxiv.org/abs/2405.00675) Эта модель была разработана с использованием оптимизации предпочтений самостоятельного воспроизведения на итерации 3 на основе архитектуры мета-llama/Meta-Llama-3-8B-Instruct в качестве отправной точки. Мы использовали наборы подсказок из набора данных openbmb/UltraFeedback, разделенные на 3 части для 3 итераций с помощью snorkelai/Snorkel-Mistral-PairRM-DPO-Dataset. Все использованные ответы являются синтетическими. — Llama-3-Instruct-8B-SPPO-Iter1 — Llama-3-Instruct-8B-SPPO-Iter2 — Llama-3-Instruct-8B-SPPO-Iter3 — Тип модели: модель GPT с параметром 8B, точно настроенная на синтетических наборах данных. — Язык(и) (NLP): Преимущественно английский — Лицензия: Apache-2.0 — Точная настройка на основе модели: Meta-llama/Meta-Llama-3-8B-Instruct — Скорость обучения: 5e-07 — Eta: 1000 — Perdevicetrainbatchsize: 8 — Gradientaccumulationsteps: 1 — Seed: 42 — распределенный тип: deepspeedzero3 — numdevices: 8 — оптимизатор: RMSProp — lrschedulertype: линейный — lrschedulerwarmupratio: 0,1 — numtrain_epochs: 6,0 (остановка на эпохе = 1,0)
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: UCLA-AGI
Теги: llama, conversational, en, model-index, text-generation-inference, endpoints_compatible
Лайков: 83 | Загрузок: 8,581
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.