abideen/AlphaMonarch-dora - Каталог нейросетей
Генерация текста

abideen/AlphaMonarch-dora

Добавлено:
abideen/AlphaMonarch-dora

AlphaMonarch-dora — это DPO, доработанный для mlabonne/NeuralMonarch-7B с использованием набора данных предпочтений argilla/OpenHermes2.5-dpo-binarized-alpha с использованием DoRA. Эта модель немного менее эффективна в таблицах лидеров Nous и Openllm по сравнению с базовыми AlphaMonarch и AlphaMonarch-laser. Я обучил эту модель 1080 шагам. Все гиперпараметры сохранялись неизменными во всех этих экспериментах. Спасибо Мухаммаду Бин Усману за оценку AlphaMonarch-DoRA в тесте NOUS. Во время обучения использовались следующие гиперпараметры: — скорость обучения: 5e-7 — trainbatchsize: 2 — evalbatchsize: не указано — начальное число: не указано — градиентаккумуляция шагов: 8 — totaltrainbatchsize: не указано — оптимизатор: PagedAdamW с 32-битной точностью — lrschedulertype: Cosine — lrschedulerwarmupsteps: 100 — TrainingSteps: 1080 — Трансформеры 4.39.0.dev0 — Peft 0.9.1.dev0 — Наборы данных 2.18.0 — факел 2.2.0 — ускорение 0.27.2

Модальности:
Генерация текста

Области применения:
Следование инструкциям Диалог / чат


Задача: Генерация текста
Автор: abideen
Теги: mistral, generated_from_trainer, instruct, finetune, chatml, gpt4, synthetic data, distillation
Лайков: 4  |  Загрузок: 21

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.