Эта модель представляет собой доработанную версию NousResearch/Nous-Hermes-2-Mixtral-8x7B-SFT в наборе данных None. В наборе оценок он достигает следующих результатов: — Потеря: 0,4559 — https://huggingface.co/MaziyarPanahi/Nous-Hermes-2-Mixtral-8x7B-SFT-Wikihow-GGUF Во время обучения использовались следующие гиперпараметры: — скорость обучения: 0,0002 — trainbatchsize: 2 — evalbatchsize: 2 — начальное число: 42 — распределенный тип: multi-GPU — numdevices: 4 -gradientaccumulationsteps: 4 — totaltrainbatchsize: 32 — totalevalbatchsize: 8 — оптимизатор: Адам с betas=(0.9,0.999) и epsilon=1e-08 — lrschedulertype: cosine — lrschedulerwarmupsteps: 10 — num_epochs: 1 — PEFT 0.8.2 — Трансформеры 4.38.0.dev0 — Pytorch 2.2.0+cu121 — Наборы данных 2.17.0 — Токенизаторы 0.15.0
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: MaziyarPanahi
Теги: peft, tensorboard, mixtral, axolotl, generated_from_trainer, nous_hermes, wikihow, lora
Лайков: 4 | Загрузок: 69
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.