📃 [Бумага] • 🚀 [Репозиторий Github] • 📏 [Модель критика] • ✍️ [Writer-7B] [Writer-32B] Эта модель точно настроена на основе Qwen/Qwen2.5-7B-Instruct на наборе данных SFT 12 КБ для написания оценочных задач. Во время обучения использовались следующие гиперпараметры: — скорость обучения: 7e-06 — trainbatchsize: 1 — evalbatchsize: 8 — начальное число: 42 — распределенный тип: multi-GPU — numdevices: 32 — GradientaccumulationSteps: 4 — totaltrainbatchsize: 128 — totalevalbatchsize: 256 — оптимизатор: используйте adamwtorch с betas=(0.9,0.999) и epsilon=1e-08 иOptimargs=Нет дополнительных аргументов оптимизатора — lrschedulertype: cosine — lrschedulerwarmupratio: 0,1 — num_epochs: 5 — Трансформеры 4.46.1 — Pytorch 2.4.0+cu121 — Наборы данных 3.1.0 — Токенизаторы 0.20.3
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: AQuarterMile
Теги: qwen2, llama-factory, generated_from_trainer, conversational, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 30
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.