Эта модель представляет собой доработанную версию Qwen/Qwen2.5-7B-Instruct на наборе данных Sky-T1. Во время обучения использовались следующие гиперпараметры: — скорость обучения: 1e-05 — размер партии: 1 — размер партии: 8 — семя: 42 — распределенный тип: мульти-GPU — количество устройств: 8 — шаги накопления градиента: 12 — общий размер партии: 96 — общий размер партии: 64 — оптимизатор: используйте adamwtorch с betas=(0,9,0,999) и epsilon = 1e-08 и optimizerargs =никаких дополнительных аргументов оптимизатора — lrschedulertype: cosine — lrschedulerwarmupratio: 0,1 — num_epochs: 2,0 — Transformers 4.46.1 — Pyto
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: pe-nlp
Теги: qwen2, llama-factory, full, generated_from_trainer, conversational, text-generation-inference, endpoints_compatible
Лайков: 3 | Загрузок: 26
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.