Попытка репликации Tulu 3 на базовых моделях Qwen 2.5. Большое спасибо Retis Labs за предоставление моего поликула 8xH100, который использовался для обучения и тестирования этой модели! Еще одно большое спасибо AllenAI за публикацию данных и серии моделей Tülu 3 (а также статьи и подробностей по обучению), а также Alibaba за обучение оригинальной серии базовых моделей Qwen 2.5! Во время обучения использовались следующие гиперпараметры: — скорость обучения: 3.5e-06 — trainbatchsize: 8 — evalbatchsize: 8 — начальное число: 42 — распределенный тип: multi-GPU — numdevices: 8 -gradientaccumulationsteps: 2 — totaltrainbatchsize: 128 — totalevalbatchsize: 64 — оптимизатор: используйте pagedademamix8bit и аргументы: Нет дополнительного оптимизатора аргументы — lrschedulertype: косинус — lrschedulerwarmupsteps: 370 — num_epochs: 1 — Трансформеры 4.46.3 — Pytorch 2.5.1+cu124 — Наборы данных 3.1.0 — Токенизаторы 0.20.3
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: allura-org
Теги: qwen2, conversational, text-generation-inference, endpoints_compatible
Лайков: 12 | Загрузок: 7
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.