Модель ученика после тонкой настройки улучшает производительность базовой модели по двум критериям: truefulqa и gsm8k. Это эксперимент по дистилляции с Qwen1.5-1.8B в качестве учителя и Qwen1.5-0.5B в качестве модели ученика соответственно. — Образцы были взяты из набора данных Pile. — оптимизатор: SM3, планировщик: косинус с прогревом, lr=2e-5 Qwen1.5 — серия языковых моделей, включающая языковые модели декодеров разных размеров. Для каждого размера мы выпускаем модель базового языка и согласованную модель чата. Он основан на архитектуре Transformer с активацией SwiGLU, смещением внимания QKV, вниманием к групповым запросам, сочетанием внимания скользящего окна и полного внимания и т. д. Кроме того, у нас есть улучшенный токенизатор, адаптивный к множеству естественных языков и кодов. Для бета-версии мы временно не включали GQA и смесь SWA и полного внимания.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: aloobun
Теги: qwen2, conversational, text-generation-inference, endpoints_compatible
Лайков: 6 | Загрузок: 105
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.