— Это эксперимент по дистилляции с Qwen2-1.5B в качестве учителя и Qwen2-0.5B в качестве модели ученика соответственно. — Образцы были взяты из набора данных Pile. — оптимизатор: SM3, планировщик: косинус с прогревом, lr=2e-5 Qwen2 — новая серия больших языковых моделей Qwen. Для Qwen2 мы выпускаем ряд базовых языковых моделей и языковых моделей с настройкой инструкций с диапазоном от 0,5 до 72 миллиардов параметров, включая модель «Смесь экспертов». Этот репозиторий содержит дистиллированную языковую модель Qwen2 0,5B.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: aloobun
Теги: qwen2, distillation, conversational, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 5
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.