MiniPLM-Qwen-200M — это модель 200M с архитектурой Qwen, предварительно обученной с нуля в Pile с использованием структуры дистилляции знаний MiniPLM с официальным Qwen1.5-1.8B в качестве модели учителя. Мы также открываем исходный код предварительного обучающего корпуса, уточненного с помощью разностной выборки в MiniPLM для обеспечения воспроизводимости. Модели MiniPLM обеспечивают более высокую производительность при одинаковых вычислениях и хорошо масштабируются по размерам модели:
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: MiniLLM
Теги: qwen2, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 9 | Загрузок: 152
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.