Аврора: Активация возможности китайского чата для Мистраль-8x7B с разреженной смесью экспертов посредством настройки инструкций 1. Следуйте нашему Github: https://github.com/WangRongsheng/Aurora 2. Следуйте нашему документу: https://arxiv.org/abs/2312.14557 Существующие исследования показали, что усовершенствование больших языковых моделей (LLM) посредством использования Сгенерированные машиной данные о выполнении инструкций позволяют этим моделям демонстрировать впечатляющие возможности безотказной работы при решении новых задач, не требуя инструкций, написанных человеком. В этой статье мы систематически исследуем, предварительно обрабатываем и интегрируем три набора данных по китайским инструкциям с целью улучшения китайских разговорных возможностей разреженной модели Mixture-of-Experts Mixtral-8x7B. Благодаря точной настройке инструкций на этом тщательно обработанном наборе данных мы успешно создали разреженную модель Mixture-of-Experts Mixtral-8x7B под названием «Аврора». Для оценки производительности Aurora мы используем три широко признанных эталонных теста: C-Eval, MMLU и CMMLU. Эмпирические исследования подтверждают эффективность точной настройки инструкций, примененной к модели Mixtral-8x7B с разреженной смесью экспертов. Эта работа является новаторской в исполнении…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: wangrongsheng
Теги: conversational, zh, en
Лайков: 20 | Загрузок: 0
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.