PCMind-2.1-Kaiyuan-2B — это передовая языковая модель с полностью открытым исходным кодом (т. е. открытый набор данных), обученная на кластере Ascend 910A. Благодаря 1,4 млрд параметров без внедрения и обучению на 2,2 триллионах токенов он достигает производительности, конкурентоспособной по сравнению с современными полностью открытыми моделями и даже соперничает с некоторыми ведущими моделями с открытым весом аналогичного масштаба. Набор данных, используемый для обучения Kaiyuan-2B, опубликован на сайте . Технический отчет PCMind-2.1-Kaiyuan-2B опубликован по адресу . Платформа предварительной обработки данных, построенная на PySpark, опубликована по адресу . Структура обучения, построенная на MindFormers, опубликована в (филиал Кайюань). Наш конвейер предварительной обработки данных и предварительного обучения предназначен для повышения эффективности обучения и качества модели, что достигается за счет нескольких ключевых инноваций: 1. Сравнительный анализ качества набора данных: подход квантильного сравнительного анализа, применяемый к основным наборам данных для предварительного обучения с открытым исходным кодом (например, DCLM Baseline, Fineweb-Edu), выявляет их распределение качества посредством небольших обучающих прогонов, что позволяет лучше выбирать данные. 2. Многоэтапное предварительное обучение. Обучение проходит в 5 этапов, стратегически увеличивая соотношение образцов, требующих интенсивных рассуждений и знаний, в то время как…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: thu-pacman
Теги: qwen2, conversational, custom_code, zh, en, text-generation-inference, endpoints_compatible
Лайков: 29 | Загрузок: 33
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.