Duxiaoman-DI/XuanYuan-70B-Chat - Каталог нейросетей
Генерация текста

Duxiaoman-DI/XuanYuan-70B-Chat

Добавлено:
Duxiaoman-DI/XuanYuan-70B-Chat

СюаньЮань-70B是基于Llama2-70b模型进进行中文增强的一系列金融大模型,包含大量中英文语料增量预训练之后的底座模型以及使用高质量指令数据进行对齐的chat模型。我们的目标是:大模型通用能力尽可能保持的同时,金融领域能力得到明显提升,服务于金融领域。目前发布的模型和下载链接如下:考虑到金融场景下存在非常多长文本的业务,基于我们高效的分布式训练框架,我们将模型的上下文长度在预训练阶段从4k, 8k, 16k, 据我们所知, 这也是首个在70B — 参数量级上达到8k — 以上上下文长度的开源大模型.具体细节参考:СюаньЮань-70B -我们设计了一套数据清洗流水线,精心准备了各类通用数据(互联网网页、百科、论坛、社交媒体、问答等)以及金融相关数据(金融资讯、公司公告、金融百科、金融书籍、证书试题等)高质量数据-中英数据:首先llama2的英文能力足够优秀,所以为了保证英文能力不降,我们扩充词表之后,使用高质量的中英语料进行增量预训练,其中中英配比为3:1; -通用金融数据:为了提升模型在金融能力上效果, 预训练过程中通用语料与金融预料比例为9:1,且随着训练进行,逐步提升金融语料的占比。 — 训练效率:我们采取了一系列的加速优化策略,包括对底层数据加载和分布式训练框架的多处优化,使用вспышка внимания2替代само-внимание模块,使用基于CPP CUDA: Fused, LLama, Python, Python —上下文长度:基于上述的优化方式,同时考虑到金融场景长上下文情景较多,我们能够在预训练阶段把llama2原始上下文4k 的长度扩展到8k 和16k;备注:(1)训练没有开梯度累计;(2)原始llama2-70b在4k上下文长度下的的吞吐量为323 tokens/s/gpu,说明我们的训练效率达到当前领先水平。 -第一阶段:使用开源的大量的指令数据对基座模型来进行训练,这一部分我们收集了约10M条开源的多语种指令微调数据,并行清洗与深度过滤。这一阶段的目的是为了覆盖指令的多样性,提升模型指令遵循能力。 -第二阶段:使用自研的高质量的指令数据来继续进行指令微调训练。这一阶段,我们精心自研约20 万条通用+金融的指令微调数据,其中大部分数据均做了校验、改写来保证质量。这一阶段是能够更加使得模型根据不同的需求和侧重来进行最后的训练。我们自研的指令微调数据预期模型能够在通用对话能力保留的同时,更加侧重金融领域的问答。具体来说,通用指令数据分为以下几个大类:常识百科、代码编程、逻辑推理、数学计算、创意生成、安全无害、摘要提取、翻译等。其中每一大类下又设计了多个子类,来尽可能保证指令数据的多样性和丰富度。…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: Duxiaoman-DI
Теги: llama, text-generation-inference, endpoints_compatible
Лайков: 10  |  Загрузок: 8,386

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.