xverse/XVERSE-65B - Каталог нейросетей
Генерация текста

xverse/XVERSE-65B

Добавлено:
xverse/XVERSE-65B

[2023/11/29] 更新模型架构及更多底座数据的相关信息。 [2023/11/24] [2023/11/06] 发布 65B 尺寸的 XVERSE-65B 底座模型。 [2023/11/06] Обновление архитектуры модели и дополнительные данные для предварительного обучения информация. [2023/11/24] Обновите соответствующую информацию в данных предварительного обучения. [2023/11/06] Выпущена базовая модель XVERSE-65B. XVERSE-65B 是由深圳元象科技自主研发的支持多语言的大语言模型(большая языковая модель),参数规模为 650 XVERSE-65B, XVERSE-65B, только для декодера: — XVERSE-65B, только для декодера的标准 Transformer 网络结构,支持 16K 的上下文长度(Context Длина), длинна, длина, длина, длина, длина, длина, длина, длина Токен 训练数据:构建了 2.6 万亿的高质量、多样化的数据对模型进行充分训练,包含中、英、俄、西等 40多种语言,通过精细化设置不同类型数据的采样比例,使得中英两种语言表现优异,也能兼顾其他语言效果。 — 分词:基于 BPE (кодирование пары байтов))算法,使用上百 GB 语料训练了一个词表大小为 100,534的分词器,能够同时支持多语言,而无需额外扩展词表。 — 训练框架:训练中采用 FlashAttention2加速计算,3D 并行基础上采用虚拟流水线(виртуальный конвейер)技术,降低较长流水线和 16k上下文窗口产生的过高气泡率,在千卡集群的峰值算力利用率达到业界前列。同时通过集群基础设施运营、资源调度、训练框架和调度平台协同等持续优化,打造出高稳定、低中断、强容错的训练系统,将每周有效训练率提升至98,6%。 在预训练阶段,XVERSE-65B 主要使用了 7 类不同的数据类型。以下表格展示了 XVERSE-65B XVERSE-65B — это многоязычная модель большого языка, независимо разработанная компанией Shenzhen Yuanxiang Technology. На этот раз выпущена базовая модель XVERSE-65B. Его основные особенности заключаются в следующем: -…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: xverse
Теги: xverse, custom_code
Лайков: 38  |  Загрузок: 44

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.