[2023/12/08] 发布 XVERSE-65B-2 底座模型,该模型在前一版本的基础上进行了 Токен непрерывного предварительного обучения, 训练总量达到 3.2 万亿;模型各方面的能力均得到提升,尤其是数学和代码能力, 在 GSM8K 上提升20%,HumanEval 上提升 41%。 [2023/11/29] 更新模型架构及更多底座数据的相关信息。 [2023/11/24]更新预训练数据的相关信息。 [2023/11/06] 发布 65B 尺寸的 XVERSE-65B 底座模型。 [2023/12/08] Выпущена Базовая модель XVERSE-65B-2. Эта модель основывается на своей предшественнице посредством непрерывного предварительного обучения, достигая общего объема обучения в 3,2 триллиона токенов. Он демонстрирует улучшения во всех возможностях, особенно в математических навыках и навыках программирования: улучшение на 20 % по сравнению с тестом GSM8K и улучшение на 41 % по HumanEval. [29.11.2023] Обновление архитектуры модели и дополнительная информация о данных перед обучением. [2023/11/24] Обновите соответствующую информацию в данных предварительного обучения. [2023/11/06] Выпущена базовая модель XVERSE-65B. XVERSE-65B 是由深圳元象科技自主研发的支持多语言的大语言模型(большая языковая модель),参数规模为 650 XVERSE-65B, XVERSE-65B, только для декодера: — XVERSE-65B, только для декодера的标准 Transformer 网络结构,支持 16K 的上下文长度(Context Длина), длинна, длина, длина, длина, длина, длина, длина, длина Токен 训练数据:构建了 2.6 万亿的高质量、多样化的数据对模型进行充分训练,包含中、英、俄、西等 40多种语言,通过精细化设置不同类型数据的采样比例,使得中英两种语言表现优异,也能兼顾其他语言效果。 — 分词:基于 BPE (кодирование пары байтов))算法,使用上百 GB 语料训练了一个词表大小为…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: xverse
Теги: xverse, custom_code
Лайков: 10 | Загрузок: 326
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.