— [28.04.2024] 发布 MoE 架构的 XVERSE-MoE-A4.2B-Chat 对话模型。 — [02.04.2024] 发布 MoE 架构的 XVERSE-MoE-A4.2B底座模型,Chat 对齐模型将在后续发布。 — [28.04.2024] Выпущена модель чата XVERSE-MoE-A4.2B-Chat MoE. — [2024/04/02] Выпущена базовая модель XVERSE-MoE-A4.2B MoE, версия для чата будет выпущена позже. XVERSE-MoE-A4.2B 是由深圳元象科技自主研发的支持多语言的大语言模型(Large Language Модель),使用混合专家模型(МО,Смесь экспертов)架构, 模型的总参数规模为 258 XVERSE-MoE-A4.2B, 主要特点如下: — Модель: XVERSE-MoE-A4.2B 为 Только для декодера, Трансформатор.中每个专家的大小与标准 FFN 相同(如Mixtral 8x7B ),使用了更细粒度的专家,每个专家是标准 FFN 大小的 1/4,并设置了共享专家(Shared Эксперт)和非共享专家(Необщий эксперт)两类,共享专家在计算时始终被激活,非共享专家通过 Маршрутизатор选择性激活。 — 训练数据:构建了 2.7 万亿 token的高质量、多样化的数据对模型进行充分训练,包含中、英、俄、西等 40多种语言,通过精细化设置不同类型数据的采样比例,使得中英两种语言表现优异,也能兼顾其他语言效果;模型使用8K 长度的训练样本进行训练。 — 训练框架:针对 MoE模型中独有的专家路由和权重计算逻辑,进行了深入定制优化,开发出一套高效的融合算子,以提升计算效率。同时,为解决MoE 模型显存占用和通信量大的挑战,设计了计算、通信和 CPU-Offload 的 Overlap XVERSE-MoE-A4.2B — это многоязычная модель большого языка, независимо разработанная компанией Shenzhen Yuanxiang Technology и использующая архитектуру Mixture-of-Experts (MoE). Общий масштаб параметров модели составляет 25,8 миллиардов, при этом фактическое…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: xverse
Теги: xverse, custom_code
Лайков: 14 | Загрузок: 626
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.