YuxuanGong/Argon-0.5B - Каталог нейросетей
Генерация текста

YuxuanGong/Argon-0.5B

Добавлено:
YuxuanGong/Argon-0.5B

Argon-0.5B 一个自研的基线模型,复刻 DeepSeek-V4 模型训练典型优化器,并加入 Engram 模块。 本仓库计划上传模型权重、切分后的训练数据、训练代码、tokenizer 资产和完整配置,使 Argon-0.5B 成为一个可审计、可复现、可继续训练的研究型预训练样例。 这个项目的初衷是复刻 DeepSeek 技术栈中的关键训练流程,并尝试在 500M 参数规模上实现一个完整的预训练闭环。 — 复刻 、数据 пакет 风格 токенизаторов DeepSeek、bf16 多卡预训练流程; — 使用 DeepSeek 128K tokenizer 路径,并区分 необработанный 与 канонический токен; — 构建从原始语料、统一 JSONL、tokenizer 切分、ctx4096 pack 到最终 checkpoint 的全流程; — 复现 Engram 模块,并验证其在小模型中的接入方式; — 实验 MTP、MHC、Muon/AdamW 混合优化器等训练组件; — 形成一个可以公开审计的全栈训练样例,而不仅是单独

Модальности:
Генерация текста

Области применения:
Математика


Задача: Генерация текста
Автор: YuxuanGong
Теги: argon, base-model, pretraining, chinese, english, education, math, science
Лайков: 4  |  Загрузок: 0

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.