Llama-zh-base — это проект с открытым исходным кодом, который предлагает полный цикл обучения для построения моделей большого китайского языка, начиная от подготовки набора данных до токенизации, предварительного обучения, оперативной настройки и техники обучения с подкреплением RLHF. Это базовая модель Llama-zh, обученная с нуля с использованием китайского корпуса предварительной подготовки в этом проекте. Количество параметров составляет около 0,8B. 120G, 120G, китайская версия, лама, лама, лама, 120G, лама, 120G, 120G, 120G, 120G, 120G, 120G Встраивание токенизатора в 0.8B в формате 0.8B. LLama-zh-base模型是基于目前llama系列的模型架构,从头重新预训练的LLama模型。由于llama原模型本身并未在中文语料上单独训练,词表中也并未包括太多的中文字符。本项目重新构建了Llama的分词工具与词表。并重新初始化了对应的模型,在中文领域上的持续预训练。 33G 33G 中文预训练, 阶段使用开源数据与本项目爬取的部分数据。共使用约33G中文预训练数据、MC4-zh、Code数据集。清洗后筛选共120G左右数据训练1 эпоха,初始学习率1e-4。未经过指令微调。 — 新浪新闻数据(SinaNews),220万条新闻文档数据 -人民日报数据(Наборы данных People’s Daily), 148万条人民日报数据。 -维基百科(wiki2019zh),100万个结构良好的中文词条 -新闻语料(news2016zh),250万篇新闻,含关键词、描述 -社区问答json版(webtext2019zh),410万个闻文档(2.19 ГБ) — THUCNews数据(THUCNews) ,74万篇新闻文档(2.19 ГБ) -评论数据-语料 (комментарии2019zhcorpus),240万条评论数据 — 社区互动-语料(webText2019zhcorpus), 310W 条社区互动数据 — 科学文献数据(CSL), 约40W篇中文核心期刊文献摘要 — Белль 数据集
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: TurboPascal
Теги: llama, en, zh, text-generation-inference, endpoints_compatible
Лайков: 13 | Загрузок: 25
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.