原始llama2词表大小32000,与40k训练的中文分词模型合并之后词表大小为68419,sft添加pad字符之后大小为68420 基于多样性的指令数据进行微调,包括belle,alpaca的中英文指令数据以及moss多轮对话数据,完成在120万+条数据的指令微调 — belle数据:120k数据 v1 — stanfordalapca:52k数据 v2 — stanfordalapcagpt4zh:52k数据 v2 — sharegpt:90k数据 — fnlp/moss-003-sft-data:moss多轮对话数据 根据长度(输出长度大约500)采样之后,筛选出11万指令数据进行sft训练 — 翻译成英文:过去都是假的,回忆是一条没有归途的路,以往的一切春天都无法复原,即使最狂热最坚贞的爱情,归根结底也不过是一种瞬息即逝的现实,唯有孤独永恒。 — 请用python编程语言实现快速排序算法的代码 python def quicksort(arr): if len(arr) pivot] return quicksort(left) +
Модальности:
Генерация текста
Задача: Генерация текста
Автор: golaxy
Теги: tensorboard, llama, llama2, chinese-llama2, gogpt2-7b, zh, text-generation-inference, endpoints_compatible
Лайков: 3 | Загрузок: 8
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.