Метка: llama2-base - Каталог нейросетей

Метка: llama2-base

Генерация текста

RicardoLee/Llama2-base-13B-Chinese-50W-LoRA

本项目旨在提供一个给Llama2-base-13B的中文对话LoRA补丁。LoRA Загрузите sftloramodel中。合并完后的模型即外层pytorch.bin。该模型使用LLama2-base 13B 作为基底模型, 使用带встраивание и головка LM的Lora训练方式训练。模型已完成参数合并,可直接使用。也可以手动将sftloramodel同Llama2-base 13B进行合并。 Поскольку модель чата LLama2 изо всех сил пытается...

Генерация текста

RicardoLee/Llama2-base-7B-Chinese-50W-fullTune

该模型为基于Llama2 база 7B全参数SFT训练的中文模型。其目的是为了同RicardoLee/Llama2-base-7 B-Chinese-50W-LoRA项目进行对比,判断LoRA效果合全参数训练效果的差异。 Эта модель представляет собой китайскую модель чата, основанную на базе 7B Llama2, обученную с...

Генерация текста

RicardoLee/Llama2-base-7B-Chinese-50W-Full2LoRA

在完成了Llama2-chat 7B Китайский 和 Llama2-chat 13B Китайский 的训练后,我非常好奇能否直接基于Llama2-base系列直接进行SFT训练。这也是本模型仓库的初衷。但是在实际操作中,在用了原先chat模型的LoRA训练框架后,我发现基于Llama2 base的 LoRA Используйте DeepSpeed для уменьшения масштаба.操作,最终scale太小越界导致训练崩溃。我遍历了LR 1e-5 — 2e-4,ранг...

Генерация текста

RicardoLee/Llama2-base-7B-Chinese-50W-LoRA

在完成了Llama2-chat 7B Китайский 和 Llama2-chat 13B Китайский 的训练后,我非常好奇能否直接基于Llama2-base系列直接进行SFT训练。这也是本模型仓库的初衷。终于,在RicardoLee/Llama2-base-7B-Chinese-50W-pre_release,RicardoLee/Llama2-base-7B-Chinese-50W-Full2LoRA之后,我成功探索出了能稳定训练LoRA的参数,并最终完成了50W 数据的LoRA 训练。 После окончания обучения Llama2-chat 7B Chinese и Llama2-chat...

Генерация текста

RicardoLee/Llama2-base-7B-Chinese-50W-pre_release

在完成了Llama2-chat 7B Китайский 和 Llama2-chat 13B Китайский 的训练后,我非常好奇能否直接基于Llama2-base系列直接进行SFT训练。这也是本模型仓库的初衷。但是在实际操作中,在用了原先chat模型的LoRA训练框架后,我发现基于Llama2 base的 LoRA Используйте DeepSpeed для уменьшения масштаба.操作,最终scale太小越界导致训练崩溃。我遍历了LR 1e-5 — 2e-4,ранг...