SakikoLab/Qwen3-0.6B-Prompt-Gen-v0.1 - Каталог нейросетей
Генерация текста

SakikoLab/Qwen3-0.6B-Prompt-Gen-v0.1

Добавлено:
SakikoLab/Qwen3-0.6B-Prompt-Gen-v0.1

这是一个基于 Qwen/Qwen3-0.6B-Base 进行指令微调的语言模型,专注于处理和生成与 动漫 图像标签体系相关的自然语言和标签数据。 基础模型: Qwen/Qwen3-0.6B-Base 微调方法: 指令微调 (Instruction SFT) 微调框架: LLaMA-Factory 训练数据集: 由五个指令构成的共 42,268,080 条样本,平均长度 287 Token,构成了一个总计约 121 亿 Token 的大规模数据集。 训练进度: 目前模型已在上述数据集中训练了 4,396,032,000 Token。 硬件配置: 3 x NVIDIA GeForce RTX 4090 赞助商: Myself 上下文长度 (cutofflen): 设为 768。这个长度覆盖了训练集中 99.5% 的样本。由于输入格式采用 XML 包裹,为避免破坏结构,超过此长度的训练样本被直接丢弃。 评估损失 (Eval Loss): 由于此语言模型与 Neta-Lumina 图像模型使用了同源的高质量 调用 , 或 指令。 2. 编写一个简单的脚本,提取输出结果 XML 中 ` 标签下的各类标签文本。 3. 将提取的标签用 «, » 连接起来,形成适用于目标模型的提示词。 3. 标签补全与优化 () 功能:** 对一组不完整的标签进行补全和优化。训练时通过对完整的标签集进行高、中、低强度的随机丢弃来模拟不完整的输入。 4. 标签扩增 () 功能: 将一组稀疏的核心标签(如 1girl`、角色名等,少于10个)扩充为包含丰富细节的完整标签集(30个以上)。 训练数据中为了保证足够的 knowledge 引入,未有效过滤掉标签过少的样本,可能需要后续通过 DPO 方法提升 和 ` 指令的输出长度和质量。

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: SakikoLab
Теги: qwen3, conversational, text-generation-inference, endpoints_compatible
Лайков: 4  |  Загрузок: 0

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.