模型参数设计遵循 Qwen2-0,5B,根据测试,深而窄的模型表现比较好,并且对于小模型,FFN Лучший вариант для SmolLM, MiniCPM.以及个人验证, 在预训练上, 效果确实好于余弦调度, 并且梯形调度支持方便地增添数据和续训。不同于 SmolLM 在最后 20% 30%, MiniCPM 一致的指数衰减,最低衰减至最大学习率的 1%。
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Mxode
Теги: llama, conversational, zh, en
Лайков: 5 | Загрузок: 11
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.