此模型由 Qwen/Qwen2.5-7B-Instruct 經過 замена токенизатора, SFT и DPO 訓練而成。所有訓練資料集都可以在 Huggingface 上取得。因為簡體中文和繁體中文在語法和語義相似度高,往往只是差在文字本身看起來不一樣。另外,千問(Qwen) 的模型中文的能力是很強的(甚至是 лицензия Apache)。我們利用繁化姬 將簡體中文所對應的 token 和繁體中文的 токен 做代換。更多關於 токенизатор 帶換掉哪些單詞,可以查看benchang1110/DeepSeek-R1-Distill-Qwen-1.5B-zhtw中的 Convert.txt。 這個階段我們用 lianghsun/tw-instruct-500k LoRA LoRA 微調。 zake7749/kyara-chinese-preference-rl-dpo-s0-30K 這個資料集做выравнивание,目標讓模型能夠條列式的輸出,並且能夠在輸出的時候保持一定的邏輯性。 — Разработано:benchang1110 — Финансируется автор [необязательно]: я — Тип модели: Qwen2ForCausalLM — Язык(и) (NLP): Традиционный китайский (zh-tw), английский — Лицензия: apache2.0 — Точная настройка на основе модели: Qwen/Qwen2.5-7B-Instruct是 системная подсказка.對於模型的輸出影響很大。Системная подсказка 的 по умолчанию 是 。 我們使用 lmevaluationharness 作為 оценка 的平台, TMLU 和 TMMLU+這兩個 скамейка 評估模型。 這個模型借用了 базовая модель 強大的能力,是 10B 參數下的模型在 TMLU 和 TMMLU+ 的SOTA。感謝提供 базовая модель 和資料集的團隊。
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: benchang1110
Теги: qwen2, conversational, zh, en, text-generation-inference, endpoints_compatible
Лайков: 7 | Загрузок: 289
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.