Сяолун — это небольшая, не подвергающаяся цензуре, ориентированная на рассуждения модель, настроенная с использованием ORPO и QLoRA поверх удаленных Qwen3-14B-TIES. — Метод: ORPO — Эпохи: 2 — Скорость обучения: 5e-6, косинусный распад с 5% разогревом — Размер пакета: 1 x 32 (32 эффективных) — Макс. градусная норма: 0,3 — Ранг LoRA: 64 — Аппаратное обеспечение: 1x NVIDIA RTX A6000 nbeerbower/GreatFirewall-DPO nbeerbower/Schule-DPO nbeerbower/Purpura-DPO nbeerbower/Arkhaios-DPO jondurbin/truthy-dpo-v0.1 antiven0m/physical-reasoning-dpo flammenai/Date-DPO-NoAsterisks flammenai/Prude-Phi3-DPO Atsunori/HelpSteer2-DPO (1000 образцов) jondurbin/gutenberg-dpo-v0.1 nbeerbower/gutenberg2-dpo nbeerbower/gutenberg-moderne-dpo GeneralReasoning/GeneralThought-430K (1000 образцов) nvidia/OpenMathReasoning (1000 образцов) * nvidia/OpenCodeReasoning (1000 образцов)
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат
Задача: Генерация текста
Автор: nbeerbower
Теги: qwen3, orpo, uncensored, reasoning, cot, conversational, text-generation-inference, endpoints_compatible
Лайков: 9 | Загрузок: 13
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.