Qwen3-1.7B-Base настроен по инструкциям с использованием SFT (QLoRA/LoRA) на инструкциях MBZUAI/LaMini, а затем объединен в единую контрольную точку модели для простоты развертывания (однооборотный вопрос/ответ). — Базовая модель: Qwen/Qwen3-1.7B-Base — Точная настройка: контролируемая точная настройка (SFT) с QLoRA — Набор данных: инструкция MBZUAI/LaMini (мы использовали половину данных) — Выход: LoRA объединено с базовыми весами и сохранено как стандартные HF причинные веса LM. Эта модель была обучена с использованием следующего формата текстовых инструкций: Для удобства этот репозиторий может включать вспомогательные утилиты, такие как Promptformat.py`. • Обучение на синтетическом/большом наборе данных инструкций; выходные данные могут содержать галлюцинации. • Наилучшие результаты достигаются при использовании формата обучающей подсказки, показанного выше. • Это модель 1.7B; сложные рассуждения/задачи с длинным контекстом могут быть ограничены. • Метод: QLoRA (4-битная база во время обучения) + адаптеры LoRA • Слияние: загружена базовая модель в fp16/bf16 и объединены адаптеры с помощью mergeandunload().
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: ericoh929
Теги: qwen3, instruction-tuning, sft, qlora, lora, merged, conversational, en
Лайков: 5 | Загрузок: 18
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.