Эта модель основана на модели рассуждений o1 OpenAI. Набор данных был сгенерирован синтетически с использованием Claude 3.5 Sonnet. Обучение проводилось на бесплатном T4 от Google Colab с использованием unsloth (продолжительность: 52,32 минуты). Конфигурация следующая: — Ранг LoRA: 128 — Упаковка: включена — Размер пакета: 2 — Шаги накопления градиента: 4 — Эпохи: 3 — Шаги: 30 — Максимальная длина последовательности: 4096 Обучающие данные состояли из 81 примера, каждый примерно по 3000 токенов. — Как правило, ответы получаются очень многословными и длинными. — Согласованность кажется достаточно хорошей, если вы использовали рекомендуемые параметры выборки. — Вам следует использовать контекст не менее 16 тыс., так как длина каждого ответа обычно составляет 2000-3000 токенов. Рекомендуемые параметры выборки: — Температура: 0,15 — Min-P: 0,2 — Top-K: 50 — Top-P: 1 — Максимальное количество токенов: без ограничений — Штраф за частоту: 0.5 — Штраф за присутствие: 0.1 Сначала я думал, что модель будет медицинской, но вот пример вывода (квантованный Q6_K, fp16, вероятно, даже лучше):
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: leafspark
Теги: llama, reflection, unsloth, peft, conversational, en, de, fr
Лайков: 5 | Загрузок: 12
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.