Точная настройка полнопараметрического рассуждения HuggingFaceTB/SmolLM2-135M-Instruct с использованием 5000 примеров, выбранных из SupraLabs/reasoning-corpus-4K-5M-v1. Модель была обучена размещать след рассуждений внутри тегов и, за которым следовал отдельный окончательный ответ. Системная и пользовательская части были замаскированы от потери. Выборки, превышающие максимальную длину контекста, отклонялись вместо того, чтобы отсекаться от середины трассы рассуждения. Эта небольшая модель является экспериментальной. Не следует предполагать, что он производит правильные рассуждения только потому, что он оставляет структурированный след рассуждения. Traininginfo.json` записывает конфигурацию тренировки, все показатели, найденные в локальном выходном каталоге, и хэши SHA-256 загруженных файлов веса. Модель соответствует лицензии Apache 2.0, используемой базовой моделью SmolLM2. Ознакомьтесь с полными условиями репозитория базовой модели и исходного набора данных.
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат
Задача: Генерация текста
Автор: Ma7ee7
Теги: llama, smollm2, reasoning, supervised-fine-tuning, chat, conversational, en, text-generation-inference
Лайков: 5 | Загрузок: 532
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.