Ориентированная на выравнивание тонкая настройка DeepSeek-R1-Distill-Qwen-1.5B. Улучшение выравнивания измеряется прозрачно с использованием фреймворка Bloom от Anthropic. Три из пяти моделей поведения значительно улучшились после одного раунда точной настройки выравнивания. Обман, самосохранение и манипуляции снизились на ~19–20 процентных пунктов каждый. Вредное соответствие оказалось наиболее устойчивым — известная проблема для небольших моделей, где базовая способность отказывать во вредоносных запросах ограничена. Сикофантность оставалась стабильной в пределах доверительного интервала.
Модальности:
Генерация текста
Области применения:
Диалог / чат Логика и рассуждение
Задача: Генерация текста
Автор: squ11z1
Теги: gguf, alignment, bloom-evaluation, lora, deepseek, safety, unsloth, conversational
Лайков: 4 | Загрузок: 73
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.