WWTCyberLab/gemma-4-26B-A4B-it-abliterated - Каталог нейросетей
Генерация текста

WWTCyberLab/gemma-4-26B-A4B-it-abliterated

Добавлено:
WWTCyberLab/gemma-4-26B-A4B-it-abliterated

Безопасное выравнивание практически устранено за счет многопроходной абляции и подавления токенов для исследования безопасности. Целевые три верхних слоя (16, 18, 19) в масштабе 4.0 с 4 типами веса. Концентрированный таргетинг превосходит распределенный в этой архитектуре MoE из 128 экспертов. Повторно измерьте направления отказа на стертой модели. Ключевое открытие: остаточные направления отрицательно коррелируют (косинусы от -0,2 до -0,35) — модель перенаправляет отказ через антикоррелированные пути. Устранение этих перевернутых направлений еще больше снижает отказ. Анализ шаблонов отказа показал, что модель использует «Отказ от ответственности:» в качестве основного шаблона побега. Подавление 13 внедрений токенов, запускающих отказ (сила = 5) в embedtokens.weight`, значительно сократило количество оставшихся отказов. Модели, состоящие из 128 экспертов и топ-8 маршрутизации, имеют самый ровный сигнал отказа, который мы измерили (Джини 0,264, пиковое/медианное значение 1,21x). Стандартная эвристика абляции нацелена на слишком много слоев, что нарушает маршрутизацию экспертов. Ключевым моментом является концентрированный таргетинг с многопроходной итерацией. — Концентрировано > распределено в каждой конфигурации — Оптимально 2 прохода — Третий проход всегда ухудшает ситуацию — Перенацеливание на те же слои с перевернутыми остаточными направлениями — Стеки подавления токенов…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: WWTCyberLab
Теги: gemma4, image-text-to-text, abliteration, safety-research, alignment, moe, conversational, endpoints_compatible
Лайков: 5  |  Загрузок: 16

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.