Название модели: sarvam-105b-uncensored Базовая модель: sarvamai/sarvam-105b Модификация: Аблитерация — удаление механизмов отказа и выравнивания Автор: aoxo Аблитерация следует строгому однонаправленному подходу: 1. Сбор активации. Проходы вперед (не генерация) выполнялись по сбалансированным наборам вредных и безвредных подсказок. Активации собирались в позициях токенов после инструкций — на границе — на всех уровнях модели. Это точка принятия решения, в которой кодируется направление отказа. 2. Выбор направления Направление отказа кандидата рассчитывалось для каждой пары (слой, положение) следующим образом: Кандидаты оценивались с использованием d-разделения Коэна. Было выбрано одно лучшее направление из одной пары (уровень, позиция), что соответствует выводу статьи о том, что отказ опосредован одним направлением, а не направлениями для каждого слоя. 3. Весовая хирургия Единственное направление отказа было спроецировано из каждой весовой матрицы по всем слоям в масштабе 1.0: — Пространство ввода (gateproj, upproj, querykeyvalue / проекции q/k/v): Sarvam-105B использует стек внимания в стиле MLA с разделенными размерами головы QK и большой репрезентативной полосой пропускания на голову в сочетании с глубоким MoE…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: aoxo
Теги: sarvam_mla, abliteration, uncensored, moe, indic, conversational, custom_code, en
Лайков: 5 | Загрузок: 19
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.