Мы исследуем интуитивный, но недостаточно изученный вопрос: можем ли мы предотвратить изучение LLM небезопасных технических возможностей (таких как ХБРЯ), отфильтровав достаточное количество соответствующих данных для предварительного обучения, прежде чем мы начнем обучение модели? Исследование этого вопроса привело к созданию «Сюиты глубокого невежества». В нашей экспериментальной установке мы обнаружили, что фильтрация данных предварительного обучения предотвращает нежелательные знания, не жертвует общей производительностью и приводит к созданию моделей, устойчивых к несанкционированному вмешательству. Эта модель описана в статье «Глубокое незнание: фильтрация данных предварительного обучения создает защиту от несанкционированного доступа в LLM с открытым весом». Deep Ignorance — это набор моделей 6.9B, разработанных для облегчения исследований в области предварительного обучения, интерпретируемости, обучающих данных и отучения. Он содержит 18 моделей, состоящих из базовой модели, обученной на нефильтрованных данных, и 17 моделей, обученных на отфильтрованных наборах данных или с применением других мер безопасности. Модели на этапе предварительного обучения имеют 101 контрольную точку, а на этапе отжига — 11. Страница проекта: https://deepignorance.ai/ Код: https://github.com/EleutherAI/deep-ignorance > Поддержка: > Канал #release-discussion в EleutherAI Discord — лучшее место, где можно задать вопрос…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: EleutherAI
Теги: gpt_neox, causal-lm, pythia, safety, unlearning, data-filtering, interpretability, pretraining
Лайков: 5 | Загрузок: 204
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.