Что опаснее — неправильный ответ ИИ или знания, которые уже хранятся внутри модели? Исследователи Anthropic совместно с AE Studio считают, что бороться нужно именно со второй проблемой. Они представили метод GRAM, позволяющий управлять знаниями двойного назначения, которые могут использоваться как для защиты, так и для атак, например в кибербезопасности или вирусологии.
Идея оказалась неожиданно простой. Для каждой чувствительной темы к каждому слою нейросети добавляются отдельные нейроны. Во время обучения обновляется только этот модуль, а общие знания модели не переучиваются. После обучения его можно удалить, и тогда исчезнет сама способность, либо оставить только тем, кому она нужна по работе.
По мнению авторов исследования, нынешние способы защиты работают хуже. Обучение отказам и классификаторы не удаляют знания, а джейлбрейк позволяет их обходить. Фильтрация данных тоже не решает проблему, потому что требует обучать новую модель под каждый набор ограничений. GRAM, как предполагают исследователи, позволяет получить эффект множества моделей за один цикл обучения: в эксперименте с четырьмя категориями одну модель удалось настроить 16 способами.
Метод проверили на синтетическом наборе детских рассказов, модели с 800 млн параметров и ещё семи моделях размером от 50 млн до 5 млрд параметров. По данным авторов, удаление модуля почти полностью убирало нужные знания без потери качества, а вернуть их дообучением не удавалось. При этом, например, в системе Claude от Anthropic метод пока не используется.
Если технология получит развитие, создание безопасных ИИ станет заметно гибче. Для бизнеса это может снизить стоимость настройки моделей под разные отрасли и требования безопасности.