Исследователи Anthropic нашли способ управлять «опасными» знаниями ИИ
Что опаснее - неправильный ответ ИИ или знания, которые уже хранятся внутри модели? Исследователи Anthropic совместно с AE Studio считают, что бороться нужно именно со второй проблемой.