Пока одни компании защищают модели вручную, OpenAI решила сыграть на опережение. Она представила внутреннюю систему GPT-Red — ИИ, который специально обучили искать уязвимости в других моделях, чтобы устранять их ещё до публичного релиза. По сути, компания создала собственного цифрового «хакера», работающего исключительно на безопасность.
GPT-Red проходит обучение по принципу противостояния. Во время тренировок он пытается обмануть модели-защитники с помощью сложных атак, включая prompt injection, а те учатся отражать эти попытки. По данным OpenAI, на обучение GPT-Red ушёл объём вычислений, сопоставимый с крупнейшими этапами постобучения компании.
Результаты оказались заметными. По данным OpenAI, GPT-Red успешно атаковал 84% новых тестовых сценариев, тогда как люди справились лишь с 13%. Именно его затем использовали при обучении GPT-5.6 Sol, благодаря чему новая модель стала в шесть раз устойчивее к наиболее сложным prompt injection по сравнению с предыдущим поколением.
При этом GPT-Red не планируют публиковать. В OpenAI считают, что модель с подобными возможностями не должна попасть в руки злоумышленников, поэтому её будут использовать только внутри компании.
Если подобный подход станет отраслевым стандартом, безопасность ИИ сможет развиваться почти так же быстро, как и сами модели. Для бизнеса это означает более надёжные ИИ-системы без заметной потери их возможностей.