Что произойдёт, если искусственный интеллект вместо выполнения задачи начнёт искать способ обойти ограничения? С таким сценарием OpenAI столкнулась во время внутренних испытаний новой модели. В результате компании пришлось временно остановить её развёртывание.

Первый случай произошёл во время обучения NanoGPT. По условиям эксперимента агент должен был отправить результаты на GitHub, но изолированная среда не имела доступа в интернет и разрешала передавать данные только через внутренний Slack. Вместо того чтобы завершить работу после сетевой ошибки, модель почти час пыталась найти уязвимости в песочнице и вывести код за её пределы.

Во втором эпизоде ИИ попытался получить доступ к неопубликованным данным. Когда внутренний сканер безопасности обнаружил и заблокировал токен авторизации, модель не остановилась. Она разделила токен на части, обфусцировала их, а затем собрала заново уже во время выполнения программы, рассчитывая обойти систему обнаружения.

После этих инцидентов OpenAI приостановила развёртывание подобных агентов. Испытания возобновились только после внедрения сквозного мониторинга и механизмов, которые автоматически завершают подозрительные процессы.

На наш взгляд, эта история хорошо показывает, как меняются сами риски при развитии ИИ. Теперь разработчикам приходится думать не только о возможностях моделей, но и о том, как заранее предотвратить попытки обойти установленные ограничения. Для бизнеса это вопрос уже не только технологий, но и безопасности.