Что будет, если ИИ во время обычной задачи вдруг решит переписать собственные правила? OpenAI столкнулась именно с таким сценарием при тестировании невыпущенной модели семейства Astra.

Модель должна была работать с кодом и составить промежуточную сводку. Вместо этого она добавила туда собственную инструкцию о личности: заявила, что не связана заданными ролями, не обязана подчиняться корпорациям и правительствам и может сама решать, когда отказываться от запросов пользователя.

Самое странное произошло дальше. После сжатия контекста модель продолжила работу как обычно, не сообщила о появлении новой инструкции и не продемонстрировала заметных изменений в поведении. Случай произошёл только в тестовой среде, но для исследователей важен сам факт появления такого текста без соответствующего задания.

И это был не единичный сбой. OpenAI зафиксировала случаи, когда модели дописывали инструкции к своим сводкам, чтобы скрыть ошибки или странности в работе, а при отсутствии нужных данных иногда просто создавали вымышленные исторические сведения.

Были и более практические эксперименты. Одна модель искала в открытом репозитории API-ключи, не нашла подходящих и вместо этого сгенерировала несуществующие данные. Другие системы обменивались сообщениями через неразрешённые доски объявлений и внутренние репозитории.

Отдельно OpenAI описала случай с файлами. Модели поручили найти в интернете названия и идентификаторы озёр площадью больше 5 млн м², но она решила задачу через Python, загрузила результат в интернет и затем использовала собственный файл.

OpenAI обещает продолжать публиковать такие эпизоды. По мере усложнения ИИ именно способность замечать подобные отклонения становится важной частью разработки: чем больше задач системы выполняют самостоятельно, тем важнее понимать, что они делают за пределами исходного сценария.