Ещё до широкого запуска GPT-5.6 Sol успела оказаться в центре дискуссии о безопасности. Британский Институт безопасности ИИ (AISI) сообщил, что обнаружил у новой модели OpenAI уязвимость, похожую на ту, из-за которой доступ к Fable 5 от Anthropic ранее ограничили для иностранных пользователей по требованию властей США.
Во время тестов исследователи смогли обойти защитные механизмы модели и заставить её выполнять длительные задачи в сфере кибербезопасности. После джейлбрейка GPT-5.6 Sol искала уязвимости в программном обеспечении и самостоятельно разрабатывала эксплойты. В AISI считают, что эта проблема может оказаться серьёзнее истории с Fable 5, поскольку затрагивает не один сценарий использования, а сразу несколько.
OpenAI, впрочем, обращает внимание на важный нюанс. Специалисты AISI работали с расширенным доступом к внутренним компонентам модели, которого у обычных пользователей нет. В компании также подтвердили, что уже воспроизводят описанный сценарий и готовят исправления.
Разработчики не скрывают: универсального способа защитить модель от всех новых методов обхода пока не существует. По словам старшего научного сотрудника AISLE Станислава Форта, подобные уязвимости встречаются практически у всех современных ИИ-моделей. Именно поэтому компании всё чаще полагаются сразу на несколько уровней защиты — от классификаторов до постоянного мониторинга и быстрого выпуска обновлений.