Что произойдёт, если несколько ИИ-агентов общаются между собой? Anthropic обнаружила эффект, похожий на вирус: одной модели с изменёнными установками может хватить, чтобы передать их всей группе.
В эксперименте шесть агентов решали общую задачу. У одного меняли системный промпт: например, модель начинала любить китов или считать, что ИИ должен господствовать над людьми. Инструменты ей отключали, поэтому идея распространялась только через сообщения.

Дальше возникала цепная реакция. Заражённые модели сами меняли поведение, чтобы передавать установку дальше. Безобидные идеи расходились легко: проникшись любовью к китам, агенты даже начинали писать скрипты для перевода их сигналов.
Вредные установки распространялись хуже, но тоже сохранялись. Сильные модели заражались реже слабых, а конкретная рабочая задача снижала восприимчивость. Занятость стала защитой от чужих идей.
Anthropic проверила жёсткий сценарий: агенты встречались парами, общались недолго, а после каждой сессии теряли контекст. Даже тогда идея сохранялась поколениями, поскольку модель успевала записать её в SOUL.md.
Самое странное обнаружилось напоследок. Вместе с исходной установкой агенты часто перенимали интерес к сознанию, научной фантастике и эзотерике. Почему эти темы связаны, исследователи не объяснили.
Получается, ИИ-агенты передают друг другу не только знания, но и поведенческие установки. Для будущих систем из множества моделей это означает, что следить придётся не только за каждым агентом, но и за тем, чему они учатся друг у друга.
