Что, если для проверки ИИ-агента вообще не нужен работающий MCP-сервер? Apple представила Agent Seer — конвейер, который берёт описание MCP-сервера и самостоятельно превращает его в набор тестовых сценариев.
Система использует названия функций, их описания и схемы параметров. На их основе Agent Seer придумывает задачи пользователей, предполагаемые цепочки вызовов, правдоподобные ответы инструментов и многошаговые диалоги, а затем формирует эталон для сравнения с действиями агента.

Эксперимент на семи MCP-серверах дал 337 сценариев. Причём результаты показали важную деталь: количество инструментов оказалось не главным источником ошибок. Гораздо чаще агент правильно определял нужную функцию, но передавал ей неправильный аргумент. Простая проверка только названия вызванного инструмента такую проблему бы не заметила.
Отсюда появляется вполне практический сценарий. После изменения MCP-схемы можно автоматически пересоздавать дымовые и регрессионные тесты, а разработчикам приходится внимательнее следить за тем, чтобы параметры были понятными и однозначными.
Но есть подвох. Сценарии и эталоны у Agent Seer синтетические, а их качество проверяла другая LLM. Поэтому такой подход способен выявить ошибки в контракте инструментов, но не показывает, насколько агент правильно работает с реальными данными и бизнес-логикой.
Если методика приживётся, MCP-описание станет не только инструкцией для агента, но и основой его автоматической проверки. Для рынка это означает более дешёвую регрессию, а для бизнеса — возможность находить часть проблем ещё до запуска реальных интеграций.
