ИИ-агенту больше не обязательно уметь всё самому. Qwen предложила другой подход: вынести работу с изображениями, видео и аудио в отдельные инструменты, которые агент сможет подключать по мере необходимости.

Новый мультимодальный tool layer устроен как набор отдельных plugins и capabilities. Агент, запущенный внутри Claude Code, Codex, Qwen Code, Gemini CLI или другого harness, сможет обнаружить нужную функцию, вызвать её и добавить результат в общий рабочий процесс.

В базовый набор входят инструменты для чтения изображений и видео, визуализации, OCR, поиска объектов, сегментации, транскрибации речи и обрезки файлов. То есть агенту не нужно каждый раз использовать одну большую мультимодальную модель — он может собрать нужную цепочку из специализированных инструментов.

Представьте задачу с видео. Сначала агент анализирует кадр, затем находит нужный объект, вырезает его область и распознаёт текст. После этого он сопоставляет результат с другим фрагментом видео, отдельно переводит речь в текст и объединяет полученные данные в один ответ.

Получается важный сдвиг в архитектуре ИИ-агентов. Мультимодальность перестаёт быть исключительно свойством конкретной модели и становится внешним набором возможностей, которыми агент может управлять самостоятельно.

Если такой подход приживётся, разработчикам будет проще добавлять агентам новые способности без полной замены основной модели. А сами агенты смогут строить более сложные рабочие процессы, комбинируя специализированные инструменты под конкретную задачу.