Qwen решила превратить мультимодальность из свойства одной модели в набор подключаемых инструментов. Команда выпустила Qwen-MM-Plugins — открытый tool layer, который позволяет добавлять ИИ-агентам работу с изображениями, видео, документами и аудио.
Идея в том, чтобы не менять модель или агентную платформу ради новых возможностей. Агент внутри Claude Code, Codex, Qwen Code, Gemini CLI, Qoder, OpenClaw или другого окружения получает нужную возможность как обычный инструмент и подключает его в ходе работы.

В базовый набор входят анализ изображений и видео, работа с документами и 3D-моделями, OCR, поиск объектов, сегментация, транскрибация речи и кадрирование. Каждый модуль можно устанавливать отдельно, поэтому агент собирает нужную последовательность действий.
Например, он может сначала изучить изображение, найти объект и вырезать нужную область. Затем распознает текст через OCR, сопоставит данные с видео, расшифрует аудио и объединит результаты в один ответ.
Получается другая архитектура: не агент, завязанный на одну мультимодальную модель, а агент, который управляет набором специализированных инструментов. Особенно полезно это в длинных сценариях, где за одной задачей следует другая.
Qwen распространяет проект по лицензии Apache 2.0. В репозитории есть примеры интеграции с агентными средами и готовые сценарии для Qwen3.8-Max.
Если подход приживётся, мультимодальные возможности проще переносить между агентами. Для разработчиков это означает меньше привязки к одной модели.
