Tencent решила проверить, насколько далеко можно продвинуть мультимодальный поиск, и команда WeChat открыла веса семейства WeMM-Embedding. Модели превращают текст, изображения, видео, сложные документы и смешанный контент в векторы внутри общего смыслового пространства — это позволяет сопоставлять разные типы данных.

В основе WeMM-Embedding лежит Qwen3.5, а обучение проводилось с Matryoshka Representation Learning. Подход позволяет уменьшать размерность вектора уже при работе, экономя память и вычисления. Младшая версия выдаёт 2048 измерений, старшая — 4096, а опубликованы варианты на 2B, 4B и 9B параметров.

Самый любопытный результат проявляется при сжатии. По данным Tencent, 2B-модель после уменьшения вектора до 256 измерений сохраняет 98,7% исходного качества на задачах с фото и видео. При этом 9B набрала 80,6 балла на MMEB-v2, установив новый лучший общий результат, а 2B обошла Qwen3-VL-Embedding, которая в четыре раза крупнее.

Но одними тестами дело не ограничивается. WeMM-Embedding уже используется в поиске и рекомендациях WeChat для каналов, аккаунтов и электронной коммерции. Команда сообщает о стабильных улучшениях в 14 онлайн A/B-тестах.

Модели совместимы с Transformers, vLLM и SGLang и распространяются по Apache 2.0 License. Пока есть один пробел — аудио не поддерживается. Если Tencent расширит применение таких моделей, мультимодальный поиск может стать доступнее для бизнеса, а разработчики получат больше возможностей работать с разными типами данных.