Qwen представила E-Commerce Bench — бенчмарк, который проверяет, способен ли ИИ-агент не просто выполнить отдельную задачу, а год самостоятельно вести интернет-магазин. На старте агент получает ¥100 000 и должен принимать решения, от которых зависит финансовый результат бизнеса.

В течение года ему предстоит искать поставщиков, торговаться с ними, устанавливать цены, запускать акции, следить за складом и управлять денежным потоком. При этом среда построена на реальных данных электронной коммерции, поэтому агенту приходится учитывать не только спрос, но и ограничения, которые обычно появляются в настоящем бизнесе.

В E-Commerce Bench собраны 6886 товаров и 576 поставщиков, среди которых 152 мошенника. В симуляции также учитываются комиссии за хранение, возвраты, репутация продавца и даже ограниченный рабочий день. Ошибка в одном решении может повлиять на последующие действия и итоговый результат.

Главная особенность бенчмарка — оценка сразу по семи направлениям. Поэтому здесь недостаточно хорошо торговаться или правильно выставлять цены: агент должен одновременно удерживать под контролем разные процессы и принимать решения на длинной дистанции.

Для разработчиков это важный сдвиг в оценке ИИ-агентов: модель проверяют не на одной задаче, а на способности последовательно управлять целым бизнесом. Пока универсального лидера нет, а значит, E-Commerce Bench может показать, какие системы действительно готовы работать в сложных коммерческих сценариях.