Долгое время считалось, что качественный агентный поиск на базе ИИ требует дорогостоящих вычислительных кластеров. Команда T-Tech решила оспорить это правило, открыв доступ к системе T-Search. Она построена на модели Qwen3.6-35B-A3B и показывает, что высокая производительность больше не обязательно связана с огромными затратами.
Главное отличие — экономика. Благодаря архитектуре MoE во время работы используются около 3 миллиардов активных параметров, поэтому модель помещается на одной GPU. При этом, по данным разработчиков, раньше сопоставимый уровень качества требовал кластеров из 16 видеокарт.
Экономия не стала компромиссом. По словам авторов проекта, по среднему показателю Recall@10 T-Search превосходит более крупные открытые модели, включая Qwen3.5-397B, GLM-5.2 и Kimi-K2.6. В результате стоимость инференса агентного поиска снижается почти на порядок, а качество, как утверждают разработчики, становится выше.
Секрет заключается и в устройстве самого агента. Вместо хранения всей истории он переносит между раундами только компактную «память», удерживая контекст примерно в пределах 32 тысяч токенов. Авторы также отмечают, что можно выбирать между быстрым дешёвым режимом и тремя параллельными роллаутами с RRF-слиянием, повышающими Recall@10 с 55,96 до 61,33. Модель, харнесс и датасеты опубликованы по лицензии Apache 2.0. Это может ускорить развитие открытых ИИ-решений, а бизнесу дать более доступные инструменты для интеллектуального поиска.