Выбрать подходящую языковую модель становится всё сложнее: одни быстрее, другие дешевле, третьи лучше справляются с кодом или поиском. OpenRouter считает, что сравнивать модели по общим рейтингам уже недостаточно, и предлагает оценивать их прямо в рабочих проектах.

Платформа представила инструмент Ori Eval, который автоматически анализирует репозиторий, находит места использования языковых моделей и тестирует разные LLM на задачах конкретного проекта. Пользователь может заранее определить, что для него важнее — качество генерации, скорость инференса или стоимость API, после чего система подбирает наиболее подходящий вариант.

По данным OpenRouter, Ori Eval умеет оценивать работу ИИ-агентов, проверять корректность вызова функций и блокировать запрещённые действия. Кроме того, если разработчик описывает ошибку текстом, инструмент самостоятельно создаёт тест-кейс для её воспроизведения, упрощая процесс проверки.

Такой подход позволяет выбирать модели не по результатам универсальных бенчмарков, а по тому, как они справляются с реальными задачами — будь то поиск информации, написание кода или обслуживание клиентов. Если подобные инструменты станут стандартом, компаниям будет проще снижать расходы на ИИ и быстрее находить оптимальные модели для каждого рабочего процесса.