Что делать, если дома несколько мощных компьютеров, а их видеокарты большую часть времени простаивают? NVIDIA предлагает не объединять их в одну суперсистему, а научить распределять между ними задачи. Для этого компания выпустила открытый инструмент NVIDIA PAIR — локальный маршрутизатор инференса под лицензией Apache 2.0.
Схема довольно простая. PAIR работает как прокси между приложением и локальными движками Ollama или LM Studio, получает запросы в формате OpenAI API и решает, на какой компьютер их отправить. Устройства находятся через mDNS, соединяются по шестизначному коду, а трафик защищается mTLS.

Но есть важное ограничение: PAIR не складывает VRAM разных видеокарт в один общий пул. Поэтому модель, которая не помещается на одном ускорителе, таким способом запустить не получится.
Зато независимые задачи можно распределять между несколькими машинами. Планировщик смотрит на очередь, загрузку GPU и наличие нужной модели в памяти, а занятый игрой или рендерингом компьютер временно исключает из работы.
В тесте NVIDIA пять субагентов с Qwen3.6 35B A3B на двух ПК с GeForce RTX 5090 выполнили сценарий за 3 минуты 48 секунд вместо 6 минут 18 секунд. Система также рассчитана на параллельные пользовательские сессии и фоновые задачи.
PAIR работает на Windows, Linux и macOS, поддерживает GeForce RTX, DGX и ускорители AMD, Intel и Apple Silicon через Ollama или LM Studio. NVIDIA проверила кластер до 18 узлов.
Прорыва в самом инференсе здесь нет. Зато у владельцев нескольких ПК появляется практичный способ загрузить простаивающее железо — и превратить домашнюю сеть в небольшой ИИ-кластер без сложной инфраструктуры.
