NVIDIA решила научить голосового ИИ не просто отвечать, а действовать прямо во время разговора. Компания представила NemotronLabs VoiceChat — открытый голосовой агент, который умеет слушать пользователя, говорить, реагировать на перебивания и вызывать внешние инструменты.

Главная особенность — полный дуплекс: диалог не разбивается на отдельные этапы распознавания речи, генерации ответа и озвучки. Модель работает с аудио напрямую, а задержка при перебивании составляет около 480 мс. Агент может продолжать разговор, пока выполняет запрос, например ищет информацию в интернете или обращается к календарю.

Это уже не обычная «говорилка». Пользователь может слушать ответ, прервать его, продолжить диалог и одновременно поручить системе действие. NVIDIA также заявляет поддержку мультимодальных сценариев.

Для обучения NemotronLabs VoiceChat использовали 550 тыс. часов реальной и синтетической речи. Модель содержит 11 млрд параметров и объединяет понимание речи, языковой вывод и генерацию речи в одной архитектуре. По заявлению NVIDIA, это первый открытый full-duplex голосовой агент с поддержкой вызова инструментов.

Но есть ограничение: версия использует один фиксированный голос без клонирования. Для запуска потребуется GPU NVIDIA минимум с 80 ГБ памяти.

Если такие модели станут доступнее, голосовые агенты смогут перейти от ответов к выполнению задач в реальном времени. Для бизнеса это открывает путь к интерфейсам, где клиент просто разговаривает с системой.