Google представила Gemini 3.5 Transcribe — модель, которая должна превратить речь в более удобный для ИИ формат. Она работает и с готовыми записями, и в реальном времени, причём задержка составляет меньше секунды.
Но главное здесь не скорость. Система умеет определять разных говорящих, добавлять временные метки и переходить с одного языка на другой прямо во время разговора. Заодно она убирает слова-паразиты, учитывает исправления и может сразу превращать разговорную речь в аккуратный текст.

Зачем всё это? Google рассчитывает использовать Gemini 3.5 Transcribe не только для расшифровки аудио, но и как основу голосовых агентов. Получается важный сдвиг: человеку уже не обязательно подстраиваться под машину и говорить идеально.
Первые цифры выглядят убедительно. На тесте FLEURS Google заявляет около 5% ошибок распознавания, а Artificial Analysis оценивает сокращение времени до финальной транскрипции примерно на 70% по сравнению с предыдущей моделью Chirp 3.
Правда, лабораторные результаты не гарантируют такого же качества в реальной жизни. Шум, несколько собеседников и плохие микрофоны по-прежнему способны серьёзно усложнить работу системы.
Но направление уже понятно. Если голосовые агенты научатся надёжно воспринимать обычную человеческую речь, бизнес получит новый способ взаимодействия с ИИ — без необходимости каждый раз говорить с компьютером на его языке.
