Распознавание речи становится одним из самых конкурентных направлений ИИ. OpenAI представила сразу две новые модели — GPT Transcribe для обработки аудиофайлов и GPT Live Transcribe для потоковой расшифровки с минимальной задержкой. Обе доступны через API, поддерживают мультиязычный ввод, умеют учитывать текстовый контекст и заранее заданные ключевые слова.
По данным OpenAI, GPT Transcribe обрабатывает записи примерно в 34 раза быстрее реального времени. При этом, согласно тестам Artificial Analysis на бенчмарке AA-WER, уровень ошибок в словах составляет 3,3%, что на 0,7 процентного пункта лучше, чем у GPT-4o Transcribe. Однако лидером рынка новинка пока не стала.
По данным Artificial Analysis, первое место занимает система Fun-Realtime-ASR-Preview от Alibaba Group с показателем WER 1,7%. Следом идут ElevenLabs Scribe v2 с результатом 2,2%, MAI-Transcribe-1.5 — 2,4%, а также Mistral Voxtral Small и Gemini 3.1 Pro, набравшие по 2,8%. Одновременно OpenAI снизила стоимость сервиса: минута обработки аудио теперь стоит $0,0045, а использование GPT Live Transcribe — $0,017.
Если конкуренция продолжит усиливаться, бизнес получит более доступные и точные инструменты для работы с голосом, а рынок — новый виток борьбы не только за качество, но и за стоимость ИИ-сервисов.