SpaceXAI представила Grok Voice Transcribe 2.0 и заявила о вдвое меньшем числе ошибок за те же деньги. Она рассчитана на шумные звонки, речь нескольких людей, акценты и диалекты.
В основе системы аудиомодель из Grok Voice. SpaceXAI сообщает, что она обрабатывает десятки тысяч звонков поддержки в день, миллионы часов видео и используется в голосовом ассистенте Tesla. Её обучали на многоязычных записях с помехами и дорабатывали постобучением.

В рейтинге Artificial Analysis версия 2.0 заняла первое место среди 32 потоковых моделей по AA-WER Streaming. На четырёх тестах SpaceXAI — звонках, диалогах с Grok, номерах и адресах, а также фразах ассистентов на 19 языках — она обошла 1.0. Данные компании, независимого подтверждения нет.
На тесте коротких фраз WER упал с 20,6 до 6,8%, примерно на 67%. Она определяет язык и продолжает работу при его смене; форматирование чисел, денег и единиц измерения — для 25 языков.
API поддерживает пакетный и потоковый режимы, Opus около 4 Кбайт/с против 48 Кбайт/с у PCM 24 кГц, таймкоды, уверенность по словам, разделение собеседников без доплаты, до 8 каналов и 100 терминов. Есть форматирование чисел и дат, удаление слов-паразитов и определение конца реплики. Файлы до 500 Мбайт принимаются в 12 форматах, поток идёт через WebSocket. Идентификатор — grok-voice-transcribe-2.0; час стоит $0,10 пакетно и $0,20 потоково.
Если точность подтвердится, бизнес получит более надёжный инструмент для голоса. Это может расширить рынок сервисов с голосовым.
