Hero-карточка статьи с надписью «Grok Voice Transcribe 2.0», бейджем «НОВОСТИ» и подзаголовком «№1 по точности потоковой расшифровки при неизменной цене», с чипами: 2,7% WER для итоговой расшифровки, 3,4% для первого промежуточного результата, 0,49 с после окончания речи и $0,20 за час потоковой расшифровки, на фоне градиента от белого к синему, с логотипом OrcaRouter в правом нижнем углу.
Engineering & Research

Grok Voice Transcribe 2.0 занимает №1 по точности потоковой транскрипции при неизменной цене

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Grok Voice Transcribe 2.0 — это модель распознавания речи, которую SpaceXAI выпустила 18 сентября 2026 года, и единственное число, которое имеет значение, — не то, с которого начинается пост о запуске. А вот это: первый частичный транскрипт — текст, на который голосовой агент фактически может реагировать, пока звонящего ещё перебивают, — упал с 18,3% WER в Grok Voice Transcribe 1.0 до 3,4%. Это измерение на доске AA-WER Streaming от Artificial Analysis, где новая модель теперь занимает первое место и в рейтинге Final Transcript (2,7% WER, 0,49 секунды после конца речи), и в рейтинге First Partial Transcript (3,4%, 0,49 секунды). Точность финального транскрипта тоже улучшилась — с 3,9% до 2,7%, что реально, но скромно. Скачок в частичном транскрипте — это то, что меняет то, что вы можете построить.

Что на самом деле изменилось между 1.0 и 2.0?

Обе версии — это один и тот же продукт в одном и том же API, и SpaceXAI не вносила никаких изменений в интерфейс: Grok Voice Transcribe 2.0 выбирается путём передачи grok-voice-transcribe-2.0 в /v1/stt вместо grok-voice-transcribe-1.0 либо путём выбора её при создании WebSocket-соединения для потоковой передачи. Существующие интеграции, которые не указывают параметр model, продолжают получать 1.0, пока SpaceXAI не переключит значение по умолчанию; по словам компании, это произойдёт в ближайшие недели одновременно с признанием старой версии устаревшей. До тех пор 2.0 включается только по желанию, а 1.0 можно закрепить намеренно — и это правильная форма для подобного изменения: вы можете провести A/B-тестирование на собственных аудиозаписях, прежде чем оно станет вашим рабочим значением по умолчанию, независимо от того, просили вы об этом или нет.

Показатели Artificial Analysis, если рассматривать их рядом, рассказывают более конкретную историю, чем «вдвое точнее»:

• Точность итоговой расшифровки — Grok Voice Transcribe 2.0 при WER 2,7 % против Grok Voice Transcribe 1.0 при WER 3,9 % на AA-WER Streaming; оба показателя измерены после окончания речи

• Точность первого частичного транскрипта — 3,4% WER против 18,3%, наибольший единичный разрыв между двумя версиями

• Время до финальной расшифровки — 0,49 с против 0,37 с, поэтому новая модель медленнее фиксирует окончательный результат, чем та, которую она заменяет

• Время до первого частичного результата — 0,49 с против 0,25 с, также медленнее

• Точность пакетного режима (без потоковой передачи) — 2,3% AA-WER в нестриминговом рейтинге Artificial Analysis против 4,07% у Whisper Large v3 и 3,31% у GPT Transcribe

• Пропускная способность при пакетной обработке — примерно 162× от реального времени на той же плате, что уступает показателю MAI-Transcribe-2 в 333× и опережает показатель Gemini 3.5 Transcribe в 88×

Четвёртая и пятая строки — это честная оговорка в этом релизе. SpaceXAI купила точность за счёт задержки. Новая модель возвращает свой первый промежуточный результат и финальную расшифровку примерно на треть секунды медленнее, чем 1.0. На табло, где Deepgram Flux возвращает промежуточный результат за 0,02 секунды, а Soniox v5 — за 0,05, Grok Voice Transcribe 2.0 вообще не соревнуется за скорость — он соревнуется за точность и выигрывает этот обмен с большим преимуществом. Правилен ли этот обмен, полностью зависит от того, является ли ваше приложение голосовым агентом в реальном времени, которому нужно начать отвечать голосом, или конвейером транскрибации, где полсекунды незаметны.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Grok Voice Transcribe 1.0 — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% final transcript WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives Grok Voice Transcribe 1.0 3.9%, 18.3%, 0.37s and the same two prices, with throughput not measured; the footer credits both columns to Artificial Analysis.

Утверждение «вдвое точнее» — проверено.

Главное заявление SpaceXAI состоит в том, что 2.0 вдвое точнее 1.0 при той же цене, и их собственная таблица оценок подтверждает это на выбранных ими наборах. На англоязычных звонках в службу поддержки с частотой 8 кГц частота ошибок в словах снизилась с 10,6% до 7,1%. В разговорах с Grok — с 8,7% до 3,3%. На произносимых учётных данных — кодах учётных записей, номерах телефонов, адресах электронной почты — с 7,2% до 3,2%. На коротких командах на 19 языках — с 20,6% до 6,8%, что означает сокращение ошибок примерно на две трети. Эти четыре набора взяты из производственного трафика SpaceXAI, и сравнения принадлежат самой SpaceXAI; никто за пределами компании их не воспроизводил. Рассматривайте таблицу как карту того, где модель настраивалась, а не как общую гарантию точности.

Результат Artificial Analysis — это та часть, которая не заявлена производителем: независимый тестовый стенд, прогнанный на примерно восьми часах аудио с весами 50% для закрытого набора AA-AgentTalk и по 25% для VoxPopuli и Earnings22. Он подтверждает более узкое и более полезное утверждение, чем «вдвое точнее», — что на этой конкретной смеси данная модель является самым точным из измеренных потоковых транскрайберов. Один нюанс, о котором стоит упомянуть: в публикации SpaceXAI говорится о первом месте «среди 32 потоковых моделей», тогда как сама страница таблицы лидеров отображает 27 из 33 моделей. Ранг реален; число участников в маркетинговом тексте — это подсчёт компании, а не таблицы.

Также стоит точно понимать, что первое место в AA-WER Streaming охватывает, а что — нет. Эта таблица лидеров ориентирована на английский язык и изобилует речью операторов. Она не измеряет ваш акцент, ваш кодек, терминологию вашей предметной области или ваш восьмиканальный аудиоматериал из колл-центра. Модель, возглавляющая её, всё равно может сильно проигрывать на ваших записях, и именно поэтому окно добровольного участия имеет значение.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first on both the Final Transcription ranking at 2.728% word error rate and 0.490s and the First Partial Transcription ranking at 3.359% and 0.489s, with Grok Voice Transcribe 1.0 further down at 18.275% on partials.

Цены не изменились, и это второй по значимости факт здесь.

Grok Voice Transcribe 2.0 стоит столько же, сколько стоил 1.0: $0,10 за час аудио для пакетной обработки и записанных файлов через REST-эндпоинт, $0,20 за час аудио для потоковой передачи через WebSocket. На ценовой доске Artificial Analysis потоковый SKU составляет $3,33 за 1000 минут, а пакетный SKU — $1,67 — та же ставка за пакетную обработку, которую Microsoft взимает за MAI-Transcribe-2, и примерно треть от того, сколько стоит ElevenLabs Scribe v2 Realtime за минуту потоковой передачи.

Диаризация, временные метки на уровне слов с оценками уверенности и смещение в сторону ключевых терминов — всё это включено в этот тариф, а не тарифицируется отдельно, что не является универсальной практикой на этом рынке. Gemini 3.5 Transcribe Live выставляет счёт за токены как на входе аудио, так и на выходе текста, поэтому ваши расходы зависят от того, сколько модель говорит, а не только от того, как долго длилась аудиозапись. Фиксированный тариф за час легче прогнозировать и сравнивать между поставщиками — и поскольку OrcaRouter передаёт прейскурантные цены провайдеров с наценкой 0%, изменение этого тарифа на стороне поставщика отразилось бы на нашей стороне в тот же день, а не после цикла пересмотра цен.

Что API на самом деле даёт вам

Список возможностей широк и в основном унаследован, а не нов, что стоит знать, если вы оцениваете обновление только по функциям:

• Пакетная обработка и потоковая передача в одной модели — REST для записанных файлов размером до 500 МБ, WebSocket по адресу wss://api.x.ai/v1/stt с промежуточными результатами, выдаваемыми примерно каждые 500 мс

• Включает диаризацию спикеров, а также многоканальную транскрипцию до 8 независимых каналов

• Временные метки на уровне слов с оценками уверенности, чтобы можно было отсекать фрагменты с низкой уверенностью, а не доверять всей расшифровке одинаково

• Смещение ключевых терминов: до 100 терминов предметной области на запрос, каждый — до 50 символов

• Обратная нормализация текста для чисел, дат, валют, телефонных номеров и адресов электронной почты с поддержкой форматирования письменной формы на 25 языках

• Удаление слов-заполнителей и определение конца реплики Smart Turn, нацеленные непосредственно на голосовых агентов

• Автоматическое определение языка с переключением языка во время записи за один проход, для 12 аудиоформатов и частот дискретизации от 8 кГц до 48 кГц

• Ограничения сервиса: 10 запросов в секунду как для REST, так и для потоковой передачи, а также 100 одновременных сессий потоковой передачи на команду при размещении в us-east-1

Единственное эксплуатационное замечание, которого нет в списке функций: сервис работает в одном регионе. Если ваш аудиопоток поступает из-за пределов США, сетевой участок теперь становится частью вашего бюджета задержки, и AA-WER Streaming явно закладывает сетевую задержку в расчет времени. SpaceXAI предлагает условия нулевого хранения данных и ссылается на SOC 2 Type II, BAAs и варианты размещения данных в ЕС, так что история соответствия проработана лучше, чем географическая.

Screenshot of the SpaceXAI docs.x.ai Speech-to-Text page listing the Grok Voice Transcribe 2.0 REST and WebSocket endpoints, the grok-voice-transcribe-2.0 model parameter, the 500 MB file limit, key-term biasing and the published rate limits.

Кому следует сделать ход, и за чем следить

Если вы уже используете Grok Voice Transcribe 1.0 и ваше приложение опирается на частичные транскрипты — определение окончания реплики, перебивание, ответы агента в реальном времени — разрыв в точности частичных транскриптов с 18,3 % до 3,4 % настолько велик, что тестирование 2.0 не является опциональным. Этот переход от «обычно неверно» к «обычно верно» — разница между частичным транскриптом, который можно использовать для маршрутизации, и тем, который можно только отображать. Если ваше приложение ждёт финальных транскриптов для записанных файлов, улучшение реально, но меньше, и добавленные 0,12 секунды задержки фиксации — это его цена.

Если вы используете совершенно другого вендора, причина присмотреться к этому релизу — не место в таблице лидеров, а то, что передовая лаборатория только что значительно улучшила свою модель транскрипции, не подняв цену, — так выглядит рынок, когда точность перестаёт быть тем, за что вы берёте деньги. Путь обновления также относится к самому дешёвому типу: один параметр, без изменения кода, без нового контракта, и возможность зафиксировать версию, если что-то пойдёт не так.

Следующее, за чем стоит следить, — это смена версии по умолчанию. Когда SpaceXAI сделает 2.0 версией по умолчанию и начнёт выводить из эксплуатации 1.0, каждая интеграция, которая никогда не передавала параметр модели, сразу перейдёт на новую модель — включая изменение задержки. Командам, которые зависят от старого тайминга частичных результатов в 0,25 секунды, стоит закрепить версию сейчас, а не обнаруживать изменение в продакшене. Второе, за чем стоит следить, — независимое воспроизведение: запись в Artificial Analysis — это реальное измерение, но это один стенд на одном аудиомиксе, и ни одна третья сторона пока не опубликовала сопоставимый прогон 1.0 против 2.0 на продакшен-аудио.