
Grok Voice Transcribe 2.0 занимает №1 по точности потоковой транскрипции при неизменной цене
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 — это модель распознавания речи, которую SpaceXAI выпустила 18 сентября 2026 года, и единственное число, которое имеет значение, — не то, с которого начинается пост о запуске. А вот это: первый частичный транскрипт — текст, на который голосовой агент фактически может реагировать, пока звонящего ещё перебивают, — упал с 18,3% WER в Grok Voice Transcribe 1.0 до 3,4%. Это измерение на доске AA-WER Streaming от Artificial Analysis, где новая модель теперь занимает первое место и в рейтинге Final Transcript (2,7% WER, 0,49 секунды после конца речи), и в рейтинге First Partial Transcript (3,4%, 0,49 секунды). Точность финального транскрипта тоже улучшилась — с 3,9% до 2,7%, что реально, но скромно. Скачок в частичном транскрипте — это то, что меняет то, что вы можете построить.
Что на самом деле изменилось между 1.0 и 2.0?
Обе версии — это один и тот же продукт в одном и том же API, и SpaceXAI не вносила никаких изменений в интерфейс: Grok Voice Transcribe 2.0 выбирается путём передачи grok-voice-transcribe-2.0 в /v1/stt вместо grok-voice-transcribe-1.0 либо путём выбора её при создании WebSocket-соединения для потоковой передачи. Существующие интеграции, которые не указывают параметр model, продолжают получать 1.0, пока SpaceXAI не переключит значение по умолчанию; по словам компании, это произойдёт в ближайшие недели одновременно с признанием старой версии устаревшей. До тех пор 2.0 включается только по желанию, а 1.0 можно закрепить намеренно — и это правильная форма для подобного изменения: вы можете провести A/B-тестирование на собственных аудиозаписях, прежде чем оно станет вашим рабочим значением по умолчанию, независимо от того, просили вы об этом или нет.
Показатели Artificial Analysis, если рассматривать их рядом, рассказывают более конкретную историю, чем «вдвое точнее»:
• Точность итоговой расшифровки — Grok Voice Transcribe 2.0 при WER 2,7 % против Grok Voice Transcribe 1.0 при WER 3,9 % на AA-WER Streaming; оба показателя измерены после окончания речи
• Точность первого частичного транскрипта — 3,4% WER против 18,3%, наибольший единичный разрыв между двумя версиями
• Время до финальной расшифровки — 0,49 с против 0,37 с, поэтому новая модель медленнее фиксирует окончательный результат, чем та, которую она заменяет
• Время до первого частичного результата — 0,49 с против 0,25 с, также медленнее
• Точность пакетного режима (без потоковой передачи) — 2,3% AA-WER в нестриминговом рейтинге Artificial Analysis против 4,07% у Whisper Large v3 и 3,31% у GPT Transcribe
• Пропускная способность при пакетной обработке — примерно 162× от реального времени на той же плате, что уступает показателю MAI-Transcribe-2 в 333× и опережает показатель Gemini 3.5 Transcribe в 88×
Четвёртая и пятая строки — это честная оговорка в этом релизе. SpaceXAI купила точность за счёт задержки. Новая модель возвращает свой первый промежуточный результат и финальную расшифровку примерно на треть секунды медленнее, чем 1.0. На табло, где Deepgram Flux возвращает промежуточный результат за 0,02 секунды, а Soniox v5 — за 0,05, Grok Voice Transcribe 2.0 вообще не соревнуется за скорость — он соревнуется за точность и выигрывает этот обмен с большим преимуществом. Правилен ли этот обмен, полностью зависит от того, является ли ваше приложение голосовым агентом в реальном времени, которому нужно начать отвечать голосом, или конвейером транскрибации, где полсекунды незаметны.

Утверждение «вдвое точнее» — проверено.
Главное заявление SpaceXAI состоит в том, что 2.0 вдвое точнее 1.0 при той же цене, и их собственная таблица оценок подтверждает это на выбранных ими наборах. На англоязычных звонках в службу поддержки с частотой 8 кГц частота ошибок в словах снизилась с 10,6% до 7,1%. В разговорах с Grok — с 8,7% до 3,3%. На произносимых учётных данных — кодах учётных записей, номерах телефонов, адресах электронной почты — с 7,2% до 3,2%. На коротких командах на 19 языках — с 20,6% до 6,8%, что означает сокращение ошибок примерно на две трети. Эти четыре набора взяты из производственного трафика SpaceXAI, и сравнения принадлежат самой SpaceXAI; никто за пределами компании их не воспроизводил. Рассматривайте таблицу как карту того, где модель настраивалась, а не как общую гарантию точности.
Результат Artificial Analysis — это та часть, которая не заявлена производителем: независимый тестовый стенд, прогнанный на примерно восьми часах аудио с весами 50% для закрытого набора AA-AgentTalk и по 25% для VoxPopuli и Earnings22. Он подтверждает более узкое и более полезное утверждение, чем «вдвое точнее», — что на этой конкретной смеси данная модель является самым точным из измеренных потоковых транскрайберов. Один нюанс, о котором стоит упомянуть: в публикации SpaceXAI говорится о первом месте «среди 32 потоковых моделей», тогда как сама страница таблицы лидеров отображает 27 из 33 моделей. Ранг реален; число участников в маркетинговом тексте — это подсчёт компании, а не таблицы.
Также стоит точно понимать, что первое место в AA-WER Streaming охватывает, а что — нет. Эта таблица лидеров ориентирована на английский язык и изобилует речью операторов. Она не измеряет ваш акцент, ваш кодек, терминологию вашей предметной области или ваш восьмиканальный аудиоматериал из колл-центра. Модель, возглавляющая её, всё равно может сильно проигрывать на ваших записях, и именно поэтому окно добровольного участия имеет значение.

Цены не изменились, и это второй по значимости факт здесь.
Grok Voice Transcribe 2.0 стоит столько же, сколько стоил 1.0: $0,10 за час аудио для пакетной обработки и записанных файлов через REST-эндпоинт, $0,20 за час аудио для потоковой передачи через WebSocket. На ценовой доске Artificial Analysis потоковый SKU составляет $3,33 за 1000 минут, а пакетный SKU — $1,67 — та же ставка за пакетную обработку, которую Microsoft взимает за MAI-Transcribe-2, и примерно треть от того, сколько стоит ElevenLabs Scribe v2 Realtime за минуту потоковой передачи.
Диаризация, временные метки на уровне слов с оценками уверенности и смещение в сторону ключевых терминов — всё это включено в этот тариф, а не тарифицируется отдельно, что не является универсальной практикой на этом рынке. Gemini 3.5 Transcribe Live выставляет счёт за токены как на входе аудио, так и на выходе текста, поэтому ваши расходы зависят от того, сколько модель говорит, а не только от того, как долго длилась аудиозапись. Фиксированный тариф за час легче прогнозировать и сравнивать между поставщиками — и поскольку OrcaRouter передаёт прейскурантные цены провайдеров с наценкой 0%, изменение этого тарифа на стороне поставщика отразилось бы на нашей стороне в тот же день, а не после цикла пересмотра цен.
Что API на самом деле даёт вам
Список возможностей широк и в основном унаследован, а не нов, что стоит знать, если вы оцениваете обновление только по функциям:
• Пакетная обработка и потоковая передача в одной модели — REST для записанных файлов размером до 500 МБ, WebSocket по адресу wss://api.x.ai/v1/stt с промежуточными результатами, выдаваемыми примерно каждые 500 мс
• Включает диаризацию спикеров, а также многоканальную транскрипцию до 8 независимых каналов
• Временные метки на уровне слов с оценками уверенности, чтобы можно было отсекать фрагменты с низкой уверенностью, а не доверять всей расшифровке одинаково
• Смещение ключевых терминов: до 100 терминов предметной области на запрос, каждый — до 50 символов
• Обратная нормализация текста для чисел, дат, валют, телефонных номеров и адресов электронной почты с поддержкой форматирования письменной формы на 25 языках
• Удаление слов-заполнителей и определение конца реплики Smart Turn, нацеленные непосредственно на голосовых агентов
• Автоматическое определение языка с переключением языка во время записи за один проход, для 12 аудиоформатов и частот дискретизации от 8 кГц до 48 кГц
• Ограничения сервиса: 10 запросов в секунду как для REST, так и для потоковой передачи, а также 100 одновременных сессий потоковой передачи на команду при размещении в us-east-1
Единственное эксплуатационное замечание, которого нет в списке функций: сервис работает в одном регионе. Если ваш аудиопоток поступает из-за пределов США, сетевой участок теперь становится частью вашего бюджета задержки, и AA-WER Streaming явно закладывает сетевую задержку в расчет времени. SpaceXAI предлагает условия нулевого хранения данных и ссылается на SOC 2 Type II, BAAs и варианты размещения данных в ЕС, так что история соответствия проработана лучше, чем географическая.

Кому следует сделать ход, и за чем следить
Если вы уже используете Grok Voice Transcribe 1.0 и ваше приложение опирается на частичные транскрипты — определение окончания реплики, перебивание, ответы агента в реальном времени — разрыв в точности частичных транскриптов с 18,3 % до 3,4 % настолько велик, что тестирование 2.0 не является опциональным. Этот переход от «обычно неверно» к «обычно верно» — разница между частичным транскриптом, который можно использовать для маршрутизации, и тем, который можно только отображать. Если ваше приложение ждёт финальных транскриптов для записанных файлов, улучшение реально, но меньше, и добавленные 0,12 секунды задержки фиксации — это его цена.
Если вы используете совершенно другого вендора, причина присмотреться к этому релизу — не место в таблице лидеров, а то, что передовая лаборатория только что значительно улучшила свою модель транскрипции, не подняв цену, — так выглядит рынок, когда точность перестаёт быть тем, за что вы берёте деньги. Путь обновления также относится к самому дешёвому типу: один параметр, без изменения кода, без нового контракта, и возможность зафиксировать версию, если что-то пойдёт не так.
Следующее, за чем стоит следить, — это смена версии по умолчанию. Когда SpaceXAI сделает 2.0 версией по умолчанию и начнёт выводить из эксплуатации 1.0, каждая интеграция, которая никогда не передавала параметр модели, сразу перейдёт на новую модель — включая изменение задержки. Командам, которые зависят от старого тайминга частичных результатов в 0,25 секунды, стоит закрепить версию сейчас, а не обнаруживать изменение в продакшене. Второе, за чем стоит следить, — независимое воспроизведение: запись в Artificial Analysis — это реальное измерение, но это один стенд на одном аудиомиксе, и ни одна третья сторона пока не опубликовала сопоставимый прогон 1.0 против 2.0 на продакшен-аудио.
