Hero-карточка статьи с надписью «Grok Voice Transcribe 2.0 vs GPT Transcribe», бейджем «СРАВНЕНИЕ МОДЕЛЕЙ» и подзаголовком «Та же цена за потоковую передачу, другая точность», с чипами: 2,7 % против 3,9 % WER в потоковом режиме, 3,4 % против 6,3 % для первого промежуточного результата, $1,67 против $4,50 за 1 000 минут и 162x против 41x в реальном времени, на градиенте от белого к синему с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Grok Voice Transcribe 2.0 против GPT Transcribe: одинаковая цена стриминга, разная точность

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Совпадение почти слишком изящное. В таблице AA-WER Streaming от Artificial Analysis Grok Voice Transcribe 2.0 и GPT Live Transcribe — эндпоинт потоковой транскрипции — указаны ровно по $3.33 за 1000 минут аудио. Grok Voice Transcribe 2.0 от SpaceXAI, выпущенный 18 сентября 2026 года, выдаёт итоговую транскрипцию с частотой ошибок в словах 2,7% через 0,49 секунды после окончания речи и первый частичный результат с 3,4%. GPT Live Transcribe, вышедший вместе с GPT Transcribe 28 июля 2026 года, выдаёт итоговую транскрипцию с 3,9% и первый частичный результат с 6,3%. Та же цена, и примерно 1,2 процентного пункта точности итоговой транскрипции плюс 2,9 процентного пункта точности частичной транскрипции в пользу SpaceXAI. А вот сторона пакетной обработки в том же сравнении — вовсе не совпадение: GPT Transcribe стоит $4.50 за 1000 минут против $1.67 у Grok Voice Transcribe 2.0 — разрыв в 63% на пути обработки записанных файлов.

Две разные ставки на то, как транскрипция становится лучше

Ответ OpenAI на вопрос точности — это контекст. GPT Transcribe и GPT Live Transcribe принимают промпты в свободной форме, списки ключевых слов и списки ожидаемых языков, а в сессиях Realtime ранее транскрибированные реплики подаются обратно в качестве контекста для последующих. В собственном бенчмарке OpenAI Context Aware ASR такое обусловливание подняло семантическую точность GPT Live Transcribe с 38,5% до 44,6% — это заявленный производителем показатель, и он измеряет, сохранился ли смысл, а не то, были ли слова правильными. Предлагаемый OpenAI компромисс явен: дайте модели информацию о том, что ей предстоит услышать, и она будет транскрибировать вашу предметную область лучше, чем это сделала бы общая модель с той же исходной точностью.

Ответ SpaceXAI — это сама модель. В Grok Voice Transcribe 2.0 действительно есть механизм смещения — до 100 ключевых терминов на запрос, каждый длиной до 50 символов, — но это список слов, а не промпт. Вы можете сообщить ей, что «OrcaRouter» и «Kubernetes» — настоящие слова; вы не можете передать ей абзац, объясняющий, что это звонок в поддержку по поводу возврата средств. Улучшение точности в версии 2.0 достигается вместо этого за счёт переобучения: на собственных оценочных наборах SpaceXAI, полученных на основе продакшена, частота ошибок в словах снизилась с 8,7 % до 3,3 % на разговорном аудио, с 10,6 % до 7,1 % на телефонной связи 8 кГц, с 7,2 % до 3,2 % на произносимых учётных данных и с 20,6 % до 6,8 % на коротких командах в 19 языках. Это цифры компании на аудио компании, никем за её пределами не воспроизведённые, и они описывают модель, которая стала лучше справляться с акустической задачей, а не модель, которая стала лучше от того, что ей сообщают, чего ожидать.

Практическая разница проявляется на втором часу работы. Модель, обусловленная контекстом, может быть значительно лучше, чем предполагает её исходный бенчмарк, потому что вы предоставили словарь и предметную область. Она также может галлюцинировать ключевые слова, которые вы предоставили: поместите «OrcaRouter» в промпт, и модель, которая не может чётко расслышать это слово, всё равно может его выдать. Модель со смещением по ключевым терминам деградирует более плавно, потому что смещение сдвигает вероятность термина, а не утверждает, что он присутствует. Ни один из этих режимов отказа не отображается в таблице лидеров, но оба появятся в ваших логах.

Числа, бок о бок

• Итоговая точность расшифровки (в потоковом режиме) — Grok Voice Transcribe 2.0 с 2,7 % WER против GPT Live Transcribe с 3,9 % на AA-WER Streaming, оба — по данным Artificial Analysis

• Точность первого частичного результата (потоковая передача) — 3,4% против 6,3%, самый большой разрыв в сравнении, и именно он определяет поведение голосового агента

• Время до финальной расшифровки — 0,49 с против 0,81 с после окончания речи, так что более точная модель ещё и быстрее фиксирует результат.

• Время до первого частичного ответа — 0,49 с против 0,26 с; единственная колонка задержки, в которой OpenAI безоговорочно выигрывает

• Цена стриминга — $3.33 за 1000 минут для обоих, нормализована Artificial Analysis на основе $0.20/час у Grok и $0.017/минуту у OpenAI

• Точность в пакетном режиме (без потоковой передачи) — Grok Voice Transcribe 2.0 с показателем AA-WER 2,3% против GPT Transcribe с 3,31%

• Пакетная цена — $1,67 за 1000 минут против $4,50 за 1000 минут, от $0,10/час против $0,0045/минута

• Пропускная способность пакетной обработки — примерно 162× реального времени против примерно 41× на той же плате

Читайте этот список как две колонки, а не как один вердикт. OpenAI с явным отрывом выигрывает по задержке первого частичного результата и предлагает механизм контекста, которого нет у Grok. SpaceXAI с большим отрывом выигрывает по итоговой точности в обоих режимах, точности частичных результатов при потоковой передаче, пропускной способности и цене пакетной обработки. Нет ни одной колонки, где GPT Live Transcribe был бы одновременно быстрее и точнее, чем Grok Voice Transcribe 2.0; есть одна колонка, где он быстрее, и это самая ранняя из них.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs GPT Transcribe — the scoreboard': the left column gives Grok Voice Transcribe 2.0 a 2.7% streaming final WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives GPT Transcribe 3.9%, 6.3%, 0.81s, $4.50, $3.33 and 41x real time.

На каком пакетном пути вы на самом деле находитесь?

Разрыв между $1,67 и $4,50 — это наименее двусмысленное число здесь, и стоит точно объяснить, почему он существует. OpenAI снизила цену на эту линейку продуктов на 25% при запуске GPT Transcribe по сравнению с эпохой GPT-4o Transcribe, и в результате цена составила $0,0045 за минуту. SpaceXAI оставила свой тариф для пакетной обработки без изменений на уровне $0,10 в час при переходе с версии 1.0 на 2.0 — она улучшила модель и взяла ту же цену, что сложнее сделать и является лучшим сигналом о том, куда движется рынок. MAI-Transcribe-2 от Microsoft оказалась на том же уровне $0,10 в час в качестве ограниченного по времени предложения, так что точка в $1,67 за 1000 минут стала минимальным уровнем для пакетной транскрипции среди передовых лабораторий, а не промо-цифрой одного поставщика.

При десяти тысячах часов аудио в месяц эта разница составляет примерно 2 830 долларов против 450. Для архива подкастов, накопившихся записей звонков или медиатеки, которую ретроспективно транскрибируют, разница в цене затмевает любую разницу в точности между 2,3% и 3,31% WER. Для стримингового агента, где оба продукта стоят одинаково, точность и задержка — единственное, о чём остаётся спорить.

За этими тарифами стоит структурное различие, которое стоит назвать: Grok Voice Transcribe 2.0 выставляет фиксированную ставку за час аудио, GPT Live Transcribe тарифицируется поминутно, а Gemini 3.5 Transcribe Live тарифицируется по токенам как за аудиовход, так и за текстовый вывод. Только один из этих трёх вариантов делает ваш счёт зависящим от того, что модель решит сказать. Если ваш объём достаточно велик, чтобы прогнозирование имело значение, фиксированные ставки легче защитить перед тем, кто подписывает счёт, — и поскольку OrcaRouter передаёт прейскурантные цены провайдеров с наценкой 0%, снижение цены со стороны вендора, например 25% у OpenAI, действовало бы на нашей стороне в тот же день, когда оно объявлено, а не при следующем продлении.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard showing the identical $3.33 per 1,000 minutes streaming price for Grok Voice Transcribe 2.0 and GPT Live Transcribe, next to their 2.728% versus 3.918% final-transcript word error rates and 0.490s versus 0.812s times to final transcript.

Чем не является ни одна из моделей

GPT Transcribe и GPT Live Transcribe — это два продукта, а не один с переключателем. Batch-модель обрабатывает завершённые файлы, транскрипты потоковых файлов и зафиксированные ходы в сессиях Realtime, а также обрабатывает аудио примерно в 34 раза быстрее реального времени по собственным данным OpenAI — Artificial Analysis на своём стенде измеряет 41×. Потоковая модель — более дорогая: $0.017 за минуту, и именно у неё в 10 раз выше частота ошибок на промежуточных результатах. Выбор OpenAI означает выбор того, какая из этих двух проблем у вас есть, потому что более дешёвый эндпоинт не может выполнять работу другого.

Grok Voice Transcribe 2.0 — это одна модель с двумя транспортами: одни и те же веса обслуживают /v1/stt по REST для файлов размером до 500 МБ и wss://api.x.ai/v1/stt по WebSocket для живого аудио, при этом промежуточные результаты выдаются примерно каждые 500 мс. Скорость потоковой передачи ровно вдвое выше скорости пакетной обработки, а не является отдельно спроектированным продуктом, а значит, точность, которую вы измеряете на своём архивном аудио, — это та точность, которую следует ожидать в реальном времени. Это также означает, что второй модели для оценки нет — один набор промптов, один набор ключевых терминов, один набор ожиданий.

Паритет функций почти достигнут, но не полный. Обе модели возвращают временные метки на уровне слов; Grok Voice Transcribe 2.0 прикрепляет к каждому слову оценку уверенности, что позволяет задавать порог для фрагментов с низкой уверенностью, а не доверять всей расшифровке одинаково. Обе выполняют диаризацию говорящих, причём у Grok она включена без дополнительной платы. Обе обрабатывают обратную нормализацию текста для чисел, дат, валют и контактных данных. Grok Voice Transcribe 2.0 добавляет многоканальную расшифровку до 8 независимых каналов, удаление слов-заполнителей и определение конца реплики Smart Turn; отличительные дополнения GPT Transcribe — контекстная настройка на уровне промпта и, на стороне Realtime, автоматический перенос предыдущих реплик. OpenAI не опубликовала число поддерживаемых языков ни для одной из моделей; Grok Voice Transcribe 2.0 документирует десятки языков с переключением в середине записи и форматированием письменной формы для 25 языков.

Screenshot of the OpenAI developers.openai.com GPT Transcribe model page describing the batch and streaming transcription endpoints, the $0.0045 per minute batch and $0.017 per minute streaming rates, the prompt and keyword context conditioning, and the Context Aware ASR accuracy figures.

Как принять решение и как это проверить

Если вы создаёте голосового агента, который должен отвечать до того, как звонящий договорит, колонка частичной расшифровки — это ваша переменная для принятия решения, и она чётко разводит две модели: Grok Voice Transcribe 2.0 на 2,9 пункта точнее на частичных результатах, но выдаёт их на 0,23 секунды медленнее. Выбирайте SpaceXAI, если неверный частичный результат хуже, чем запоздалый, — маршрутизация, эскалация, ответы, инициируемые требованиями соответствия. Выбирайте OpenAI, если запоздалый частичный результат хуже неверного и если у вас есть отраслевая лексика, чтобы подпитывать механизм контекста так, что разрыв в точности сокращается. Затем измерьте оба, потому что поведение частичной расшифровки ни у одного из поставщиков на восьми часах английской речи агентов не предсказывает, как каждый из них поведёт себя с вашим акцентом, вашим кодеком и вашим жаргоном.

Если вы транскрибируете файлы, решение принять гораздо проще: $1,67 против $4,50 за 1 000 минут и 2,3% против 3,31% WER — оба показателя указывают в одну сторону. Единственная причина оставаться на GPT Transcribe для пакетной работы — если механизм контекстной обусловленности делает для вашего аудио нечто такое, что не может компенсировать разрыв в чистой точности, — а это вполне реально для узкоспециализированных записей, и это можно проверить.

Ни одна из моделей транскрипции сегодня не входит в каталог OrcaRouter, поэтому сами вызовы идут в собственный API вендора. А вот за одним ключом OrcaRouter действительно стоит всё, что получает на вход транскрипт: агентная модель, суммаризатор, классификатор, код, который решает, что делать с текстом. Именно здесь обычно появляется второй контракт — один вендор для речи, другой — для модели, которая делает выводы на основе текста, — и это не обязательно. Один ключ для 200+ моделей, автоматическое переключение при сбое, если провайдер начнёт работать хуже, и DSL маршрутизации, если вы хотите отправить запрос через несколько моделей и сравнить, прежде чем сделать окончательный выбор. Это более скромное утверждение, чем «мы маршрутизируем вашу транскрипцию», и оно правдиво.

Главное, за чем стоит следить, — ответит ли OpenAI точностью, а не контекстом. Компания уже выпустила два поколения транскрибации за год и один раз снизила цены; механизм контекста действительно уникален, но в рейтинге, оценивающем чистую транскрибацию, она сейчас уступает и SpaceXAI, и Microsoft. Если GPT Transcribe 2 появится с сохранённым механизмом контекста и сниженной до диапазона 2% частотой ошибок, это сравнение перевернётся на стороне пакетной обработки в одночасье — а цена стриминга, уже идентичная, делает эту гонку достойной наблюдения.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно