Hero-карточка статьи с надписью «Grok Voice Transcribe 2.0 против MAI Transcribe 2», бейджем «СРАВНЕНИЕ МОДЕЛЕЙ» и подзаголовком «Две дорожки, а не два соперника», с чипами: «3,4% против отсутствия потокового SKU», «2,29% против 2,04% WER пакетной обработки», «162× против 333× относительно реального времени» и «$1,67 за 1 000 минут у каждой» — на фоне градиента от белого к синему с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Grok Voice Transcribe 2.0 vs MAI Transcribe 2: две дорожки, а не два соперника

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Эти две модели были выпущены с разницей в пятнадцать дней и имели цену, совпадающую до цента, и они почти никогда не окажутся в одном и том же решении о закупке. Grok Voice Transcribe 2.0, выпущенная SpaceXAI 18 сентября 2026 года, — это модель, к которой вы обращаетесь, когда аудио всё ещё поступает: она передаёт поток через WebSocket, выдаёт промежуточные результаты примерно каждые 500 мс и возглавляет рейтинг AA-WER Streaming от Artificial Analysis с частотой ошибок в словах 2,7% для финальных расшифровок и 3,4% для первых частичных результатов. MAI-Transcribe-2, выпущенная Microsoft AI 3 сентября 2026 года, — это модель, к которой вы обращаетесь, когда аудио уже является файлом: она работает только в пакетном режиме, и в непоточной таблице Artificial Analysis это самая точная управляемая модель с измеренным AA-WER 2,04%, опережая Grok Voice Transcribe 2.0 с 2,29% и примерно в 2 раза превосходя её по пропускной способности. Обе указаны по цене $0,10 за час аудио, около $1,67 за 1000 минут. Если ваше требование — работа в реальном времени, сравнивать нечего. Если ваше требование — файл, то сравнение есть.

Черта, которую за вас не проведёт ни один из вендоров.

Поддержка потоковой передачи — это не переключатель функции. Grok Voice Transcribe 2.0 обслуживает одну и ту же модель через REST для записанных файлов и через `wss://api.x.ai/v1/stt` для живого аудио, так что точность, которую вы измеряете на своём архиве, — это точность, которую вы получаете на живом звонке. У MAI-Transcribe-2 нет потокового SKU вообще: в материалах запуска Microsoft позиционирует её явно для длинных и пакетных аудиозаписей, и хотя в карточке модели среди сценариев применения указаны субтитры в реальном времени, путь к этому — сегментирование аудио и подача каждого сегмента через пакетный API, а это конвейер, который вы строите и обслуживаете сами, а не гарантия задержки, которую вы покупаете. Заявленная Microsoft пропускная способность примерно 411× от реального времени — это показатель скорости обработки, а не времени отклика, и эти два понятия постоянно путают в освещении данного релиза.

Практическое следствие: если вы создаёте голосовых агентов с передачей реплик, субтитры в реальном времени или что-либо, где человек или модель реагирует на речь по мере её поступления, MAI-Transcribe-2 не является кандидатом, как бы хороша ни была его точность. Если вы расшифровываете встречи постфактум, записи контакт-центра за ночь, медиаархивы или очереди на соответствие требованиям, стриминг — мёртвый груз, и всё решают показатели пакетной обработки.

Где MAI-Transcribe-2 действительно впереди

Сначала — точность на файлах. Разрыв между 2,04% и 2,29% измерен на одном и том же независимом стенде — AA-WER v2 от Artificial Analysis, на 50% из AA-AgentTalk и по 25% из VoxPopuli и Earnings22 — что делает его самым бесспорным фактом в этом сравнении. Это разница в 0,25 пункта — примерно на две с половиной ошибки меньше на тысячу слов. Имеет ли это значение, зависит от того, что вы делаете с расшифровкой; для архива с поиском — нет, а для юридической или медицинской записи — возможно.

Пропускная способность — и это во-вторых, причём с отрывом, превышающим разрыв в точности: 333× реального времени против 162× у Grok Voice Transcribe 2.0. Обе цифры — это измерения Artificial Analysis: сколько секунд входного аудио транскрибируется за секунду, а не заявления вендоров. При такой скорости архив на тысячу часов обрабатывается примерно за три часа вычислений на модели Microsoft и примерно за шесть — на модели SpaceXAI. Для разовой миграции это не имеет значения; для конвейера, который принимает данные непрерывно, сокращение времени обработки вдвое — это реальная разница в пропускной способности.

Что касается языкового покрытия — третье. Microsoft заявляет 60 языков с автоматическим определением, переключением языков внутри одной записи и средней частотой ошибок в словах 5,2 % по ним на FLEURS — это число, сообщённое поставщиком, а не независимо воспроизведённое, но по крайней мере оно описывает многоязычный случай по заявленному списку языков. SpaceXAI документирует десятки языков с переключением в середине записи и форматированием письменной формы по 25 из них. Если ваше аудио выходит за пределы хорошо покрытого набора — английского и основных европейских языков, — показатель FLEURS информативнее, чем таблица лидеров, смещённая в сторону английского и перегруженная речью агентов.

Ещё два различия, которые важны с операционной точки зрения. MAI-Transcribe-2 предлагает настраиваемые стили транскрипции — дословный, сохраняющий нарушения плавности речи, и чистый, который их удаляет, — тогда как Grok Voice Transcribe 2.0 решает ту же проблему с помощью флага удаления слов-заполнителей. А модель Microsoft находится в публичной предварительной версии на Microsoft Foundry, что означает отсутствие SLA и постоянную рекомендацию не использовать её в продакшене до выхода в общий доступ; модель SpaceXAI общедоступна с опубликованными ограничениями скорости: 10 запросов в секунду и 100 одновременных потоковых сессий на команду.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs MAI Transcribe 2 — the scoreboard': the left column gives Grok Voice Transcribe 2.0 WebSocket streaming with 500ms interim results, 2.29% batch WER, 162x real time throughput, $1.67 per 1,000 minutes, included diarization and general availability; the right column gives MAI Transcribe 2 no announced streaming, 2.04%, 333x, a $1.67 launch offer, included diarization and public preview with no SLA.

Где Grok Voice Transcribe 2.0 действительно впереди

• Потоковая передача в реальном времени — эндпоинт WebSocket с промежуточными результатами примерно каждые 500 мс, в отличие от только пакетного режима без объявленного SKU в реальном времени

• Точность первого частичного транскрипта — 3,4% WER при 0,49 с в AA-WER Streaming, категории, в которой MAI-Transcribe-2 не участвует

• Пакетная точность на аудио с речью агентов — 2,29% в целом, но на подмножестве AA-AgentTalk нестриминговой таблицы порядок плотнее, чем подсказывает заголовок, а в насыщенной агентами смеси стриминговой таблицы Grok безоговорочно лидирует

• Инфраструктура голосового агента — определение конца реплики Smart Turn и удаление слов-заполнителей поставляются в составе модели, тогда как MAI-Transcribe-2 оставляет логику реплик вызывающей стороне

• Многоканальное аудио — до 8 независимых каналов, транскрибируемых за один проход, что важно для стереофонических или многозвенных записей звонков

• Уверенность на уровне слов — временные метки содержат оценку уверенности для каждого слова, поэтому фрагменты с низкой уверенностью можно помечать, а не доверять им в равной степени

• Условия доступности — общедоступно с опубликованными ограничениями на параллелизм, в отличие от общедоступной предварительной версии без SLA

• Устойчивость цены — $0,10 в час — это постоянная ставка как для пакетного режима, так и базовая для потокового тарифа за $0,20, где аналогичные $0,10 у Microsoft — это ограниченное по времени стартовое предложение без объявленной стандартной ставки на 2027 год

Последний пункт — это то, что пропускает большинство сравнений. Сегодня обе модели стоят одинаково, и у одной из этих цен есть срок истечения, а у другой — нет. Microsoft не опубликовала тариф после окончания промоакции, и в публикациях нет единого мнения о том, действует ли предложение до конца 2026 года или вообще не имеет заявленного срока окончания. Если вы рассчитываете трёхлетний бюджет на транскрипцию исходя из $1.67 за 1 000 минут от Microsoft, вы закладываете в расчёт число, по которому поставщик не давал обязательств.

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard, showing MAI-Transcribe-2 at 2.04% AA-WER and 333x real time, Grok Voice Transcribe 2.0 at 2.29% and 161.77x, Gemini 3.5 Transcribe at 2.60%, GPT Transcribe at 3.31% and Whisper Large v3 at 4.07%.

Совпадение реально, и оно составляет большую часть списка функций.

Отбросьте вопрос потоковой передачи — и два продукта сильно сближаются. Оба выполняют диаризацию говорящих. Оба возвращают временные метки на уровне слов. Оба выполняют обратную нормализацию текста — числа, даты, валюты и контактные данные представляются в письменной форме. Оба принимают отраслевую терминологию: Grok Voice Transcribe 2.0 — до 100 ключевых терминов на запрос, а MAI-Transcribe-2 — списки отраслевых терминов и сокращений. Оба автоматически определяют язык и отслеживают ситуацию, когда говорящий переключается на другой язык в середине записи. Оба обрабатывают телефонное аудио 8 кГц — случай, на котором большинство моделей транскрипции незаметно проваливаются и против которого SpaceXAI настраивала модель усерднее всего: показатель WER её внутреннего телефонного набора между версиями снизился с 10,6% до 7,1% — цифра, заявленная компанией на аудиоданных компании.

Оба также имеют входные ограничения, которые определяют архитектуру, а не только бюджет. Grok Voice Transcribe 2.0 принимает файлы размером до 500 МБ в 12 аудиоформатах с частотой дискретизации от 8 кГц до 48 кГц. Ограничения MAI-Transcribe-2 задаются не моделью, а путем через Foundry, и командам следует читать собственную документацию Microsoft, чтобы узнать текущий предел, а не предполагать паритет со специализированным сервисом STT.

Что означает эта сходимость: решение сводится к трём вопросам по порядку — нужно ли это в реальном времени, сколько языков у вас на самом деле и во сколько вам обходится разрыв в точности. Первый вопрос бинарный и сразу исключает один вариант. На второй обычно можно ответить по образцу собственного аудио. Третий настолько мал, что для большинства рабочих нагрузок на основе файлов он ничего не решит — разрыв в 0,25 пункта реален, но реален и тот факт, что обе модели находятся в пределах половины пункта от лучшего показателя, который кто-либо измерял.

Screenshot of the Microsoft learn.microsoft.com MAI-Transcribe-2 model page, showing the September 3 2026 launch, the 60-language list with automatic detection and code-switching, the 5.2% FLEURS word error rate, the configurable verbatim and clean transcription styles, and the public-preview availability on Microsoft Foundry.

Что с этим делать

Рассматривайте их как стек из двух параллельных потоков, а не как прямое противостояние. Контакт-центр, который использует поддержку операторов в реальном времени и ночной архив для целей комплаенса, не выбирает между Grok Voice Transcribe 2.0 и MAI-Transcribe-2 — он использует обе, и единственный вопрос — обходится ли это ему в отношения с двумя вендорами, два набора учетных данных, два счета и два лимита запросов. Ни одна из этих моделей сегодня не входит в каталог OrcaRouter, поэтому сами вызовы транскрипции идут в собственный API каждого вендора. А вот что покрывает один ключ OrcaRouter — так это все последующие этапы: суммаризатор, классификатор, агент, который рассуждает на основе транскрипта, и задачу оценки, которая сравнивает вывод двух вендоров на одной и той же записи. Именно последняя и есть причина, почему это важно — вы не можете выбрать между этими моделями по лидерборду, потому что лидерборд — это восемь часов английской речи операторов, а ваше аудио — нет.

Следите за двумя вещами. Во-первых, за тем, назначит ли Microsoft стандартную цену для MAI-Transcribe-2, когда закончится стартовое предложение; постоянная цена в $1,67 за 1000 минут сделала бы его выбором по умолчанию для пакетной обработки уже только по стоимости, а возврат к цене MAI-Transcribe-1 в $0,36 в час сделал бы этот разговор гораздо короче. Во-вторых, за тем, выпустит ли Microsoft потоковый SKU. В карточке модели уже указано создание субтитров в реальном времени как целевой сценарий, и единственное, что стоит между MAI-Transcribe-2 и потоковым направлением, — это эндпоинт — если это появится, эти два перестанут быть направлениями и станут конкурентами.