
Grok Voice Transcribe 2.0 vs MAI Transcribe 2: две дорожки, а не два соперника
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Эти две модели были выпущены с разницей в пятнадцать дней и имели цену, совпадающую до цента, и они почти никогда не окажутся в одном и том же решении о закупке. Grok Voice Transcribe 2.0, выпущенная SpaceXAI 18 сентября 2026 года, — это модель, к которой вы обращаетесь, когда аудио всё ещё поступает: она передаёт поток через WebSocket, выдаёт промежуточные результаты примерно каждые 500 мс и возглавляет рейтинг AA-WER Streaming от Artificial Analysis с частотой ошибок в словах 2,7% для финальных расшифровок и 3,4% для первых частичных результатов. MAI-Transcribe-2, выпущенная Microsoft AI 3 сентября 2026 года, — это модель, к которой вы обращаетесь, когда аудио уже является файлом: она работает только в пакетном режиме, и в непоточной таблице Artificial Analysis это самая точная управляемая модель с измеренным AA-WER 2,04%, опережая Grok Voice Transcribe 2.0 с 2,29% и примерно в 2 раза превосходя её по пропускной способности. Обе указаны по цене $0,10 за час аудио, около $1,67 за 1000 минут. Если ваше требование — работа в реальном времени, сравнивать нечего. Если ваше требование — файл, то сравнение есть.
Черта, которую за вас не проведёт ни один из вендоров.
Поддержка потоковой передачи — это не переключатель функции. Grok Voice Transcribe 2.0 обслуживает одну и ту же модель через REST для записанных файлов и через `wss://api.x.ai/v1/stt` для живого аудио, так что точность, которую вы измеряете на своём архиве, — это точность, которую вы получаете на живом звонке. У MAI-Transcribe-2 нет потокового SKU вообще: в материалах запуска Microsoft позиционирует её явно для длинных и пакетных аудиозаписей, и хотя в карточке модели среди сценариев применения указаны субтитры в реальном времени, путь к этому — сегментирование аудио и подача каждого сегмента через пакетный API, а это конвейер, который вы строите и обслуживаете сами, а не гарантия задержки, которую вы покупаете. Заявленная Microsoft пропускная способность примерно 411× от реального времени — это показатель скорости обработки, а не времени отклика, и эти два понятия постоянно путают в освещении данного релиза.
Практическое следствие: если вы создаёте голосовых агентов с передачей реплик, субтитры в реальном времени или что-либо, где человек или модель реагирует на речь по мере её поступления, MAI-Transcribe-2 не является кандидатом, как бы хороша ни была его точность. Если вы расшифровываете встречи постфактум, записи контакт-центра за ночь, медиаархивы или очереди на соответствие требованиям, стриминг — мёртвый груз, и всё решают показатели пакетной обработки.
Где MAI-Transcribe-2 действительно впереди
Сначала — точность на файлах. Разрыв между 2,04% и 2,29% измерен на одном и том же независимом стенде — AA-WER v2 от Artificial Analysis, на 50% из AA-AgentTalk и по 25% из VoxPopuli и Earnings22 — что делает его самым бесспорным фактом в этом сравнении. Это разница в 0,25 пункта — примерно на две с половиной ошибки меньше на тысячу слов. Имеет ли это значение, зависит от того, что вы делаете с расшифровкой; для архива с поиском — нет, а для юридической или медицинской записи — возможно.
Пропускная способность — и это во-вторых, причём с отрывом, превышающим разрыв в точности: 333× реального времени против 162× у Grok Voice Transcribe 2.0. Обе цифры — это измерения Artificial Analysis: сколько секунд входного аудио транскрибируется за секунду, а не заявления вендоров. При такой скорости архив на тысячу часов обрабатывается примерно за три часа вычислений на модели Microsoft и примерно за шесть — на модели SpaceXAI. Для разовой миграции это не имеет значения; для конвейера, который принимает данные непрерывно, сокращение времени обработки вдвое — это реальная разница в пропускной способности.
Что касается языкового покрытия — третье. Microsoft заявляет 60 языков с автоматическим определением, переключением языков внутри одной записи и средней частотой ошибок в словах 5,2 % по ним на FLEURS — это число, сообщённое поставщиком, а не независимо воспроизведённое, но по крайней мере оно описывает многоязычный случай по заявленному списку языков. SpaceXAI документирует десятки языков с переключением в середине записи и форматированием письменной формы по 25 из них. Если ваше аудио выходит за пределы хорошо покрытого набора — английского и основных европейских языков, — показатель FLEURS информативнее, чем таблица лидеров, смещённая в сторону английского и перегруженная речью агентов.
Ещё два различия, которые важны с операционной точки зрения. MAI-Transcribe-2 предлагает настраиваемые стили транскрипции — дословный, сохраняющий нарушения плавности речи, и чистый, который их удаляет, — тогда как Grok Voice Transcribe 2.0 решает ту же проблему с помощью флага удаления слов-заполнителей. А модель Microsoft находится в публичной предварительной версии на Microsoft Foundry, что означает отсутствие SLA и постоянную рекомендацию не использовать её в продакшене до выхода в общий доступ; модель SpaceXAI общедоступна с опубликованными ограничениями скорости: 10 запросов в секунду и 100 одновременных потоковых сессий на команду.

Где Grok Voice Transcribe 2.0 действительно впереди
• Потоковая передача в реальном времени — эндпоинт WebSocket с промежуточными результатами примерно каждые 500 мс, в отличие от только пакетного режима без объявленного SKU в реальном времени
• Точность первого частичного транскрипта — 3,4% WER при 0,49 с в AA-WER Streaming, категории, в которой MAI-Transcribe-2 не участвует
• Пакетная точность на аудио с речью агентов — 2,29% в целом, но на подмножестве AA-AgentTalk нестриминговой таблицы порядок плотнее, чем подсказывает заголовок, а в насыщенной агентами смеси стриминговой таблицы Grok безоговорочно лидирует
• Инфраструктура голосового агента — определение конца реплики Smart Turn и удаление слов-заполнителей поставляются в составе модели, тогда как MAI-Transcribe-2 оставляет логику реплик вызывающей стороне
• Многоканальное аудио — до 8 независимых каналов, транскрибируемых за один проход, что важно для стереофонических или многозвенных записей звонков
• Уверенность на уровне слов — временные метки содержат оценку уверенности для каждого слова, поэтому фрагменты с низкой уверенностью можно помечать, а не доверять им в равной степени
• Условия доступности — общедоступно с опубликованными ограничениями на параллелизм, в отличие от общедоступной предварительной версии без SLA
• Устойчивость цены — $0,10 в час — это постоянная ставка как для пакетного режима, так и базовая для потокового тарифа за $0,20, где аналогичные $0,10 у Microsoft — это ограниченное по времени стартовое предложение без объявленной стандартной ставки на 2027 год
Последний пункт — это то, что пропускает большинство сравнений. Сегодня обе модели стоят одинаково, и у одной из этих цен есть срок истечения, а у другой — нет. Microsoft не опубликовала тариф после окончания промоакции, и в публикациях нет единого мнения о том, действует ли предложение до конца 2026 года или вообще не имеет заявленного срока окончания. Если вы рассчитываете трёхлетний бюджет на транскрипцию исходя из $1.67 за 1 000 минут от Microsoft, вы закладываете в расчёт число, по которому поставщик не давал обязательств.

Совпадение реально, и оно составляет большую часть списка функций.
Отбросьте вопрос потоковой передачи — и два продукта сильно сближаются. Оба выполняют диаризацию говорящих. Оба возвращают временные метки на уровне слов. Оба выполняют обратную нормализацию текста — числа, даты, валюты и контактные данные представляются в письменной форме. Оба принимают отраслевую терминологию: Grok Voice Transcribe 2.0 — до 100 ключевых терминов на запрос, а MAI-Transcribe-2 — списки отраслевых терминов и сокращений. Оба автоматически определяют язык и отслеживают ситуацию, когда говорящий переключается на другой язык в середине записи. Оба обрабатывают телефонное аудио 8 кГц — случай, на котором большинство моделей транскрипции незаметно проваливаются и против которого SpaceXAI настраивала модель усерднее всего: показатель WER её внутреннего телефонного набора между версиями снизился с 10,6% до 7,1% — цифра, заявленная компанией на аудиоданных компании.
Оба также имеют входные ограничения, которые определяют архитектуру, а не только бюджет. Grok Voice Transcribe 2.0 принимает файлы размером до 500 МБ в 12 аудиоформатах с частотой дискретизации от 8 кГц до 48 кГц. Ограничения MAI-Transcribe-2 задаются не моделью, а путем через Foundry, и командам следует читать собственную документацию Microsoft, чтобы узнать текущий предел, а не предполагать паритет со специализированным сервисом STT.
Что означает эта сходимость: решение сводится к трём вопросам по порядку — нужно ли это в реальном времени, сколько языков у вас на самом деле и во сколько вам обходится разрыв в точности. Первый вопрос бинарный и сразу исключает один вариант. На второй обычно можно ответить по образцу собственного аудио. Третий настолько мал, что для большинства рабочих нагрузок на основе файлов он ничего не решит — разрыв в 0,25 пункта реален, но реален и тот факт, что обе модели находятся в пределах половины пункта от лучшего показателя, который кто-либо измерял.

Что с этим делать
Рассматривайте их как стек из двух параллельных потоков, а не как прямое противостояние. Контакт-центр, который использует поддержку операторов в реальном времени и ночной архив для целей комплаенса, не выбирает между Grok Voice Transcribe 2.0 и MAI-Transcribe-2 — он использует обе, и единственный вопрос — обходится ли это ему в отношения с двумя вендорами, два набора учетных данных, два счета и два лимита запросов. Ни одна из этих моделей сегодня не входит в каталог OrcaRouter, поэтому сами вызовы транскрипции идут в собственный API каждого вендора. А вот что покрывает один ключ OrcaRouter — так это все последующие этапы: суммаризатор, классификатор, агент, который рассуждает на основе транскрипта, и задачу оценки, которая сравнивает вывод двух вендоров на одной и той же записи. Именно последняя и есть причина, почему это важно — вы не можете выбрать между этими моделями по лидерборду, потому что лидерборд — это восемь часов английской речи операторов, а ваше аудио — нет.
Следите за двумя вещами. Во-первых, за тем, назначит ли Microsoft стандартную цену для MAI-Transcribe-2, когда закончится стартовое предложение; постоянная цена в $1,67 за 1000 минут сделала бы его выбором по умолчанию для пакетной обработки уже только по стоимости, а возврат к цене MAI-Transcribe-1 в $0,36 в час сделал бы этот разговор гораздо короче. Во-вторых, за тем, выпустит ли Microsoft потоковый SKU. В карточке модели уже указано создание субтитров в реальном времени как целевой сценарий, и единственное, что стоит между MAI-Transcribe-2 и потоковым направлением, — это эндпоинт — если это появится, эти два перестанут быть направлениями и станут конкурентами.
