
MAI-Transcribe-2-Streaming запущен: Microsoft забирает корону потоковой транскрипции с WER 2,5%
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 221 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
MAI-Transcribe-2-Streaming — это ответ Microsoft AI на единственный вопрос, который остался открытым после ее сентябрьского релиза, и она ответила на него за 28 дней. Выпущенная 1 октября 2026 года, MAI-Transcribe-2-Streaming представляет собой модель распознавания речи в реальном времени, которая транскрибирует по мере поступления слов, а не после завершения файла. Microsoft заявляет, что она занимает первое место по точности как для окончательных, так и для частичных транскриптов в оценке AA-WER Streaming от Artificial Analysis, с частотой ошибок в словах 2,5%, при этом окончательный транскрипт готов через 0,13 секунды после окончания речи. Это заявление производителя, основанное на методологии трекера, а не на строке, которую публикует трекер, — на момент составления документа 37 моделей в таблице не включают ее, а модель, которую она могла бы сместить, — это Grok Voice Transcribe 2.0 (Streaming) с показателями 2,73% и 0,49 секунды. Модель, на которой она основана, MAI-Transcribe-2, была выпущена 3 сентября как пакетная модель с WER 2,0% и без SKU для работы в реальном времени; потоковый вариант закрывает этот пробел, почти не жертвуя точностью, которая сделала пакетную версию примечательной. А чем она жертвует, так это ценой: на момент запуска потоковая версия стоит в 5,4 раза дороже пакетной.
Трактовка, которую хочет Microsoft, — это полная победа в таблице лидеров стриминговых моделей. Трактовка, которую поддерживают цифры, уже и интереснее: модель заявляет о лидерстве одновременно по точности и задержке — на фронтире, где самая точная модель в таблице стабилизируется вчетверо медленнее, чем самые быстрые, и ни одна из этих быстрых не показывает менее 3% ошибок в словах, а цена — на уровне действующего игрока, а не ниже. Вот как прошел запуск — заявления вендора помечены.
Что Microsoft выпустила 1 октября
MAI-Transcribe-2-Streaming предоставляется через речевой стек Microsoft в сервисе Azure AI Speech; документация доступна под собственным именем модели, а распространяется она по той же модели, что и пакетный выпуск: только через API, без весов. Она транскрибирует 60 языков с автоматическим непрерывным определением языка, поэтому сеанс, в котором язык переключается в середине потока, не нужно объявлять заранее. Microsoft позиционирует её на границе Парето по соотношению точности и задержки на графике потоковой передачи Artificial Analysis — это собственная трактовка вендором данных трекера, и именно её подтверждает собственный график трекера.
Потоковая модель была не всем релизом. Вместе с ней Microsoft выпустила две голосовые модели: MAI-Voice-2.1, поддерживающую 23 языка в 26 локалях, и MAI-Voice-2.1-Flash, которая обрабатывает до 45 секунд аудио при задержке примерно 150 мс. Если рассматривать их как набор, релиз от 1 октября — это полноценный стек для общения в реальном времени — слышать, понимать, говорить, — а не запуск одной модели.

Чтение таблицы лидеров стриминга
AA-WER Streaming измеряет для каждой модели две вещи: насколько ошибочен готовый транскрипт и сколько времени после того, как говорящий замолкает, требуется, чтобы завершить работу. Утверждение Microsoft состоит в том, что MAI-Transcribe-2-Streaming лидирует по обоим показателям: частота ошибок в словах 2,5% в итоговом транскрипте через 0,13 секунды после окончания речи и те же 2,5% в первом частичном транскрипте через 0,12 секунды, что, по словам Microsoft, делает её первой по точности сразу по обоим. Воспринимайте это как показатель от производителя — на момент написания черновика на собственной стриминговой доске трекера модель ещё не была отображена, поэтому нет независимой строки MAI-Transcribe-2-Streaming, которую можно было бы увидеть. А вот что доска действительно показывает — так это конкурентное поле, которое, как утверждается, она превосходит, и это поле теснее, чем предполагает формулировка про «корону»:
• Grok Voice Transcribe 2.0 — WER финальной расшифровки 2,73% через 0,49 секунды после окончания речи, по данным Artificial Analysis, и текущий лидер в рейтинге. Это на 0,23 пункта отстаёт от заявленных Microsoft 2,5% и примерно в четыре раза медленнее финализируется — разница между субтитром, который поспевает, и тем, который отстаёт.
• Muse Voice Transcribe — 3,06 % при 0,16 секунды, по данным Artificial Analysis. Ближайший конкурент по задержке: отстаёт примерно на 30 миллисекунд и на 0,5 пункта уступает по точности заявленному Microsoft показателю.
• ElevenLabs Scribe v2 Realtime — 3,59 % за 0,14 секунды по данным Artificial Analysis. По скорости практически наравне, по точности отстаёт более чем на пункт.
• Gemini 3.5 Transcribe Live — 4,00% потокового WER при 0,40 секунды — показатель, опубликованный Artificial Analysis и приводимый Google для собственной модели Live API. Это разрыв в 1,5 пункта, и именно на это сравнение нацелен данный релиз.
Колонка первых частичных результатов — это место, где утверждение меньше всего похоже на остальную таблицу. В том же трекере первые частичные результаты Grok Voice Transcribe 2.0 держатся на уровне 3,36%, а Gemini 3.5 Transcribe Live — на уровне 5,77%: частичные результаты должны быть хуже финальной расшифровки, часто на один процентный пункт или больше, потому что модель фиксирует результат до окончания предложения. Первый частичный результат, совпадающий с финальным числом, — это по-настоящему необычная часть запуска Microsoft, и именно её собственные данные трекера пока не могут подтвердить. Приводите это как утверждение, пока не появится строка.
Честная оговорка состоит в том, что 0,13 секунды и 0,16 секунды — это одинаковый пользовательский опыт для человека, читающего субтитры, а 2,5% против 2,73%, которые сейчас лидируют в таблице, — это примерно 2 ошибки на 1000 слов. Преимущество такого размера реально, но невелико, и ощутимо ли его кто-либо — зависит от нагрузки. А вот где это действительно кусает — так это в хвосте: поток контакт-центра, работающий восемь часов в день при 2,73% против 2,5%, — это десятки тысяч лишних неверных слов в год, а ошибки в словах транскрипта распределены неравномерно — они скапливаются ровно на тех именах собственных и числах, которые делают транскрипт полезным.

Что можно купить за $9.00 за 1 000 минут
Потоковая транскрибация стоит дороже пакетной, и Microsoft установила цену на верхней границе тарифа реального времени, а не ниже. MAI-Transcribe-2-Streaming указан по цене $0.54 за аудиочас, что составляет $9.00 за 1000 минут потокового аудио, и описывается как вводный тариф, действующий до конца года. Для сравнения, пакетная MAI-Transcribe-2 стоит $0.10 за аудиочас — $1.67 за 1000 минут — так что транскрибация в реальном времени стоит примерно в 5.4 раза дороже тарифа для файлов для того же базового семейства и на 0.5 пункта выше уровень ошибок в словах. Это не наценка, которую Microsoft скрывает; это честная цена за постоянное соединение и частичную расшифровку, которая должна быть правильной до того, как предложение закончится.
На фоне остальных представителей сегмента стриминговых моделей картина неоднозначная. MAI-Transcribe-2-Streaming идёт вровень с Gemini 3.5 Transcribe Live при примерно $9 за 1 000 минут — точнее, за те же деньги. Она располагается выше ElevenLabs Scribe v2 Realtime и Deepgram Flux с примерно $6,50 за 1 000 минут, выше Cartesia Ink-2 с примерно $4 и примерно втрое дороже Muse Voice Transcribe с примерно $3. Так что запуск — это ставка на точность и задержку при сопоставимых ценах, а не ценовая война; команды, уже использующие более дешёвую стриминговую модель, будут обменивать доллары на пункты WER.
Этот компромисс стоит назвать точно, потому что это тот же компромисс, который перевернул запуск пакетного режима. В сентябре Microsoft сделала точность дешёвой. В октябре она сделала так, что точность в реальном времени стала стоить столько же, сколько у всех остальных. Если вашему конвейеру транскрипты нужны только в конечном счёте, то для вашего счёта 1 октября ничего не меняет. Если они нужны ему, пока звонок ещё идёт, то калькуляция только что сместилась в сторону качества.

Надстройка над транскриптом — это вторая половина того решения, и именно здесь многомодельный слой оправдывает своё существование. Транскрипт в реальном времени редко оказывается концом конвейера — его суммируют, оценивают, ищут по нему, маршрутизируют и эскалируют, и для этих шагов нужны разные модели с разной стоимостью. OrcaRouter существует именно для этого слоя: единый API к более чем 200 моделям, списочные цены провайдеров с наценкой 0%, автоматическое переключение при сбое и DSL маршрутизации, который может отправить живой транскрипт одной модели для проверки на соответствие требованиям, а другой — для заметок о встрече, без второй интеграции. Сам MAI-Transcribe-2-Streaming не входит в этот список — он обслуживается через собственный речевой стек Microsoft — но потоковый транскрипт, который он создаёт, — это именно тот тип высокообъёмного, чувствительного к задержкам ввода, который говорит в пользу того, чтобы слой над ним не зависел от модели.
Что ещё не доказано
Три вопроса действительно остаются открытыми. Во-первых, диаризация: пакетная модель включает атрибуцию говорящих без опубликованной частоты ошибок диаризации, а материалы Microsoft по потоковой обработке вообще не содержат заявлений о диаризации — для модели реального времени, питающей живую поддержку агентов или субтитры, кто что сказал часто важнее, чем сам WER. Во-вторых, разбивка по языкам: 60 языков с автоматическим непрерывным определением языка — это широкое утверждение, а задержка потоковой модели по каждому языку может варьироваться гораздо сильнее, чем у пакетного аналога, потому что качество частичной расшифровки зависит от того, насколько быстро модель фиксируется на языке. Microsoft не опубликовала таблицу потоковых показателей по языкам. В-третьих, WER в потоковом режиме измеряется на чистом эталонном аудио; режим отказа, который вредит реальным внедрениям, — это зашумлённый поток из дальнего поля, а в день запуска независимого сравнения потоковых моделей в дальнем поле не существовало.
В каком состоянии это оставляет ваш стек
Интересное в этом запуске не то, что у Microsoft самая точная потоковая расшифровка. А ритм: пакетная обработка в сентябре, потоковая — в октябре, в одном семействе, в одной и той же документации, со структурой цен, которая теперь охватывает диапазон от $1,67 до $9,00 за 1 000 минут для одной и той же базовой возможности. Это впервые даёт командам реальный выбор — платить за режим реального времени только там, где он действительно важен, а всё остальное обрабатывать пакетно, — но это также означает, что слой расшифровки теперь приходится настраивать под каждую рабочую нагрузку, а не стандартизировать один раз.
Прочитайте главное утверждение буквально — и оно сойдёт за заявление вендора: Microsoft говорит, что MAI-Transcribe-2-Streaming первый как по точности финальной транскрипции, так и по точности первого частичного результата, и что он находится на границе Парето. Но есть оговорки: на доске трекера модель ещё не отмечена, преимущество, которое она заявляет над текущим лидером, настолько мало, что может исчезнуть при повторном прогоне, ценовое преимущество равно нулю, а история с диаризацией ещё не рассказана. Вот за чем стоит следить, а не за короной.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
