
MAI-Transcribe-2-Streaming 공개: Microsoft, 2.5% WER로 스트리밍 전사 왕좌 차지
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 221 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
MAI-Transcribe-2-Streaming은 Microsoft AI가 9월 릴리스에서 남긴 한 가지 질문에 대한 답이며, 28일 만에 그 답을 내놨다. 2026년 10월 1일 출시된 MAI-Transcribe-2-Streaming은 파일이 끝난 뒤가 아니라 단어가 들어오는 즉시 전사하는 실시간 음성-텍스트 모델이다. Microsoft는 Artificial Analysis의 AA-WER Streaming 평가에서 최종 및 부분 전사 모두 정확도 1위라고 말하며, 단어 오류율 2.5%에 발화 종료 후 0.13초 만에 최종 전사가 준비된다고 한다. 이는 트래커가 게시한 행이 아니라 트래커의 방법론에 대한 벤더의 주장이다 — 작성 시점 기준으로 해당 보드의 37개 모델에는 이 모델이 포함되어 있지 않으며, 이 모델이 대체하게 될 모델은 2.73%, 0.49초의 Grok Voice Transcribe 2.0 (Streaming)이다. 이 모델의 기반이 되는 MAI-Transcribe-2는 9월 3일 2.0% WER의 배치 모델로 출시되었으며 실시간 SKU는 없었다; 스트리밍 변형은 배치 버전을 주목받게 한 정확도를 크게 포기하지 않으면서 그 격차를 좁힌다. 대신 포기하는 것은 가격이다: 출시 당시 스트리밍은 배치 요금의 5.4배다.
마이크로소프트가 원하는 프레이밍은 스트리밍 리더보드의 완전 석권이다. 숫자가 뒷받침하는 프레이밍은 더 좁고 더 흥미롭다. 즉 정확도와 지연 시간 모두에서 앞선다고 주장하는 모델인데, 이 프런티어에서는 리더보드에서 가장 정확한 항목이 가장 빠른 항목들보다 결과를 확정하는 데 네 배 더 느리고, 그 빠른 항목 중 어느 것도 단어 오류율이 3% 미만이 아니며, 가격은 기존 제품보다 낮은 것이 아니라 기존 제품과 동등하다. 다음은 실제 있었던 출시 내용이며, 공급업체의 주장에는 표시를 달았다.
10월 1일에 Microsoft가 출시한 것
MAI-Transcribe-2-Streaming은 Azure AI Speech 서비스 내 Microsoft의 음성 스택을 통해 제공되며, 문서는 모델 자체 이름 아래에 있고, 배치 릴리스와 동일한 API 전용·가중치 비공개 배포 모델을 따릅니다. 이 모델은 자동 연속 언어 감지로 60개 언어를 전사하므로, 스트리밍 중간에 언어가 바뀌는 세션을 미리 선언할 필요가 없습니다. Microsoft는 이를 Artificial Analysis의 스트리밍 차트에서 정확도 대 지연 시간 파레토 프런티어에 위치시킵니다. 이는 공급업체가 추적기 데이터를 자체적으로 해석한 것이며, 추적기 자체 차트가 뒷받침하는 해석이기도 합니다.
스트리밍 모델이 이번 릴리스의 전부는 아니었습니다. Microsoft는 이와 함께 두 가지 음성 모델을 출시했습니다. 26개 로캘에 걸쳐 23개 언어를 지원하는 MAI-Voice-2.1과 약 150ms의 지연 시간으로 최대 45초 분량의 오디오를 처리하는 MAI-Voice-2.1-Flash입니다. 한 묶음으로 보면, 10월 1일 공개는 단일 모델 출시라기보다 듣고, 이해하고, 말하는 완전한 실시간 대화형 스택입니다.

스트리밍 리더보드 읽기
AA-WER Streaming은 모델별로 두 가지를 측정한다: 완성된 트랜스크립트가 얼마나 틀렸는지, 그리고 발화자가 멈춘 뒤 완성되기까지 얼마나 걸리는지. Microsoft의 주장은 MAI-Transcribe-2-Streaming이 두 가지 모두에서 앞선다는 것이다: 발화 종료 후 0.13초에 최종 트랜스크립트에서 2.5% 단어 오류율, 그리고 0.12초에 첫 부분 트랜스크립트에서도 동일한 2.5%인데, Microsoft는 이것이 두 가지 모두에서 정확도 1위라고 말한다. 이것은 벤더 수치로 읽어야 한다 — 작성 시점 기준으로, 트래커 자체의 스트리밍 보드에는 아직 이 모델이 플롯되지 않았으므로, 읽을 수 있는 독립적인 MAI-Transcribe-2-Streaming 행은 없다. 보드가 실제로 보여주는 것은 이 모델이 이기려고 주장하는 경쟁 구도이며, 그 구도는 "왕관"이라는 프레이밍이 시사하는 것보다 더 팽팽하다:
• Grok Voice Transcribe 2.0 — Artificial Analysis에 따르면 발화 종료 후 0.49초에 최종 전사 WER 2.73%를 기록했고, 현재 리더보드에서 1위입니다. 이는 Microsoft가 주장한 2.5%보다 0.23포인트 뒤처지며, 확정되기까지는 약 4배 더 느립니다 — 따라가는 자막과 뒤처지는 자막의 차이입니다.
• Muse Voice Transcribe — Artificial Analysis 기준, 0.16초에 3.06%. 지연 시간에서 가장 근접한 경쟁사: 약 30밀리초 뒤처지고, 정확도는 Microsoft의 주장보다 0.5포인트 낮다.
• ElevenLabs Scribe v2 Realtime — Artificial Analysis에 따르면 0.14초에 3.59%. 속도는 사실상 동률이지만 정확도는 1%포인트 이상 뒤처집니다.
• Gemini 3.5 Transcribe Live — 0.40초에서 4.00% 스트리밍 WER, Artificial Analysis가 발표하고 Google이 자체 Live API 모델에 대해 인용하는 수치입니다. 이는 1.5포인트 차이이며, 이번 릴리스가 겨냥하는 비교 대상입니다.
첫 부분 전사 열은 해당 주장이 보드의 나머지와 가장 동떨어져 있는 곳입니다. 같은 트래커에서 Grok Voice Transcribe 2.0의 첫 부분 전사들은 3.36%에, Gemini 3.5 Transcribe Live의 첫 부분 전사들은 5.77%에 있습니다 — 부분 전사는 최종 전사보다 더 나쁜 것이 보통이며, 흔히 1%포인트 이상 차이가 납니다. 왜냐하면 모델이 문장이 끝나기 전에 확정하기 때문입니다. 최종 수치와 일치하는 첫 부분 전사는 마이크로소프트의 출시에서 진정으로 이례적인 부분이며, 트래커 자체 데이터가 아직 확인할 수 없는 부분입니다. 행이 존재할 때까지는 이를 주장으로 인용하십시오.
솔직한 유의점은 0.13초와 0.16초가 자막을 읽는 사람에게는 같은 제품 경험이라는 것이고, 현재 순위표에서 앞서는 2.73%에 맞선 2.5%는 1,000단어당 약 2개의 오류에 해당한다는 점이다. 그 정도 격차는 실재하지만 작으며, 그것이 누구나 체감할 수 있는 격차인지는 작업량에 달려 있다. 정말로 문제가 되는 곳은 꼬리다. 하루 8시간 돌아가는 콘택트센터 스트림에서 2.73% 대 2.5%는 연간 수만 개의 추가 오류 단어를 뜻하며, 녹취록의 단어 오류는 고르게 분포하지 않는다. 그것들은 바로 녹취록을 유용하게 만드는 고유명사와 숫자에 몰린다.

$9.00로 1,000분에 살 수 있는 것
스트리밍은 배치보다 비용이 더 많이 들며, Microsoft는 이를 실시간 티어의 아래가 아니라 최상단에 책정했습니다. MAI-Transcribe-2-Streaming은 오디오 1시간당 $0.54로 책정되어 있으며, 이는 스트리밍 오디오 1,000분당 $9.00에 해당하고, 연말까지 유효한 도입 요금이라고 설명됩니다. 비교하자면 배치용 MAI-Transcribe-2는 오디오 1시간당 $0.10 — 1,000분당 $1.67 — 이므로, 실시간 전사는 동일한 기반 제품군에 대해 파일 기반 요금의 약 5.4배이고 단어 오류율은 0.5포인트 더 높습니다. 이는 Microsoft가 숨기고 있는 가격 인상이 아닙니다. 이는 지속적인 연결과 문장이 끝나기 전에 정확해야 하는 부분 전사에 대한 정직한 가격입니다.
스트리밍 티어의 나머지와 비교하면 그림은 엇갈린다. MAI-Transcribe-2-Streaming은 1,000분당 약 $9로 Gemini 3.5 Transcribe Live와 동률을 이루는데, 더 정확하면서 같은 가격이다. 1,000분당 약 $6.50의 ElevenLabs Scribe v2 Realtime과 Deepgram Flux보다 높고, 약 $4의 Cartesia Ink-2보다도 높으며, 약 $3의 Muse Voice Transcribe보다는 대략 세 배 높다. 따라서 이번 출시는 동일 가격에서 정확도와 지연 시간을 앞세운 전략이지 가격 경쟁이 아니다. 이미 더 저렴한 스트리밍 모델을 운영하는 팀들은 달러를 WER 포인트와 맞바꾸게 될 것이다.
그 트레이드오프는 정확히 이름 붙일 가치가 있다. 왜냐하면 그것은 배치 출시가 뒤집어 놓은 바로 그 트레이드오프이기 때문이다. 9월에 Microsoft는 정확성을 저렴하게 만들었다. 10월에는 실시간 정확성의 비용을 다른 모든 이들과 같게 만들었다. 파이프라인이 결국 트랜스크립트만 필요로 한다면, 10월 1일이 당신의 청구서를 바꾸는 일은 없다. 통화가 아직 진행 중일 때 트랜스크립트가 필요하다면, 셈법은 방금 품질로 옮겨갔다.

트랜스크립트 위에 구축하는 것은 그 결정의 나머지 절반이며, 바로 이 지점에서 멀티모델 계층이 진가를 발휘합니다. 실시간 트랜스크립트는 파이프라인의 끝인 경우가 드뭅니다. 그것은 요약되고, 점수화되고, 검색되고, 라우팅되고, 에스컬레이션되며, 이러한 단계들은 서로 다른 비용의 서로 다른 모델을 필요로 합니다. OrcaRouter는 바로 그 계층을 위해 존재합니다. 200개 이상의 모델을 아우르는 단일 API, 제공업체 정가를 0% 마크업으로 그대로 전달, 자동 장애 조치, 그리고 두 번째 통합 없이 라이브 트랜스크립트를 규정 준수 심사를 위해 한 모델로, 회의록을 위해 다른 모델로 보낼 수 있는 라우팅 DSL을 제공합니다. MAI-Transcribe-2-Streaming 자체는 그 명단에 없습니다. 이는 Microsoft 자체 음성 스택을 통해 제공됩니다. 하지만 그것이 생성하는 스트리밍 트랜스크립트는 바로 그 위 계층을 모델에 구애받지 않게 유지해야 한다는 주장을 뒷받침하는, 대용량·지연 민감형 입력의 전형입니다.
아직 증명되지 않은 것
세 가지는 진정으로 미해결로 남아 있다. 첫째, 화자 분리: 배치 모델은 공개된 화자 분리 오류율 없이 화자 귀속을 묶어 제공하며, Microsoft의 스트리밍 자료는 화자 분리 주장을 전혀 하지 않는다 — 실시간 모델이 라이브 상담원 지원이나 자막에 공급되는 경우, 누가 무엇을 말했는지는 원시 WER보다 더 중요한 기능인 경우가 많다. 둘째, 다국어 세부 분석: 자동 연속 언어 감지를 지원하는 60개 언어는 광범위한 주장이며, 스트리밍 모델의 언어별 지연은 배치 모델보다 훨씬 더 크게 달라질 수 있는데, 부분 전사 품질이 모델이 얼마나 빨리 언어를 확정하는지에 달려 있기 때문이다. Microsoft는 언어별 스트리밍 표를 공개하지 않았다. 셋째, 스트리밍 WER은 깨끗한 벤치마크 오디오에서 측정된다. 실제 배포에 피해를 주는 실패 모드는 잡음이 많은 원거리 스트림이며, 출시 당일에는 독립적인 원거리 스트리밍 비교가 존재하지 않았다.
그것이 당신의 스택을 벗어나는 지점
이번 출시에서 흥미로운 점은 Microsoft가 가장 정확한 스트리밍 전사를 제공한다는 것이 아니다. 그것은 흐름이다: 9월의 배치, 10월의 스트리밍, 같은 제품군에서, 같은 문서 표면에서, 그리고 이제 동일한 기반 기능에 대해 1,000분당 $1.67에서 $9.00에 이르는 가격 구조와 함께. 이는 팀들에게 처음으로 진정한 선택권을 준다 — 실시간이 중요한 곳에서만 실시간에 비용을 지불하고, 나머지는 모두 배치로 처리하는 것 — 하지만 이는 또한 전사 계층이 이제 한 번 표준화하는 대상이 아니라 워크로드별로 조정하는 대상이 되었음을 의미한다.
헤드라인 주장을 문자 그대로 읽으면, 그것은 벤더 진술로서는 성립합니다: Microsoft는 MAI-Transcribe-2-Streaming이 최종 전사와 first-partial 정확도 모두에서 1위이며, 파레토 프런티어에 위치한다고 말합니다. 별표가 붙는 지점은 다음과 같습니다. 해당 트래커의 보드에는 아직 이 모델이 플롯되지 않았고, 현재 선두 모델에 대해 주장하는 우위는 재실행하면 사라질 만큼 작으며, 가격 우위는 0이고, 화자 분리(diarization) 이야기는 아직 나오지 않았습니다. 지켜봐야 할 것은 그것들이지, 왕관이 아닙니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
