'Grok Voice Transcribe 2.0 vs MAI Transcribe 2'라는 문구가 적힌 아티클 히어로 카드로, 'MODEL COMPARISON' 배지와 '두 개의 갈래, 두 라이벌이 아니다'라는 부제가 있으며, 3.4% vs 스트리밍 SKU 없음, 2.29% vs 2.04% 배치 WER, 162x vs 333x 실시간, 각각 1,000분당 $1.67을 나타내는 칩이 있고, 흰색에서 파란색으로 이어지는 그라데이션 위 오른쪽 아래에 OrcaRouter 로고가 있다.
Guides & Insights

Grok Voice Transcribe 2.0 vs MAI Transcribe 2: 두 개의 차선, 두 경쟁자가 아니다

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 두 모델은 15일 간격으로 출시되었고 가격은 센트 단위까지 동일했지만, 같은 조달 결정에서 함께 검토되는 일은 거의 없을 것입니다. 2026년 9월 18일 SpaceXAI가 출시한 Grok Voice Transcribe 2.0은 오디오가 아직 들어오고 있을 때 호출하는 모델입니다. WebSocket을 통해 스트리밍하고 약 500ms마다 중간 결과를 내보내며, Artificial Analysis의 AA-WER 스트리밍 리더보드에서 최종 전사 기준 2.7%, 첫 부분 전사 기준 3.4%의 단어 오류율로 1위를 차지합니다. 2026년 9월 3일 Microsoft AI가 출시한 MAI-Transcribe-2는 오디오가 이미 파일일 때 호출하는 모델입니다. 배치 전용이며, Artificial Analysis의 비스트리밍 리더보드에서 2.04% AA-WER로 측정된 관리형 모델 중 가장 정확하고, Grok Voice Transcribe 2.0의 2.29%보다 앞서며 처리량은 약 2배 빠릅니다. 두 모델 모두 오디오 1시간당 $0.10, 1,000분당 약 $1.67의 정가로 책정되어 있습니다. 요구사항이 실시간이라면 비교할 것이 없습니다. 요구사항이 파일이라면 비교할 것이 있습니다.

어느 벤더도 당신을 위해 그 선을 그어주지 않을 것이다

스트리밍 지원은 기능 토글이 아닙니다. Grok Voice Transcribe 2.0은 동일한 모델을 녹음 파일에는 REST를 통해, `wss://api.x.ai/v1/stt`를 통해서는 라이브 오디오에 제공하므로, 아카이브에서 측정한 정확도가 라이브 통화에서 얻는 정확도입니다. MAI-Transcribe-2에는 스트리밍 SKU가 전혀 없습니다: Microsoft의 출시 자료는 이를 장편 및 배치 오디오용으로 명시적으로 포지셔닝하며, 모델 카드가 애플리케이션 시나리오 중 실시간 캡셔닝을 나열하기는 하지만, 그 경로는 오디오를 분할하고 각 세그먼트를 배치 API로 공급하는 것입니다 — 이는 여러분이 구축하고 운영하는 파이프라인이지, 구매하는 지연 시간 보장이 아닙니다. 약 411× 실시간이라는 Microsoft의 대표 처리량은 처리 속도 수치이지 응답 시간 수치가 아니며, 이 릴리스에 대한 보도에서 둘은 끊임없이 혼동됩니다.

실질적인 결과: 턴테이킹 음성 에이전트, 실시간 자막, 또는 진행 중인 발화에 사람이나 모델이 반응하는 무엇이든 만들고 있다면, MAI-Transcribe-2는 정확도가 아무리 뛰어나도 후보가 아니다. 사후에 회의를 전사하거나, 콜센터 녹음을 밤새 전사하거나, 미디어 아카이브나 규정 준수 백로그를 처리한다면, 스트리밍은 군더더기이고 배치 수치가 전부다.

MAI-Transcribe-2가 진정으로 앞서 있는 부분

우선 파일 정확도다. 2.04% 대 2.29% 격차는 동일한 독립 하네스, 즉 Artificial Analysis의 AA-WER v2(AA-AgentTalk 50%, VoxPopuli와 Earnings22 각각 25%)에서 측정된 것이므로 이 비교에서 가장 명확한 사실이다. 0.25포인트 차이로, 1,000단어당 대략 2.5개 적은 오류에 해당한다. 그게 중요한지는 전사본으로 무엇을 하느냐에 달려 있다. 검색 가능한 아카이브라면 중요하지 않고, 법률 또는 의료 기록이라면 중요할 수 있다.

두 번째로는 처리량이며, 정확도 격차보다 더 큰 차이로 앞선다: 333배 실시간 대 Grok Voice Transcribe 2.0의 162배. 두 수치 모두 벤더의 주장이 아니라, 초당 전사된 입력 오디오 초를 측정한 Artificial Analysis의 측정값이다. 그 속도라면 1,000시간 분량의 아카이브는 Microsoft 모델에서 약 3시간의 연산으로, SpaceXAI 모델에서는 약 6시간으로 끝난다. 일회성 마이그레이션이라면 상관없지만, 지속적으로 데이터를 수집하는 파이프라인에서는 절반으로 줄어든 실제 소요 시간이 실질적인 처리 용량 차이를 만든다.

언어 지원 범위, 세 번째. Microsoft는 자동 감지, 녹음 내 코드 전환, 그리고 FLEURS에서 이들 전반에 걸친 평균 5.2%의 단어 오류율을 갖춘 60개 언어를 명시합니다 — 공급업체가 보고한 수치로 독립적으로 재현된 것은 아니지만, 적어도 명시된 언어 목록 전반의 다국어 사례를 설명합니다. SpaceXAI는 녹음 중 전환과 25개 언어에 걸친 문어형 서식을 갖춘 수십 개 언어를 문서화합니다. 오디오가 잘 지원되는 영어 및 주요 유럽어 집합을 벗어난다면, FLEURS 수치는 영어에 가중치가 있고 상담원 대화가 많은 리더보드보다 더 유익합니다.

운영적으로 중요한 두 가지 차이점이 더 있습니다. MAI-Transcribe-2는 구성 가능한 전사 스타일을 제공합니다. 즉, 비유창성을 보존하는 축어적 스타일과 이를 제거하는 깔끔한 스타일입니다. 반면 Grok Voice Transcribe 2.0은 동일한 문제를 불필요한 단어 제거 플래그로 처리합니다. 그리고 Microsoft의 모델은 Microsoft Foundry에서 공개 미리 보기 상태이므로 SLA가 없고 GA가 될 때까지 프로덕션 사용에 반대하는 상시 권고가 있습니다. SpaceXAI의 모델은 일반 제공되며 팀당 초당 10건의 요청과 100개의 동시 스트리밍 세션이라는 공개된 속도 제한이 있습니다.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs MAI Transcribe 2 — the scoreboard': the left column gives Grok Voice Transcribe 2.0 WebSocket streaming with 500ms interim results, 2.29% batch WER, 162x real time throughput, $1.67 per 1,000 minutes, included diarization and general availability; the right column gives MAI Transcribe 2 no announced streaming, 2.04%, 333x, a $1.67 launch offer, included diarization and public preview with no SLA.

Grok Voice Transcribe 2.0이 진정으로 앞서 있는 부분

• 실시간 스트리밍 — 약 500ms마다 중간 결과를 제공하는 WebSocket 엔드포인트, 반면 실시간 SKU가 발표되지 않은 배치 전용

• 첫 부분 전사 정확도 — MAI-Transcribe-2가 참여하지 않는 카테고리인 AA-WER Streaming에서 0.49초에 3.4% WER

• 에이전트 대화 오디오에 대한 배치 정확도 — 전체 2.29%이지만, 비스트리밍 보드의 AA-AgentTalk 하위 집합에서는 순위가 헤드라인이 시사하는 것보다 더 팽팽하고, 스트리밍 보드의 에이전트 비중이 높은 구성에서는 Grok이 단독으로 앞선다

• 음성 에이전트 기반 처리 — Smart Turn의 발화 종료 감지와 필러 단어 제거가 모델에 포함되어 제공되는 반면, MAI-Transcribe-2는 턴 로직을 호출자에게 맡깁니다

• 다채널 오디오 — 한 번에 최대 8개의 독립 채널을 전사하며, 이는 스테레오 또는 다자 통화 녹음에 중요합니다

• 단어 수준 신뢰도 — 타임스탬프는 단어별 신뢰도 점수를 포함하므로, 신뢰도가 낮은 구간은 동일하게 신뢰하기보다는 플래그를 지정할 수 있습니다

가용성 조건 — 공개된 동시성 한도와 함께 일반 제공(GA), SLA가 없는 공개 미리 보기와 대비

• 가격 지속성 — 시간당 $0.10은 배치와 $0.20 스트리밍 티어의 기준 요금 모두에 적용되는 상시 요금인 반면, Microsoft의 동일한 $0.10은 2027년 표준 요금이 발표되지 않은 한시적 출시 프로모션입니다

그 마지막 요점은 대부분의 비교가 건너뛰는 부분이다. 두 모델의 가격은 오늘날 동일하지만, 그중 하나의 가격에는 다른 하나에는 없는 만료일이 있다. Microsoft는 프로모션 이후 요금을 공개하지 않았으며, 해당 혜택이 2026년 말까지인지 아니면 명시된 종료 시점이 전혀 없는지에 대해 보도가 엇갈린다. Microsoft의 1,000분당 $1.67을 기준으로 3년 전사 예산을 모델링하고 있다면, 공급업체가 확약하지 않은 숫자를 모델링하고 있는 것이다.

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard, showing MAI-Transcribe-2 at 2.04% AA-WER and 333x real time, Grok Voice Transcribe 2.0 at 2.29% and 161.77x, Gemini 3.5 Transcribe at 2.60%, GPT Transcribe at 3.31% and Whisper Large v3 at 4.07%.

중복은 실제로 존재하며, 그것이 기능 목록의 대부분을 차지합니다.

스트리밍 문제는 일단 제쳐두면 두 제품은 강하게 수렴합니다. 둘 다 화자 분리를 수행합니다. 둘 다 단어 수준 타임스탬프를 반환합니다. 둘 다 역방향 텍스트 정규화를 처리합니다 — 숫자, 날짜, 통화, 연락처 정보를 서면 형태로 렌더링합니다. 둘 다 도메인 용어를 받아들이는데, Grok Voice Transcribe 2.0은 요청당 최대 100개의 핵심 용어로, MAI-Transcribe-2는 도메인 용어 및 약어 목록으로 받아들입니다. 둘 다 언어를 자동 감지하고 녹음 중간에 화자가 언어를 바꾸는 것을 따라갑니다. 둘 다 8 kHz 전화 통신 오디오를 처리하는데, 이는 대부분의 전사 모델이 조용히 실패하는 경우이자 SpaceXAI가 가장 집중적으로 튜닝한 대상입니다 — 내부 전화 통신 세트의 WER은 버전 간에 10.6%에서 7.1%로 개선되었으며, 이는 회사 오디오에 대해 회사가 보고한 수치입니다.

두 서비스 모두 단순한 예산이 아니라 아키텍처를 좌우하는 입력 제한도 가지고 있습니다. Grok Voice Transcribe 2.0은 8kHz~48kHz의 샘플 레이트를 지원하는 12가지 오디오 형식에서 최대 500MB 파일을 허용합니다. MAI-Transcribe-2의 제한은 모델이 아니라 Foundry 경로에 의해 설정되며, 팀은 전용 STT 서비스와 동등하다고 가정하기보다 현재 상한에 대해 Microsoft의 자체 문서를 읽어야 합니다.

그 수렴이 의미하는 바는 결정이 순서대로 세 가지 질문으로 좁혀진다는 것입니다: 실시간이어야 하는가, 실제로 보유한 언어는 몇 개인가, 정확도 격차가 얼마나 비용을 초래하는가. 첫 번째 질문은 이분법적이며 한 가지 선택지를 곧바로 제거합니다. 두 번째는 보통 자신의 오디오 샘플로 답할 수 있습니다. 세 번째는 대부분의 파일 기반 워크로드에서 어떤 것도 결정하지 못할 만큼 작습니다 — 0.25포인트 격차는 실재하지만, 두 모델 모두 지금까지 누구든 측정한 최고 수치에서 반 포인트 이내라는 사실도 마찬가지입니다.

Screenshot of the Microsoft learn.microsoft.com MAI-Transcribe-2 model page, showing the September 3 2026 launch, the 60-language list with automatic detection and code-switching, the 5.2% FLEURS word error rate, the configurable verbatim and clean transcription styles, and the public-preview availability on Microsoft Foundry.

이걸 어떻게 해야 할까요?

이들을 맞대결이 아니라 2레인 스택으로 보세요. 실시간 상담원 지원과 야간 컴플라이언스 아카이브를 운영하는 컨택트 센터는 Grok Voice Transcribe 2.0과 MAI-Transcribe-2 중에서 하나를 선택하는 것이 아니라 두 가지를 모두 운영하는 것이며, 유일한 문제는 그로 인해 공급업체 관계 두 개, 자격 증명 두 세트, 청구서 두 장, 요청 속도 제한 두 개가 추가로 드는지 여부뿐입니다. 현재 어느 모델도 OrcaRouter의 카탈로그에 없으므로 전사 호출 자체는 각 공급업체의 자체 API로 전달됩니다. OrcaRouter 키 하나가 실제로 포괄하는 것은 다운스트림의 모든 것입니다: 요약기, 분류기, 전사 내용을 기반으로 추론하는 에이전트, 그리고 동일한 녹음에 대해 두 공급업체의 출력을 비교하는 평가 작업입니다. 마지막 항목이 바로 주목해야 하는 이유입니다. 리더보드만으로는 이 모델들 중에서 결정을 내릴 수 없습니다. 리더보드는 8시간 분량의 영어 상담원 대화이고, 여러분의 오디오는 그와 다르기 때문입니다.

두 가지를 지켜보세요. 첫째, 출시 프로모션이 끝날 때 Microsoft가 MAI-Transcribe-2에 표준 가격을 책정하는지 여부입니다. 영구적으로 1,000분당 $1.67이라면 비용만으로도 기본 배치 선택이 될 것이고, MAI-Transcribe-1의 시간당 $0.36으로 회귀한다면 이 논의는 훨씬 짧아질 것입니다. 둘째, Microsoft가 스트리밍 SKU를 출시하는지 여부입니다. 모델 카드에는 이미 실시간 캡션이 목표 시나리오로 명시되어 있으며, MAI-Transcribe-2와 스트리밍 레인 사이에 가로막고 있는 유일한 것은 엔드포인트입니다 — 그것이 실현된다면, 이 둘은 더 이상 레인이 아니라 경쟁자가 되기 시작할 것입니다.