
MAI-Transcribe-2 vs Muse Voice Transcribe: 같은 주, 오디오에 건 정반대의 두 베팅
- openaiNEWOpenAI: GPT-6 Astra2026-09-0455지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0247지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0247지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0157지능82코딩
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2646지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1849지능75코딩
- obsidianQwen3.8 27B2026-08-1541지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1251지능77코딩
- metaMeta: Muse Spark 1.22026-08-0547지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0347지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2140지능69코딩
2026년 9월 1일이 포함된 주에는 두 프런티어 연구소에서 두 개의 음성 모델이 나왔고, MAI-Transcribe-2와 Muse Voice Transcribe는 오디오 인텔리전스가 어디에 있어야 하는지에 대한 질문에 정반대의 답을 제시하는 모델로 이해하는 것이 가장 적절하다. Meta Superintelligence Labs가 9월 1일에 공개한 Muse Voice Transcribe는 실시간 오디오 인지 모델이다. {{1}}라이브 오디오의 80밀리초 청크를 단일 스트리밍 패스로 처리하면서{{/1}} 받아쓰기, 20명 이상의 화자 분리, 화자가 말을 마쳤는지 감지까지 모두 수행하며, 측정된 스트리밍 음성-텍스트 벤치마크에서 최상위를 차지한다. 이틀 뒤인 9월 3일에 Microsoft가 공개한 MAI-Transcribe-2는 정반대의 선택이다. {{2}}실시간 지연 시간을 전혀 좇지 않는 배치 엔진으로,{{/2}} 모든 역량을 사전 녹음된 파일의 받아쓰기에 쏟아부어 독립 비스트리밍 벤치마크에서 최고의 단어 오류율을 기록했으며, 약 411배 실시간 속도로 처리하고 1,000분당 약 $1.67의 비용이 든다. 이 둘을 단순히 "받아쓰기 모델"로 나란히 비교하면 실제 결정 기준이 가려진다. {{3}}그 기준은 오디오의 수명 중 어느 시점에 단어가 필요한가, 즉 말이 진행되는 중인가 아니면 끝난 뒤인가라는 문제다.{{/3}}
두 제품이 서로 다른 시점을 가리켰습니다.
Muse Voice Transcribe는 오디오가 여전히 진행 중인 순간을 위해 설계되었습니다. 이는 Meta의 Muse 제품군에 속한 자기회귀 다중모달 모델로, 자동 음성 인식, 20명 이상의 화자를 구분하는 화자 분리, 그리고 화자가 말을 멈추었을 때 시스템이 응답할 수 있도록 감지하는 엔드포인팅이라는 세 가지 작업을 한 번의 처리로 통합합니다. Meta는 최종 전사가 화자가 멈춘 후 약 0.16초 뒤에 산출되며, 최종 전사에서 단어 오류율 3.1%, 첫 부분 결과에서 3.6%를 기록했다고 보고합니다. 이 수치는 Meta가 출시일에 Artificial Analysis 스트리밍 리더보드를 인용하며 공개한 것으로, 이 글을 쓰는 시점에는 독립적으로 재현되지 않았습니다. 이 모델은 1시간 이상의 오디오를 단일 스트림으로 처리하며, 문장 중간에서 언어를 전환하고, 70개 이상의 언어로 학습되었으며 출시 시점에 25개 언어가 집중적으로 검증되었습니다. 가격은 Meta Model API를 통해 오디오 1,000분당 $3.00, 즉 시간당 약 $0.18입니다. Meta는 가중치가 공개되지 않을 것이라고 확인했습니다.
MAI-Transcribe-2는 오디오가 이미 파일로 존재하는 상황을 위해 설계된 모델이다. Microsoft의 이 모델은 Artificial Analysis의 비스트리밍 리더보드에서 AA-WER 2.0%를 기록하며 2위를 차지했다. 이는 관리형 배치 API 중 가장 우수한 수치다. 또한 대략 실시간의 411배 속도로 실행되는데, 이는 처리량(throughput) 수치이지 지연 시간을 보장하는 약속이 아니다. 이 모델은 자동 언어 식별과 함께 60개 언어를 전사하며, 화자 분리(diarization), 단어 수준 타임스탬프, 키워드 바이어싱(keyword biasing), 축어적(verbatim) 스타일과 정제된(clean) 스타일을 함께 제공한다. Hinglish나 Spanglish 같은 코드 스위칭도 처리한다. MAI-Transcribe-2는 공개 미리보기 상태로 Microsoft Foundry에서 제공되며, MAI Playground에서는 오디오 시간당 $0.10이라는 한정 출시 혜택으로 연말까지 이용할 수 있다. 스트리밍 제품은 발표되지 않았다. Microsoft의 출시 게시물은 이 모델이 명시적으로 장시간(long-form) 및 배치(batch) 오디오를 겨냥하고 있음을 밝힌다. 바로 그러한 워크로드에서는 스트리밍 모델의 낮은 지연 시간이 무가치하지만, 분당 비용은 결코 무시할 수 없기 때문이다.

두 정확도 수치가 충돌하지 않는 이유
2.0%와 3.1%를 비교하여 승자를 가리는 것이 자연스러운 본능이겠지만, 그렇게 하면 두 가지 면에서 틀리게 된다. 첫째, 그 수치는 서로 다른 작업을 측정한다. MAI-Transcribe-2의 2.0%는 사전 녹음된 오디오에 대한 비스트리밍 정확도로, 모델이 전체 파일을 볼 수 있는 상황에서의 수치다. 반면 Muse Voice Transcribe의 3.1%는 오디오가 도착하는 대로 전사해야 하는 제약 아래 생성된 최종 기록에 대한 스트리밍 정확도다. 스트리밍은 더 어려운 문제이므로, 스트리밍 리더보드와 비스트리밍 리더보드가 별도의 점수와 함께 분리되어 있는 것이다. 둘째, 그 수치가 의미하는 바가 서로 다르다. MAI-Transcribe-2의 수치는 Artificial Analysis가 그 모델을 측정한 값이다. 반면 Muse Voice Transcribe의 수치는 Meta가 출시일에 Artificial Analysis가 측정한 결과를 보고한 것, 즉 공급업체가 보고했고 재현되지 않은 값이다. 정직하게 말하자면, 두 모델 모두 각자의 리더보드 최상위권에 있는 신뢰할 만한 주장이며, 어느 쪽 숫자도 다른 트랙에 대해 아무것도 알려주지 않는다.
화자 분리가 진정한 비교가 이루어지는 지점입니다. 두 제품 모두 제공하는 유일한 기능이면서, 그들의 야망이 눈에 띄게 갈리는 부분이기 때문입니다. Muse Voice Transcribe는 핵심 스트리밍 기능으로 20명 이상의 화자를 분리하며, Meta는 평균 화자 분리 오류율 17.5%를 경쟁사 범위 21.1%~28.6%와 대비해 보고합니다. — 역시 Meta가 보고한 수치이며 검증되지 않았습니다. MAI-Transcribe-2도 화자 분리를 포함하지만, Microsoft는 화자 수 상한도 화자 분리 오류율도 전혀 공개하지 않습니다. 양자 통화의 경우 두 제품 모두 문제없고 차이는 중요하지 않습니다. 12인 포커스 그룹이나 패널 녹음의 경우, Muse Voice Transcribe만이 두 제품 중 다중 화자 상한을 명시했으며, MAI-Transcribe-2의 측정되지 않은 화자 분리는 더 어려운 오디오를 신뢰하기 전에 테스트해야 하는 가장 큰 이유입니다.
말이 되는 가격 비교
가격만 놓고 보면 두 제품은 배치 대 스트리밍이라는 프레임이 시사하는 것보다 더 가깝습니다. 1,000분당 $1.67(MAI-Transcribe-2, 조기 도입)과 1,000분당 $3.00(Muse Voice Transcribe)은 둘 다 관리형 음성 인식 서비스의 저렴한 축에 속하기 때문입니다. 이 비교는 같은 범주 안에서만 의미가 있습니다. 사전 녹음된 배치 전사의 경우 MAI-Transcribe-2는 스트리밍 네이티브 모델 가격의 절반도 안 되면서 더 나은 비스트리밍 WER을 제공합니다. 다만 녹음 파일을 Muse Voice Transcribe로 보내는 것은 특별히 스트리밍 파이프라인이 필요할 때뿐이며, 보관 자료를 처리하는 데는 그 방식이 효율적이지 않습니다. 라이브 회의 오디오의 경우 Muse Voice Transcribe는 이 글에서 다루는 제품 중 유일하게 실제로 작동하며, 1,000분당 $3.00이라는 요금은 출시 때 겨냥한 다른 실시간 전사 API들 — 1,000분당 약 $9인 Gemini 3.5 Transcribe Live, $17인 GPT Live Transcribe — 보다 훨씬 저렴합니다. 게다가 이들 제품이 따라가지 못하는 20명 이상 화자 분리(diarization) 기능도 제공합니다. 정직한 가격 요약은 이러합니다. 메타는 스트리밍 가격을 낮게, 마이크로소프트는 배치 가격을 더 낮게 책정했으며, 두 숫자 모두 각 공급업체가 표준 요금을 발표하면 변동될 프로모션 기간 가격입니다.

어떤 오디오에 어떤 것을 사용하나요?
오디오가 라이브라면 — 회의 실시간 전사, 음성 에이전트, 라이브 자막, 말하는 동안 단어가 필요한 모든 경우 — Muse Voice Transcribe가 정답이고, 그 격차는 상당합니다. 이 목록에서 유일한 스트리밍 모델이며, 한 번의 패스로 20명 이상의 화자를 구분하고, 첫날부터 이 시장에서 이기도록 가격이 책정되었습니다. 그 약점은 시험판에서 확인할 부분입니다. 정확도와 화자 분리 수치는 Meta가 보고한 것이며, 출시된 지 일주일 된 스트리밍 모델이 출시 벤치마크 밖의 지저분한 오디오에서 어떻게 작동하는지는 아직 입증되지 않았습니다.
이미 파일 형태의 오디오 — 아카이브, 통화 녹음, 미디어 라이브러리, 대량 처리되는 모든 것 — 를 보유하고 있다면, MAI-Transcribe-2가 모든 중요한 측면에서 더 나은 선택입니다: 더 낮은 측정 WER, 대략 10배에 달하는 처리량, 그리고 스트리밍 모델보다 낮은 1,000분당 가격을 제공합니다. {{1}}이 모델의 리스크는 Muse의 리스크와 정확히 대칭입니다: 출시된 지 4일밖에 되지 않았고, 스트리밍 SKU가 없으며, 화자 분리 품질이 측정되지 않았고, 공개되지 않은 표준 가격 뒤에 숨겨진 얼리버드 요금제가 있다는 점입니다.{{/1}} {{2}}Muse가 실시간 애플리케이션을 염두에 두고 만들어진 검증된 제품이라면, MAI-Transcribe-2는 속도와 경제성을 우선시하는 배치 처리용으로 설계된 신생 제품입니다.{{/2}}
MAI-Transcribe-2를 소개하는 Microsoft 출시 페이지는 Microsoft가 번들로 제공하면서 스트리밍 경쟁사가 동일한 패스에서 제공하지 않는 기능들을 나열하며, 어떤 주장이 실제 제품 기능 영역이고 어떤 주장이 여전히 벤치마크 약속인지 판단할 때 확인해야 할 문서입니다.

그리고 트랜스크립트가 파이프라인의 전반부에 불과하다면, 이 둘 사이의 선택은 그 위에서 내리는 선택보다 중요도가 낮습니다. Muse Voice Transcribe로 전사된 라이브 회의 오디오는 유용해지기 전에 여전히 요약, 액션 아이템 추출, 후속 조치 초안 작성이 필요하며, MAI-Transcribe-2로 전사된 보관 통화도 여전히 검색, 민감 정보 제거, 올바른 다운스트림 시스템으로의 라우팅이 필요합니다. 바로 이 계층이 멀티모델 플랫폼이 진가를 발휘하는 곳입니다. OrcaRouter는 200개 이상의 모델을 단일 API로 제공하고 공급업체 정가를 0% 마크업으로 전달하므로, 다운스트림 작업은 단일 통합을 통해 워크로드별로 다른 모델을 호출할 수 있습니다. 따라서 파일럿에서 어떤 음성 모델이 승리하든, 전환을 위해 트랜스크립트 위의 스택을 재구축할 필요는 없습니다. Muse Voice Transcribe와 MAI-Transcribe-2는 현재 그 명단에 없으며, 둘 다 공급업체 자체 API로만 제공됩니다. 이번 주에 실제로 판가름 난 승부는 더 좁고 더 실용적입니다. 실시간 전사와 배치 전사 모두 이제 막 충분히 저렴해졌으므로, 더 이상 차별화 요소는 단어가 아니라 그 단어들로 무엇을 하느냐입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
