
Grok Voice Transcribe 2.0 vs Muse Voice Transcribe: 17일간의 군림과 4분의 1초
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026년 9월 1일, Meta는 Muse Voice Transcribe가 Artificial Analysis의 스트리밍 음성 인식 평가에서 최종 단어 오류율 3.1%로 1위를 차지했다고 밝혔고, 그 주장은 17일 동안 아무 도전도 받지 않았다. 9월 18일, SpaceXAI는 같은 리더보드에서 2.7%를 기록한 Grok Voice Transcribe 2.0을 출시하며 그 자리를 가져갔다. 두 모델, 하나의 순위표, 17일의 간격 — 그리고 더 흥미로운 비교는 정확도의 0.4포인트 차이가 아니다. 왜냐하면 Meta의 모델은 여전히 문장을 최종 확정하는 속도가 약 3배 더 빠르기 때문이다: 발화가 끝난 뒤 0.16초로, Grok Voice Transcribe 2.0의 0.49초와 대비된다. Muse Voice Transcribe는 Meta Superintelligence Labs가 Meta 자체 제품 안에서 실행되도록 만든 실시간 오디오 지각 모델이며, 여기서 0.25초는 곁에 있다고 느껴지는 비서와 느리다고 느껴지는 비서를 가르는 차이다. Grok Voice Transcribe 2.0은 누구나 호출할 수 있도록 만들어진 전사 API로, 배치 작업을 실행 가능하게 하는 가격을 갖췄다. 두 수치 모두 출시 당일 공급업체가 보고한 것이며, 그중 하나만 이후 독립적으로 공개 리더보드에 올라갔다.
리더보드가 지금 실제로 보여주는 것
AA-WER Streaming board는 가중 합성 지표입니다 — AA-AgentTalk 50%, VoxPopuli 25%, Earnings22 25%, 대부분 에이전트형 영어 오디오로 구성된 약 8시간 분량 — 그리고 두 모델 모두 이 보드에서 측정되며, 바로 이 점 때문에 수치가 적어도 비교 가능한 드문 일대일 비교가 됩니다. 나란히 보면, 벤더 보고 수치 포함:
• 최종 전사 정확도 — Grok Voice Transcribe 2.0은 2.7% WER, Muse Voice Transcribe는 3.1%
• 첫 번째 부분 전사 정확도 — 3.4% 대 3.6%
• 첫 부분 출력까지 걸리는 시간 — 0.49초 대 0.13초
• 발화 종료 후 최종 변환 텍스트까지 걸리는 시간 — 0.49초 vs 0.16초
• 화자 분리 오류율 — 포함됨, 수치 미공개 vs Meta의 평가 전반에서 평균 17.5%
정확도 행과 지연 시간 행은 따로 읽으세요. 두 지표는 서로 반대 방향을 가리키면서도 둘 다 사실이기 때문입니다. 정확도에서는 두 모델이 최종 전사에서 서로 0.4포인트 이내, 첫 부분 결과에서는 0.2포인트 이내입니다. 이 격차는 어느 회사든 다음 릴리스에서 뒤집힐 만큼 작고, 합리적인 사람이라면 그것만으로 둘 중 하나를 선택해서는 안 될 만큼 작습니다. 지연 시간에서는 두 모델이 가깝지 않습니다. Meta의 모델은 약 8분의 1초에 부분 결과를 반환하고 약 6분의 1초에 최종 확정하는 반면, SpaceXAI의 모델은 두 경우 모두 약 0.5초입니다.
그것이 전체 비교를 한 줄로 요약한 것입니다: Grok Voice Transcribe 2.0은 지연 시간을 지불해 정확도를 얻었고, Muse Voice Transcribe는 그 반대였습니다. SpaceXAI는 1.0 버전에서 18.3%였던 첫 부분 오류율을 2.0에서 3.4%로 낮췄으며, 그 대가는 같은 지표에서 0.25초에서 0.49초로 늘어나는 것이었습니다. Meta의 모델은 반대 방식으로 설계되었는데, 80밀리초 오디오 청크와 텍스트로 확정하기 전에 얼마나 기다릴지를 결정하는 강화학습으로 학습된 적응형 지연을 사용합니다. 이 메커니즘의 목적은 확정 속도를 빠르게 유지하면서 정확도를 지키는 것입니다. 어느 선택도 실수가 아닙니다. 그것들은 서로 다른 질문에 대한 답입니다.
어떤 질문을 하고 있는 건가요?
전사 결과가 대화의 멈춤 안에서 응답해야 하는 음성 에이전트에 공급된다면, 0.16초와 0.49초는 서로 다른 제품입니다. 인간의 턴 테이킹은 상호작용이 어색하게 느껴지기 시작하기 전까지 몇백 밀리초의 간격을 허용하며, 지연 예산은 공유됩니다 — 전사, 그다음 추론, 그다음 음성 합성. 6분의 1초 만에 최종 전사를 돌려주는 모델은 나머지 파이프라인을 위한 여유를 남깁니다. 반 초가 걸리는 모델은 모델이 무엇이든 생각하기도 전에 예산의 대부분을 소모합니다. 그것이 Meta가 목표로 삼은 것이며, 이 모델이 다른 사람들의 파이프라인을 위한 엔드포인트로 주로 제공되기보다는 Mac의 Meta AI 내부와 Muse Code 내부에서 실행되는 이유입니다.
트랜스크립트가 문서라면 — 통화 녹음, 회의, 영상 라이브러리, 컴플라이언스 아카이브 — 0.5초는 아무것도 아니고, 정확도 격차도 여전히 아무것도 아니며, 중요한 유일한 숫자는 오디오 한 시간에 드는 비용입니다. 바로 이 지점에서 이 둘은 극명하게 갈라지며, 스트리밍 단가만 보는 사람들을 놀라게 하는 방향으로 벌어집니다.
배치에서는 절반 가격, 스트리밍에서는 10% 더
Meta는 Muse Voice Transcribe의 가격을 오디오 1시간당 $0.18, 즉 1,000분당 $3.00으로 표시합니다. Grok Voice Transcribe 2.0은 배치의 경우 시간당 $0.10, 스트리밍의 경우 시간당 $0.20으로 표시합니다. 따라서:
• 스트리밍 — Grok Voice Transcribe 2.0은 시간당 $0.20인 반면 Muse Voice Transcribe는 $0.18이므로 Meta가 약 10% 더 저렴합니다
• 배치 또는 녹음 — 시간당 $0.10 vs $0.18, 따라서 SpaceXAI가 44% 더 저렴합니다
• 목록 가격에 포함 — SpaceXAI 측은 화자 분리, 신뢰도가 포함된 단어 타임스탬프, 핵심 용어 바이어싱 및 역 텍스트 정규화를, Meta 측은 스트리밍 전사, 화자 분리, 엔드포인트 감지를 하나의 모델로 제공
• 무료 티어도, 셀프 호스팅도 — 둘 다 아니다
오직 스트리밍만 사용하는 팀이라면 가격만 놓고 보면 둘 중 어느 쪽이든 상관없이 여겨야 하고, 지연 시간을 기준으로 선택해야 합니다. 그렇다면 Meta입니다. 의미 있는 양의 녹음 오디오를 다루는 팀이라면 배치 행을 봐야 합니다. 시간당 $0.08은 누적되기 때문입니다. 월 5,000시간이면 한쪽은 $500, 다른 쪽은 $900이고, 두 서비스 간의 정확도 차이는 두 숫자 중 어느 쪽의 반올림 오차보다도 작습니다.
라이선스상의 입장은 중요한 측면에서는 동일하고, 중요하지 않은 측면에서는 다릅니다. 둘 다 클로즈드 웨이트입니다 — Muse Voice Transcribe는 독점 제품이며 Meta의 호스팅 API를 통해서만 사용할 수 있고, Grok Voice Transcribe 2.0은 다운로드가 제공되지 않는 상용 API입니다. 오디오가 직접 통제하는 인프라를 절대 벗어나지 않아야 한다는 것이 요구사항이라면 둘 다 선택지가 아닙니다. 또한 둘 다 공급업체가 가격, 모델 버전 또는 지원 중단 일정을 발밑에서 바꿔버릴 위험에 노출시킵니다. 이는 가정이 아니라 실제로 고려해야 할 사항입니다: Grok Voice Transcribe 1.0은 후속 제품이 출시된 지 2주도 채 되지 않아 이미 지원 중단 경로에 들어섰습니다.

화자 분리, 둘 중 어느 쪽도 앞세우지 않는 기능
두 모델 모두 화자 귀속을 단일 패스로 수행하는데, 이는 2년 전에는 나중에 덧붙여지는 별도 시스템이었으며, Meta는 수치를 공개했고 SpaceXAI는 공개하지 않았기 때문에 여기서의 비교는 유난히 구체적이다.
Meta는 자체 평가에서 평균 화자 분리(diarization) 오류율 17.5%를 보고하며, 후처리 없이 20명 이상의 화자를 처리하고, 이를 다운스트림 단계가 아니라 스트리밍 모델의 일부로 처리한다 — "누가 무엇을 말했는지"는 텍스트 뒤가 아니라 텍스트와 함께 도착한다. 이는 스트리밍 맥락에서 정말로 어려운 일인데, 화자 턴은 충분히 들은 뒤에야 식별할 수 있기 때문이다. 그리고 17.5%는 진짜 숫자이면서 진짜 단서를 달고 있다: Meta가 스스로 선택한 평가 세트에서 평균을 낸, Meta 자체의 수치라는 점이다.
SpaceXAI의 모델은 추가 비용 없이 화자 분리(diarization)를 포함하며, 단일 요청에서 최대 8개의 독립 오디오 채널도 지원합니다. 이는 같은 문제를 해결하는 다른 방식입니다 — 오디오가 참가자별 개별 채널로 들어오는 경우, 컨택트 센터 전화에서 흔히 그렇듯, 채널 분리가 화자 분리보다 더 안정적이고 오류율이 전혀 필요하지 않습니다. 오디오가 하나의 혼합 스트림으로 들어온다면, 화자 분리 품질에 의존하게 되며, 이 두 공급업체 중 한 곳만이 그 품질이 어떤지 알려주었습니다.
주목할 만한 이차적 차이가 있습니다: Muse Voice Transcribe는 화자 분리, 전사, 엔드포인트 감지를 하나의 출력을 생성하는 하나의 모델로 취급하므로, 구성 요소들이 독립적으로 실패할 수 없습니다. Grok Voice Transcribe 2.0은 채널, 핵심 용어, 화자 분리를 각각 별도의 레버로 다룰 수 있게 해줍니다. 단일 모델은 실행하기 더 간단하고 디버그하기 더 어렵습니다.

언어, 그리고 두 모델 카드가 더 이상 비교할 수 없게 되는 지점
Meta는 Muse Voice Transcribe를 70개 이상의 언어로 학습시켰고 출시 당시 그중 25개 언어를 광범위하게 검증했으며, 문장 내부와 문장 사이의 네이티브 코드 스위칭과 1시간이 넘는 오디오 지원을 갖추고 있습니다. Grok Voice Transcribe 2.0은 녹음 도중 전환을 포함한 자동 언어 감지를 처리하고, 25개 언어에 걸쳐 역방향 텍스트 정규화 — 말로 한 날짜, 통화, 전화번호, 이메일 주소를 글로 표기하는 것 — 를 적용합니다.
겹치는 부분은 한쪽의 광범위하게 검증된 25개 언어와 다른 쪽의 정규화 언어 25개이며, 두 집합은 같은 25개가 아니고 어느 벤더도 그 목록을 공개하지 않았다. "70개 이상 언어 학습됨"과 "포맷팅 지원이 되는 25개 언어"는 서로 비교 가능한 주장이 아니며 서로에서 빼서도 안 된다. 말할 수 있는 것은 Meta는 더 폭넓은 다국어 주장을 하고 SpaceXAI는 더 좁지만 더 실무적인 주장을 한다는 점이다: 언어를 감지하는 것은 기본 중의 기본이고, 모델이 들은 내용을 다운스트림 시스템이 파싱할 수 있는 형태로 포맷팅하는 것이 바로, 빠져 있을 때 통합을 깨뜨리는 부분이다.
그 선택, 그리고 그것이 당신의 몫이 아닐 수 있는 이유
마케팅을 걷어내면 결정은 세 문장으로 줄어든다. 대화 중에 실시간으로 소비되는 스크립트라면 Muse Voice Transcribe를 골라라. 0.16초는 사소한 디테일이 아니니까. 대량의 녹음 오디오를 보유하고 있다면 Grok Voice Transcribe 2.0을 골라라. 배치 가격의 절반도 역시 사소한 디테일이 아니니까. 두 극단 모두 필요 없다면, 지역, 계약, 기존 통합 등 당신을 제약하는 다른 기준으로 골라라. 정확도 차이만으로는 결판나지 않을 테니까.
문제는 이 두 모델 중 하나가 일반적인 의미에서 실제로 판매되는 것이 아니라는 점입니다. Muse Voice Transcribe는 Meta 자체 어시스턴트가 빠르게 느껴지도록 하기 위해 존재하며, Meta Model API를 통해 제공되는 주된 이유는 Meta가 노출을 통한 생태계 가치가 독점의 가치보다 크다고 판단했기 때문입니다. 이는 바뀔 수 있고, 빠르게 바뀔 수도 있습니다. Meta는 같은 주에 Muse의 커넥터 플랫폼을 서드파티 개발자에게 개방했는데, 이는 다른 모든 이에게 중립적인 공급자가 되기보다 자사 유통 채널에 투자하는 회사의 모습입니다. 경쟁사의 내부 모델에 프로덕션 의존성을 구축하는 것은 조건이 바뀌지 않을 것이라는 베팅이며, 그 베팅에는 나쁜 역사적 기록이 있습니다.
그 비대칭성은 둘 중 어느 것도 하드코딩하지 말아야 한다는 근거가 된다. OrcaRouter는 단일 OpenAI 호환 키 뒤에 200개 이상의 모델을 노출하며, 제공업체 간 자동 장애 조치와 제공업체 정가 대비 0% 마크업을 지원한다. 따라서 SpaceXAI가 기본값을 2.0으로 전환하고 1.0을 지원 중단할 때, 또는 Meta가 자사의 음성 API를 재배치할 때, 그 변화는 마이그레이션 프로젝트가 아니라 모델 문자열 하나가 된다. 3주 만에 선두 주자가 두 번 바뀐 범주에서, 라우팅 계층은 스택에서 안정적이어야 하는 부분이고, 모델은 그렇지 않아야 하는 부분이다.

앞으로 한 달 동안 지켜볼 한 가지: Grok Voice Transcribe 2.0이 Muse Voice Transcribe를 밀어낸 지금, Artificial Analysis가 스트리밍 보드에서 Muse Voice Transcribe를 다시 측정하는지 여부다. Meta의 3.1%와 SpaceXAI의 2.7%는 둘 다 출시 당시 보고되었지만, 독립적으로 순위에 오른 것은 SpaceXAI의 수치뿐이다. 누군가 Meta의 수치를 다시 측정했을 때 그대로 유지된다면, 정확도 격차는 보이는 만큼 작고 지연 시간 격차가 모든 것을 결정한다. 그렇지 않다면, 17일간의 군림이 전부였던 셈이다.
