Meta Superintelligence Labs의 첫 실시간 오디오 인식 모델인 Muse Voice Transcribe용 히어로 타이틀 카드로, ASR, 20+ 화자 분리, 엔드포인팅이 표시된 스트리밍 파형과 오디오 시간당 $0.18이라고 적힌 가격 칩을 보여줍니다.
Guides & Insights

Muse Voice Transcribe 출시: 메타 최초의 실시간 오디오 인식 모델

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

뮤즈 보이스 트랜스크라이브(Muse Voice Transcribe)는 메타 슈퍼인텔리전스 랩스(Meta Superintelligence Labs)의 첫 실시간 오디오 인식 모델로, 2026년 9월 1일에 출시되었으며, 가격은 스포일러처럼 책정되었습니다: 메타 모델 API(Meta Model API) 기준 오디오 1,000분당 3.00달러, 즉 시간당 약 0.18달러입니다. 단 한 번의 스트리밍 패스로 이 모델은 대부분의 전사 스택이 세 시스템에 분산해 처리하는 작업을 수행합니다: 자동 음성 인식, 20개 이상의 목소리에 대한 화자 분리, 그리고 화자가 생각 도중에 멈춘 것이 아니라 실제로 말을 마쳤는지 결정하는 작업인 엔드포인팅입니다. 메타에 따르면 이 모델은 최종 전사본 기준 3.1%의 단어 오류율을 기록하며 화자가 말을 멈춘 후 0.16초 만에 결과를 제공하여 Artificial Analysis 스트리밍 음성-텍스트 리더보드에서 1위를 차지했습니다.

그 마지막 숫자는 제 역할을 하기 전에 정직한 꼬리표가 필요합니다. 이는 메타가 출시일에 내세운 주장으로, 발표 당시 출시된 지 하루도 채 안 된 모델에 대해 독립적인 리더보드를 가리키는 수치입니다. 아직 연구실 밖에서 3.1%를 재현한 사람은 없습니다. 정확도 주장은 그렇다 치고, 나머지 홍보 내용(70개 이상의 학습 언어, 네이티브 코드 스위칭, 강화 학습 기반 '적응형 지연')도 모두 같은 처지에 있는 별도의 공급업체 진술입니다. 이 게시물의 모든 내용은 모델 출시 첫날의 상태이며, 공급업체 수치는 공급업체 수치로 명시되어 있습니다.

첫날 중요한 숫자들

• 가격 — Meta Model API에서 오디오 1,000분당 $3.00(오디오 1시간당 약 $0.18)으로, 우리가 추적하는 모든 주요 스트리밍 전사 API보다 저렴합니다.

• 정확성 주장 — 최종 트랜스크립트에서 음성 종료 후 0.16초 시점에 WER 3.1%; 첫 번째 부분 트랜스크립트에서 0.13초 시점에 WER 3.6%. 공급업체 보고에 따르며, Artificial Analysis 스트리밍 리더보드를 인용.

• 화자 분리 — 20명 이상의 화자, 별도의 후처리 단계 없이 스트리밍으로 출력(Meta는 평균 화자 분리 오류율 17.5%를 보고함).

• 언어 — 70개 이상 언어로 학습됨; 출시 시 25개 언어가 "광범위하게 검증됨"; 문장 내 및 문장 간 원활한 코드 스위칭.

• 컨텍스트 — 1시간 이상의 오디오 처리, 전문 용어가 많은 도메인을 위한 언어·키워드·컨텍스트 바이어싱.

A screenshot of the Meta AI Research announcement post for Muse Voice Transcribe (captured September 2, 2026), showing the headline 'Introducing Muse Voice Transcribe', the September 1, 2026 publication date, and an interactive real-time transcription demo at the top of the page.

여기서 "audio perception model"이 무엇을 의미하는지

아키텍처가 곧 이야기다. Muse Voice Transcribe는 80밀리초 단위로 오디오를 소비하며, 단어가 안정화되는 대로 스트리밍으로 내보낸다. 이것이 실제로 '실시간'이 의미하는 바다. 흥미로운 점은 단어를 확정하는 시점을 어떻게 결정하느냐에 있다. 고정된 지연 시간 예산 — 인식기가 일찍 확정하고 추측하거나 더 오래 기다렸다가 방어적으로 처리하는 표준적 트레이드오프 — 대신, 이 모델은 메타가 '적응형 지연(adaptive delay)'이라고 부르는 방식을 사용한다. 쉬운 발화는 빠르게 처리하고, 확신이 덜한 단어는 더 많은 오디오 컨텍스트를 보유하는 방식이다. 지연 정책 자체는 강화 학습을 통해 학습되었으므로, 이 모델은 하나의 전역 설정을 적용하는 대신 단어별로 속도와 정확성의 균형을 효과적으로 조정한다.

바로 그 차이 때문에 Meta는 Muse Voice Transcribe를 ASR 모델이 아닌 '오디오 지각 모델'이라고 부른다. 출력 스트림은 하나의 실시간 전사본으로, 누가 말하고 있는지와 발화가 언제 완료되는지도 함께 전달한다. 이는 스트리밍 시스템이 일반적으로 음성 인식기를 음성 활동 감지기와 화자 분리 모델에 붙여서 조합하는 세 가지 레이블이며, 각각 자체적인 지연 시간과 실패 모드를 추가한다.

A screenshot of the Artificial Analysis Speech to Text leaderboard showing the WER Index (non-streaming), Speed Factor, Streaming, and Price in USD per 1,000 minutes of audio sections.

화자 분리와 엔드포인팅 내장.

화자 분리(speaker diarization)는 가장 면밀히 살펴볼 가치가 있는 부분인데, 스트리밍 제품들이 가장 흔히 과장하는 기능이기 때문이다. Meta는 이 모델이 단일 녹음에서 20명 이상의 화자를 분리하며 평균 분리 오류율(diarization error rate) 17.5%를 보고한다고 말하는데, 이는 경쟁 시스템에 귀속되는 21.1–28.6% 범위와 대조된다. 두 수치 모두 출시일에 공급업체가 공개한 것이며, 아직 17.5%를 확인한 독립적 평가는 없다. 구조적으로 실제인 것은 분리(diarization)가 인식과 동일한 스트리밍 패스 안에서 실행된다는 점이다. "오디오를 업로드하고, 기다렸다가, 화자를 돌려받는" 2단계 과정이 없으며, 이것이 라이브 환경에서 20명 이상의 화자 추적을 가능하게 만드는 설계 선택이다.

엔드포인팅은 덜 주목받는 기능이지만 틀림없이 가장 유용한 기능이다. 원시 스트리밍 ASR을 노출하는 전사 API는 호출자가 스스로 발화 종료 감지를 구현해야 하며, 이것이 음성 에이전트가 자주 상대방 말을 끊거나 침묵을 남기는 이유이다. Muse Voice Transcribe는 턴이 완료된 시점을 결정하고 그 경계를 스트림의 일부로 내보내므로, 애플리케이션은 VAD 레이어를 구축하지 않고도 깔끔한 "이 화자가 말을 마쳤다"는 신호를 얻을 수 있다.

다국어 주장을 주의 깊게 읽으십시오

{{1}}메타는 70개 이상의 언어로 모델을 훈련했지만 출시 시점에는 25개 언어만 검증했습니다.{{/1}} {{2}}이 둘은 서로 다른 것입니다. "훈련됨"은 데이터에 해당 언어가 포함되었다는 뜻이고, "광범위하게 검증됨"은 메타가 내부 테스트를 통해 실제로 보증하는 하위 집합을 의미합니다.{{/2}} {{3}}프로덕션 사용의 경우 25개 검증 목록이 실제 적용 범위이며, 40개 언어를 여기에 통과시키기 전에 70과 25 사이의 차이를 알아두는 것이 좋습니다.{{/3}} {{4}}진정으로 특이한 점은 코드 스위칭(code-switching) 이야기입니다. 이 모델은 지시 없이도 문장 중간과 발화 중간에 언어를 전환하도록 설계되었는데, 이는 다국어 지역에서 실제로 겪는 문제이며 대부분의 단일 언어 ASR 제품이 전혀 할 수 없는 일입니다.{{/4}} {{5}}언어, 키워드, 컨텍스트 바이어싱(biasing)이 커스터마이제이션을 완성합니다. 도메인 어휘에 맞춰 인식을 바이어스할 수 있는데, 이 기능 덕분에 스트리밍 ASR이 의료, 법률, 고객 지원 대기열에서 실용적으로 사용될 수 있습니다.{{/5}}

세 개의 표면, 하나의 모델

Muse Voice Transcribe는 세 가지 표면에서 동시에 제공됩니다. 유료 버전은 Meta Model API로, 오디오 1,000분당 3달러입니다. 소비자용은 Mac용 Meta AI로, Fn 키를 누르고 있으면 어떤 애플리케이션에서도 받아쓰기를 할 수 있습니다 — Apple의 내장 받아쓰기에 대한 Meta의 답변이자, 모델이 출시 첫날 가장 가시적으로 실제 배포된 사례입니다. 개발자용은 Meta의 코딩 에이전트인 Muse Code로, 음성 명령이 멀티 에이전트 세션과 리팩토링 흐름을 구동합니다. 하나의 모델이 받아쓰기 기능과 코딩 에이전트를 구동하는 것은 "하나의 스트리밍 모델, 다양한 표면"이라는 제안을 제품화한 버전입니다.

가격이 낮추는 것

오디오 시간당 $0.18로 Muse Voice Transcribe는 스트리밍 전사 분야의 공시 가격을 크게 밑돈다. 우리가 추적하는 비교 기준은 다음과 같다: GoogleGemini 3.5 Transcribe Live는 1,000분당 약 $9, ElevenLabs의 Scribe v2 Realtime은 1,000분당 $6.50, Cartesia의 Ink-2는 $4.00, OpenAIGPT Live Transcribe는 $17.00으로 표기된다. 이것들은 해당 업체들이 공개한 수치이며, 그 중 여러 모델은 Muse가 아직 갖추지 못한 독립적인 정확도 증거를 보유하고 있다. 첫날의 가격 우위는 확정된 리더보드와 같은 의미는 아니다. 그러나 화자 분리(diarization)와 엔드포인팅(endpointing)을 내장한 스트리밍 모델이 기존 스트리밍 API 가격의 대략 5분의 1에서 10분의 1에 해당하는 가격으로 시장에 진입하는 것은, 그 자체로 기대치를 새로 쓰는 수치다.

A generated price-comparison infographic titled 'Streaming transcription — list price per 1,000 minutes' showing Muse Voice Transcribe at $3.00 against Cartesia Ink-2 at $4.00, ElevenLabs Scribe v2 Realtime at $6.50, Gemini 3.5 Transcribe Live at $9.00, and GPT Live Transcribe at $17.00, with a footer noting these are vendor list prices as published in September 2026, and the OrcaRouter logo in the bottom-right corner.

솔직한 경고

Muse Voice Transcribe는 사유 기술이며 가중치가 공개되어 있지 않습니다. '직접 실행' 옵션은 존재하지 않고, 감사나 파인튜닝을 위한 오픈 가중치 경로도 없습니다. 정확도 주장은 출시 당일 기준의 것이며 재현된 바 없습니다. 검증된 25개 언어는 저자원 언어 커버리지와 관련해 '학습에 사용된' 70개 이상 언어 수치와 맞지 않을 수 있습니다. 또한 화자 분리(diarization) 벤치마크는 아무리 유망해 보여도 독립적인 실행으로 확인되기 전까지는 공급업체 측정치일 뿐입니다. 사전 녹음된 오디오의 정확한 일괄 전사만 요구하는 팀이라면 더 저렴하고 더 잘 검증된 옵션이 여전히 존재합니다. 스트리밍 제안은 실시간 상호작용을 위한 것이지, 오디오 시간당 비용에서 일괄 전사 시장을 능가하기 위한 것이 아닙니다.

다음에 볼 콘텐츠

{{1}}이번 출시가 일시적 반향에 그칠지, 지속적 트렌드가 될지를 결정할 네 가지 요소가 있습니다.{{/1}} {{2}}첫째, Artificial Analysis 스트리밍 리더보드가 독립적 검증 이후 실제로 Muse Voice Transcribe를 1위로 등재하는지 여부입니다 — 출시 당일의 주장이 확정된 보드 항목으로 자리 잡아야 합니다.{{/2}} {{3}}둘째, 20+ 화자 분리 기능이 실제의 시끄러운 회의 환경에서도 제대로 작동하는지 여부입니다.{{/3}} {{4}}셋째, Meta의 Mac 받아쓰기 인터페이스가 개발자들의 API 채택으로 이어지는지 여부입니다.{{/4}} {{5}}넷째, 기존 업체들이 가격으로 어떻게 대응하는지입니다. 시간당 $0.18에 화자 분리와 엔드포인팅을 갖춘 스트리밍 모델이 나오면 그 위에 있는 모든 업체에 눈에 띄는 압박이 가해지기 때문입니다.{{/5}} {{6}}Meta가 모델을 추가 서빙 파트너에게 개방하면, OrcaRouter와 같은 통과형 게이트웨이 — 공급업체 공시 가격을 0% 마크업으로 전달하는 — 는 출시 당일 리셀러 마진 없이 동일한 1,000분당 $3.00 수치를 표시하게 될 것입니다.{{/6}} {{7}}그때까지 Muse Voice Transcribe를 호출할 수 있는 유일한 곳은 Meta의 자체 API입니다.{{/7}}

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube