
VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe: 하루 차이로 등장한 두 스트리밍 도전자
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
2026년 9월 초 약 36시간 사이, 두 대형 연구소가 똑같은 핵심 약속을 내세우는 스트리밍 음성-텍스트 변환 모델을 잇달아 출시했다. 그것은 말이 실제로 발화되는 그 순간, 누가 무엇을 말했는지까지 알려 주는 라이브 대화 기록이다. 9월 1일, 메타 슈퍼인텔리전스 랩(Meta Superintelligence Labs)은 뮤즈 보이스 트랜스크라이브(Muse Voice Transcribe)를 호스팅 API로 출시했다. 요금은 오디오 1,000분당 3.00달러(시간당 약 0.18달러)이고, 스트리밍 인식, 20명 이상 화자 구분(diarization), 발화 종점 검출(endpointing)을 하나의 패스로 통합했다. 9월 2일, 마이크로소프트 리서치(Microsoft Research)는 VibeVoice-ASR-Streaming-7B를 허깅 페이스(Hugging Face)에 업로드했다. 발표도 없이 MIT 라이선스 오픈 가중치로 공개된 모델로, 모델 카드에는 핫워드(hotword)와 10개 언어를 지원하는 스트리밍 화자 귀속 전사(speaker-attributed transcription)가 가능하다고 적혀 있으나 호스팅 서비스는 어디에도 없다. 같은 제안, 정반대의 비즈니스 모델. 그리고 양측이 제시한 증거는, 어느 쪽 연구소든 당신이 눈치채기를 달가워하지 않을 만큼 빈약하다.
이 페이지는 현재까지 알려진 내용을 바탕으로 작성되었습니다. 두 모델 모두 독립적으로 검증된 정확도 수치가 없기 때문입니다. Muse Voice Transcribe의 수치는 Meta의 출시 당시 주장으로, 벤더가 보고한 것이며 재현되지 않았습니다. VibeVoice-ASR-Streaming-7B는 텍스트로 스트리밍 정확도 수치를 전혀 공개하지 않았습니다. 따라서 아래 비교는 구조적이고 확인 가능한 측면(아키텍처, 가격, 라이선스, 문서화된 동작)에 의존하며, 드물게 나타나는 벤더 수치는 해당 위치에 표시해 두었습니다.
하루 차이로 배치 파이프라인에 도전하는 두 경쟁자
두 모델 모두 동일한 가정을 공격한다. 즉, 음성을 텍스트로 변환하는 것은 완성된 녹음을 대상으로 실행하는 작업이라는 가정이다. Muse Voice Transcribe는 메타가 '실시간 오디오 인식 모델'이라고 부르는 최초의 제품이다. 이는 인식, 20명 이상의 화자를 구분하는 화자 분리, 그리고 화자가 잠시 멈춘 것이 아니라 실제로 말을 마쳤는지를 판단하는 작업인 발화 종점 검출을 수행하는 단일 스트리밍 패스다. 이 제품은 동시에 세 가지 플랫폼으로 출시된다: 오디오 시간당 0.18달러의 Meta Model API, Fn 키를 누르고 있으면 어떤 애플리케이션에서든 받아쓰기가 되는 Mac용 Meta AI, 그리고 Muse Code. 마이크로소프트의 VibeVoice-ASR-Streaming-7B는 오픈 VibeVoice 제품군의 스트리밍 구성원이며, 그 출시 과정은 훨씬 조용하다: 9월 2일에 생성된 Hugging Face 저장소(타임스탬프는 15:46 UTC, 3분 후 마지막 수정), MIT 라이선스의 safetensors 샤드 8개, 그리고 microsoft/VibeVoice GitHub 저장소의 9월 3일자 뉴스 로그 한 줄이 전부다. 그 로그는 이 모델을 '음성이 도착하는 대로 누가 무엇을 말했는지 지속적으로 전사하는 통합 스트리밍 ASR 모델로, 맞춤형 핫워드와 10개 언어를 지원한다'고 설명한다. 업로드 하루 후에도 다운로드 수는 여전히 0이었다.

기능 충돌
• 스트리밍 메커니즘 — Muse Voice Transcribe는 오디오를 {{1}}80밀리초 청크{{/1}} 단위로 소비하며 단어가 안정화되면 커밋하는 반면, VibeVoice-ASR-Streaming-7B는 ~{{2}}2.9초 청크{{/2}}를 ~{{3}}0.5초의 룩어헤드{{/3}}로 처리하여 해석이 완료된 각 청크마다 텍스트를 한 번씩 내보냅니다.
• 화자 귀속 — 한 번의 처리로 20명 이상의 화자를 지원하며, 모델 카드에 명시된 스트리밍 '누가 무슨 말을 했는지' 출력 대비 평균 다이어라이제이션 오류 17.5%는 공급업체 보고에 따른 수치로, 검증되지 않음.
• 엔드포인팅 — 내장형: 스트림이 완료된 발화 경계를 전달할 뿐, 출력 신호로 문서화되지는 않음.
• 컨텍스트 제어 — 언어, 키워드 및 컨텍스트 바이어싱 vs 컨텍스트 프롬프트(--context_info)를 통한 맞춤형 핫워드.
• 언어 — 70개 이상의 언어로 학습되었고, 출시 시점에 25개 언어가 광범위하게 검증되었습니다. 선언된 10개 언어(en, zh, es, pt, de, ja, ko, fr, ru, it)와 비교하여 자연스러운 코드 스위칭을 지원합니다.
• 증거 — 출시일 공급업체 주장: 음성 종료 후 0.16초 시점의 최종 결과에서 3.1% WER, 첫 부분 결과에서 3.6% WER를 기록했다고 하며, Artificial Analysis 스트리밍 리더보드를 인용한다. 반면 텍스트로 공개된 스트리밍 WER이나 지연 시간 수치는 없다.
• 비용 및 라이선스 — 호스팅(폐쇄형 가중치)은 오디오 시간당 $0.18, 가중치(MIT)는 $0, 약 18GB의 bf16, 자체 호스팅.

매우 다른 두 가지 '스트리밍' 개념
‘스트리밍’이라는 단어는 매우 넓은 캐던스 범위를 포괄하며, 이 둘 사이의 간격은 각각의 기반 위에서 무엇을 구축할 수 있는지를 바꿀 만큼 넓다. Muse Voice Transcribe는 단어 단위로 스트리밍한다. Meta의 아키텍처는 오디오를 80밀리초 청크로 소비하며, 이른바 “adaptive delay”라고 부르는 방식을 사용한다. 이는 강화 학습으로 학습된 지연 정책으로, 모델이 확신하는 각 단어는 즉시 확정하고, 확신이 덜한 단어에 대해서는 하나의 고정된 지연 예산을 적용하는 대신 더 많은 맥락을 보유하는 방식이다. 이 업체는 화자가 말을 멈춘 후 0.16초 만에 최종 전사본이 나오고, 발화 시작 0.13초 후에 첫 부분 결과가 나온다고 주장한다. 이러한 캐던스는 대화형 루프, 즉 실시간 자막, 받아쓰기, 완성된 발화에 거의 즉시 응답해야 하는 음성 에이전트를 위해 설계된 것이다.
VibeVoice-ASR-Streaming-7B는 더 큰 단위(grain)로 스트리밍합니다. 해당 전처리기 구성에 따르면 오디오는 24kHz로 유입되어 약 3,200배 압축된 토큰으로 변환되며, 초당 약 7.5프레임 속도로 생성됩니다. 이후 4프레임 lookahead를 포함한 22프레임 청크 단위로 처리되는데, 이는 청크당 약 2.9초 분량의 오디오에 해당하며 lookahead는 약 0.5초입니다. 이러한 수치는 측정된 지연 시간이 아니라 구성(config)에서 도출된 값입니다. 각 청크가 해석될 때마다 텍스트가 출력되며, 이전 청크의 맥락은 KV 캐시를 통해 보존되므로 긴 세션에서도 처음부터 다시 계산하지 않습니다. 약 3초 간격으로 늘어나는 기록은 회의 노트와 통화 분석에 적합하며, 이는 실시간 대화를 위한 1초 미만 단위의 단어 스트리밍과는 다른 제품입니다. 두 연구소 모두 스트리밍 체크포인트에 대한 종단 간 지연 시간 측정 결과를 발표하지 않았으므로, 해당 주기를 설계 의도로 간주하고 실제 환경에서의 체감 품질은 검증되지 않은 것으로 취급해야 합니다.
화자 라벨 및 엔드포인팅: 하나에는 내장되어 있고, 다른 하나에는 주장만 되어 있다.
화자 귀속(speaker attribution)은 스트리밍 제품들이 가장 흔히 과장해서 주장하는 부분이며, 두 제품 모두 그런 주장을 한다. Muse Voice Transcribe의 버전은 구체적이고 구조적이다. 화자 분리(diarization)가 인식(recognition)과 동일한 스트리밍 패스 안에서 실행되므로, 20명이 참여한 통화 녹음도 별도의 "업로드 → 대기 → 화자 결과 수신" 단계 없이 화자별 레이블을 붙일 수 있다. Meta는 평균 화자 분리 오류율 17.5%를 보고하는데, 이는 재현되지 않은 벤더 수치이지만 실제 메커니즘에 기반한 숫자다. 또한 이 제품은 엔드포인트 경계(endpoint boundaries)도 내보내는데, 이는 덜 부각되는 기능이다. 애플리케이션은 음성 활동 감지기(voice-activity detector)를 따로 구축하지 않고도 "이 화자의 발언이 끝났다"는 명확한 신호를 받을 수 있다. 이것이 바로 원시 ASR 위에 구축된 음성 에이전트가 사용자를 그토록 자주 끊어버리는 이유다.
VibeVoice-ASR-Streaming-7B는 모델 카드에서 스트리밍 방식의 '누가 무엇을 말했는지' 출력을 주장하며, 이는 배치용 VibeVoice-ASR의 구조화된 누가/언제/무엇(Who/When/What) 출력과 같은 맥락에 있다. 다만 스트리밍 체크포인트의 경우 이 주장은 검증되지 않았고, 독립적인 테스트로 재현된 적도 없으며, Muse가 제공하는 것과 같은 문서화된 엔드포인팅(endpointing) 신호도 존재하지 않는다. 처리 대상이 진짜 다중 화자 라이브 오디오라면, 현재 Muse가 더 완전한 메커니즘을 제공한다. 반면, 직접 관리하는 하드웨어에서 오픈 가중치 모델이 동일한 작업을 해낼 수 있는지 평가하는 중이라면, VibeVoice의 주장은 믿기 전에 자신의 회의 녹음으로 테스트해볼 만한 바로 그런 사례다.
증거: 빈 카드에 대한 출시일 주장
각 측이 가진 것이 정확히 무엇인지 따져보는 것은 가치가 있다. 어느 쪽도 구매자가 실제로 원하는 것을 갖고 있지 않기 때문이다. Muse Voice Transcribe는 공급업체 수치를 빽빽하게 갖추고 있다. 최종 전사본 기준 단어 오류율 3.1%, 첫 번째 부분 인식 결과 기준 3.6%, 최종 지연 시간 0.16초, 평균 화자 분리 오류율 17.5% 등이다. 이 모든 수치는 메타가 출시일에 공개한 것으로, 메타가 1위를 주장하는 Artificial Analysis 스트리밍 음성-텍스트 리더보드를 가리킨다. 이는 실험실 밖에서는 누구도 재현하지 못한 주장일 뿐이지만, 반증할 수 있을 만큼 구체적이라는 점에서 일종의 진전이다.
VibeVoice-ASR-Streaming-7B에는 그런 것이 전혀 없다. 이 모델 카드는 평가 수치를 이미지로 싣고 있으며, 스트리밍 기술 보고서는 PDF이지만, 본문에서 인용할 수 있는 스트리밍 WER이나 지연 시간 수치는 없다. VibeVoice 제품군에서 유일한 숫자 기준점은 배치(batch) VibeVoice-ASR 카드에 공급업체가 보고한 표뿐이다. 즉, 8개 영어 테스트 세트에서 평균 WER 7.77%, LibriSpeech clean에서 2.20%인데, 이는 명시적으로 이 체크포인트의 수치가 아니다. 출시일의 주장이 빈 카드와 마주할 때, 정직한 승부 기준은 헤드라인 WER을 제외한 모든 것, 즉 가격, 라이선스, 스트리밍 주기, 그리고 각 측이 실제로 문서화한 기능들이다.
언어: 25개 검증됨(선언 10개 대비)
언어 커버리지가 두 모델을 가르는 기준은 헤드라인의 정확도 주장보다 더 명확합니다. Muse Voice Transcribe는 70개 이상의 언어로 학습되었지만 Meta는 출시 시점에 25개 언어만 검증합니다. 그리고 학습 목록이 아닌 검증 목록이 실제 프로덕션 커버리지이며, 네이티브 코드 스위칭이 차별점입니다. 이 모델은 별도 지시 없이 문장 중간에 언어를 전환하도록 설계되었습니다. VibeVoice-ASR-Streaming-7B는 모델 카드에 10개 언어를 명시합니다 — 영어, 중국어, 스페인어, 포르투갈어, 독일어, 일본어, 한국어, 프랑스어, 러시아어, 이탈리아어 — 배치형 VibeVoice-ASR의 50개 이상 언어와 대비됩니다. 트래픽에 코드 스위칭 대화가 포함된다면 Muse가 더 구체적인 강점을 갖고, 트래픽이 그 10개 언어 안에 머문다면 Microsoft 모델의 커버리지는 최소한 명시적이며, 이는 대부분의 출시 자료가 제공하는 수준보다 더 나은 것입니다.
비용과 당신이 갖게 되는 것
비즈니스 모델의 차이가 가장 명확한 판단 기준이다. Muse Voice Transcribe는 오디오 시간당 $0.18로 모든 주요 스트리밍 전사 API를 공식 가격 기준으로 밑돈다. GPU가 필요 없고, 운영 부담이 없고, 가중치가 비공개이며, 가격은 Meta가 책정한다. VibeVoice-ASR-Streaming-7B는 다운로드 비용은 없지만, 24GB급 GPU에서 자체 호스팅하려면 KV 캐시 이전에 약 18GB의 bf16 가중치가 필요하다. 문서화된 서빙 경로는 microsoft/VibeVoice 데모 스크립트 또는 vLLM 플러그인이며, 아직 이 모델을 호스팅하는 추론 제공업체는 없다. 진짜 지속 가능한 자산은 MIT 라이선스다. 가중치는 API 구독으로는 불가능한 방식으로 온전히 소유하여 보관하고 미세 조정할 수 있다. 가격 구도가 흥미로워질 수 있는 지점도 바로 여기다. 어떤 제공업체가 그 오픈 체크포인트를 실제로 호스팅하는 순간, 시간당 $0.18이라는 가격은 단일 벤더의 공식 가격이 아니라 시장 가격이 된다. 패스스루 라우터가 존재 가치를 입증하는 상황이 정확히 이것이다. OrcaRouter는 현재 음성-텍스트 변환(STT)을 라우팅하지 않으며, 이 두 모델 모두 카탈로그에 없다. OrcaRouter가 실제로 하는 일은 실시간 전사(transcript)를 소비하는 200개 이상의 언어 모델에 대해 제공업체 공식 가격을 0% 마크업으로 패스스루하는 것이다. 따라서 그 스택 어디에서든 벤더가 가격을 인하하면 발표된 당일에 구매자 측에도 그대로 반영된다.

자주 묻는 질문
Muse Voice Transcribe의 3.1% WER은 VibeVoice-ASR-Streaming-7B보다 더 정확하다는 것을 의미합니까?
아니요, 그리고 그 비교는 아직 의미가 없습니다. Meta의 3.1%는 스트리밍 경로에 대한 출시일 당시의 주장일 뿐이며, 공급업체가 보고한 것이고 재현된 바 없습니다. VibeVoice-ASR-Streaming-7B는 텍스트로 공개된 스트리밍 정확도 수치가 전혀 없습니다. 두 모델이 동일한 오디오에 대해 동일한 공개 테스트 하네스로 실행되기 전까지, 정직하게 말할 수 있는 유일한 사실은 Muse는 테스트 가능한 구체적인 주장이 있는 반면 VibeVoice에는 아직 그런 주장이 없다는 것입니다.
이미 녹음된 오디오에 두 모델 중 하나를 사용할 수 있나요?
둘 다 그렇습니다, 다만 그 형태는 다릅니다. Muse Voice Transcribe는 동일한 스트리밍 API를 통해 한 시간 이상 길이의 녹음도 처리합니다. VibeVoice-ASR-Streaming-7B의 vLLM 플러그인은 WebSocket 스트림 엔드포인트와 함께 전체 파일 트랜스크라이브 엔드포인트를 제공합니다. 그러나 둘 다 실시간(라이브) 사례에 맞춰 설계되고 가격도 그에 맞게 책정되어 있습니다. Muse는 스트리밍 전용이라는 비즈니스 모델 때문에, VibeVoice는 오디오가 도착하는 대로 결과를 내보내는 청크 기반 아키텍처 때문에 그렇습니다. 따라서 작업량이 순수한 배치 파일 처리라면, 전용 파일 트랜스크립션 API가 이 둘 중 어느 것보다 대개 더 저렴하고 측정 결과도 더 좋을 것입니다.
