
Grok Voice Transcribe 2.0 대 VibeVoice ASR Streaming 7B: Microsoft가 공개하지 않은 숫자
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
VibeVoice ASR Streaming 7B는 Microsoft의 통합 스트리밍 음성 인식기로, 2026년 9월 2일 Hugging Face에 업로드되었고 하루 뒤 microsoft/VibeVoice 저장소에서 MIT 라이선스로 발표되었으며, Grok Voice Transcribe 2.0이나 대부분의 경쟁 제품이 하지 않는 일을 합니다: 별도의 화자 분리 단계 없이 오디오가 도착하는 대로 화자 귀속 텍스트를 출력합니다. Microsoft의 기술 보고서에 따르면 7B 체크포인트는 다섯 개 평가 세트에서 가장 낮은 평균 WER과 CER을 달성했고, 13개 평가 설정 중 12개에서 최고 또는 공동 최고의 화자 귀속 성능을 보였습니다. 모델 카드가 하지 않는 일은 텍스트로 단 하나의 수치도 공개하지 않는다는 점입니다 — WER도, RTF도, 지연 시간 수치도 없습니다. 결과는 보고서에 이미지로만 존재합니다. Grok Voice Transcribe 2.0은 16일 뒤인 2026년 9월 18일에 출시되었으며, 배치의 경우 오디오 시간당 $0.10, 스트리밍의 경우 시간당 $0.20에 모든 것을 공개합니다: Artificial Analysis의 스트리밍 보드에서 최종 트랜스크립트 WER 2.7%와 첫 부분 WER 3.4%, 각각 0.49초입니다. 따라서 이 비교의 정직한 출발점은 두 모델 중 하나가 다른 하나보다 측정 가능하게 더 잘 문서화되어 있다는 것이며, 그 비대칭성 자체가 이 맞대결에서 가장 의사 결정에 관련된 사실입니다.
마이크로소프트가 공개한 것, 그리고 독자가 그것으로 무엇을 할 수 있는지
VibeVoice 보고서는 실제 연구이며, 그 안의 주장들은 값에서는 아니더라도 형태에서는 구체적이다. 이 보고서는 네 가지 회의 벤치마크 — AliMeeting, AISHELL-4, AMI-SDM, AMI-IHM — 와 MLC-Challenge를 아홉 개 언어에 걸쳐 평가했고, 두 가지 주요 결과를 보고한다: 7B 모델이 다섯 세트 전체에서 가장 낮은 평균 WER/CER를 기록했고, 13개 평가 설정 중 12개에서 최고 또는 공동 최고의 화자 귀속 성능을 보였다. 둘 다 상대적 주장인데, 이는 의미 있는 종류의 주장이다: "이 다섯 세트에서 가장 낮음"은 순서에 관한 진술이고, 순서는 구매자에게 필요한 것이다.
빠져 있는 것은 모든 절대 수치다. 무엇과도 비교할 WER 백분율도 없고, 처리량 수치도 없고, 지연 시간 측정치도 없고, 텍스트로 제시된 세트별 분석도 없다. VibeVoice를 Grok Voice Transcribe 2.0 옆에 놓고 Microsoft 모델에 숫자를 부여하는 비교표는 그 숫자를 지어내는 셈이다. 말할 수 있는 것은 VibeVoice가 자체 5개 세트 평가에서 이겼다는 것과 Microsoft 외부의 누구도 이를 다시 실행하지 않았다는 것뿐이다 — 독립적 벤치마크도, 제3자 평가도, 이 글을 쓰는 시점에 해당 모델을 아예 등록한 호스팅 추론 제공자도 없다. 따라서 비교는 문서화된 숫자와 문서화되지 않은 순위 사이의 비교이며, 문서화되지 않은 순위가 단지 소수점이 없다는 이유로 둘 중 더 약한 쪽인 것은 아니다.
Grok Voice Transcribe 2.0의 문서는 정반대의 문제를 안고 있다. 이 모델의 2.7%와 3.4%는 Artificial Analysis의 AA-WER Streaming 보드에서 나온 수치로, AA-AgentTalk 50%, VoxPopuli와 Earnings22 각 25%의 가중 복합 지표다 — 약 8시간 분량의 에이전트 형태 영어 대화 오디오를 독립적으로 운영한 것으로, 벤더 자체 평가보다 진정으로 더 강력한 출처다. 하지만 그것은 영어의 좁은 한 조각일 뿐이며, 그 보드 페이지 자체는 SpaceXAI가 32개 중 1위를 주장할 때 집계하는 33개 모델 가운데 27개만 표시한다. 좁은 테스트에서의 정밀한 숫자와 더 넓은 테스트에서의 부정확한 주장은 직접 비교할 수 없으며, 이 글은 그렇지 않은 척하지 않을 것이다.
2.5초 대 0.5초
레이턴시 비교는 두 모델을 데이터셋에 대한 어떠한 유보 조건도 없이 나란히 놓을 수 있는 유일한 곳입니다. 두 모델 모두 스트리밍 구성을 공개하기 때문이며, 그 차이는 튜닝 선택이 아니라 아키텍처에 기인합니다.
VibeVoice ASR Streaming 7B는 청크 단위로 작동합니다. 공개된 체크포인트는 청크당 22개의 잠재 프레임을 사용하는데, 이는 모델의 초당 7.5 잠재 프레임 기준으로 청크당 약 2.9초의 오디오에 해당하며, 4개의 잠재 프레임, 즉 약 0.5초의 미래 오디오를 미리 살펴보는 룩어헤드와 약 2.00초의 예상 화자 귀속 지연을 가집니다. 청크당 한 번 텍스트를 출력합니다. 이것은 실제 스트리밍 시스템이지만, 그 주기는 밀리초가 아니라 초 단위로 측정됩니다.
Grok Voice Transcribe 2.0은 화자가 말을 멈춘 뒤 0.49초 후에 첫 부분 전사 결과를 반환하고, 발화가 끝난 뒤 0.49초 후에 최종 전사 결과를 확정한다. 그것은 속도와 정확도를 맞바꾼 결과였다 — 첫 부분 오류율은 버전 1.0의 18.3%에서 2.0의 3.4%로 떨어졌지만, 같은 지표에서 0.25초에서 0.49초로 늘어나는 대가를 치렀다.
나란히 놓으세요:
• 스트리밍 케이던스 — Grok Voice Transcribe 2.0은 0.49초의 첫 부분 지연으로 부분 결과를 지속적으로 생성하는 반면, VibeVoice ASR Streaming 7B는 약 2.9초마다 하나의 텍스트 청크를 생성합니다.
• 화자 귀속 지연 시간 — 동일한 0.49초 경로 내에 포함 vs 설계상 약 2.00초
• 룩어헤드 — 게시되지 않음 대 네 개의 잠재 프레임, 약 0.5초의 미래 오디오
• 실질적 효과 — 음성 에이전트는 진행 중인 문장에 대해 바로 행동할 수 있는 반면, 어떤 시스템은 3초마다 화자 라벨이 붙은 문단을 받는다
이 둘 중 어느 것도 틀리지 않았습니다. 2.9초 청크는 회의 전사에 있어 지극히 합리적인 설계입니다. 여기서 출력은 문서이고, 그 가치는 문서가 회의가 끝난 뒤가 아니라 회의 중에 도착한다는 데 있습니다. 하지만 대화형 에이전트에는 잘못된 설계입니다. 대화형 에이전트에서 3초의 침묵은 일시 정지가 아니라 실패입니다. 두 리듬 사이의 격차는 대략 6배이며, 이는 대화를 전사하는 것과 대화에 참여하는 것의 차이에 거의 정확히 대응합니다.

파이프라인 단계가 아닌 출력으로서의 화자 귀속
바로 이 부분에서 Microsoft 모델이 진정으로 앞서 있으며, 이 설계는 청킹이 거칠게 되는 이유이므로 이해할 가치가 있습니다.
VibeVoice는 두 개의 사전 학습된 토크나이저 — 음향 인코더와 의미 인코더 — 를 사용하며, 24kHz에서 3,200배 다운샘플링으로 초당 7.5개의 잠재 프레임을 생성합니다. 이는 133밀리초마다 하나씩입니다. 이 프레임들은 Qwen2.5 언어 모델 백본에 투영되고, 들어오는 음성과 생성된 텍스트는 단일 시퀀스로 인터리빙되며, 이전에 관찰된 음성과 텍스트는 모델의 컨텍스트에 유지됩니다. 그 결과 화자 정체성은 결코 별도의 문제가 되지 않습니다. 모델은 전사한 다음 누가 말했는지 결정하는 것이 아니라, 여전히 목소리들을 담고 있는 오디오 이력을 조건으로 텍스트를 생성합니다. 그래서 정렬해야 할 화자 분리 단계가 없고, 13개 설정 중 12개에서의 화자 귀속에 관한 Microsoft의 주장이 덧붙인 결과가 아니라 아키텍처적으로 신뢰할 수 있는 것입니다.
그 설계의 대가는 녹음 길이에 따라 선형적으로 증가하는 이력 보존이며, 그래서 공개된 체크포인트들은 최대 8분 길이의 녹음을 대상으로 한다. 이는 실질적인 한계이고 분명하게 명시되어 있다. 이는 장시간 작업, 즉 2시간짜리 실적 발표 통화나 하루 종일의 컨택트 센터 오디오에는 이 모델을 배제한다. 직접 분할과 재초기화를 구축하지 않는 한 말이다. 그러면 아키텍처가 제거하도록 설계된 바로 그 복잡성이 다시 도입된다.
Grok Voice Transcribe 2.0은 같은 문제를 다른 방식과 다른 제약 조건으로 해결한다. 추가 비용 없이 화자 분리를 포함하며, 단일 요청에서 최대 8개의 독립 오디오 채널을 지원한다. 각 참가자가 종종 자신만의 채널로 들어오는 컨택트 센터 전화 통신에서는 채널 분리가 화자 분리보다 더 안정적이며 오류율도 수반되지 않는다. 혼합 오디오의 경우에는 화자 분리 품질에 달려 있으며, 평균 화자 분리 오류율 17.5%를 공개한 Meta의 Muse Voice Transcribe와 달리 SpaceXAI는 화자 분리 수치를 전혀 공개하지 않았다. 따라서 두 모델 모두 화자 분리 증거에 공백을 남긴다. 하나는 값 없이 순위를 공개하고, 다른 하나는 측정치 없이 기능 목록을 공개한다.
18기가바이트, 10개 언어, MIT
배포 관련 사실이 너무나 완전히 달라서 거의 비교라고 할 수 없을 정도입니다. VibeVoice ASR Streaming 7B는 대략 18GB의 bf16 가중치입니다. Hugging Face 모델 카드에는 7B라는 이름의 체크포인트에 대해 총 9B 파라미터가 기재되어 있으며, 약 5.6GB의 1.5B 형제 모델도 있습니다. MIT 라이선스가 적용되어 있고, Python 데모와 서빙용 vLLM 플러그인이 제공됩니다. 10개 언어: 중국어, 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 스페인어. Microsoft는 이를 연구 및 개발용으로 포지셔닝합니다.
Grok Voice Transcribe 2.0은 다운로드할 가중치가 없는 관리형 엔드포인트로, 8kHz 전화 오디오부터 48kHz까지의 12가지 입력 형식, 최대 8개 채널, 요청당 100개 핵심 용어, 녹음 중 전환을 지원하는 자동 언어 감지, 25개 언어에 걸친 역 텍스트 정규화, 최대 500MB 파일, 그리고 팀당 초당 10개 요청 및 100개 동시 스트리밍 세션의 서비스 한도를 제공합니다. us-east-1에서 실행되며 us-east-1에서만 실행됩니다.
• 가중치 — MIT, 18GB, 어디서든 실행 가능 vs 없음, 벤더 호스팅 전용
• 언어 — 10개 명명 언어 vs 25개 전반에 걸친 서식 지원을 포함한 자동 감지
• 핵심 용어 바이어싱 — 핫워드를 통한 지원 vs 요청당 최대 100개 핵심 용어
녹음 길이 — 기록 보존이 제약이 되기 전까지 체크포인트당 약 8분 vs 공개된 상한 없음, 파일은 최대 500MB
• 리전 제어 — 어디에 배포하든 vs us-east-1
• 비용 — 라이선스 비용 없음, 그리고 18GB의 GPU 메모리와 서빙 스택 대 배치 시간당 $0.10 및 스트리밍 시간당 $0.20
18GB 모델은 노트북에서 돌릴 수 있는 것이 아니며, vLLM 플러그인은 실제 메모리를 갖춘 GPU를 필요로 한다. 그에 반해, 그 정도 규모의 모델에 MIT 라이선스가 적용된다는 것은 드물고 가치 있는 일이다. 이는 둘 중 자체 네트워크 안에서 벤더 관계 없이 전혀 실행할 수 있는 유일한 모델이며, 규제 대상 오디오에서는 선호가 아니라 필수다. 관리형 대안은 시간당 저렴하지만 온프레미스에 배포하는 것은 불가능하다.

라우팅 결정이 속하는 위치
비용은 두 모델이 마침내 하나의 숫자로 비교 가능해지는 지점입니다. Grok Voice Transcribe 2.0의 배치 경로는 오디오 1시간당 $0.10, 1,000분당 약 $1.67이고, 스트리밍 경로는 $0.20, 1,000분당 약 $3.33입니다. VibeVoice ASR Streaming 7B는 라이선스 비용이 전혀 없습니다. 그 대신 약 18GB의 상주 GPU 메모리와 직접 운영해야 하는 vLLM 서빙 스택이 있습니다. 그 정도 크기의 7B급 모델은 임대 하드웨어에서 오디오 1시간당 저렴하지 않을 것이며, 활용률 곡선은 가차 없습니다 — 피크 트래픽을 위해 웜 상태로 유지되는 GPU는 전사 중이든 유휴 상태이든 비용이 동일합니다.
그것이 구축 대 구매 논쟁의 일반적인 형태이며, 그 결론은 볼륨과 오디오가 네트워크를 떠나도 되는지 여부에 따라 달라집니다. 지난 한 달 동안 달라진 점은 답이 움직이는 속도입니다. 스트리밍 정확도 선두는 3주 만에 두 번 바뀌었고, 9월 초에 출시된 모델은 9월 중순에 밀려났습니다. 모델 선택을 되돌리는 데 비용이 많이 들게 만드는 아키텍처는 이제 이 범주에 맞지 않는 아키텍처입니다.
OrcaRouter는 바로 그 역전이 저렴해지는 곳입니다. OpenAI 호환 키 하나로 자동 장애 조치 기능과 함께 200개 이상의 모델을 사용할 수 있으므로, 단일 리전 관리형 엔드포인트의 장애는 서비스 중단이 아니라 라우팅 이벤트가 되며, 제공업체의 정가는 0% 마크업으로 그대로 전달됩니다 — 즉, 공급업체의 가격 변경이나 새로운 체크포인트가 같은 날 우리 쪽에 반영됩니다. 자체 오디오로 VibeVoice를 Grok Voice Transcribe 2.0과 비교 테스트하려는 팀이나, 관리형 주 엔드포인트와 동일한 인터페이스 뒤에 자체 호스팅 폴백을 유지하려는 팀에게 호출 지점은 더 이상 변경해야 하는 대상이 아닙니다.

정직한 평결: VibeVoice ASR Streaming 7B는 더 흥미로운 모델이고 Grok Voice Transcribe 2.0은 더 쓸 만한 제품이며, 이 두 문장 사이의 격차는 전적으로 한 벤더는 차트를 공개하고 다른 벤더는 숫자를 공개한다는 점으로 설명된다. 요구사항이 8분 미만 회의를 온프레미스에서 화자 귀속 전사하는 것이라면, Microsoft 체크포인트가 둘 중 유일하게 조건을 충족한다. 요구사항이 대화 중 멈춤 안에 응답하는 음성 에이전트라면, 2.9초 청크 주기 때문에 정확도를 논하기도 전에 탈락한다. 그리고 이 문제를 결정지어 줄 비교 — 같은 오디오를 두 모델에 통과시키고 어느 회사에도 소속되지 않은 사람이 점수를 매기는 것 — 를 기다리고 있다면, 그 측정은 아직 존재하지 않으며, 다음번에 어떤 표가 VibeVoice의 이름 옆에 숫자를 놓을 때 기억해 둘 가치가 있다.
