VibeVoice-ASR-Streaming-7B와 Gemini 3.5 Transcribe Live를 비교하는 히어로 타이틀 카드로, 오버라인은 '스트리밍 음성-텍스트 변환 - 2026년 9월'이다. 부제는 Microsoft가 조용히 공개한 오픈 체크포인트와 Google의 신중한 Live API가 맞서는 구도를 설명하며, 칩으로 'MIT 가중치 - 9월 2일', 'Google API - 8월 26일', 'VibeVoice WER 미공개'가 표시된다. '지금까지 알려진 내용'이라는 각주가 붙어 있고, OrcaRouter 로고는 오른쪽 하단에 합성되어 있다.
Guides & Insights

VibeVoice-ASR-Streaming-7B 대 Gemini 3.5 Transcribe Live: 일주일, 두 종류의 스트리밍 음성-텍스트 변환

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 8월 마지막 주와 9월 첫 며칠 사이, 서로 라이벌처럼 보이지만 실제로는 같은 질문에 대한 서로 다른 답변인 두 개의 스트리밍 음성-텍스트 변환 시스템이 등장했다. 8월 26일, 구글은 Gemini 3.5 Transcribe Live를 공개 미리보기로 내놓았다. 이는 호스팅 방식의 폐쇄형 음성-텍스트 변환 엔드포인트로서, 화자가 말을 멈춘 후 0.40초 만에 완성된 텍스트를 반환하며, Artificial Analysis가 측정한 4.0%의 스트리밍 단어 오류율과 공식 출시 자료가 이를 뒷받침한다. 9월 2일, 마이크로소프트 리서치는 Hugging Face의 microsoft 네임스페이스에 VibeVoice-ASR-Streaming-7B를 업로드했다. 이 업로드는 MIT 라이선스의 오픈 가중치이며, 보도자료도 출시 페이지도 없고, 모델 카드는 읽을 수 있는 텍스트로 단어 오류율이나 지연 시간 수치를 전혀 공개하지 않는다. 두 시스템 모두 오디오가 아직 도착하는 동안에도 이를 입력으로 받아들인다. 이것이 두 시스템이 공유하는 거의 유일한 공통점이다.

양측의 증거는 대칭적이지 않으므로, 이 비교는 '지금까지 알려진 것'이라는 틀에서 작성되었습니다. Gemini 3.5 Transcribe Live는 공개된 토큰 가격과 타사 측정 결과가 있는 Google 제품이며, 그 내용은 아래에 표시됩니다. VibeVoice-ASR-Streaming-7B는 저장소 자체에서 모든 주장을 읽어낸 체크포인트입니다. 즉, 구성 파일, 모델 카드, 그리고 VibeVoice GitHub 저장소에 있는 Microsoft의 스트리밍 문서가 그 출처입니다. Microsoft 측에 대해서는 아직 독립적인 벤치마킹이 이루어지지 않았으며, 숫자가 마치 근거처럼 보일 수 있는 모든 곳에서 우리는 그 사실을 명시했습니다.

출시 과정: API 출시와 조용한 업로드

Google은 {{1}}Gemini 3.5 Transcribe Live{{/1}}를 일반적인 방식으로 출시했습니다. 이 모델은 {{2}}Gemini Audio{{/2}} 배너 아래에 자매 모델인 {{3}}Gemini 3.5 Transcribe{{/3}}(사전 녹음 오디오용 {{4}}Interactions API{{/4}} 경로)와 함께 자리 잡고 있습니다. 가격은 모델 페이지에 나와 있으며, 독립 리더보드에서도 며칠 내에 Live 엔드포인트를 등재했습니다. 4.0%의 스트리밍 WER과 0.40초의 최종 지연 시간은 바로 이 리더보드에서 나온 수치입니다. 무료 티어도 제공되며, 무료 티어 콘텐츠는 Google 제품 개선에 사용될 수 있다는 일반적인 주의사항이 적용됩니다.

Microsoft의 스트리밍 릴리스에는 그러한 장치가 전혀 없었다. Hugging Face 저장소 microsoft/VibeVoice-ASR-Streaming-7B는 2026-09-02 15:46 UTC에 생성되었고, 3분 후에 마지막으로 수정되었다. 이 저장소에는 MIT 라이선스 하에 8개의 safetensors 샤드, 토크나이저, 전처리기 구성이 들어 있다. 공식 기록은 microsoft/VibeVoice 저장소에 9월 3일자 뉴스 로그 한 줄로, "누가 무엇을 말했는지 음성이 도착함에 따라 연속적으로 전사하고, 맞춤형 핫워드와 10개 언어를 지원하는 통합 스트리밍 ASR 모델"을 발표하며 aka.ms/vibeasr의 데모와 스트리밍 기술 보고서 링크를 포함한다. 업로드 하루 후 확인했을 때, 체크포인트는 여전히 다운로드 0회를 기록하고 있었고, 호스팅된 추론 제공업체 중 이 모델을 나열하는 곳은 없다. 모델 카드는 발표문보다 더 많은 내용을 담고 있으며, 아래 내용의 거의 전부가 이 저장소에서 나온 것이다.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

사양, 나란히 비교

• 정의 — VibeVoice-ASR-Streaming-7B: 오픈 가중치 스트리밍 ASR(자체 호스팅) vs Gemini 3.5 Transcribe Live: 호스팅형 스트리밍 API(비공개 가중치).

• 스트리밍 형태 — 체크포인트 구성에서 파생된 약 0.5초의 선행 시간과 함께 대략 2.9초 단위로 텍스트를 내보내는 반면, 양방향 WebSocket 세션은 연속적인 부분 전사와 화자가 말을 멈춘 후 0.40초 후에 나오는 최종 결과를 제공합니다.

인쇄 정확도 — Artificial Analysis에 따르면, 텍스트로 게시된 WER 또는 지연 시간 수치는 없으며, 스트리밍 WER 4.0% 및 사전 녹음 모델에서 2.6%와 대비됩니다.

• 화자(Speakers) — 스트리밍 '누가 뭐라고 했는지' 귀속 기능을 주장하지만, 라이브 엔드포인트에서는 화자 분리(diarization)가 미검증이거나 지원되지 않습니다. (사전 녹음 모델에서는 최대 3명까지 사용 가능)

• 언어 — 10개(en, zh, es, pt, de, ja, ko, fr, ru, it) 대 85개 이상 언어 자동 감지, 중간 전환 지원

• 세션 길이 — GPU와 메모리에 의해서만 제한되며, Live 세션당 10분 하드 캡과는 대조적입니다.

• 비용 — 가중치 비용은 $0이고, 자체 호스팅에는 약 18GB의 bf16이 필요하며, 텍스트 출력 토큰까지 계산하면 Live 기준 오디오 시간당 약 $0.54입니다.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Gemini 3.5 Transcribe Live - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): what it is - open weights self-hosted; streaming cadence - ~2.9 s chunks + ~0.5 s lookahead; WER published - none in text; speaker output - claimed, unverified; languages - 10; cost - $0 weights, ~18 GB bf16. Right column Gemini 3.5 Transcribe Live (released Aug 26, 2026 - public preview): hosted streaming API closed weights; WebSocket partials, final 0.40 s after speech (AA); 4.0% streaming / 2.6% batch (AA); none on the Live endpoint; 85+ auto-detect; ~$0.54 per audio-hour. Footer: 'Gemini figures per Google pricing + Artificial Analysis. VibeVoice specs read from the HF repo; no benchmark exists yet.'

각 측면에서 "스트리밍"이 의미하는 것

그 단어는 실제 설계 차이를 숨기고 있다. 두 시스템은 애초에 동일한 리듬을 만들어내려고 하지 않기 때문에, 정확히 짚고 넘어갈 가치가 있다. Microsoft의 전처리기 구성은 VibeVoice 리듬을 구체화한다. 오디오는 24kHz로 들어오며 초당 약 7.5프레임의 토큰 스트림으로 3,200배 압축된다. 그런 다음 구성은 22프레임 청크와 4프레임 lookahead를 선언한다. 즉 청크당 약 2.9초 분량의 오디오와, 이를 확고히 하기 위한 대략 0.5초의 미래 오디오가 포함된다. 모델은 해석된 청크마다 텍스트를 한 번씩 출력하며, 이전 청크의 컨텍스트는 KV 캐시를 통해 유지되므로 긴 세션에서도 처음부터 다시 계산하지 않는다. 실제 전사본은 대략 3초 단위로 늘어난다.

Google의 {{1}}Live{{/1}} 엔드포인트는 더 빠르고 인터랙티브한 루프를 위해 설계되었습니다. 오디오는 16kHz 또는 24kHz PCM 청크로 {{2}}WebSocket{{/2}}을 통해 스트리밍되며, 화자가 말하는 동안 부분 전사본이 계속 반환되고, 최종 포맷 전사본은 음성 종료 후 {{3}}0.40초{{/3}} 뒤에 도착합니다. 이 수치는 Google이 인용한 Artificial Analysis의 측정값입니다. 트레이드오프는 세션 상한(오디오 {{4}}10분{{/4}}, 이후 애플리케이션이 재연결하고 이어붙여야 함)과 누락된 추가 기능입니다. Live 경로에는 {{5}}화자 분리{{/5}}와 {{6}}단어 수준 타임스탬프{{/6}}가 없지만, 둘 다 사전 녹음된 {{7}}Gemini 3.5 Transcribe{{/7}}에는 존재합니다. 따라서 솔직한 요약은 {{8}}Google{{/8}}의 스트리밍 모델이 발화당 더 빠른 반면, {{9}}Microsoft{{/9}}의 스트리밍 체크포인트가 청크당 더 느리지만 {{10}}Google{{/10}}의 실시간 경로가 누락하는 화자 귀속을 {{11}}Google{{/11}}이 지원하지 않는 세션 길이에서 제공한다는 것입니다.

정확도: 빈 공간과 대비하여 측정됨

이번 맞대결에서 가장 큰 차이는 품질이 아니라 증거의 차이다. Artificial Analysis는 Gemini 3.5 Transcribe Live의 스트리밍 평균 단어 오류율을 4.0%, 비스트리밍 모델은 2.6%로 측정했는데, 후자는 출시 당시 자체 WER 리더보드에서 5위를 기록했다. Google은 별도로 FLEURS 다국어 세트에서 스트리밍 5.50%, 비스트리밍 5.04% 수치를 제시한다. 이 수치들은 표시된 대로 읽어야 한다. Artificial Analysis는 Google과 무관한 곳이지만, 출시 하루 만의 API 수치는 여전히 이르다. 그리고 배치 모델 대비 스트리밍의 추가 오류율(4.0% 대 2.6%)은 실시간 전달에 따르는 일반적인 대가다.

VibeVoice-ASR-Streaming-7B는 어디에도 비교할 만한 수치가 없습니다. 모델 카드에는 평가 수치가 이미지로 포함되어 있고 Microsoft의 기술 보고서는 PDF일 뿐이며, 어느 쪽도 인용하거나 독립적으로 검증할 수 있는 일반 텍스트 형식의 스트리밍 WER 또는 지연 시간 수치를 제공하지 않습니다. 전체 제품군에서 유일한 수치적 기준점은 배치(batch)용 VibeVoice-ASR 모델 카드로, 8개 영어 테스트 세트에서 평균 7.77% WER과 LibriSpeech clean에서 2.20%를 보고합니다. 이는 이 모델이 아닌 비스트리밍 모델의 수치이며, 스트리밍 모델은 일반적으로 지연 시간이라는 이점을 위해 약간의 정확도를 맞바꿉니다. 누군가 공개 하네스로 스트리밍 체크포인트를 실행하기 전까지, 공정한 표현은 이 비교의 한쪽은 측정된 수치이고 다른 쪽은 그렇지 않다는 것입니다.

비용: 이미 예산에 포함된 GPU 대비 종량제 API

Google은 Gemini 3.5 Transcribe Live를 토큰 단위로 가격을 책정하며, 오디오는 초당 25토큰으로 청구합니다. 공개된 Live 요금 기준(오디오 토큰 100만 개당 $3.50, 텍스트 출력 토큰 100만 개당 $21)으로 오디오 1시간을 혼합 환산하면 대략 $0.54, 즉 오디오 1,000분당 약 $9이며, 사전 녹음 모델은 시간당 약 $0.30으로 더 저렴합니다. 무음 구간은 클라이언트가 해당 구간을 스트리밍하지 않을 때만 무료입니다. 재연결, 중복 오디오, 로깅은 모두 실제 청구서에 측정된 토큰으로 추가됩니다.

마이크로소프트의 체크포인트는 대신 GPU 시간 단위로 요금이 책정됩니다. bf16 가중치만 해도 KV 캐시를 포함하기 전에 약 18GB에 달하며, 문서화된 사용 경로는 microsoft/VibeVoice 저장소의 Python 데모와 WebSocket 및 OpenAI 호환 엔드포인트를 제공하는 vLLM 플러그인입니다. 그리고 아직 어떤 제공업체도 이 모델을 호스팅하지 않기 때문에 호스팅 요금은 없습니다. 배치(batch) VibeVoice-ASR이 3월부터 제공된 것과 달리, 이 모델은 Azure AI 파운드리(Azure AI Foundry)에 올라와 있지 않습니다. 7B급 음성 LLM을 자체 호스팅하려면 24GB급 GPU와 직접 운영할 시간을 예산에 포함해야 합니다. 그 대가로 무제한 세션 길이와 마음대로 보관할 수 있는 가중치를 얻습니다. 두 모델은 상호 배타적이지 않으며, 이것이 마지막 섹션의 핵심입니다.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

선택을 저렴하게 유지하기

어느 쪽을 선택할지는 숫자가 필요한지 코드가 필요한지에 따라 달라집니다. 오늘 바로 작동하고 공개된 정확도를 갖추었으며 GPU 실행이 필요 없는 전사를 원하고, 오디오가 10개 언어에 국한되지 않거나 Live 엔드포인트가 제공하지 않는 화자 라벨링을 직접 구축할 준비가 되어 있다면 Gemini 3.5 Transcribe Live를 선택하세요. 자체 호스팅을 하고, 무제한 세션 길이나 주장된 화자 귀속 스트리밍 출력이 중요하며, 기댈 벤치마크가 없기 때문에 자체 평가 게이트를 운영할 의향이 있다면 VibeVoice-ASR-Streaming-7B를 선택하세요.

어느 쪽 선택도 영구적일 필요는 없으며, 바로 그 점이 라우팅 계층이 제 몫을 하는 이유입니다 — 트랜스크립션 자체가 아니라 트랜스크립트를 둘러싼 모델들을 위해서 말이죠. OrcaRouter는 현재 음성-텍스트 변환을 라우팅하지 않으며, 이 페이지에 등장하는 어떤 모델도 해당 카탈로그에 포함되어 있지 않습니다. OrcaRouter가 하는 일은 실시간 트랜스크립트를 소비하는 200개 이상의 언어 모델들 — 요약기, 실행 항목 추출기, 음성 에이전트의 플래너 — 에게 단일 API를 제공하는 것이며, 공급업체 목록 가격을 마크업 없이 그대로 전달하는 동시에 공급업체 간 자동 페일오버를 제공합니다. 그 스택에 포함된 어떤 모델의 공급업체 가격 인하도, 목록 가격이 마크업되지 않고 그대로 전달되므로 당일 반영됩니다. 트랜스크립션 단계는 원래 둔 그 자리에 그대로 남습니다. 트랜스크립트에 작용하는 스택이 바로 단일 키와 폴백 라우트가 일주일 된, 벤치마크되지 않은 체크포인트를 단순한 도박에서 실제로 시험 가능한 옵션으로 바꿔주는 계층입니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube