생성된 히어로 타이틀 카드: 'VibeVoice-ASR-Streaming-1.5B vs Gemini 3.5 Transcribe: Microsoft의 조용한 스트리밍 ASR과 Google의 새로운 API'라는 제목, 부제 'Microsoft의 조용한 오픈 스트리밍 ASR과 Google의 새로운 호스팅 API'를 포함하며, 두 개의 모델 카드가 있다 — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · MIT 가중치, 2026년 9월 2일 · 공개 체크포인트 · 10개 언어) 및 Gemini 3.5 Transcribe (Google · 공개 미리보기, 2026년 8월 26일 · 호스팅 API · 2개 엔드포인트) — 그리고 '아직 발표 없음', '벤치마크 미공개', '오디오 시간당 약 $0.30–0.54 (Google)'라는 태그가 있다. OrcaRouter 로고는 오른쪽 하단에 합성되어 있다.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs Gemini 3.5 Transcribe: Microsoft의 조용한 스트리밍 ASR 대 Google의 새로운 API

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

7일과 하나의 철학적 분기가 가장 최신 스트리밍 음성-텍스트 시스템 두 개를 갈라놓는다. 2026년 8월 26일, GoogleGemini 3.5 Transcribe를 공개 프리뷰로 내놓았다. 오디오 토큰당 과금되는 호스팅형 폐쇄 음성-텍스트 API이며, 실시간 세션을 위한 별도의 Live 엔드포인트를 갖추고 있다. 2026년 9월 2일, Microsoft Research는 microsoft 네임스페이스 아래 VibeVoice-ASR-Streaming-1.5B를 Hugging Face에 업로드했다. MIT 라이선스가 적용된 가중치, 보도자료도 없고 출시 공지도 없으며, 이 글을 쓰는 시점 기준 어디에서도 서드파티 보도가 없다. 두 시스템 모두 음성이 아직 도착하는 중에 전사를 수행한다. 그 외의 거의 모든 것, 즉 누가 실행할 수 있는지, 비용이 얼마인지, 작동한다는 증거가 무엇인지는 모두 다르다.

이 페이지는 두 대상을 오늘날 실제 존재하는 모습 그대로 비교하므로, 증거의 양쪽이 대칭적이지 않습니다. Gemini 3.5 Transcribe는 실제 서비스 중인 Google 제품으로, 게시된 토큰 가격과 Artificial Analysis의 제3자 정확도 수치가 있습니다. 아래에서 AA로 표시된 숫자가 바로 그 값입니다. VibeVoice-ASR-Streaming-1.5B는 모델 카드가 텍스트로는 단어 오류율(WER)과 지연 시간 수치를 전혀 공개하지 않는 체크포인트입니다. 카드의 평가 항목은 이미지이며, 스트리밍 제품군에 대한 현재까지의 유일한 발표는 Microsoft의 VibeVoice GitHub 저장소에 9월 3일자로 게시된 뉴스 한 줄입니다. 아래 Microsoft 측 정보는 모두 저장소에서 확인 가능한 내용, 즉 구성 파일, 모델 카드, Microsoft 자체 스트리밍 문서에서 비롯되었습니다. 이에 대한 독립적인 벤치마크는 아직 수행된 바 없습니다.

두 모델 한눈에 보기

• 정의 — VibeVoice-ASR-Streaming-1.5B: 공개 체크포인트, MIT 라이선스, 자체 호스팅 vs Gemini 3.5 Transcribe: 호스팅 API, 비공개 가중치.

• 릴리스 — 2026년 9월 2일 가중치, 9월 3일 저장소 뉴스 라인 vs 2026년 8월 26일 전체 출시 자료를 포함한 공개 미리보기.

• 스트리밍 방식 — 약 2.9초 단위 청크로 텍스트를 출력하며 약 0.5초의 lookahead가 있고, 세션 상태는 prefix cache에 저장됩니다. 반면 WebSocket Live 세션은 오디오 토큰당 과금되며 세션당 오디오 10분으로 제한됩니다.

• 문서상의 정확도 — AA가 사전 녹음 엔드포인트에서 측정한 WER 2.6%, 라이브 엔드포인트에서의 4.0%와 달리, 텍스트로 공개된 WER 또는 지연 시간 수치는 없습니다.

• 화자 출력 — 스트리밍 화자 귀속(누가 말했는지) 제공을 주장하나(검증되지 않음) vs Live 엔드포인트에는 화자 분리 및 단어 수준 타임스탬프가 없음

• Hotwords — 배치 VibeVoice-ASR과 동일한 컨텍스트 프롬프트를 통해 지원되지만, Live 엔드포인트의 기능 목록에는 포함되지 않습니다.

• 비용: 가중치는 $0, 셀프 호스팅에 약 5.6GB. 반면 사전 녹음 엔드포인트는 혼합 기준 오디오 시간당 약 $0.30, Live는 약 $0.54 (Google이 공시한 토큰 가격 기준).

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Gemini 3.5 Transcribe — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, License MIT open weights, Streaming ~2.9 s chunks + ~0.5 s lookahead, WER none published, Speaker output who-said-what claimed, Cost $0 weights / ~5.6 GB self-host. Right column Gemini 3.5 Transcribe: Released Aug 26 2026, License closed API, Streaming WebSocket Live, 10-min cap, WER 2.6% batch / 4.0% Live (AA), Speaker output none on Live, Cost ~$0.30–0.54 per audio-hour. Footer reads 'Gemini figures per Google pricing and Artificial Analysis; VibeVoice specs read from the HF repo; no VibeVoice benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

호스팅된 API와 조용한 업로드, 7일 간격으로

Gemini 3.5 Transcribe는 Google의 교체 등급 전사 모델로, 두 가지 제품으로 제공됩니다. Interactions API를 통해 제공되는 사전 녹음 엔드포인트는 전체 오디오 파일을 받아 예상되는 부가 정보와 함께 전사본을 반환합니다. 라이브 엔드포인트인 gemini-3.5-transcribe-live는 양방향 WebSocket을 통해 실행되며, 세션이 진행되는 동안 이를 전사한다는 작업의 형태에서 VibeVoice-ASR-Streaming-1.5B와 경쟁하는 모델입니다. Google은 일반적인 공식 절차를 통해 이 모델을 발표했습니다. 8월 26일 공개 미리보기 출시, 모델 페이지의 가격 책정, 그리고 며칠 안에 이를 채택한 제3자 리더보드가 그 뒤를 이었습니다.

마이크로소프트의 스트리밍 출시에는 그런 것이 전혀 없었다. 9월 2일, 마이크로소프트 Hugging Face 계정은 같은 분에 VibeVoice-ASR-Streaming-7B와 VibeVoice-ASR-Streaming-1.5B라는 두 개의 체크포인트를 생성했다. GitHub 저장소의 모델 테이블에는 이제 VibeVoice-ASR-Streaming이 패밀리 구성원으로 등재되어 있으며, News 섹션에는 9월 3일자로 "음성이 도착함에 따라 누가 무엇을 말했는지 지속적으로 전사하는 통합 스트리밍 ASR 모델로, 맞춤형 핫워드와 10개 언어를 지원한다"는 발표가 실려 있다. 그러나 그 발표는 7B만을 언급했고, 1.5B는 언급되지 않은 채 7B와 함께 출시된 더 작은 형제 모델이다. 업로드 하루 후 확인했을 때, 두 체크포인트 모두 여전히 다운로드 수가 0이었다.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

각 측면에서 "스트리밍"이 의미하는 것

스트리밍이라는 단어는 실제 설계 차이를 숨기고 있다. 마이크로소프트의 전처리기 구성은 VibeVoice의 케이던스를 구체적으로 만든다. 오디오는 24kHz로 들어오며 약 7.5Hz(약 133ms마다 하나의 토큰)의 음성 토큰 스트림으로 3,200배 압축된다. 그런 다음 구성은 22프레임의 청크와 4프레임의 룩어헤드를 선언하는데, 이는 청크당 약 2.9초의 오디오에 해당하며, 현재 세그먼트를 확정하는 데 약 0.5초의 향후 오디오가 사용된다. 모델은 해결된 청크마다 한 번씩 텍스트를 내보낸다. 마이크로소프트 문서에 따르면 이전 청크의 컨텍스트는 KV 캐시를 통해 보존되므로 긴 세션에서 처음부터 다시 계산하지 않는다. 계산은 구성에 명시되어 있다. 실제 결과는 대략 3초 단위로 증가하는 트랜스크립트이지, 단어별 부분 결과가 아니다.

Google Live 엔드포인트는 다른 형태의 스트리밍 구조입니다. 즉, 양방향 WebSocket 세션으로, 오디오가 초당 25 오디오 토큰으로 과금되며, 대화형 사용을 위해 설계되었지만 세션당 오디오가 10분으로 제한되고, 특히 Live 엔드포인트에서는 화자 분리(diarization)나 단어 수준 타임스탬프가 제공되지 않습니다. 이 둘을 실시간 전사 엔진으로 비교하는 사람이라면, 중요한 차이점은 세션 제한(Google Live 쪽은 10분, Microsoft 쪽은 자신의 GPU와 메모리에 의해서만 제한됨), 출력 주기(약 3초 단위 청크 대 WebSocket 세션이 전달하는 결과), 그리고 출력 부가 기능(Microsoft 카드에 명시된 화자 속성 및 핫워드 기능은 Google Live 기능 목록에는 없음)입니다.

정확성: 한쪽에는 숫자가 있고, 다른 쪽에는 그림이 있습니다.

이번 매치업에서 가장 큰 격차이며, 이는 품질의 차이라기보다 증거의 차이입니다. Artificial Analysis는 사전 녹음 엔드포인트에서 Gemini 3.5 Transcribe의 단어 오류율을 2.6%로, Live 엔드포인트에서는 4.0%로 측정합니다. 실시간 전송에 대해 지불하는 프리미엄은 오류율에 그대로 드러나며, 이는 스트리밍 시스템에서 흔하고 정직한 절충입니다. 이는 출시 며칠 후 게시된 중립적 리더보드의 제3자 수치입니다.

VibeVoice-ASR-Streaming-1.5B는 어디에도 비교할 만한 수치가 없습니다. 모델 카드에는 평가 결과 그림이 이미지로 포함되어 있지만, 문장으로 된 수치형 WER, RTF, 지연 시간은 없습니다. 인용할 수 있는 것도, 독립적으로 검증할 수 있는 것도 전혀 없습니다. Microsoft는 7B와 1.5B 양쪽 모두에 대해 스트리밍 정확도 수치를 텍스트로 제공하지 않았습니다. 전체 제품군에서 유일한 수치 기준점은 배치(batch) VibeVoice-ASR 모델 카드로, 여기에는 8개 영어 테스트 세트에서 벤더가 실행한 평균 WER 7.77%, LibriSpeech clean에서 2.20%가 보고되어 있습니다. 그러나 이것은 비스트리밍 모델에 대한 설명이며, 스트리밍 모델은 일반적으로 지연 시간 이점을 위해 약간의 정확도를 맞바꿉니다. 누군가가 공개 하네스를 통해 스트리밍 체크포인트를 실행하기 전까지, 정직한 입장은 Google의 모델은 측정되었고 Microsoft의 모델은 측정되지 않았다는 것입니다.

비용: 오디오 시간당 대비 GPU 시간당

Google은 Gemini 3.5 Transcribe를 토큰 단위로 판매하며, 가격은 두 엔드포인트에 걸쳐 명확히 나뉩니다. 사전 녹음 엔드포인트는 오디오 입력 토큰 1M당 $2, 텍스트 출력 토큰 1M당 $12로 책정되어 있으며, 혼합 기준 오디오 시간당 약 $0.30입니다. Live 엔드포인트는 오디오 토큰 1M당 $3.50, 텍스트 토큰 1M당 $21로, 오디오 시간당 약 $0.54입니다. 이는 사전 녹음보다 약 80% 높은 가격으로, 실시간 전송의 대가입니다. Google은 오디오를 초당 25토큰으로 청구하므로, 무음 구간은 클라이언트가 해당 구간을 스트리밍하지 않을 때만 무료입니다. 재연결, 중복 오디오, 로깅은 모두 실제 청구 금액을 늘릴 수 있습니다. 무료 티어도 존재하지만, 무료 티어 콘텐츠는 Google 제품을 개선하는 데 사용될 수 있다는 주의사항이 있습니다.

A generated comparison card titled 'Gemini 3.5 Transcribe — the two endpoints'. Left column 'Pre-recorded': $2 / $12 per 1M audio / text tokens, ~$0.30 per audio-hour, AA WER 2.6%, diarization and word-level timestamps. Right column 'Live': $3.50 / $21 per 1M tokens, ~$0.54 per audio-hour, AA WER 4.0%, no diarization, 10-minute session cap. Footer reads 'Token prices per Google's model page; WER per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Microsoft의 모델은 대신 GPU 시간 단위로 가격이 책정됩니다. 1.5B 체크포인트는 대략 5.6GB의 bf16 가중치입니다(1.5B급 Qwen 언어 백본에 오디오 토크나이저와 확산 헤드가 더해진 형태 — safetensors 메타데이터를 합치면 약 3B 파라미터). 문서화된 실행 경로는 자체 호스팅 방식입니다: microsoft/VibeVoice 저장소의 Python 데모, 또는 Microsoft가 OpenAI 호환 및 WebSocket 엔드포인트 서빙용으로 설명하는 vLLM 플러그인입니다. 아직 호스팅 가격이 없는 이유는 어떤 추론 제공업체도 이 모델을 아직 등록하지 않았기 때문입니다. 비용 문제는 전적으로 자체 GPU 시간이 Google의 시간당 요금보다 저렴한지에 달려 있으며, 지속적인 전사 볼륨 기준으로는 거의 확실히 저렴합니다 — 그리고 라이선스 문제는 비용 문제와 별개입니다. MIT 가중치는 어떤 API 구독도 제공할 수 없는 방식으로 귀하의 소유가 되기 때문입니다.

이 둘은 프로덕션 스택에서 상호 배타적이지 않습니다. 오늘 실시간 전사가 필요한 팀에게 실용적인 패턴은 ASR 계층을 단일 엔드포인트 뒤에 유지해 선택을 되돌릴 수 있게 하는 것입니다. 공급업체 목록 가격 그대로 200개 이상의 모델을 제공하고, 마크업이 없어 공급업체의 가격 변경이 당일에 바로 반영되며, 자동 장애 조치를 갖춘 라우팅 API야말로 Google의 measured API를 기본값으로 실행하면서도 공급업체가 VibeVoice-ASR-Streaming-1.5B를 호스팅하는 순간 실제 트래픽의 일부가 이를 테스트하게 해주는 계층입니다. 이것이 OrcaRouter의 모델이며, 아직 정확성을 검증한 사람이 없는 체크포인트를 도입하는 저위험 방식입니다.

누가 어떤 것을 골라야 하나요

오늘 당장 작동하는 전사 API를 원한다면 Gemini 3.5 Transcribe를 선택하세요. 공개된 정확도, 시간당 예측 가능한 가격, 관리할 GPU가 필요 없으며, 특히 오디오가 Microsoft가 나열한 10개 언어에 포함되지 않거나, 파일 전사에 사전 녹음 엔드포인트의 화자 분리(diarization)와 단어 수준 타임스탬프가 필요하다면 더욱 그렇습니다. 10분 라이브 세션 제한은 실제 제약이므로, 라이브 세션에 적용하기 전에 사용 사례에 맞게 테스트해 보아야 합니다.

직접 호스팅하거나, MIT가 제공하는 가중치와 데이터 제어를 원하거나, 무제한 세션 길이가 필요하거나, 누가 무엇을 말했는지 스트리밍 출력과 핫워드 기능을 특별히 평가하고 싶다면 VibeVoice-ASR-Streaming-1.5B를 선택하세요. 소스에서 설치하고, NVIDIA GPU에서 약 5.6GB의 가중치, 그리고 자체 평가 게이트를 예산에 포함하세요. 의지할 벤치마크가 없으므로 정확성 문제는 자신의 오디오로 직접 답해야 합니다.

일주일간의 평가: Google은 검증된 제품을 출시했고, Microsoft는 흥미로운 도전을 출시했다. Gemini 3.5 Transcribe는 더 안전한 기본값이며, 그 뒤에는 타사 수치가 뒷받침된다. VibeVoice-ASR-Streaming-1.5B는 개방형이자 자체 호스팅이 가능하지만 전적으로 검증되지 않은 대안이다. 이 선택이 부담스럽지 않은 이유는 그것이 영구적일 필요가 없다는 점이다 — ASR 엔드포인트를 교체 가능하게 유지하면, 단 하나의 벤치마크도 없이 출시된 체크포인트라도 자신의 트랜스크립트 증거에 따라 트래픽을 얻거나 잃을 수 있다.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube