'VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo: 네이티브 스트리밍과 99개 언어를 처리하는 워크호스의 대결'이라는 제목, '네이티브 스트리밍과 99개 언어를 처리하는 워크호스의 대결'이라는 부제가 달린 생성형 히어로 타이틀 카드입니다. 두 모델 카드 — VibeVoice-ASR-Streaming-1.5B(Microsoft Research · 2026년 9월 2일 · MIT · 스트리밍 네이티브 · 10개 언어) 및 Whisper Large v3 Turbo(OpenAI · 2024년 10월 · MIT · 배치 · 99개 언어) — 와 함께 '~2.9초 청크 + ~0.5초 룩어헤드', '월 700만+ 다운로드(Whisper)', '아직 공개된 벤치마크 없음' 태그가 표시됩니다. OrcaRouter 로고는 오른쪽 하단 모서리에 합성되어 있습니다.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo: 99개 언어 지원 워크호스에 맞서는 네이티브 스트리밍

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

오늘날 여러분이 실행하는 음성-텍스트 변환 모델이 Whisper Large v3 Turbo일 가능성이 높습니다. 그런데 "정말 그래야 할까?"라고 묻는 새 모델이 등장했습니다. OpenAI의 Whisper Large v3 Turbo, 즉 2024년 10월에 출시된 지식 증류형 809M 파라미터 체크포인트는 오픈 가중치(open-weight) 진영의 주력 모델입니다. 이 모델은 99개 언어를 지원하고 원본 large-v3보다 약 4~8배 빠르며, 노트북에서도 실행할 수 있을 만큼 가볍고, MIT 라이선스이며, 현존하는 최대 규모의 음성 전사 생태계의 지원을 받고 있습니다. 2026년 9월 2일 Microsoft Research가 업로드한 VibeVoice-ASR-Streaming-1.5B는 Whisper가 기본적으로 지원하지 못하는 단 한 가지, 즉 스트리밍을 위해 만들어진 도전자입니다. 이 모델은 고정된 윈도우를 통째로 처리하는 대신 오디오가 도착하는 대로 청크 단위로 전사하며, 화자별로 구분된 출력을 제공한다고 주장합니다. 지원 언어는 10개뿐이며, 내세울 만한 공개 벤치마크도 없습니다.

마지막 조항이 이 페이지를 직접 대결(shootout)보다는 마이그레이션 질문 중심으로 구성한 이유입니다. Whisper Large v3 Turbo의 수치는 측정된 값으로 공개되어 있습니다. LibriSpeech, Open ASR 복합(composite), Common Voice 등이 그 예입니다. 반면 VibeVoice-ASR-Streaming-1.5B의 모델 카드는 텍스트로 WER이나 지연 시간 수치를 게시하지 않으며, 이 글을 쓰는 시점에 독립적인 벤치마크도 존재하지 않습니다. 아래 Microsoft 측에 관한 모든 내용은 해당 저장소에서 알 수 있는 정보, 즉 구성 파일, 모델 카드, Microsoft 스트리밍 문서에 기반합니다. Whisper 측에 관한 모든 내용은 확정된 공개 기록입니다. 두 모델을 직접 비교 실행하지는 않았습니다. 이 비교는 입증된 것과 약속된 것 사이의 비교입니다.

여러분이 아마도 이미 실행 중인 모델

Whisper Large v3 Turbo는 화려하지 않은 방식으로 입지를 다졌습니다. 빠르고, 작고, 다국어를 지원하며, 프로덕션 팀이 좋아할 만한 '지루함', 즉 예측 가능하고 안정적인 특성을 갖추고 있습니다. 1.55B 파라미터의 Whisper large-v3를 809M 파라미터로 증류한 이 모델은 99개 언어 지원과 large-v3 정확도의 약 95%를 유지합니다. LibriSpeech clean에서는 단어 오류율(WER) 약 2.1%, Open ASR 종합(composite)에서는 약 7.7~7.8%를 기록하며, 가장 큰 성능 저하가 나타나는 부분은 저자원 언어와 성조 언어입니다. 그 대신 실행 속도는 몇 배 더 빠르고, FP16 기준 약 1.6GB의 VRAM만으로 실행됩니다. MIT 라이선스로 배포되며, faster-whisper, whisper.cpp, 그리고 3년 동안의 통합(integration) 작업 덕분에 다양한 환경에서 실행됩니다. Hugging Face 페이지에는 한 달에 700만 회 이상의 다운로드가 기록되어 있습니다. 자체 호스팅으로 전사(transcription) 작업을 수행한다면, 그 작업을 맡고 있는 모델이 바로 이것일 가능성이 매우 높습니다.

Whisper Large v3 Turbo는 스트리밍 모델이 아니며, 그렇게 주장한 적도 없습니다. 고정된 30초 창 단위로 오디오를 입력받아 창마다 대본(transcript)을 반환합니다. 기본적인 음성 활동 감지, 종단점 검출(endpointing), 화자 분리(diarization), 핫워드 메커니즘도 없습니다. Whisper에서 실시간 전사는 항상 직접 구축해야 하는 개조(retrofit)이며, 지연 시간과 엔지니어링 비용은 바로 그 개조 과정에서 발생합니다.

전환하면 실제로 무엇이 달라지나요?

• 지연 시간 모델 — VibeVoice-ASR-Streaming-1.5B는 설계상 약 2.9초 분량의 해석된 청크마다 약 0.5초의 룩어헤드로 텍스트를 출력합니다. 이는 Whisper Large v3 Turbo와 대비되는데, 후자는 30초 창 배치 모델로서 실시간 출력에 근사하려면 청킹 및 스티칭 계층이 필요합니다.

{{1}}• 세션 형태 — 프리픽스 캐시를 통해 청크 간에 컨텍스트가 유지되는 무제한 실시간 세션과, 창 간 대화 상태가 없는 개별 30초 창의 비교.{{/1}}

• 언어 — 열 개 (중국어, 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 스페인어) vs 99.

• 출판된 정확도: 발표된 수치 없음 vs LibriSpeech clean 약 2.1%, Open ASR composite 약 7.7–7.8%, 모두 측정되었고 공개됨.

출력 추가 기능 — 스트리밍 화자 귀속 정보와 핫워드를 지원한다고 주장하지만, 실제로는 워드 타임스탬프만 제공되며 화자 분리와 네이티브 핫워드 기능은 없음.

• 하드웨어 — NVIDIA GPU에서 bf16 가중치 약 5.6 GB(소스 설치 시 약 1.6 GB FP16과 비교), whisper.cpp 및 faster-whisper를 통해 노트북과 CPU에서 실행 가능

• 라이선스 — MIT, 둘 다.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Streaming native ~2.9 s chunks, Languages 10, WER none published, Extras who-said-what + hotwords, Hardware ~5.6 GB NVIDIA GPU, License MIT. Right column Whisper Large v3 Turbo: Released Oct 2024, Streaming none / 30 s windows, Languages 99, WER ~2.1% LibriSpeech clean, Extras timestamps, no diarization, Hardware ~1.6 GB laptop-class, License MIT. Footer reads 'Whisper figures measured and public; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

스트리밍 개조 문제

이번 맞대결을 정직하게 보자면, Whisper Large v3 Turbo는 여러분이 이미 비용을 지불했거나 여전히 지불하고 있는 스트리밍 문제를 안고 있습니다. Whisper에서 라이브 파이프라인을 구축한다는 것은 음성을 찾아내는 음성 활동 감지기, 오디오를 Whisper 크기의 창으로 잘라내는 청크 분할기, 경계에서 단어가 유실되지 않도록 겹치는 창, 그리고 부분 전사본을 하나로 맞추는 스티처를 의미합니다. 해당 스택을 커뮤니티 구현으로 구성하면 종단 간 지연 시간이 대략 1~5초에 달하는데, 회의록에는 쓸 만하지만 전화 상담원이나 실시간 자막이 요구하는 기준에는 미치지 못합니다.

VibeVoice-ASR-Streaming-1.5B는 설계 구조상 리트로핏을 제거합니다. 이 모델의 전처리기 구성은 약 7.5Hz 음성 토큰 스트림에서 22프레임 청크와 4프레임 룩어헤드를 고정합니다. 즉, 방출되는 세그먼트당 약 2.9초 분량의 오디오와 0.5초의 미래 컨텍스트를 포함합니다. Microsoft 문서에는 이전 청크의 컨텍스트가 KV 캐시를 통해 보존되므로 라이브 세션이 처음부터 다시 계산하지 않는다고 설명되어 있습니다. 그러나 이 비교의 양쪽 모두에서 ‘스트리밍’이라는 단어를 주의 깊게 읽어야 합니다. 두 모델 모두 가장 낮은 지연 시간을 갖춘 상용 API가 판매하는 종류의 단어 단위 부분(partials) 엔진이 아닙니다. VibeVoice의 전사 결과물은 설계상 약 3초 간격으로 늘어납니다. 이는 회의에는 색다르지만 대개 수용 가능한 주기이며, 1초 미만은 아닙니다. 요구 사항이 1초 안에 단어를 화면에 표시하는 것이라면, 그 시간 예산에 맞춰 이 청크 구조를 측정한 뒤 해당 모델 위에 구축해야 합니다.

정확성: 네이티브 스트리밍으로 전환할 때 포기하게 되는 것

결정을 좌우해야 할 격차는 다음과 같습니다. Whisper Large v3 Turbo는 감사할 수 있는 공개 정확도 기록을 보유하고 있으며 — 녹음이 지원하는 99개 언어에 해당할 때 그 기록은 탄탄합니다. VibeVoice-ASR-Streaming-1.5B에는 그러한 기록이 없습니다. 모델 카드의 평가는 이미지일 뿐이고, Microsoft는 스트리밍 WER을 텍스트로 공개한 적이 없으며, 이 제품군의 유일한 수치적 기준점은 공급업체가 보고한 배치(batch) VibeVoice-ASR 카드의 8개 영어 테스트 세트 평균 WER 7.77%로, 이는 다른 비스트리밍(non-streaming) 모델을 설명하는 수치입니다. 솔직히 말하면, 오늘 전사(transcription) 작업을 VibeVoice-ASR-Streaming-1.5B로 전환한다는 것은 자체 오디오에 대한 정확도 수준이 불명(不明)임을 감수하는 일입니다. 그렇기에 이 모델에 대한 평가는 프로덕션 트래픽을 받기 전에, 가장 까다로운 실제 녹음들을 대상으로 반드시 직접 수행되어야 합니다.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

언어와 화자 귀속: 기능 격차는 양방향으로 작용한다

기능 비교가 한쪽으로 치우쳐 있지 않으며, 바로 그 점이 이 선택을 진정으로 흥미롭게 만든다. 오디오가 다국어라면 결정은 즉시 끝난다. Whisper Large v3 Turbo의 99개 언어는 VibeVoice-ASR-Streaming-1.5B의 10개 언어가 담아내지 못하는 범위를 커버하며, 다양한 언어의 음성이 두루 섞여 들어오는 파이프라인에서 10개 언어 상한은 탈락 사유가 되기 때문이다. 하지만 처리 대상이 그 10개 언어 안에 있고 실제로 필요한 것이 라이브 회의에서 누가 무슨 말을 했는지 알아내는 것이라면, 화살표는 반대쪽을 가리킨다. Whisper는 기본 제공 화자 분리(diarization)도, 핫워드도 없는 반면, VibeVoice-ASR-Streaming-1.5B는 둘 모두를 내세운다. 즉 스트리밍 방식의 화자 속성 출력과 컨텍스트 프롬프트로 전달되는 도메인 용어 핫워드가 그것이다. 그 주장은 아직 검증되지 않았고, 청크 경계를 넘나드는 스트리밍 화자 분리는 회의적으로 바라볼 만큼 어려운 작업이다. 그럼에도 이는 Whisper를 아무리 엔지니어링해도 기본 상태에서 얻을 수 없는 구체적인 기능이다.

마이그레이션 계산

비용과 노력은 기존 제품에 유리합니다. Whisper Large v3 Turbo는 이미 여러분이 소유한 하드웨어, 즉 노트북, CPU, 적정 수준의 GPU에서 여러분의 스택 내에서 실행됩니다. 반면 VibeVoice-ASR-Streaming-1.5B로 전환하는 것은 약 5.6GB의 가중치를 가진 NVIDIA GPU에서 소스로부터 직접 연구용 설치를 구성하고, 아직 공개 Transformers 문서에 포함되지 않은 아키텍처 클래스의 로드 경로를 검증하며, 결정의 근거가 될 벤치마크를 처음부터 구축해야 함을 의미합니다. 이는 실질적인 프로젝트이며, 그 성과는 검증되지 않은 기능이 정말로 여러분에게 중요할 때에만 조건부로 보장됩니다.

A screenshot of the Hugging Face model card for openai/whisper-large-v3-turbo, showing the OpenAI namespace, the model title Whisper, the MIT license tag, the 99-languages tag, and the automatic-speech-recognition pipeline tags, with the description of Whisper as a state-of-the-art automatic speech recognition model.

그 프로젝트를 저비용으로 운영하는 방법은 그것을 교체(swap)로 취급하지 않는 것입니다. Whisper Large v3 Turbo를 기본값으로 유지한 채, 라이브 오디오의 일부를 하나의 API를 통해 VibeVoice-ASR-Streaming-1.5B로 라우팅하면 됩니다. 이는 라우팅 계층이 존재하는 이유이기도 한 패턴입니다. 즉, 공급업체 목록 가격에 마크업을 붙이지 않은 단일 엔드포인트 뒤에 200개 이상의 모델을 두고, 새 모델이 실패하면 자동 장애 조치(failover)가 이루어지며, 하나의 호출에서 워크로드마다 다른 전사 모델을 선택하게 해주는 라우팅 DSL이 제공되는 구조입니다. 이것이 바로 OrcaRouter의 방식이며, 이틀 된 체크포인트에 프로덕션 파이프라인을 걸게 되는 것과 그 체크포인트가 자체 트랜스크립트에서 주력 모델과 겨루며 제자리를 증명하도록 두는 것은 전혀 다른 일입니다.

자주 묻는 질문

Whisper Large v3 Turbo가 라이브 스트리밍을 전혀 할 수 있나요?

단지 레트로핏(retrofit) 방식으로만 가능합니다. Whisper Large v3 Turbo는 고정된 30초 윈도우를 처리하는 배치(batch) 모델이므로, 실시간 전사를 위해서는 그 위에 음성 활동 감지기(VAD), 청크 분할기(chunker), 오버랩 전략, 스티처(stitcher)를 직접 구축해야 합니다. 실제로 동작하는 구현체도 있으며 지연 시간은 대략 1~5초 수준이라 회의록에는 적합하지만, 전화 상담 에이전트와 실시간 자막에 요구되는 1초 미만 기준에는 미치지 못합니다. VibeVoice-ASR-Streaming-1.5B는 스트리밍 네이티브 모델로, 약 0.5초의 룩어헤드(lookahead)와 함께 약 2.9초 단위의 청크마다 텍스트를 출력합니다. 다만 이 역시 단어 단위의 부분 결과(partial)가 아니라 청크 단위 스트리밍이므로, 이 출력 주기가 자체 지연 시간 예산(latency budget)에 부합하는지도 확인해 보세요.

VibeVoice-ASR-Streaming-1.5B가 Whisper Large v3 Turbo보다 더 정확한가요?

아직 아무도 그 질문에 답할 수 없습니다. 마이크로소프트도 마찬가지입니다. Whisper Large v3 Turbo의 정확도는 측정되어 공개된 수치입니다. LibriSpeech clean에서 약 2.1% WER, Open ASR 복합(composite) 기준으로 7.7–7.8% WER입니다. VibeVoice-ASR-Streaming-1.5B는 현재까지 문서로 공개된 스트리밍 WER 수치가 없으며, 독립적인 벤치마크 결과도 존재하지 않습니다. 이 질문에 답할 수 있는 유일한 방법은 자체 오디오에서 체크포인트를 실행하고 전사 결과를 기존 시스템과 비교하는 것입니다. 이것이 바로 이 페이지가 마이그레이션 전에 권장하는 테스트와 정확히 일치합니다.

그 둘은 어떤 언어를 지원하나요?

Whisper Large v3 Turbo는 하나의 가중치 세트로 99개 언어를 지원합니다. VibeVoice-ASR-Streaming-1.5B는 중국어, 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 스페인어 등 10개 언어를 지원합니다. 해당 10개 언어에 속하지 않는 오디오의 경우, 이 두 모델 조합에서는 Whisper만이 유일한 선택지이며, 이러한 다국어 지원 격차는 대부분의 팀이 기존 모델을 유지하는 가장 분명한 이유입니다.

Whisper Large v3 Turbo는 대부분의 팀에게 대부분의 경우 적합한 모델이며, 벤치마크가 없는 이틀 된 체크포인트가 플랫폼을 전환할 이유는 아닙니다. 그것은 실험을 실행할 이유입니다. 만약 오디오가 그 10개 언어 안에 있고 실시간 화자 귀속이 제품을 변화시킬 수 있다면, VibeVoice-ASR-Streaming-1.5B를 라우터 뒤에 배포하고 실제 트래픽의 일부를 그쪽으로 보내십시오. 그리고 전사 결과—어느 쪽의 벤치마크 부재가 아니라—가 결정을 내리게 하십시오.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube