‘VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B: 검증되지 않은 MIT 라이선스 도전자 대 Open ASR 챔피언’이라는 생성된 히어로 타이틀 카드로, ‘검증된 기본값 대 하루 된 도전자’라는 부제가 붙어 있다. 두 모델 카드 — VibeVoice-ASR-Streaming-1.5B(Microsoft Research · 2026년 9월 2일 · MIT · 아직 공개된 벤치마크 없음)와 NVIDIA Parakeet TDT 0.6B(NVIDIA · 2025년 5월 5일 · CC-BY-4.0 · 2025년 5월 이후 Open ASR 1위) — 및 ‘평균 WER 6.05%(Parakeet)’, ‘16개월 차이’, ‘누가 말했는지 + 핫워드(Microsoft, 미검증)’ 태그가 포함되어 있다. OrcaRouter 로고는 오른쪽 하단 모서리에 합성되어 있다.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B: 검증되지 않은 MIT의 도전자, Open ASR 챔피언에 맞서다

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

오늘날 프로덕션 환경에서 오픈 가중치 음성-텍스트 변환 모델이 필요하다면, 기본 선택지는 하나로 정해져 있습니다. 바로 NVIDIA Parakeet TDT 0.6B입니다. 2025년 5월 이후로 6억 개 파라미터를 가진 Parakeet TDT 0.6B v2는 Hugging Face Open ASR 리더보드에서 평균 단어 오류율 6.05%로 1위 자리를 지켜왔으며, 이 성적은 제3자에 의해 1년 넘게 재현되었습니다. 가장 최근의 도전자 후보는 VibeVoice-ASR-Streaming-1.5B로, Microsoft Research가 2026년 9월 2일에 업로드했습니다. Parakeet보다 16개월 뒤인 셈이며, MIT 라이선스 아래 배포되고 스트리밍 화자 귀속 기능을 내세우지만, 지금까지 공개된 정확도 수치는 전혀 없습니다. 이 페이지에서는 증거, 아키텍처, 그리고 각 모델이 기본 제공 환경에서 실제로 내놓는 결과물을 기준으로 챔피언과 도전자를 비교합니다.

스펙을 보기 전에 두 가지 라벨이 중요하다. 이 둘이 이 맞대결의 전체 구도를 결정하기 때문이다. Parakeet의 수치는 확정돼 있다. 6.05% 평균 WER과 "1시간 분량의 오디오를 약 1초 만에 처리한다"는 주장의 배경이 되는 ~3,386 RTFx 처리량 수치는 1년 넘게 공개 리더보드와 NVIDIA 자료에 실려 있다. VibeVoice-ASR-Streaming-1.5B 쪽에서 알 수 있는 것은 저장소에서 확인 가능한 정보, 즉 모델 카드, 구성 파일, Microsoft의 스트리밍 문서가 전부다. Microsoft는 WER, 지연 시간, 처리량을 문서로 공개하지 않았고, 이 글을 쓰는 시점에 해당 체크포인트에 대한 독립적인 벤치마크도 없다. 아래 모든 비교의 한쪽 열은 실전에서 검증된 수치이고, 다른 쪽 열은 사양서에 불과하다.

16개월과 한 번의 리더보드 1위 기간을 사이에 두고

Parakeet TDT 0.6B v2는 2025년 5월 5일, 스트리밍 ASR 문제에 대한 NVIDIA의 해답으로 등장했습니다. FastConformer 인코더와 각 토큰과 그 지속 시간을 단일 단계에서 예측하는 토큰-지속 시간 변환기(TDT) 디코더를 결합한 것으로, 기존 변환기의 블랭크 토큰 오버헤드를 제거하는 효율성 기법입니다. CC-BY-4.0 라이선스로 상업적으로 사용하기 좋으며, 평균 6.05%의 단어 오류율을 바탕으로 Open ASR 리더보드의 정상을 차지했습니다. 또한 리더보드가 측정하지 않는 생산 기능(구두점, 대문자화, 단어 수준 타임스탬프)과 단일 패스로 최대 24분의 오디오를 처리하는 완전 어텐션 인코더를 갖추어, 과도한 청크 분할 없이 긴 회의와 팟캐스트에 유용합니다.

VibeVoice-ASR-Streaming-1.5B는 가장 순수한 의미의 도전자입니다. 존재하고, 문서화되어 있지만, 성능이 얼마나 잘 작동하는지에 대해서는 아무것도 입증되지 않았습니다. 마이크로소프트의 GitHub 뉴스라인(9월 3일자)은 음성이 도착하는 대로 "누가 무엇을 말했는지 지속적으로 전사하는" 통합 스트리밍 ASR 모델을 발표하며, 핫워드와 10개 언어를 지원합니다. 그리고 체크포인트의 설정(config)은 완전히 다른 엔지니어링 전통을 설명합니다. 컨볼루션 오디오 토크나이저가 공급하는 Qwen2 계열 언어 모델 디코더와, 약 2.9초 청크 및 약 0.5초 lookahead로 출력을 생성하는 디퓨전 헤드로 구성되어 있습니다. Parakeet이 1년간의 실제 배포를 통해 다듬어진 특수 목적 음성 모델인 반면, VibeVoice-ASR-Streaming-1.5B는 이제 막 이틀 된 연구 계열 체크포인트입니다.

증거의 비대칭성이 핵심이다.

이 페이지의 나머지 내용을 한 가지 사실을 염두에 두고 읽으십시오: 이 비교에서 숫자는 정확히 한쪽에만 있습니다. Parakeet TDT 0.6B의 측에는 1년간의 리더보드 수성 기록이 있습니다 — Open ASR 공개 영어 단문 세트에서 평균 WER 6.05%, NVIDIA 하드웨어에서 배치 크기 128 기준 약 3,386 RTFx, 그리고 프로덕션 환경에서 검증된 NeMo 배포 툴링, TensorRT 가속, FP8 양자화 생태계가 있습니다. VibeVoice-ASR-Streaming-1.5B의 측에는 텍스트가 아닌 이미지로 제공되는 모델 카드의 평가 수치와, 배치(batch) VibeVoice-ASR 카드에 공급업체가 보고한 8개 영어 테스트 세트 평균 WER 7.77%가 있습니다 — 이 수치는 비스트리밍(non-streaming) 모델을 설명하는 것으로, 이 체크포인트에 적용할 수 없습니다. 도전자 모델이 우수할 가능성이 충분히 있습니다. 핵심은 "우수할 가능성이 충분히 있다"는 것 자체가 증거 기반의 전부라는 점입니다.

스펙 확인

• 파라미터 — NVIDIA Parakeet TDT 0.6B: 600M, FastConformer 인코더 + TDT 디코더 vs VibeVoice-ASR-Streaming-1.5B: 총 ~3B (1.5B급 Qwen 백본 + 토크나이저 및 디퓨전 헤드).

• 출시 — 2025년 5월 5일 vs 2026년 9월 2일.

• 정확도 — 평균 WER 6.05%, 2025년 5월 이후 Open ASR 1위, 제3자 재현 결과 vs 게재된 바 없음.

• 속도 — NVIDIA 하드웨어에서 배치 128 기준 약 3,386 RTFx, 초당 약 1시간 분량의 오디오 처리. 반면 공개된 처리량 수치는 없음.

• 스트리밍 — 전체 어텐션 컨텍스트로 패스당 최대 24분까지 지원하는 스트리밍. 청크 스트리밍은 약 2.9초 청크와 약 0.5초 선행(lookahead) 방식을 사용한다.

출력 추가 기능 — 문장 부호, 대문자 사용, 단어 수준 타임스탬프 대 스트리밍 화자 구분(미검증), 핫워드, 10개 언어 지원.

• 라이선스 — CC-BY-4.0 vs MIT.

• 생태계 — TensorRT 및 FP8을 사용하는 NVIDIA NeMo vs microsoft/VibeVoice 저장소 데모 및 vLLM 플러그인

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total, Architecture speech LLM + diffusion, WER none published, Streaming ~2.9 s chunks, Extras who-said-what + hotwords, License MIT. Right column NVIDIA Parakeet TDT 0.6B v2: Released May 5 2025, Params 600M, Architecture FastConformer + TDT, WER 6.05% Open ASR #1, Streaming full-attention up to 24 min, Extras punctuation + timestamps, License CC-BY-4.0. Footer reads 'Parakeet figures per the Open ASR leaderboard, settled since 2025; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

속을 들여다보면: 음성 모델의 용도에 대한 두 가지 생각

이 두 아키텍처는 이 작업에 대한 서로 다른 두 가지 신념을 담고 있다. Parakeet TDT 0.6B는 전사를 효율적으로 해결되는 신호 처리 문제로 간주한다. FastConformer 인코더가 음향 특징을 추출하고 TDT 디코더가 텍스트 토큰과 지속 시간을 함께 생성하기 때문에, 실시간보다 수천 배 빠른 속도로 실행되며 NVIDIA 배포 스택에서도 무리 없이 구동된다. VibeVoice-ASR-Streaming-1.5B는 전사를 언어 문제로 취급한다. 오디오를 토큰 스트림으로 압축하고, 대본 수준의 맥락을 읽어 들인 언어 모델에 넘긴 다음, 누가 무엇을 말하는지와 대화가 어떻게 이어지는지에 대한 LM의 이해가 작업을 수행하게 하는 것이다. LLM 백본이라는 점은 체크포인트가 600M이 아니라 약 3B 파라미터인 이유이기도 하며, 마이크로소프트가 엣지 환경에서의 구동을 내세우지 않은 이유이기도 하다. 이는 GPU를 필요로 하고, 그 메모리를 맥락을 유지하는 데 사용하는 모델이다.

실시간 전사에서 실질적인 결과는 지연 시간의 형태입니다. Parakeet의 전체 어텐션 인코더는 단일 패스로 긴 윈도우를 처리할 수 있어, VibeVoice-ASR-Streaming-1.5B가 세그먼트당 약 2.9초의 오디오를 출력하는 고정된 청크 및 lookahead 계약과는 다른 스트리밍 철학을 보여줍니다. 둘 다 최저 지연 상용 API 스타일의 단어별 부분 스트리머는 아니며, 모두 청크 기반 시스템입니다. 따라서 어느 쪽이 적합한지는 오디오가 유한한 파일로 들어오는지, 무기한 실시간 세션으로 들어오는지에 달려 있습니다.

기능 스토리와 배포 구역

Parakeet TDT 0.6B는 기본 그대로도 더 완성도 높은 전사 제품입니다. 구두점과 대문자 표기가 전사 결과에 포함되고, 정렬을 위한 단어 수준 타임스탬프가 제공되며, 24분 단일 패스(single-pass) 창 덕분에 긴 녹음에서 청크 분할 오류가 줄어듭니다. VibeVoice-ASR-Streaming-1.5B는 Parakeet이 명시하지 않은 기능, 즉 10개 언어에 걸친 화자 표기 출력과 핫워드(hotword) 기능으로 맞섭니다. 스트리밍 화자 분리(streaming diarization)라는 주장은 독립적 검증이 필요한 전형적인 사례입니다. 화자 귀속은 청크 경계에서 어긋나기 때문입니다. 하지만 실시간 회의에서 누가 어떤 말을 했는지 알아야 하는 요구 사항이 있다면 NVIDIA 모델이 아니라 Microsoft 모델을 주목해야 하는 이유도 바로 이것입니다.

A screenshot of the Hugging Face model card for nvidia/parakeet-tdt-0.6b-v2, showing the NVIDIA namespace, the model title 'Parakeet TDT 0.6B V2 (En)', the automatic-speech-recognition and NeMo pipeline tags, and the card description of the 600-million-parameter FastConformer model with TDT decoder, punctuation and timestamps, audio segments up to 24 minutes in a single pass, and an RTFx of 3380 on the Open ASR leaderboard at batch 128.

{{1}}이 모델들이 사는 동네는 모델 자체만큼이나 서로 다릅니다.{{/1}} {{2}}Parakeet TDT 0.6B는 NVIDIA NeMo 생태계의 일원입니다. NVIDIA GPU에 최적화된 TensorRT, FP8, 배포 도구를 갖추고 있어서, 이미 NVIDIA 인프라를 쓰고 있다면 더없이 좋은 선택입니다.{{/2}} {{3}}VibeVoice-ASR-Streaming-1.5B는 연구용 저장소에 살고 있습니다. 문서화된 사용 경로는 Microsoft의 Python 데모와 vLLM 플러그인뿐이고, 이 모델의 아키텍처 클래스는 아직 공개 Transformers 문서에 없습니다. 또한 이 모델을 구동하려면 소스에서 직접 설치하고 로드 경로가 실제로 동작하는지 스스로 검증해야 합니다.{{/3}} {{4}}지루하지만 탄탄하고 문서화가 잘 된 배포를 중시하는 팀이라면, 그런 차이만으로도 벤치마크 격차를 상쇄하고도 남습니다.{{/4}}

현직자를 위한 논거, 도전자를 위한 논거

NVIDIA Parakeet TDT 0.6B를 선택해야 하는 이유는 검증된 선택지를 고르는 이유와 같습니다. 1년간의 리더보드 수성, 타사 재현, 상용 라이선스, 프로덕션 기능, 그리고 실제 트래픽을 소화해 온 배포 생태계가 그 근거입니다. 이번 분기에 영어 전사 기능을 출시하면서 오픈 가중치를 원한다면, 이것이 방어 가능한 기본값이며, 이를 대체한다고 주장하는 모든 것은 입증 책임을 져야 합니다.

VibeVoice-ASR-Streaming-1.5B를 선택해야 할 이유는 더 좁고 구체적입니다. 스트리밍 화자 귀속(speaker attribution)이나 핫워드가 필요하거나, 영어 외의 언어가 필요하거나, 음성 처리에 언어 모델 접근 방식이 승리할 것이라고 믿고 일찍 시작하고 싶은 경우입니다. 이는 결정이 아니라 도박입니다. 아직 프로덕션 트래픽을 여기로 전환할 만한 수치가 없으며, Microsoft의 자체 입장도 연구 우선입니다. 현재 두 모델 모두 OrcaRouter를 통해 제공되지 않으므로, 이 도박을 시험하는 저비용 방법은 새로운 오픈 모델에 적용되는 패턴과 같습니다. ASR 계층을 공급업체 목록 가격 그대로, 마크업 없이, 자동 장애 조치로 200개 이상의 모델을 제공하는 단일 라우팅 API 뒤에 유지하고, 공급업체가 호스팅하는 즉시 실제 오디오의 일부를 VibeVoice-ASR-Streaming-1.5B로 라우팅한 다음, 자체 트래픽에서 나온 기록이 Parakeet이 16개월 동안 차지해 온 왕관을 도전자가 받을 자격이 있는지 결정하게 하십시오.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube