
VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC: 조용한 두 오픈웨이트 스트리밍 승부수
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
2026년 8월 말에 출시된 가장 흥미로운 오픈 가중치 스트리밍 음성-텍스트 모델 두 가지는 모두 출시 이벤트 없이 공개되었다. 8월 25일, IBM은 Granite Speech 5.0 470M TurboCTC를 Hugging Face에 올렸다. 가중치와 모델 카드, 그리고 블로그 게시물 하나뿐이었다. 그리고 9월 2일, Microsoft Research는 VibeVoice-ASR-Streaming-1.5B를 microsoft 네임스페이스에 업로드했는데, VibeVoice GitHub 저장소의 뉴스 한 줄 외에는 아무런 발표도 없었다. 이 둘은 본질적으로 같은 종류의 산출물이면서 정반대의 엔지니어링 선택이다. IBM의 모델은 노트북에서 엣지 속도로 실행되도록 설계된 4억 7천만 파라미터의 순수 CTC 인코더이고, Microsoft의 모델은 오디오 토크나이저와 확산 헤드로 감싼 15억급 음성 언어 모델로, 전체 약 30억 파라미터이며, 전사하는 동안 음성을 언어로 이해하도록 만들어졌다.
숫자들 앞에, 이 비교를 정직하게 유지하는 출처 표시가 있다. IBM-reported로 표시된 모든 것은 Granite Speech 5.0 470M TurboCTC 모델 카드와 해당 모델의 Open ASR 리더보드 항목에서 비롯된 것으로, 출시일에 IBM이 공식 하네스를 통해 실행했으며 아직 독립적으로 재현되지 않았다. VibeVoice-ASR-Streaming-1.5B에 관한 모든 것은 저장소를 읽은 데서 비롯되었다. 즉, 설정 파일, 모델 카드, 그리고 Microsoft의 스트리밍 문서를 통해서다. Microsoft는 정확도나 지연 시간 수치를 문서로 공개한 적이 없고, Microsoft 외부에서 이 체크포인트를 벤치마킹한 사람도 없기 때문이다. 두 모델은 공유된 하네스에서 실행되지 않았다. 이 비교는 두 모델을 동일한 공개 증거에 대비해 평가하며, 그것이 지금까지 어느 쪽 회사가 제공한 전부다.
8일 간격의 두 건의 조용한 릴리스
두 모델 모두 아무런 성대한 절차 없이 같은 방식으로 출시되었는데, 이는 두 회사 모두 이후 별다른 언급을 하지 않았기에 분명히 밝혀둘 가치가 있다. IBM의 Granite Speech 5.0 470M TurboCTC는 두 가지 변형으로 출시된 제품군 중 Apache-2.0 라이선스 버전이다. IBM은 또한 약간 더 나은 대표 수치를 보여주는 비상업용 -NC 자매 모델도 공개했다. 이 모델의 카드에는 2026년 8월 25일자 출시일이 적혀 있으며, 네이티브 Transformers 지원과 같은 날짜의 Open ASR 리더보드 제출 기록이 포함되어 있다. Microsoft의 스트리밍 듀오인 VibeVoice-ASR-Streaming-7B와 VibeVoice-ASR-Streaming-1.5B는 9월 2일 같은 분 안에 Hugging Face에 생성되었다. "음성이 도착하면 누가 무엇을 말했는지 지속적으로 전사하는 통합 스트리밍 ASR 모델"을 발표한 GitHub 뉴스 글은 9월 3일자이며 7B 모델을 언급하고 있어, 여기서 다루는 1.5B는 그 옆에 조용히 함께 출시된 더 작은 형제 모델로 남는다.
흥미로운 점은 두 팀이 "스트리밍"이라는 단어를 붙잡고 정반대의 것을 만들었다는 것이다. Granite Speech 5.0 470M TurboCTC는 CTC로 학습되고 단일 비자기회귀 패스로 디코딩되는 컨포머 인코더로, 토큰을 하나씩 생성해 텍스트를 만드는 디코더가 없기 때문에 구조적으로 저렴하고 구조적으로 빠르다. VibeVoice-ASR-Streaming-1.5B는 음성 LLM이다. 두 개의 컨볼루션 토크나이저가 24kHz 오디오를 약 7.5Hz의 음성 토큰 스트림으로 바꾸고, Qwen2 계열 디코더(28개 레이어, 1,536개 히든 유닛 — 1.5B급)가 이를 읽은 다음, 확산 헤드가 약 2.9초 단위의 청크로 약 0.5초의 룩어헤드와 함께 트랜스크립트를 생성한다. 하나는 레이스카이고, 다른 하나는 듣기까지 겸하는 작은 언어 모델이다.
스펙 확인
• 매개변수 — Granite Speech 5.0 470M TurboCTC: 470M, 인코더 전용 vs VibeVoice-ASR-Streaming-1.5B: 전체 약 3B(1.5B급 LM 백본 + 토크나이저 및 디퓨전 헤드).
• 아키텍처 — 블록 셀프 어텐션과 자기 조건화를 갖춘 Conformer 인코더, CTC 훈련을 통한 그리디 비자기회귀 디코딩 vs DDPM 확산 헤드를 갖춘 Qwen2 계열 인과 디코더로 입력을 공급하는 음향/의미 이중 토크나이저
• 출력 속도 — 청크 단위 스트리밍으로 약 7.5Hz 음성 토큰에 비해 초당 약 12.5개의 출력 프레임을 생성하며, 약 2.9초 청크마다 텍스트를 출력하고 약 0.5초의 lookahead를 가진다.
• 언어 — 영어 전용 vs 10개 언어: 중국어, 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 스페인어.
• 가중치 — 약 0.5B 파라미터 / GB의 일부(엣지급) 대비 ~5.6GB bf16(NVIDIA GPU급).
• 인쇄 문서상의 정확도 — IBM이 Open ASR 단문(short-form) 세트에서 보고한 평균 WER 약 5.00% 대비, 해당 문서에는 게시된 WER 수치가 없음
• 라이선스 — Apache-2.0 vs MIT.
• 출시 — 2026년 8월 25일 vs 2026년 9월 2일.

속도: 하나는 작게 만들어졌고, 다른 하나는 언어 모델로 만들어졌습니다.
The architectural divide shows up first in speed and hardware. Granite Speech 5.0 470M TurboCTC is pitched at laptops, smartphones, and other edge devices. Because a pure CTC encoder samples nothing — output is a single greedy pass over a 16,384-unit BPE head — it is extremely cheap to run, and IBM's model card reports an Open ASR throughput figure measured on a single H200 that is in the tens of thousands of RTFx for the TurboCTC line, alongside a WebGPU demo that transcribes live in a browser tab. Those figures are IBM-measured and unreproduced, but the structural point stands on its own: a 470M encoder with no autoregressive decoder is a model you can run on hardware a phone ships with.
VibeVoice-ASR-Streaming-1.5B는 정반대의 트레이드오프를 택한다. 해당 디코더는 인과적 언어 모델(causal language model)이므로 CTC argmax보다 더 무거운 루프에서 텍스트를 생성하며, 문서화된 실행 방식은 NVIDIA GPU에서의 자체 호스팅 — microsoft/VibeVoice 저장소의 Python 데모 또는 vLLM 플러그인 — 이고, KV 캐시 이전에 약 5.6GB의 bf16 가중치가 필요하다. Microsoft는 처리량이나 실시간 계수(real-time factor)에 대한 수치를 공개하지 않았으므로 IBM의 수치와 견줄 만한 벤더 제공 값이 없다. LLM 아키텍처가 그 대신 제공하는 것은 맥락이다. 즉, 이 모델은 언어 모델이 그렇듯 발화자와 내용에 대한 이해를 전사(transcript) 전체에 걸쳐 유지하며, 이것이 소리를 받아 적는 것과 대화를 따라가는 것의 차이를 만든다.
정확성: 한 공급업체는 숫자를 인쇄했고, 다른 공급업체는 그림을 인쇄했다.
증거상으로, Granite Speech 5.0 470M TurboCTC는 VibeVoice-ASR-Streaming-1.5B보다 발표 가능한 벤치마크 하나 전체만큼 앞서 있습니다. IBM은 출시일에 공식 Open ASR 리더보드 하네스로 자사 모델을 실행했고, 공개 영어 단문 세트에서 평균 단어 오류율 약 5.00%를 보고했습니다. 이 수치는 공급업체 측정값이며 제3자 검증을 거치지 않았고, 이 비교에서 Microsoft 측에는 전혀 존재하지 않습니다. VibeVoice-ASR-Streaming-1.5B의 모델 카드는 평가 결과 수치를 이미지로 제공하지만, 본문에는 숫자로 된 WER, RTF 또는 지연 시간이 없습니다. VibeVoice 제품군에서 유일한 숫자 기준점은 배치(batch) VibeVoice-ASR 카드에 공급업체가 보고한 8개 영어 테스트 세트 평균 WER 7.77%인데, 이는 비스트리밍 모델을 설명하는 것이며 스트리밍 모델에 해당되지 않습니다. 결국 독립적인 실행 결과가 어떻게 나오든, 오늘의 정직한 요약은 IBM은 숫자를 발표했고 Microsoft는 그림을 발표했다는 것입니다.

언어 및 출력: 영어 전용 대 10에서 누가 무엇을 말했는지
Granite Speech 5.0 470M TurboCTC는 영어 전용이며 원시 전사 텍스트를 반환합니다. 이는 IBM이 목표로 하는 워크로드, 즉 엣지 하드웨어에서의 기업용 영어 전사에는 결점이 아니지만, 오디오가 영어가 아닌 순간 비교는 끝납니다. VibeVoice-ASR-Streaming-1.5B는 10개 언어를 나열하며 스트리밍 화자 속성 출력을 주장합니다. 모델 카드에 따르면 음성이 도착할 때 "누가 무엇을 말했는지 연속적으로 전사"하며, 도메인 용어에 대한 핫워드는 컨텍스트 프롬프트로 전달됩니다. 두 가지 추가 기능 모두 회의적으로 읽을 가치가 있습니다. 청크 경계를 넘는 스트리밍 화자 분리는 정말 어렵고, 그 주장은 검증되지 않았기 때문입니다. 하지만 그렇기 때문에 실시간 다국어 회의를 진행하는 팀이 Microsoft의 모델을 살펴볼 이유가 생기는 것입니다.
라이선스 및 생태계: Apache-2.0 대 MIT, Transformers 대 연구용 저장소
두 라이선스 모두 상업적 사용을 허용하므로, 이 점만으로도 이 두 모델은 동일한 아키텍처의 IBM 자체 -NC 변형과 구별됩니다. Granite Speech 5.0 470M TurboCTC는 일반적인 특허 승인 조항을 포함한 Apache-2.0이며, Hugging Face Transformers(transformers >= 5.16의 AutoModelForCTC) 및 Apple Silicon용 mlx-audio에서 기본 지원됩니다. 즉, 이 생태계에서 가장 큰 배포 커뮤니티가 실행되는 모든 환경, 어떤 공급업체의 하드웨어에서든 실행된다는 뜻입니다. VibeVoice-ASR-Streaming-1.5B는 더 단순한 MIT이지만, 그 서빙 경로는 소스에서 직접 구축하는 연구용 설정입니다. 체크포인트의 아키텍처 클래스인 VibeVoiceForASRStreamingTraining은 공개 Transformers 문서에 없으며, Microsoft의 자체 스트리밍 문서도 표준 라이브러리 로드 대신 저장소의 데모 코드와 vLLM 플러그인을 가리킵니다. 프로덕션 팀에게 그 차이는 실질적입니다. 한 모델은 오늘 기존 Transformers 파이프라인에 바로 통합되지만, 다른 모델은 연구 저장소를 직접 구축하고 로드 경로를 스스로 검증해야 합니다.

어떤 조용한 릴리즈를 평가해야 할까요?
워크로드가 영어 중심이고, 하드웨어가 엣지(edge)급이거나 CPU 성능에 제약이 있으며, Transformers에 바로 드롭인할 수 있고 모델 카드의 수치를 검증(sanity check) 기준으로 삼을 수 있는 모델을 원한다면 Granite Speech 5.0 470M TurboCTC를 먼저 평가하세요. 이 모델은 단 한 가지를 제외한 모든 측면에서 리스크가 더 낮은 선택입니다. 제2언어 처리에는 도움이 되지 않으며, 누가 말하고 있는지 알아야 하는 실시간 회의 기록(트랜스크립트)에도 적합하지 않습니다.
다국어 스트리밍이 필요하거나, 화자 구분(who-said-what) 출력이나 핫워드 기능을 테스트해 보고 싶거나, 순수 인코더보다 언어 모델 기반 음성 인식 방식을 더 신뢰하고 싶다면 VibeVoice-ASR-Streaming-1.5B를 평가해 보세요. NVIDIA GPU, 소스 설치, 약 5.6GB의 가중치, 그리고 직접 설계한 평가가 필요합니다. Microsoft를 포함해 아무도 아직 신뢰할 만한 수치를 공개하지 않았기 때문입니다.
두 조용한 릴리스 중 어느 쪽도 바꾸지 못하는 것은, 어떤 베팅이 성과를 내는지 알아내는 동안 ASR 계층을 교체 가능하게 유지하는 것의 가치입니다. 두 모델 모두 신생이며, 이 글을 쓰는 시점에 어느 쪽도 OrcaRouter를 통해 제공되지 않습니다. 공급자가 둘 중 하나를 호스팅하게 되면, 이를 시험해 볼 저위험 방법은 200개 이상의 모델을 공급자 정가로 제공하는 라우팅 계층 뒤에서 사용하는 것입니다. 즉 0% 마크업이라 가격 변동이 당일에 반영되며, 이미 신뢰하는 모델로 자동 페일오버됩니다. 실제 오디오의 일부를 새 모델로 라우팅하고, 전사 내용을 읽은 다음, 출시일의 벤치마크 시트가 아니라 여러분의 실제 트래픽이 어느 조용한 베팅이 옳았는지 판단하게 하세요.
