
VibeVoice-ASR-Streaming-1.5B, 설명: 마이크로소프트의 스트리밍 ASR이 출시 없이 도착했다
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0259지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0258지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0166지능82코딩
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
2026년 9월 2일, Microsoft Research는 보도 자료도, 블로그 게시물도, 아무런 홍보도 없이 두 개의 새로운 음성-텍스트 체크포인트를 Hugging Face에 업로드했습니다: microsoft/VibeVoice-ASR-Streaming-1.5B 및 더 큰 형제 모델인 microsoft/VibeVoice-ASR-Streaming-7B. 지금까지의 유일한 발표는 2026년 9월 3일자 뉴스 게시물로, Microsoft의 오픈소스 VibeVoice GitHub 리포지토리의 News 섹션에 게재되어 이번 릴리스를 오디오가 도착하는 동안 누가 무엇을 말했는지 전사하며 맞춤형 핫워드와 10개 언어를 지원하는 통합 스트리밍 ASR 모델로 설명합니다. 두 체크포인트 모두 MIT 라이선스이며, 공식 microsoft Hugging Face 계정에서 서로 약 5분 간격으로 생성되었고, 하루 뒤 확인했을 때 둘 다 다운로드 수가 0이었습니다. 두 모델 모두에 대한 제3자 보도는 찾을 수 없었습니다.
그래서 이 글은 좀 특이한 소개글이 됐습니다. 실제로 날짜가 확인되는 출시물, 즉 9월 2일자로 Hugging Face에 올라온 가중치와 9월 3일자로 저장소에 게시된 공지가 있지만, 더 넓은 세상은 아직 이를 따라잡지 못했습니다. 아래에서 알 수 있는 모든 내용은 저장소를 직접 읽어서 얻은 것입니다. 설정 파일, 모델 카드, 그리고 Microsoft의 스트리밍 문서에서 말이죠. 아직 확인되지 않은 사항들, 즉 정확도, 실제 지연 시간, 스트리밍 화자 귀속이 실제 두 명이 통화하는 상황에서도 유지되는지 여부 등은 확인되지 않았다고 표시했습니다. 인용할 벤치마크가 없는 이유는 Microsoft가 아직 텍스트 형식의 벤치마크를 공개하지 않았기 때문입니다.
유일한 공지는 뉴스 한 줄입니다.
VibeVoice는 Microsoft Research의 MIT 라이선스 기반 오픈소스 음성 모델 제품군입니다. 그중 가장 잘 알려진 ASR 모델인microsoft/VibeVoice-ASR은(는) 2026년 1월 21일에 출시되었습니다. 이 모델은 단일 패스로 최대 60분 분량의 오디오를 입력받아 화자·시간·내용이 포함된 구조화된 전사(transcript)를 반환하는 배치 모델이며, 이후 약 700,000건의 Hugging Face 다운로드가 이어졌습니다. 같은 해 9월 2일에는 같은 조직이 스트리밍 형제 모델인 microsoft/VibeVoice-ASR-Streaming-7B와 microsoft/VibeVoice-ASR-Streaming-1.5B를 공개했습니다. Hugging Face API의 타임스탬프에 따르면 7B는 2026-09-02T15:46 UTC, 1.5B는 5분 뒤인 15:51 UTC로 기록되었습니다. GitHub 저장소의 모델 테이블에는 이제 VibeVoice-ASR-Streaming이 별도 항목으로 등재되어 있으며, 뉴스 섹션에도 이를 발표하는 9월 3일자 공지가 실려 있습니다.
1월 모델과 비교해 진정으로 새로운 점은 상호작용 모델입니다. 스트리밍 체크포인트는 전체 파일을 기다리지 않고 오디오가 도착하는 대로 전사하는 방식입니다. 그 외의 모든 것, 즉 기본 음성 토큰 아키텍처, 화자 귀속 출력, 핫워드 메커니즘은 배치 설계의 연장선상에 있으며, 실시간 사용에 맞게 확장되고 방향이 전환된 것입니다. 먼저 언어 지원 차이를 주목하세요. 배치 모델은 50개 이상의 언어를 내세우는 반면, 스트리밍 카드는 10개 언어를 나열합니다.

이 체크포인트에서 'streaming'이 의미하는 바는 무엇인가?
Microsoft의 스트리밍 문서는 해당 의도를 명확히 설명합니다: 모델은 오디오가 아직 도착하는 동안 전사를 수행하며, 오디오 청크마다 텍스트를 한 번씩 출력하므로 {{1}}화자가 말하는 동안{{/1}} 대화 내용이 나타납니다. 1.5B 저장소의 preprocessor_config.json은 {{2}}이 전사 주기를{{/2}} 구체적으로 정의합니다: {{3}}오디오 청크 32개마다{{/3}} (0.32초 간격) {{4}}텍스트 토큰 3개가{{/4}} 출력되어 {{5}}약 320ms마다{{/5}} 부분 전사가 갱신되는 셈입니다.
• 샘플 레이트 및 토큰 레이트 — 24kHz 오디오 입력을 3,200배 압축하여 약 7.5Hz의 음성 토큰 스트림을 생성합니다(약 133ms마다 하나의 토큰).
• 청크(Chunk) — 22프레임으로, 7.5Hz에서 방출되는 세그먼트당 약 2.9초의 오디오에 해당합니다.
• Lookahead — 향후 4프레임, 약 0.5초의 오디오를 참조하여 현재 세그먼트를 보다 정확하게 처리합니다.
(저장소의 산술 계산은 간단합니다: 22 × 3,200 = 70,400 샘플 ≈ 24kHz에서 약 2.93초, 4 × 3,200 = 12,800 샘플 ≈ 0.53초입니다. Microsoft 자체 문서에 따르면 체크포인트는 항상 학습된 청크에서 실행되므로, 이 값들은 추론 시 조정할 수 없습니다.)
이는 단어별(word-by-word) 스트리밍이 아닌 청크 단위(chunked) 스트리밍 계열에 해당한다. 라이브 트랜스크립트는 토큰별 부분 결과(partial)로 늘어나는 것이 아니라 약 3초 간격으로 커지며, 약 0.5초의 예측(lookahead)을 갖는다. 이는 회의 및 통화 전사에서 타당하고 일반적인 설계 방식이지만, 1초 미만의 부분 결과를 내보내는 시스템과는 다른 지연 시간 프로파일을 보인다. 따라서 '스트리밍'을 하나의 스펙트럼으로 간주하고, 이를 기반으로 라이브 캡셔닝 제품을 구축하기 전에 자체 지연 시간 예산에 맞춰 측정해야 한다.
내부 구조: Qwen 규모의 음성 LLM
1.5B 체크포인트의 config.json을 읽으면 이제는 익숙한 VibeVoice 레시피를 더 작은 규모에서 확인할 수 있습니다:
• 디코더는 Qwen2 계열 언어 모델로, 그 차원이 1.5B Qwen2.5 클래스와 정확히 일치합니다 — 28개 레이어, 1,536개의 히든 유닛, 2개의 키-밸류 헤드를 가진 12개 어텐션 헤드, 그리고 65,536 토큰 윈도우. 이 LLM 덕분에 모델이 트랜스크립트 전반에 걸쳐 화자 및 내용 이해를 유지할 수 있습니다.
• 음향 및 의미 토크나이저(8/5/5/4/2/2 스트라이딩을 적용한 심층 합성곱 인코더)는 24 kHz 오디오를 디코더가 읽는 ~7.5 Hz 음성 토큰 스트림으로 변환합니다.
• 생성 측에는 확산 헤드(DDPM, 노이즈 제거 20단계, v-예측)가 있으며, 이는 VibeVoice 제품군의 나머지 부분과 일관됩니다.
• 크기 정직성: 체크포인트 자체의 safetensors 메타데이터에는 약 30억 개의 파라미터, 대략 5.6GB의 가중치가 나열되어 있습니다. 이름의 "1.5B"는 언어 백본의 규모를 가리킵니다. 즉, 디코더가 1.5B급 Qwen 모델인 구성의 자연스러운 해석이며, 오디오 토크나이저와 확산 헤드가 나머지를 더합니다. 구성의 아키텍처 문자열인 VibeVoiceForASRStreamingTraining은 이것이 연구용 패밀리 체크포인트임을 나타냅니다.

누가 무엇을 말했는지, 열 가지 언어로
모델 카드의 핵심 기능은 스트리밍 화자 귀속 전사입니다. 카드 자체의 설명에 따르면 "음성이 도착하는 대로 누가 무엇을 말했는지 계속해서 전사합니다." 또한 도메인 용어를 위한 맞춤형 핫워드를 제공하며, 중국어, 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 스페인어 등 10개 언어를 지원합니다.

핫워드는 배치 모델이 사용하는 동일한 컨텍스트 바이어싱 메커니즘을 통해 구현됩니다. Microsoft의 명령줄 데모에서는 컨텍스트 정보로 이를 전달합니다(예: --context_info "Microsoft,VibeVoice"). 이렇게 하면 파인튜닝 없이 이름과 기술 용어 쪽으로 인식을 편향시킬 수 있습니다. 카드는 스트리밍 모델의 언어 자동 감지나 코드 스위칭에 대해 언급하지 않으며, 이는 배치 모델의 주장과 비교했을 때 또 다른 격차입니다.
한 가지 주의할 점이 강조될 필요가 있다. 스트리밍 문서 페이지는 청크 단위 방출과 핫워드에 집중하며, 청크 경계를 넘어 화자 귀속이 어떻게 유지되는지에 대해서는 자세히 설명하지 않는다. 스트리밍 화자 분리는 정말로 어렵다. 화자가 겹치고, 청크 경계는 바로 귀속이 어긋나기 쉬운 지점이기 때문이다. 카드에 적힌 "누가 무엇을 말했는가"라는 표현은 실제 두 명의 화자가 있는 라이브 통화를 실행해 보기 전까지는 공급업체의 주장에 불과하다.
위치: VibeVoice 제품군과 2026 스트리밍 ASR 분야
가족 내에서, 이번 릴리스는 다음과 같이 자리 잡습니다:
• microsoft/VibeVoice-ASR (2026년 1월 21일) — 배치 플래그십: 한 번에 최대 60분 처리, 50개 이상 언어, 누가/언제/무엇 출력, 핫워드, 약 70만 다운로드.
• microsoft/VibeVoice-ASR-Streaming-7B 및 microsoft/VibeVoice-ASR-Streaming-1.5B (2026년 9월 2일) — 새로운 스트리밍 변형 모델이며, 이 글의 주제는 1.5B입니다.
• microsoft/VibeVoice-ASR-BitNet (2026년 7월 23일) — 배치 모델용 양자화된 CPU 중심 엣지 엔진
• VibeVoice-1.5B TTS 및 VibeVoice-Realtime-0.5B 스트리밍-TTS 모델은 동일한 제품군에 속하는 별개의 모델이며, ASR 계열에 포함되지 않습니다.
올해 내내 오픈 가중치 ASR 분야 전반이 실시간 처리 쪽으로 움직여 왔기 때문에, 새로 등장한 스트리밍 모델은 직접 비교할 기준을 갖추고 있다. Qwen3-ASR(알리바바, ~1.7B)은 50개 이상의 언어와 방언을 지원하는 통합 스트리밍/오프라인 모델이다. NVIDIA의 Nemotron 3.5 ASR은 40개 언어를 지원하는 0.6B 스트리밍 모델로, MIT가 아닌 OpenMDW 라이선스로 배포된다. IBM의 Granite Speech 5.0 470M TurboCTC는 Apache-2.0이며, 벤더가 보고한 처리량 수치가 비정상적으로 높다. 이에 맞서 Microsoft의 스트리밍 모델은 세 가지 측면에서 차별화된다: MIT 라이선스, 순수 음향 모델이 아닌 화자·내용 이해를 담당하는 LLM 백본, 그리고 화자별 실시간 전사라는 프레임이다. 남은 과제는 정확도와 실제 환경에서의 지연 시간이며, 이 두 가지에는 아직 독립적인 수치가 없다.
아직 검증되지 않은 것
리포지토리를 읽으면 설계는 알 수 있지만, 그것이 얼마나 잘 작동하는지는 알 수 없습니다. 구체적으로:
• 본문에 정확도나 지연 시간 수치가 없습니다. 모델 카드에는 결과 그림이 이미지로만 포함되어 있고, 수치화된 WER, RTF 또는 지연 시간 표는 본문에 없어 독립적으로 인용할 만한 내용이 없습니다.
• 제3자 평가가 없습니다. 업로드 하루 후 다운로드 수는 0이었고, 커뮤니티 벤치마크도, 리더보드 등재도, 우리가 찾을 수 있는 독립적인 테스트도 없습니다.
• 서빙 경로는 소스에서 직접 빌드하는 연구용 설정입니다. Microsoft의 스트리밍 문서는 NVIDIA PyTorch 컨테이너(nvcr.io/nvidia/pytorch, flash-attention 권장) 내부의 VibeVoice GitHub 리포지토리 클론에서 실행됩니다. 모델 카드에는 Transformers 파이프라인 스니펫도 표시되어 있으며 설치 세부 사항은 GitHub로 넘깁니다. 현재 출시된 Transformers 버전이 이 체크포인트에서 기본 설정으로 스트리밍 추론을 실행할 수 있는지 여부는 확인하지 않았습니다.
프레이밍은 연구 우선이다. Microsoft의 저장소는 VibeVoice 모델을 연구 및 개발 목적으로 사용하도록 설명한다. 가중치는 MIT 라이선스이며, 그 포지션은 "여기 지원되는 제품이 있다"가 아니라 "여기 과학이 있다"는 것이다. 자체 평가 게이트를 위한 예산을 책정하라.
그 위에 구축해야 할까요?
이미 ASR을 자체 호스팅하는 팀이라면, 오디오가 10개 언어 세트에 포함되고 MIT 라이선스 모델을 기반으로 화자 속성이 부여된 실시간 전사가 특별히 필요하다면, 이 모델은 주말 평가를 해볼 가치가 있습니다. NVIDIA GPU에서 1.5B 모델을 돌리려면 가중치 약 5.6GB와 소스 기반 설치 비용을 예산에 포함하세요. 그리고 신뢰하기 전에 자체 오디오로 정확도를 직접 측정해 보는 것을 계획하세요.
오늘날 프로덕션 전사(transcription) 파이프라인을 구축하는 팀에게 신중한 답은 다음 세 가지 중 하나를 기다리는 것입니다: Microsoft가 현재 이미지로만 존재하는 정확도 및 지연 시간 수치를 공개하는 것, 독립적인 벤치마크가 나오는 것, 또는 지원되는 런타임을 갖춘 유지 관리되는 서빙 경로가 등장하는 것입니다. 또한 약 3초 단위로 분할되는 청크 주기는 '스트리밍'이라는 단어를 보고 단정 지을 사항이 아니라, 지연 시간 요구 사항과 대조해 검증해야 할 사양입니다.
옵션을 열어 두는 저렴한 방법은 애플리케이션을 단일 전사 엔진에 하드와이어링하지 않는 것입니다. 하나의 API를 통해 여러 모델을 연결하는 라우팅 계층이 있다면, VibeVoice-ASR-Streaming — 또는 차기 오픈 ASR — 이 추론 제공업체에 등장했을 때, 동일한 트래픽에서 기존 모델과 A/B 테스트하는 것은 플랫폼을 다시 구축하는 일이 아니라 설정 변경 하나일 뿐입니다. 패스스루 라우터는 제공업체의 정가를 마크업 없이 그대로 청구하므로 그 비교는 비용이 낮게 유지되고, 자동 장애 조치는 아직 검증되지 않은 신생 모델이 파이프라인의 단일 장애 지점이 되는 것을 막아 줍니다. 이것이 출시된 지 며칠 안 된 모델을 채택하는 일반적인 패턴입니다. 프로덕션을 걸기 전에 실제 트래픽에서 자리를 증명하게 하십시오.
자주 묻는 질문
VibeVoice-ASR-Streaming-1.5B는 실제 Microsoft 릴리스인가요?
네. 해당 체크포인트는 공식 microsoft Hugging Face 계정에 2026년 9월 2일 생성 타임스탬프와 함께 있으며, microsoft/VibeVoice GitHub 저장소의 모델 테이블에는 VibeVoice-ASR-Streaming이 2026년 9월 3일자 뉴스 항목과 함께 링크되어 있습니다. 특이한 점은 출처가 아니라 침묵입니다. 현재 시점 기준으로 보도자료도, 블로그 게시물도, 제3자 보도도 전혀 없습니다.
왜 두 가지 크기, 7B와 1.5B인가요?
Microsoft는 두 체크포인트를 같은 분에 업로드했지만 비교 결과를 발표하지 않았습니다. config 기준으로 1.5B는 작은 쪽 끝입니다 — 1.5B급 Qwen 언어 백본에 오디오 스택을 더한 것으로, 약 3B 파라미터와 약 5.6GB의 가중치입니다. 자연스러운 해석은 더 높은 정확도의 7B와 더 저렴하고 빠른 1.5B라는 것이지만, Microsoft는 그렇게 밝히지 않았고, 이러한 트레이드오프를 확인할 벤치마크도 없습니다.
이전 VibeVoice-ASR과 어떻게 다른가요?
1월 배치 모델은 단일 패스로 최대 60분의 오디오를 처리하며 50개 이상의 언어를 지원한다고 표기합니다. 스트리밍 체크포인트는 오디오가 도착하는 동안 전사를 수행하여 약 3초 단위로 트랜스크립트를 출력하고, 약 0.5초의 룩어헤드(lookahead)를 가집니다. 또한 모델 카드에는 10개 언어가 나열되어 있습니다. 두 모델 모두 동일한 음성 토큰 아키텍처, 화자 귀속 출력 아이디어, 그리고 핫워드 메커니즘을 공유합니다.
현재 VibeVoice-ASR-Streaming-1.5B는 체크포인트와 뉴스 한 줄에 불과합니다. 자체 호스팅을 하면서 허용적 라이선스의 스트리밍 ASR을 평가할 필요가 있다면 리포지토리를 읽어보세요. 프로덕션 엔진을 선택하는 중이라면 수치가 나올 때까지 기다리세요. 흥미로운 신호는 Microsoft가 자사의 음성 라인업을 실시간 처리 방향으로 두 가지 크기로 동시에 밀어붙이고 있다는 점입니다. 그리고 그 소식이 너무 조용해서 하루가 지나도 다운로드 카운터는 여전히 0을 가리키고 있었습니다.
