Hero-titelkaart voor het artikel 'VibeVoice-ASR-Streaming-1.5B' met de tag 'Wat we tot nu toe weten', ondertitel 'Microsofts streaming spraak-naar-tekst werd stilletjes uitgebracht', en chips met de tekst 'Uitgebracht op 2 september 2026', 'MIT · Open weights' en '10 talen'. Het OrcaRouter-logo is rechtsonder in de hoek samengesteld.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B, uitgelegd: Microsofts streaming-ASR verscheen zonder lancering

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op 2 september 2026 heeft Microsoft Research twee nieuwe spraak-naar-tekst-checkpoints naar Hugging Face geüpload, zonder persbericht, zonder blogpost en zonder fanfare: microsoft/VibeVoice-ASR-Streaming-1.5B en zijn grotere broer microsoft/VibeVoice-ASR-Streaming-7B. De enige aankondiging tot nu toe is een nieuwsbericht van 3 september 2026 in de News-sectie van de opensource-VibeVoice-GitHub-repository van Microsoft, waarin de release wordt beschreven als een uniform streaming-ASR-model dat transcribeert wie wat zei terwijl de audio nog binnenkomt, met aangepaste hotwords en tien talen. Beide checkpoints zijn onder de MIT-licentie uitgebracht, beide zijn binnen ongeveer vijf minuten na elkaar aangemaakt op het officiële Hugging Face-account van microsoft, en beide stonden op nul downloads toen we een dag later keken. We konden geen berichtgeving van derden over een van beide vinden.

Dat maakt dit een ongebruikelijke bespreking: een echte, dateerbare release — gewichten op Hugging Face gedateerd 2 september, een aankondiging in de repository gedateerd 3 september — waar de bredere wereld nog niet van heeft opgemerkt. Alles wat hieronder kenbaar is, komt voort uit het lezen van de repository: de configuratiebestanden, de modelkaart en Microsofts eigen streamingdocumentatie. Alles wat nog niet bevestigd is — nauwkeurigheid, werkelijke latentie, of de streaming-toeschrijving van sprekers een echt gesprek met twee sprekers overleeft — is als zodanig gelabeld. Er is geen benchmark om naar te verwijzen, omdat Microsoft er nog geen in tekstvorm heeft gepubliceerd.

De enige aankondiging is een nieuwsregel.

VibeVoice is de familie van MIT-gelicentieerde, open-source spraakmodellen van Microsoft Research. Het bekendste ASR-lid, microsoft/VibeVoice-ASR, verscheen op 21 januari 2026: een batchmodel dat in één enkele doorgang tot zestig minuten audio verwerkt en gestructureerde transcripten retourneert met spreker, timing en inhoud — inmiddels zijn er ongeveer 700.000 Hugging Face-downloads gevolgd. Op 2 september publiceerde dezelfde organisatie de streaming-zustermodellen microsoft/VibeVoice-ASR-Streaming-7B en microsoft/VibeVoice-ASR-Streaming-1.5B; de Hugging Face-API geeft voor het 7B-model een tijdstempel van 2026-09-02T15:46 UTC en voor het 1.5B-model vijf minuten later om 15:51 UTC. De modeltabel van de GitHub-repository bevat VibeVoice-ASR-Streaming nu als zelfstandige vermelding, en de sectie Nieuws bevat de regel van 3 september die dit aankondigt.

Wat werkelijk nieuw is ten opzichte van het januarinmodel is het interactiemodel: de streaming-checkpoints transcriberen terwijl audio binnenkomt in plaats van te wachten op een volledig bestand. Al het andere — de onderliggende spraak-tokenarchitectuur, de aan sprekers toegeschreven output, het hotword-mechanisme — is een voortzetting van het batchontwerp, opgeschaald en opnieuw gericht op realtime gebruik. Merk het taalverschil direct op: het batchmodel adverteert 50+ talen, terwijl de streamingkaart er tien vermeldt.

A screenshot of the microsoft/VibeVoice GitHub repository README showing the model table that lists VibeVoice-ASR-Streaming as a member of the family and the News section entry dated September 3, 2026 announcing the streaming ASR release.

Wat betekent "streaming" in dit checkpoint?

Het streaming-document van Microsoft beschrijft de bedoeling glashelder: het model transcribeert terwijl de audio nog binnenkomt, en het genereert per audioblok tekst, zodat er een transcript ontstaat terwijl de spreker praat. Het preprocessor_config.json van de 1.5B-repo maakt dat ritme concreet:

• Samplefrequentie en tokenfrequentie — 24 kHz audio-ingang, 3.200× gecomprimeerd, wat ruwweg een stroom van 7,5 Hz spraaktokens oplevert (ongeveer één token per 133 ms).

• Chunk — 22 frames, wat bij 7,5 Hz overeenkomt met ongeveer 2,9 seconden audio per gegenereerd segment.

• Lookahead — 4 frames, ongeveer 0,5 seconde toekomstige audio die wordt gebruikt om het huidige segment te verstevigen.

De rekenkunde is eenvoudig af te leiden uit de repo: 22 × 3.200 = 70.400 samples ≈ 2,93 s bij 24 kHz; 4 × 3.200 = 12.800 samples ≈ 0,53 s. Microsofts eigen documentatie merkt op dat een checkpoint altijd draait op de chunk waarop het is getraind, dus deze zijn niet instelbaar op het moment van inferentie.

Dat plaatst dit in de categorie van chunked streaming in plaats van woord-voor-woord: een live transcript groeit in stappen van ongeveer drie seconden met een vooruitblik van een halve seconde, niet in partiële resultaten per token. Dat is een legitiem en gangbaar ontwerp voor transcriptie van vergaderingen en gesprekken, maar het is een ander latentieprofiel dan systemen die binnen een seconde partiële resultaten leveren — behandel 'streaming' dus als een spectrum en meet het af tegen je eigen latentiebudget voordat je er een live-ondertitelingsproduct op bouwt.

Onder de motorkap: een spraak-LLM op Qwen-schaal

Het lezen van de config.json van de 1.5B-checkpoint geeft het inmiddels bekende VibeVoice-recept op een kleinere schaal:

De decoder is een taalmodel uit de Qwen2-familie waarvan de afmetingen exact overeenkomen met de 1,5B Qwen2.5-klasse — 28 lagen, 1.536 verborgen eenheden, 12 aandachtskoppen met 2 sleutel-waardekoppen en een venster van 65.536 tokens. De LLM zorgt ervoor dat het model spreker- en inhoudsbegrip over het hele transcript kan dragen.

• Akoestische en semantische tokenizers — diepe convolutionele encoders met een stride van 8/5/5/4/2/2 — zetten 24 kHz audio om in de ~7,5 Hz spraak-tokenstroom die de decoder leest.

Een diffusiekop (DDPM, 20 denoising-stappen, v-voorspelling) bevindt zich aan de generatiekant, consistent met de rest van de VibeVoice-serie.

• Eerlijkheid over grootte: de safetensors-metadata van de checkpoint zelf vermeldt ongeveer 3 miljard parameters, ruwweg 5,6 GB aan gewichten. De "1.5B" in de naam is de schaal van de taal-backbone — de natuurlijke lezing van een config waarvan de decoder een Qwen-model van de 1,5B-klasse is — terwijl de audiotokenizers en de diffusiehead de rest toevoegen. De architectuurstring in de config, VibeVoiceForASRStreamingTraining, geeft aan dat dit een checkpoint uit de onderzoeksfamilie is.

A single-column scoreboard titled 'VibeVoice-ASR-Streaming-1.5B — the scoreboard' with the subtitle 'Key specs read from the Hugging Face checkpoint and Microsoft's repo' and six rows: 'Released: Sept 2, 2026', 'Streaming cadence: ~3 s chunks, ~0.5 s lookahead', 'Languages: 10', 'Speaker output: who said what (unverified)', 'Scale: 1.5B LM backbone, ~3B total', 'License: MIT, open weights'. Footer: 'Specs from HF config and microsoft/VibeVoice repo — no independent benchmarks yet.' The OrcaRouter logo is composited in the bottom-right corner.

Wie zei wat, in tien talen

De belangrijkste eigenschap van de modelkaart is streamingtranscriptie met sprekerstoewijzing: het model 'transcribeert continu wie wat zegt terwijl spraak binnenkomt', volgens het eigen opsommingspunt van de kaart. Het adverteert ook met aangepaste hotwords voor domeintermen en vermeldt tien ondersteunde talen — Chinees, Engels, Frans, Duits, Italiaans, Japans, Koreaans, Portugees, Russisch en Spaans.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the MIT license tag, the automatic-speech-recognition pipeline tag, and the card description of streaming speaker-attributed transcription with customized hotwords and ten languages.

Hotwords worden geïmplementeerd via hetzelfde context-biasmechanisme dat het batchmodel gebruikt. In de command-line-demo van Microsoft geef je ze mee als contextinformatie — bijvoorbeeld --context_info "Microsoft,VibeVoice" — om de herkenning te laten neigen naar namen en technische termen, zonder enige fijnafstemming. De kaart zegt niets over automatische taaldetectie of code-switching voor het streamingmodel, wat opnieuw een hiaat is ten opzichte van de claims van het batchmodel.

Eén kanttekening verdient hier de nadruk. De streaming-documentatiepagina richt zich op chunksgewijze emissie en hotwords; ze beschrijft niet hoe sprekerstoewijzing over chunkgrenzen heen wordt gehandhaafd. Streaming-diarisatie is werkelijk moeilijk — sprekers overlappen elkaar, en een chunkgrens is precies waar de toewijzing afdwaalt. De 'wie zei wat'-framing op de kaart is een leveranciersclaim totdat iemand er een echte live tweegesprek doorheen draait en het controleert.

Waar het past: de VibeVoice-familie en het streaming-ASR-veld van 2026

Binnen de familie wordt de release als volgt ingepast:

• microsoft/VibeVoice-ASR (21 januari 2026) — het batch-vlaggenschip: tot 60 minuten in één keer, 50+ talen, Wie/Wanneer/Wat-uitvoer, hotwords, ongeveer 700K downloads.

• microsoft/VibeVoice-ASR-Streaming-7B en microsoft/VibeVoice-ASR-Streaming-1.5B (2 september 2026) — de nieuwe streamingvarianten; het onderwerp van dit artikel is de 1.5B.

• microsoft/VibeVoice-ASR-BitNet (23 juli 2026) — een gekwantiseerde, op CPU gerichte edge-engine voor het batchmodel.

• De VibeVoice-1.5B TTS- en VibeVoice-Realtime-0.5B streaming-TTS-modellen zijn afzonderlijke leden van dezelfde familie, en maken geen deel uit van de ASR-lijn.

Het bredere veld van ASR met open gewichten is het hele jaar richting realtime bewogen, dus een nieuwe streamingoplossing heeft directe vergelijkingspunten. Qwen3-ASR (Alibaba, ~1,7B) is een uniform streaming- en offlinemodel dat 50+ talen en dialecten bestrijkt. NVIDIA’s Nemotron 3.5 ASR is een 0,6B streamingmodel dat 40 talen omvat, onder de OpenMDW-licentie in plaats van MIT. IBM’s Granite Speech 5.0 470M TurboCTC is Apache-2.0, met door de leverancier gerapporteerde doorvoercijfers die ongewoon hoog zijn. Daartegenover onderscheidt Microsofts streamingmodel zich op drie punten: MIT-licentie, een LLM-backbone die spreker- en inhoudsbegrip draagt in plaats van een puur akoestisch model, en het kader van live-transcriptie met sprekerattributie. De open vragen zijn nauwkeurigheid en real-world latentie — geen van beide heeft nog een onafhankelijk cijfer.

Wat is nog niet geverifieerd

De repo lezen vertelt je het ontwerp; het vertelt je niet hoe goed het werkt. Specifiek:

• Geen nauwkeurigheids- of latentiecijfers in de tekst. De modelkaart bevat een resultatenfiguur als afbeelding, maar geen numerieke WER-, RTF- of latentietabel in doorlopende tekst — niets om onafhankelijk te citeren.

• Geen evaluatie door derden. Downloads stonden op nul een dag na upload; er is geen community-benchmark, geen leaderboard-vermelding en geen onafhankelijke test die we konden vinden.

• Het servingpad is een onderzoeksopzet vanuit de bron. Microsofts streamingdocumentatie draait vanaf een clone van de VibeVoice GitHub-repository in een NVIDIA PyTorch-container (nvcr.io/nvidia/pytorch, met flash-attention aanbevolen). De modelkaart toont ook een Transformers-pipelinefragment en verwijst voor installatiedetails naar GitHub; of de huidige uitgebrachte Transformers-versie streaminginferentie op dit checkpoint uit de doos ondersteunt, hebben we niet geverifieerd.

• De insteek is onderzoek voorop. De repository van Microsoft beschrijft de VibeVoice-modellen als bedoeld voor onderzoeks- en ontwikkelingsdoeleinden. De gewichten vallen onder de MIT-licentie; de opstelling is: "hier is de wetenschap", niet "hier is een ondersteund product." Neem budget op voor een eigen evaluatiemoment.

Moet je erop voortbouwen?

Voor teams die al zelf ASR hosten, is dit een weekend evaluatie waard als je audio binnen de set van tien talen valt en je specifiek live transcriptie met sprekerstoewijzing nodig hebt van een MIT-gelicenseerd model. Reken op ~5,6 GB aan gewichten voor het 1.5B-model op een NVIDIA-GPU en een installatie vanuit de broncode, en plan om de nauwkeurigheid zelf te meten op je eigen audio voordat je het vertrouwt.

Voor teams die vandaag een productietranscriptiepijplijn uitrollen, is het verstandige antwoord te wachten op een van drie dingen: Microsoft die de nauwkeurigheids- en latentiecijfers publiceert die momenteel alleen als afbeelding bestaan; een onafhankelijke benchmark; of een onderhouden servingpad met een ondersteunde runtime. De opgedeelde cadans van ~3 seconden is ook een specificatie om te toetsen aan je latentievereiste, in plaats van die aan te nemen op basis van het woord 'streaming'.

De goedkope manier om de optie open te houden is uw applicatie niet onlosmakelijk te koppelen aan één enkele transcriptie-engine. Met een routeringslaag die via één API toegang biedt tot veel modellen, is het A/B-testen van VibeVoice-ASR-Streaming — of de volgende open ASR — tegen uw bestaande engine op hetzelfde verkeer een configuratiewijziging in plaats van een herplatforming, wanneer het model bij een inferentieprovider beschikbaar komt. Omdat een pass-through-router de lijstprijs van de provider zonder opslag rekent, blijft die vergelijking goedkoop, en automatische failover voorkomt dat een jong, onbewezen model een single point of failure in uw pijplijn wordt. Dat is het algemene patroon voor het adopteren van elk kersvers model: laat het eerst een plek verdienen op echt verkeer voordat u er de productie op baseert.

Veelgestelde vragen

Is VibeVoice-ASR-Streaming-1.5B een echte Microsoft-release?

Ja. De checkpoint bevindt zich op het officiële microsoft Hugging Face-account met een aanmaaktijdstempel van 2 september 2026, en de microsoft/VibeVoice GitHub-repository verwijst in zijn modeltabel naar VibeVoice-ASR-Streaming, met een nieuwsbericht gedateerd 3 september 2026. Wat ongewoon is, is niet de herkomst maar de stilte: geen persbericht, geen blogpost en geen berichtgeving van derden op het moment van schrijven.

Waarom twee formaten, 7B en 1.5B?

Microsoft heeft beide checkpoints binnen dezelfde minuut geüpload, maar heeft geen vergelijking gepubliceerd. Uit de configuraties blijkt dat de 1.5B het kleine uiteinde vormt — een Qwen-taalbasis van de 1.5B-klasse plus de audiostream, met ongeveer 3B parameters en ~5,6 GB aan gewichten. De voor de hand liggende interpretatie is een nauwkeurigere 7B en een goedkopere, snellere 1.5B, maar Microsoft heeft dat niet gezegd en er zijn geen benchmarks om die afweging te bevestigen.

Hoe verschilt dit van de eerdere VibeVoice-ASR?

Het batchmodel van januari verwerkt tot 60 minuten audio in één enkele doorgang en adverteert 50+ talen. De streaming-checkpoints transcriberen terwijl de audio binnenkomt, en leveren een transcript in stukken van ~3 seconden met ~0,5 seconden vooruitblik, en de modelkaart vermeldt tien talen. Beide delen dezelfde spraak-tokenarchitectuur, het idee van spreker-gerelateerde uitvoer, en het hotword-mechanisme.

Voorlopig is VibeVoice-ASR-Streaming-1.5B een checkpoint plus een nieuwsbericht. Lees de repository als je zelf host en een permissief gelicenseerde streaming-ASR nodig hebt om te evalueren; wacht op de cijfers als je een productie-engine kiest. Het interessante signaal is dat Microsoft zijn spraaklijn tegelijk in twee groottes naar realtime stuwt — en dat zo geruisloos deed dat de downloadteller een dag later nog steeds op nul stond.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube