Hero-titelkort för artikeln 'VibeVoice-ASR-Streaming-1.5B' med taggen 'Vad vi vet hittills', underrubriken 'Microsofts strömmande tal-till-text släpptes i tysthet', och chips med texten 'Släppt 2 september 2026', 'MIT · Öppna vikter' och '10 språk'. OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B, förklarad: Microsofts strömmande ASR anlände utan lansering

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den 2 september 2026 laddade Microsoft Research upp två nya tal-till-text-checkpoints till Hugging Face utan pressmeddelande, blogginlägg eller någon uppståndelse: microsoft/VibeVoice-ASR-Streaming-1.5B och dess större syskon microsoft/VibeVoice-ASR-Streaming-7B. Det enda som hittills har tillkännagivits är ett nyhetsinlägg daterat 3 september 2026 i nyhetssektionen för Microsofts VibeVoice-repo med öppen källkod på GitHub, där releasen beskrivs som en enhetlig strömmande ASR-modell som transkriberar vem som sa vad medan ljudet fortfarande strömmar in, med anpassningsbara hotwords och tio språk. Båda checkpoints är MIT-licensierade, båda skapades inom cirka fem minuter från varandra på det officiella microsoft-kontot på Hugging Face, och båda visade noll nedladdningar när vi kontrollerade en dag senare. Vi kunde inte hitta någon tredjepartsbevakning av någon av dem.

Det gör det här till en ovanlig genomgång: en verklig, daterbar release — vikter på Hugging Face daterade till den 2 september, ett tillkännagivande i repot daterat till den 3 september — som omvärlden ännu inte har hunnit ikapp. Allt nedan som går att veta kommer från att läsa repot: konfigurationsfilerna, modellkortet och Microsofts egna streamingdokument. Allt som ännu inte är bekräftat — noggrannhet, verklig latens, huruvida streamingens talarattribuering överlever ett verkligt tvåtalarsamtal — är märkt som sådant. Det finns inget riktmärke att citera eftersom Microsoft ännu inte har publicerat något i textform.

Det enda tillkännagivandet är en nyhetsrad.

VibeVoice är Microsoft Researchs familj av MIT-licensierade talmodeller med öppen källkod. Dess mest kända ASR-medlem, microsoft/VibeVoice-ASR, lanserades den 21 januari 2026: en batchmodell som tar emot upp till sextio minuters ljud i ett enda pass och returnerar strukturerade transkript med talare, tidpunkter och innehåll — ungefär 700 000 nedladdningar på Hugging Face har följt. Den 2 september publicerade samma organisation de strömmande syskonmodellerna microsoft/VibeVoice-ASR-Streaming-7B och microsoft/VibeVoice-ASR-Streaming-1.5B; Hugging Faces API tidsstämplar 7B vid 2026-09-02T15:46 UTC och 1.5B fem minuter senare vid 15:51 UTC. GitHub-repositoriets modelltabell listar nu VibeVoice-ASR-Streaming som en egen post, och dess nyhetssektion innehåller raden från den 3 september som tillkännager den.

Det som verkligen är nytt jämfört med januarimodellen är interaktionsmodellen: de strömmande kontrollpunkterna transkriberar i takt med att ljudet kommer in, i stället för att vänta på en komplett fil. Allt annat – den underliggande speech-token-arkitekturen, den talarattribuerade utdatan, hotword-mekanismen – är en fortsättning av batchdesignen, uppskalad och omriktad mot realtidsanvändning. Notera språkskillnaden på förhand: batchmodellen anger 50+ språk, medan strömningskortet listar tio.

A screenshot of the microsoft/VibeVoice GitHub repository README showing the model table that lists VibeVoice-ASR-Streaming as a member of the family and the News section entry dated September 3, 2026 announcing the streaming ASR release.

Vad "streaming" betyder i denna checkpoint

Microsofts strömningsdokumentation beskriver avsikten tydligt: modellen transkriberar medan ljudet fortfarande anländer, och den avger text en gång per ljudsegment, så att en utskrift visas medan talaren pratar. 1.5B-repots preprocessor_config.json gör kadensen konkret:

• Samplingsfrekvens och tokenfrekvens — 24 kHz ljud in, komprimerat 3 200×, vilket ger ungefär en 7,5 Hz ström av tal-tokens (cirka en token var 133:e ms).

• Chunk — 22 frames, vilket vid 7,5 Hz är ungefär 2,9 sekunders ljud per genererat segment.

• Lookahead — 4 frames, cirka 0,5 sekunders framtida ljud som används för att stärka det aktuella segmentet.

(Aritmetiken är enkel att räkna ut från repot: 22 × 3 200 = 70 400 sampel ≈ 2,93 s vid 24 kHz; 4 × 3 200 = 12 800 sampel ≈ 0,53 s. Microsofts egen dokumentation påpekar att en checkpoint alltid körs på det chunk som den tränades på, så dessa går inte att justera vid inferenstillfället.)

Det placerar detta i familjen för strömning i segment (chunked streaming) snarare än ord-för-ord-strömning: en live-transkription växer i steg om ungefär tre sekunder med cirka en halv sekunds framförhållning, inte i tokenvisa delresultat. Det är en legitim och vanlig design för transkribering av möten och samtal, men det är en annan latensprofil än system som avger delresultat på under en sekund — så behandla "strömning" som ett spektrum och mät det mot din egen latensbudget innan du bygger en live-textningsprodukt på det.

Under huven: en tal-LLM i Qwen-skala

Att läsa config.json för 1.5B-checkpointen ger det numera välbekanta VibeVoice-receptet i mindre skala:

{{1}}Avkodaren är en språkmodell från Qwen2-familjen vars dimensioner exakt matchar 1,5B Qwen2.5-klassen — 28 lager, 1 536 dolda enheter, 12 uppmärksamhetshuvuden med 2 nyckel-värde-huvuden och ett fönster på 65 536 token.{{/1}} {{2}}Språkmodellen är det som gör att modellen kan bära talar- och innehållsförståelse genom hela transkriptet.{{/2}}

Akustiska och semantiska tokenizers — djupa konvolutionella enkoder med steglängd 8/5/5/4/2/2 — omvandlar 24 kHz-ljud till strömmen av tal-tokens på ~7,5 Hz som avkodaren läser.

En diffusionshuvud (DDPM, 20 avbrusningssteg, v-prediktion) sitter på generationssidan, i linje med resten av VibeVoice-serien.

Ärlighet om storleken: checkpointens egna safetensors-metadata listar cirka 3 miljarder parametrar, vilket motsvarar ungefär 5,6 GB vikter. ”1.5B” i namnet är skalan på språkryggraden – den naturliga läsningen av en config vars avkodare är en Qwen-modell i 1.5B-klassen – medan ljudtokeniserarna och diffusionshuvudet står för resten. Arkitektursträngen i configen, VibeVoiceForASRStreamingTraining, signalerar att detta är en checkpoint från forskningsfamiljen.

A single-column scoreboard titled 'VibeVoice-ASR-Streaming-1.5B — the scoreboard' with the subtitle 'Key specs read from the Hugging Face checkpoint and Microsoft's repo' and six rows: 'Released: Sept 2, 2026', 'Streaming cadence: ~3 s chunks, ~0.5 s lookahead', 'Languages: 10', 'Speaker output: who said what (unverified)', 'Scale: 1.5B LM backbone, ~3B total', 'License: MIT, open weights'. Footer: 'Specs from HF config and microsoft/VibeVoice repo — no independent benchmarks yet.' The OrcaRouter logo is composited in the bottom-right corner.

Vem sa vad, på tio språk

Modellkortets huvudfunktion är strömmande talarattribuerad transkription: det ”transkriberar kontinuerligt vem som sa vad när tal anländer”, enligt kortets egen punkt. Det annonserar också anpassade hotwords för domäntermer och listar tio språk som stöds – kinesiska, engelska, franska, tyska, italienska, japanska, koreanska, portugisiska, ryska och spanska.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the MIT license tag, the automatic-speech-recognition pipeline tag, and the card description of streaming speaker-attributed transcription with customized hotwords and ten languages.

Hotwords implementeras genom samma kontextstyrningsmekanism som batchmodellen använder. I Microsofts kommandoradisdemo anger du dem som kontextinformation – till exempel --context_info "Microsoft,VibeVoice" – för att styra igenkänningen mot namn och tekniska termer utan någon finjustering. Kortet säger ingenting om automatisk språkdetektering eller kodväxling för streamingmodellen, vilket är ytterligare en lucka jämfört med batchmodellens påståenden.

Ett förbehåll förtjänar att betonas. Streamingdokumentationen fokuserar på utsändning i chunkar och på hotwords; den anger inte i detalj hur talartilldelningen upprätthålls över chunkgränserna. Strömmande diarisering är genuint svår — talare överlappar varandra, och en chunkgräns är precis där tilldelningen glider. Skrivningen ”vem sa vad” på kortet är ett leverantörspåstående tills någon faktiskt kör ett riktigt livesamtal med två talare och kontrollerar.

Var den hör hemma: VibeVoice-familjen och 2026 års streaming-ASR-område.

Inom familjen placerar sig releasen på följande sätt:

microsoft/VibeVoice-ASR (21 januari 2026) — flaggskeppet för batchbearbetning: upp till 60 minuter i ett enda pass, 50+ språk, Vem/När/Vad-utdata, hotwords, cirka 700 000 nedladdningar.

• microsoft/VibeVoice-ASR-Streaming-7B och microsoft/VibeVoice-ASR-Streaming-1.5B (2 september 2026) — de nya strömmande varianterna; denna artikel handlar om 1.5B.

• microsoft/VibeVoice-ASR-BitNet (23 juli 2026) — en kvantiserad, CPU-orienterad edge-motor för batchmodellen.

• VibeVoice-1.5B TTS- och VibeVoice-Realtime-0.5B streaming-TTS-modellerna är separata medlemmar av samma familj, inte en del av ASR-serien.

Det bredare open-weights-ASR-fältet har rört sig mot realtid under hela året, så en ny strömningsmodell har direkta jämförelsepunkter. Qwen3-ASR (Alibaba, ~1.7B) är en enhetlig strömnings- och offlinemodell som täcker 50+ språk och dialekter. NVIDIAs Nemotron 3.5 ASR är en 0.6B-strömningsmodell som täcker 40 språk, under OpenMDW-licensen snarare än MIT. IBMs Granite Speech 5.0 470M TurboCTC är Apache-2.0 med leverantörsrapporterade genomströmningssiffror som är ovanligt höga. Jämfört med dessa utmärker sig Microsofts strömningsmodell på tre sätt: MIT-licensiering, en LLM-stomme som bär på förståelse för talare och innehåll snarare än en ren akustisk modell, samt inramningen med talarattribuerad direkttranskribering. Dess öppna frågor är noggrannhet och verklig latens — ingen av dem har ännu ett oberoende mått.

Vad är ännu inte verifierat?

Att läsa repot berättar för dig om designen; det berättar inte hur väl det fungerar. Specifikt:

• Inga siffror för noggrannhet eller latens i texten. Modellkortet medföljer en resultatfigur som bild, men ingen numerisk WER-, RTF- eller latenstabell i brödtexten — inget att citera oberoende.

• Ingen tredjepartsutvärdering. Nedladdningarna var noll en dag efter uppladdningen; det finns inget community-benchmark, ingen plats på leaderboarden och inget oberoende test som vi kunde hitta.

• Serveringsvägen är en forskningsinstallation byggd från källkod. Microsofts strömningsdokumentation körs från en klon av VibeVoice GitHub-repo inuti en NVIDIA PyTorch-container (nvcr.io/nvidia/pytorch, med flash-attention rekommenderat). Modellkortet visar också ett Transformers-pipeline-utdrag och hänvisar installationsdetaljer till GitHub; huruvida den nuvarande utgivna Transformers-versionen kan köra strömningsinferens på denna checkpoint direkt utan modifieringar har vi inte verifierat.

• Inramningen är forskning i första hand. Microsofts repository beskriver VibeVoice-modellerna som avsedda för forsknings- och utvecklingsändamål. Vikterna är MIT-licensierade; hållningen är "här är vetenskapen", inte "här är en produkt med support". Budgetera för din egen utvärderingsgrind.

Bör du bygga vidare på det?

För team som redan självhostar ASR är detta värt en helgs utvärdering om ditt ljud finns inom tiospråksuppsättningen och du specifikt behöver talartillskriven live-transkribering från en MIT-licensierad modell. Budgetera för ~5,6 GB vikter för 1.5B-modellen på en NVIDIA GPU och en installation från källkod, och planera att mäta noggrannheten själv på ditt eget ljud innan du litar på den.

För team som i dag sätter en transkriptionspipeline i produktion är det försiktiga svaret att vänta på en av tre saker: att Microsoft publicerar siffrorna för noggrannhet och latens som för närvarande endast finns som en bild; ett oberoende riktmärke; eller en underhållen serveringsväg med en runtime som stöds. Den chunkade ~3-sekundstakten är också en spec att rimlighetskontrollera mot ditt latensbehov snarare än att utgå från ordet "streaming".

Det billiga sättet att hålla alternativet öppet är att inte låsa fast din applikation vid en enda transkriptionsmotor. Ett routinglager som exponerar många modeller via ett enda API innebär att när VibeVoice-ASR-Streaming — eller nästa öppna ASR — landar hos en inferensleverantör, blir A/B-testning mot den nuvarande motorn på samma trafik en konfigurationsändring snarare än en omplattformering. Eftersom en pass-through-router tar leverantörens listpris utan påslag, förblir jämförelsen billig, och automatisk failover hindrar en ung, oprövad modell från att bli en enskild felpunkt i din pipeline. Det är det allmänna mönstret för att införa en modell som är några dagar gammal: låt den förtjäna en plats på riktig trafik innan du satsar produktion på den.

FAQ

Är VibeVoice-ASR-Streaming-1.5B en faktisk Microsoft-utgåva?

Ja. Checkpointen ligger på det officiella Microsoft Hugging Face-kontot med en skapelsetidsstämpel från 2 september 2026, och GitHub-repositoriet microsoft/VibeVoice refererar till VibeVoice-ASR-Streaming i sin modelltabell med en nyhetspost daterad 3 september 2026. Det ovanliga är inte ursprunget utan tystnaden: inget pressmeddelande, inget blogginlägg och ingen tredjepartsbevakning i skrivande stund.

Varför två storlekar, 7B och 1.5B?

Microsoft laddade upp båda kontrollpunkterna i samma minut men har inte publicerat en jämförelse. Enligt konfigurationerna är 1.5B den lilla änden – en 1.5B-klass Qwen-språkryggrad plus ljudstacken, cirka 3B parametrar och ~5,6 GB vikter. Den naturliga tolkningen är en högre träffsäkerhet 7B och en billigare, snabbare 1.5B, men Microsoft har inte sagt det, och det finns inga benchmarks som bekräftar avvägningen.

Hur skiljer sig detta från den tidigare VibeVoice-ASR?

Januari-batchmodellen matar in upp till 60 minuter ljud i ett enda pass och utlovar 50+ språk. Strömningskontrollpunkterna transkriberar medan ljudet anländer och avger en transkription i ~3-sekundersblock med ~0,5 sekunders framförhållning, och modellkortet listar tio språk. Båda delar samma tal-token-arkitektur, idén med talarattribuerad utdata och hotword-mekanismen.

För närvarande är VibeVoice-ASR-Streaming-1.5B en checkpoint plus en nyhet. Läs repot om du hostar själv och behöver en streaming-ASR med tillåtande licens att utvärdera; avvakta med siffrorna om du väljer en produktionsmotor. Den intressanta signalen är att Microsoft driver sin röstlinje mot realtid i två storlekar samtidigt — och gjorde det så tyst att nedladdningsräknaren fortfarande stod på noll en dag senare.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube