Artikel-herokaart met de tekst 'Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B', met de badge 'MODELVERGELIJKING' en de ondertitel 'het getal dat Microsoft niet publiceerde', met chips met de tekst 2,7% streaming WER, 0,49 s eerste deelresultaat, 2,9 s chunks met sprekerattributie en MIT-gewichten bij 18 GB, over een gradiënt van wit naar blauw met het OrcaRouter-logo rechtsonder.
Guides & Insights

Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B: Het cijfer dat Microsoft niet publiceerde

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

VibeVoice ASR Streaming 7B is Microsofts uniforme streaming spraakherkenner, op 2 september 2026 geüpload naar Hugging Face en een dag later aangekondigd in de microsoft/VibeVoice-repository onder de MIT-licentie, en doet iets wat noch Grok Voice Transcribe 2.0 noch de meeste van zijn concurrenten doen: het produceert tekst met sprekerattributie terwijl audio binnenkomt, zonder een afzonderlijke diarisatiefase. In Microsofts technische rapport staat dat het 7B-checkpoint de laagste gemiddelde WER en CER behaalt over vijf evaluatiesets en de beste of gedeeld beste sprekerattributie in 12 van de 13 evaluatie-instellingen. Wat de modelkaart niet doet, is één enkel getal in tekst publiceren — geen WER, geen RTF, geen latentiecijfer; de resultaten bestaan alleen als afbeeldingen in het rapport. Grok Voice Transcribe 2.0, zestien dagen later uitgebracht, op 18 september 2026, voor $0,10 per audio-uur voor batch en $0,20 per uur voor streaming, publiceert alles: 2,7% WER voor het eindtranscript en 3,4% WER voor het eerste partiële transcript op de streamingboard van Artificial Analysis, 0,49 seconden voor elk. Het eerlijke uitgangspunt voor deze vergelijking is dus dat een van de twee modellen meetbaar beter gedocumenteerd is dan het andere, en die asymmetrie is op zichzelf het meest beslissingsrelevante feit in de confrontatie.

Wat Microsoft heeft gepubliceerd, en wat een lezer ermee kan doen

Het VibeVoice-rapport is echt onderzoek en de beweringen erin zijn specifiek in vorm, zo niet in waarde. Het evalueerde vier vergaderbenchmarks — AliMeeting, AISHELL-4, AMI-SDM en AMI-IHM — plus MLC-Challenge, in negen talen, en rapporteert twee hoofdresultaten: het 7B-model had de laagste gemiddelde WER/CER over de vijf sets, en de beste of gedeeld beste sprekerattributie in 12 van de 13 evaluatie-instellingen. Beide zijn relatieve beweringen, wat een betekenisvol soort bewering is: "laagste over deze vijf sets" is een uitspraak over ordening, en ordening is wat een koper nodig heeft.

Wat ontbreekt, is elk absoluut cijfer. Er is geen WER-percentage om mee te vergelijken, geen doorvoercijfer, geen latencymeting en geen uitsplitsing per set in de tekst. Een vergelijkingstabel die VibeVoice naast Grok Voice Transcribe 2.0 zet en het Microsoft-model een cijfer toekent, verzint dat cijfer. Wat gezegd kan worden, is dat VibeVoice zijn eigen evaluatie met vijf sets heeft gewonnen en dat niemand buiten Microsoft die opnieuw heeft uitgevoerd — geen onafhankelijke benchmark, geen evaluatie door derden, en op het moment van schrijven geen enkele gehoste inferentieprovider die het model überhaupt vermeldt. De vergelijking gaat dus tussen een gedocumenteerd cijfer en een ongedocumenteerde rangschikking, en de ongedocumenteerde rangschikking is niet de zwakkere van de twee, louter omdat ze geen decimaalteken heeft.

De documentatie van Grok Voice Transcribe 2.0 heeft het tegenovergestelde probleem. De 2,7% en 3,4% komen van het AA-WER Streaming-bord van Artificial Analysis, een gewogen samenstelling van AA-AgentTalk tegen 50% met VoxPopuli en Earnings22 tegen elk 25% — ongeveer acht uur Engels conversationele audio in agentvorm, onafhankelijk uitgevoerd, wat een werkelijk sterkere herkomst is dan de eigen evaluatie van een leverancier. Maar het is slechts een smalle doorsnede van het Engels, en de bordpagina zelf toont 27 van de 33 modellen die SpaceXAI meetelt wanneer het claimt eerste te staan van de 32. Een precies getal op een smalle test en een onnauwkeurige claim op een bredere test zijn niet direct vergelijkbaar, en dit artikel zal niet doen alsof dat wel zo is.

Tweeënhalf seconde tegen een halve seconde

De latentievergelijking is de enige plek waar de twee modellen naast elkaar kunnen worden gezet zonder enig voorbehoud over datasets, omdat beide hun streamingconfiguratie publiceren — en het verschil is architecturaal van aard en niet een kwestie van afstelling.

VibeVoice ASR Streaming 7B werkt in chunks. De vrijgegeven checkpoints gebruiken 22 latente frames per chunk, wat bij de 7,5 latente frames per seconde van het model neerkomt op ongeveer 2,9 seconden audio per chunk, met een lookahead van vier latente frames — ongeveer 0,5 seconden toekomstige audio — en een verwachte latentie voor sprekerattributie van ongeveer 2,00 seconden. Het genereert tekst één keer per chunk. Dat is een echt streamingsysteem, maar de cadans wordt in seconden gemeten, niet in milliseconden.

Grok Voice Transcribe 2.0 levert zijn eerste gedeeltelijke transcriptie 0,49 seconden nadat de spreker stopt, en finaliseert 0,49 seconden na het einde van de spraak. Het kocht die snelheid met nauwkeurigheid — het foutenpercentage van de eerste partiële transcriptie daalde van 18,3% in versie 1.0 naar 3,4% in 2.0, ten koste van een toename van 0,25 seconden naar 0,49 seconden op dezelfde maatstaf.

Zet naast elkaar:

• Streamingritme — Grok Voice Transcribe 2.0 zendt continu partiële resultaten uit met een latentie van 0,49 seconde voor het eerste partiële resultaat, tegenover VibeVoice ASR Streaming 7B dat ongeveer elke 2,9 seconden één stuk tekst uitzendt

• Latentie bij sprekerattributie — opgenomen in hetzelfde pad van 0,49 seconde tegenover ongeveer 2,00 seconden zoals ontworpen

• Lookahead — niet gepubliceerd versus vier latente frames, ongeveer 0,5 seconde toekomstige audio

• Praktisch effect — een spraakagent kan inspelen op een zin die nog gaande is, versus een systeem dat elke drie seconden een paragraaf met sprekerslabels ontvangt

Geen van beide is verkeerd. Een blok van 2,9 seconden is een volkomen redelijk ontwerp voor vergadertranscriptie, waarbij de output een document is en de waarde erin ligt dat het document tijdens de vergadering aankomt in plaats van erna. Het is het verkeerde ontwerp voor een conversationele agent, waarbij een stilte van drie seconden geen pauze is, maar een fout. Het verschil tussen de twee cadansen is ongeveer een factor zes, en het komt bijna exact overeen met het verschil tussen het transcriberen van een gesprek en het deelnemen aan een gesprek.

Screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B, showing the MIT licence tag, the 10 languages and Streaming tags, the model card opening line 'a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the 9B parameter and BF16 tensor type fields, a notice that no inference provider deploys it, and the architecture diagram showing 2.9 second chunks with 0.5 second lookahead.

Sprekertoewijzing als output, niet als pijplijnstadium

Dit is waar het Microsoft-model echt vooroploopt, en het ontwerp is het waard om te begrijpen, want het is de reden dat de chunking grof is.

VibeVoice gebruikt twee vooraf getrainde tokenizers — een akoestische encoder en een semantische encoder — die op 24 kHz werken met een downsampling van 3.200× om 7,5 latente frames per seconde te produceren, één per 133 milliseconden. Die frames worden geprojecteerd in een Qwen2.5-taalmodel-backbone, en inkomende spraak en gegenereerde tekst worden als één enkele sequentie verweven, waarbij eerder waargenomen spraak en tekst in de context van het model behouden blijven. Het gevolg is dat sprekeridentiteit nooit een afzonderlijk probleem is: het model transcribeert niet en beslist daarna wie er sprak, het genereert tekst die geconditioneerd is op een audiogeschiedenis die de stemmen nog steeds bevat. Daarom is er geen diarisatiefase die moet worden uitgelijnd, en daarom is Microsofts bewering over sprekerattributie in 12 van de 13 instellingen architectonisch geloofwaardig in plaats van een aangeplakt resultaat.

De prijs van dat ontwerp is het bijhouden van geschiedenis dat lineair groeit met de opnamelengte, en daarom richten de vrijgegeven checkpoints zich op opnames van maximaal acht minuten. Dat is een echte bovengrens en dat wordt ronduit gezegd. Het sluit het model uit voor langdurig werk — een resultatengesprek van twee uur, een hele dag contactcenter-audio — tenzij je je eigen segmentering en herinitialisatie bouwt, wat precies de complexiteit opnieuw introduceert die de architectuur moest wegnemen.

Grok Voice Transcribe 2.0 lost hetzelfde probleem anders op en met een andere set beperkingen. Het bevat diarisatie zonder extra kosten en ondersteunt maximaal acht onafhankelijke audiokanalen in één enkele aanvraag. Voor telefonie in contactcenters, waar elke deelnemer vaak via zijn eigen kanaal binnenkomt, is kanaalscheiding betrouwbaarder dan diarisatie en kleeft er geen foutpercentage aan. Voor gemengde audio hangt het af van de kwaliteit van de diarisatie, en anders dan Meta's Muse Voice Transcribe — dat een gemiddeld diarisatiefoutpercentage van 17,5% publiceerde — heeft SpaceXAI helemaal geen diarisatiecijfer gepubliceerd. Dus beide modellen laten een leemte in het bewijs voor diarisatie: het ene publiceert een rangschikking zonder waarde, het andere een functielijst zonder meting.

Achttien gigabytes, tien talen, MIT

De deploymentfeiten lopen zo volledig uiteen dat het bijna geen vergelijking meer is. VibeVoice ASR Streaming 7B bestaat uit ongeveer 18 GB aan bf16-gewichten — de Hugging Face-kaart vermeldt 9B totale parameters voor het checkpoint met de naam 7B, met een 1,5B-variant van ongeveer 5,6 GB — MIT-gelicenseerd, met Python-demo's en een vLLM-plugin voor serving. Tien talen: Chinees, Engels, Frans, Duits, Italiaans, Japans, Koreaans, Portugees, Russisch en Spaans. Microsoft positioneert het voor onderzoek en ontwikkeling.

Grok Voice Transcribe 2.0 is een beheerd endpoint zonder gewichten te downloaden, 12 invoerformaten van telefonie-audio van 8 kHz tot 48 kHz, tot acht kanalen, 100 sleuteltermen per verzoek, automatische taalherkenning met omschakeling halverwege de opname, inverse tekstnormalisatie in 25 talen, bestanden tot 500 MB, en servicelimieten van 10 verzoeken per seconde en 100 gelijktijdige streamingsessies per team. Het draait in us-east-1 en alleen in us-east-1.

• Gewichten — MIT, 18 GB, overal zelf te draaien versus geen, alleen gehost bij de leverancier

• Talen — 10 benoemde talen versus automatische detectie met opmaakondersteuning voor 25

• Biasing van sleuteltermen — ondersteund via hotwords versus tot 100 sleuteltermen per verzoek

• Opnamelengte — ongeveer acht minuten per checkpoint voordat het bewaren van geschiedenis de beperkende factor wordt, tegenover geen gepubliceerd maximum, bestanden tot 500 MB

• Regiobeheer — wat je ook gebruikt om op te implementeren versus us-east-1

• Kosten — geen licentiekosten, plus 18 GB GPU-geheugen en een serving-stack versus $0,10 per batchuur en $0,20 per streaminguur

Een model van 18 GB is niet iets wat je op een laptop draait, en de vLLM-plugin betekent een GPU met echt geheugen. Daar staat tegenover dat een MIT-licentie op een model van die omvang ongewoon en waardevol is: het is de enige van de twee die je binnen je eigen netwerk kunt draaien zonder enige leveranciersrelatie, wat voor gereguleerde audio geen voorkeur maar een vereiste is. Het beheerde alternatief is goedkoop per uur en onmogelijk on-premises te implementeren.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7% streaming, first partial 0.49s, cadence continuous partials, diarization included with no figure published, $0.10 per batch hour, managed in us-east-1. The right column gives VibeVoice ASR Streaming 7B the rows: WER lowest of five sets but unpublished, speaker attribution about 2.00s, cadence 2.9 second chunks, diarization built into streaming, MIT weights at about 18 GB, recordings up to 8 minutes. A footer reads 'VibeVoice figures Microsoft-reported with no absolute values published; Grok figures per Artificial Analysis.'

Waar de routeringsbeslissing thuishoort

Kosten zijn waar de twee modellen eindelijk vergelijkbaar worden op een manier die een getal oplevert. De batchroute van Grok Voice Transcribe 2.0 kost $0,10 per audio-uur, ongeveer $1,67 per 1.000 minuten, en de streamingroute $0,20, ongeveer $3,33. VibeVoice ASR Streaming 7B heeft helemaal geen licentiekosten; wat het in plaats daarvan heeft, is ongeveer 18 GB resident GPU-geheugen en een vLLM-servingstack die u zelf draait. Een model van de 7B-klasse van die omvang zal op gehuurde hardware niet goedkoop zijn per uur audio, en de benuttingscurve is meedogenloos — een GPU die warm wordt gehouden voor piekverkeer kost hetzelfde, of hij nu aan het transcriberen is of niets doet.

Dat is de gebruikelijke vorm van het build-versus-buy-debat, en het pakt anders uit afhankelijk van volume en van of de audio je netwerk mag verlaten. Wat de afgelopen maand is veranderd, is hoe snel het antwoord verschuift: de koploper op het gebied van streamingnauwkeurigheid wisselde in drie weken twee keer van eigenaar, en een model dat begin september werd uitgebracht, was medio september al verdrongen. Elke architectuur die de modelkeuze duur maakt om terug te draaien, is nu de verkeerde architectuur voor deze categorie.

OrcaRouter is waar die ommekeer goedkoop wordt. Eén OpenAI-compatibele sleutel dekt 200+ modellen met automatische failover tussen providers, dus het uitvallen van een beheerd endpoint in één regio is een routeringsgebeurtenis in plaats van een storing, en de lijstprijs van de provider wordt doorgegeven tegen 0% opslag — wat betekent dat een prijswijziging van een leverancier of een nieuw checkpoint dezelfde dag nog bij ons live is. Voor een team dat VibeVoice wil testen tegen Grok Voice Transcribe 2.0 op zijn eigen audio, of om een self-hosted fallback achter dezelfde interface te houden als een beheerde primaire, is de call site niet langer het ding dat moet veranderen.

Screenshot of the microsoft/VibeVoice GitHub repository showing the description 'Open-Source Frontier Voice AI' and the MIT licence in the About sidebar, the file listing with demo and vibevoice directories both updated with streaming ASR inference code and a vllm_plugin directory, the repository's 53.6 thousand stars, and a GitHub Trending badge reading number 1 Repository Of The Day.

Het eerlijke oordeel: VibeVoice ASR Streaming 7B is het interessantere model en Grok Voice Transcribe 2.0 is het bruikbaardere product, en de kloof tussen die twee uitspraken wordt volledig verklaard doordat de ene leverancier grafieken publiceert en de andere cijfers. Als je vereiste on-premises transcriptie met sprekerattributie van vergaderingen van minder dan acht minuten is, is het Microsoft-checkpoint de enige van de twee die daarvoor in aanmerking komt. Als je vereiste een spraakagent is die binnen een gesprekspauze antwoordt, sluit een chunkcadans van 2,9 seconden die uit voordat nauwkeurigheid ter sprake komt. En als je wacht op de vergelijking die de knoop zou doorhakken — dezelfde audio door beide modellen, beoordeeld door iemand die niet voor een van beide bedrijven werkt — die meting bestaat nog niet, wat het onthouden waard is de volgende keer dat een tabel een getal naast de naam van VibeVoice zet.