Een gegenereerde hero-titelkaart voor 'VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC: de twee stille open-weights streaming-kandidaten', ondertiteld 'Twee open-weights streaming-ASR-modellen, acht dagen na elkaar', met twee modelkaarten — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 sept 2026 · MIT · ~3B totaal · spraak-LLM) en Granite Speech 5.0 470M TurboCTC (IBM · 25 aug 2026 · Apache-2.0 · 470M · pure CTC-encoder) — en tags die luiden 'Edge-class-snelheid (IBM)', 'Alleen Engels (IBM)' en 'Wie zei wat in 10 talen (Microsoft, ongeverifieerd)'. Het OrcaRouter-logo is in de rechteronderhoek verwerkt.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC: {{1}}de twee stille open-gewichten streaming-gokken{{/1}}

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De twee interessantste open-weights-releases voor streaming spraak-naar-tekst van eind augustus 2026 kwamen beide zonder lanceringsevenement uit. Op 25 augustus plaatste IBM Granite Speech 5.0 470M TurboCTC op Hugging Face — weights, modelkaart en een blogpost, meer niet — en op 2 september uploadde Microsoft Research VibeVoice-ASR-Streaming-1.5B onder de microsoft-naamruimte, zonder enige aankondiging behalve een nieuwsregel in de VibeVoice GitHub-repository. Het zijn hetzelfde soort product én tegengestelde technische gokken: IBM's model is een pure-CTC-encoder met 470 miljoen parameters, ontworpen om op edge-snelheid op een laptop te draaien, terwijl dat van Microsoft een spraaktaalmodel van de 1.5B-klasse is, ingepakt in audio-tokenizers en een diffusie-head — in totaal ongeveer drie miljard parameters — gebouwd om spraak als taal te begrijpen terwijl het transcribeert.

Vóór de cijfers: de bronlabels die dit eerlijk houden. Alles dat is gemarkeerd als afkomstig van IBM komt van de Granite Speech 5.0 470M TurboCTC-modelkaart en de bijbehorende vermeldingen op het Open ASR-leaderboard, uitgevoerd via de officiële testomgeving door IBM op de releasedag en nog niet onafhankelijk gereproduceerd. Alles over VibeVoice-ASR-Streaming-1.5B komt uit het lezen van de repository — de configuratiebestanden, de modelkaart en Microsofts streamingdocumentatie — omdat Microsoft geen nauwkeurigheids- of latentiecijfers in tekst heeft gepubliceerd en niemand buiten Microsoft de checkpoint heeft gebenchmarkt. De twee zijn niet uitgevoerd in een gedeelde testomgeving; deze vergelijking toetst beide aan hetzelfde publieke bewijsmateriaal, en dat is alles wat beide bedrijven tot nu toe hebben aangeboden.

Twee stille releases, acht dagen na elkaar

Beide modellen kwamen op dezelfde onopvallende manier uit, wat het waard is om ronduit te vermelden, omdat geen van beide bedrijven sindsdien veel heeft gezegd. IBM's Granite Speech 5.0 470M TurboCTC is het Apache-2.0-lid van een lancering met twee varianten — IBM publiceerde ook een niet-commerciële -NC-zusterversie met iets betere cijfers in de koppen — en de bijbehorende kaart vermeldt een releasedatum van 25 augustus 2026, met native Transformers-ondersteuning en een Open ASR-leaderboardinzending van dezelfde datum. Microsoft's streaming paar, VibeVoice-ASR-Streaming-7B en VibeVoice-ASR-Streaming-1.5B, werden op 2 september binnen dezelfde minuut op Hugging Face aangemaakt; de GitHub-nieuwsregel die "een unified streaming ASR-model dat continu transcribeert wie wat zegt terwijl spraak binnenkomt" aankondigt, is gedateerd op 3 september en noemt de 7B, waardoor de 1.5B hier wordt behandeld als de kleinere sibling die er stil naast werd uitgebracht.

Het interessante is dat twee teams naar het woord "streaming" grepen en tegenovergestelde dingen bouwden. Granite Speech 5.0 470M TurboCTC is een conformer-encoder die met CTC is getraind en in één niet-autoregressieve doorgang wordt gedecodeerd — er is geen decoder die tekst token voor token genereert, dus is het model structureel goedkoop en structureel snel. VibeVoice-ASR-Streaming-1.5B is een spraak-LLM: twee convolutionele tokenizers zetten 24 kHz-audio om in een spraaktokenstroom van ~7,5 Hz, een decoder uit de Qwen2-familie (28 lagen, 1.536 verborgen eenheden — de 1,5B-klasse) leest deze stroom, en een diffusie-head produceert het transcript in stukken van ongeveer 2,9 seconden, met een lookahead van ruwweg een halve seconde. De ene is een raceauto; de andere is een klein taalmodel dat toevallig luistert.

De spec-check

• Parameters — Granite Speech 5.0 470M TurboCTC: 470M, alleen-encoder versus VibeVoice-ASR-Streaming-1.5B: ~3B totaal (1.5B-klasse LM-backbone plus tokenizers en diffusiekop).

• Architectuur — conformer-encoder met blok-zelfaandacht en zelfconditionering, CTC-getraind, greedy niet-autoregressieve decodering versus dubbele akoestische/semantische tokenizers die een causale decoder van de Qwen2-familie voeden met een DDPM-diffusiekop.

• Uitvoercadans — ~12,5 uitvoerframes per seconde, chunksgewijs gestreamd, versus ~7,5 Hz spraaktokens; tekst wordt gegenereerd per chunk van ~2,9 s met ~0,5 s vooruitblik.

• Talen — alleen Engels versus tien: Chinees, Engels, Frans, Duits, Italiaans, Japans, Koreaans, Portugees, Russisch en Spaans.

• Gewichten — ongeveer 0,5B parameters / een fractie van een GB, edge-klasse versus ~5,6 GB bf16, NVIDIA-GPU-klasse.

• Nauwkeurigheid in druk — IBM rapporteert ~5,00% gemiddelde WER op de Open ASR short-form sets, tegenover geen WER-cijfer in de tekst.

• Licentie — Apache-2.0 vs MIT.

• Uitgebracht — 25 augustus 2026 versus 2 september 2026.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total / 1.5B-class LM, Architecture speech LLM + diffusion, Languages 10, Streaming ~2.9 s chunks + ~0.5 s lookahead, WER none published, License MIT. Right column Granite Speech 5.0 470M TurboCTC: Released Aug 25 2026, Params 470M, Architecture conformer CTC, Languages English only, Streaming chunkwise ~12.5 frames/s, WER ~5.00% (IBM-reported), License Apache-2.0. Footer reads 'Granite figures IBM-reported, unverified; VibeVoice specs read from the HF repo; no independent benchmark of either exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

Snelheid: de ene is gebouwd om klein te zijn, de andere om een taalmodel te zijn

De architecturale scheiding komt het eerst naar voren in snelheid en hardware. Granite Speech 5.0 470M TurboCTC is bedoeld voor laptops, smartphones en andere edge-apparaten. Omdat een pure CTC-encoder niets sampled — de output is een enkele greedy pass over een BPE-head met 16.384 eenheden — is hij extreem goedkoop om te draaien, en IBM's modelkaart vermeldt een Open ASR-throughputcijfer, gemeten op een enkele H200, dat voor de TurboCTC-lijn in de tienduizenden RTFx ligt, naast een WebGPU-demo die live in een browsertabblad transpcribeert. Die cijfers zijn door IBM gemeten en niet onafhankelijk gereproduceerd, maar het structurele punt staat op zichzelf: een encoder van 470M zonder autoregressieve decoder is een model dat je kunt draaien op hardware die standaard in een telefoon zit.

VibeVoice-ASR-Streaming-1.5B maakt de tegenovergestelde afweging. De decoder is een causaal taalmodel, wat betekent dat tekst wordt gegenereerd in een zwaardere lus dan een CTC-argmax, en de gedocumenteerde manieren om het uit te voeren zijn om het zelf te hosten op NVIDIA-GPU's — de Python-demo's van de microsoft/VibeVoice-repository of de vLLM-plugin ervan — met ~5,6 GB aan bf16-gewichten vóór enige KV-cache. Microsoft heeft geen claim over doorvoer of real-timefactor gepubliceerd, dus er is geen leverancierscijfer om tegenover dat van IBM te zetten. Wat de LLM-architectuur in plaats daarvan oplevert, is context: het model draagt begrip van spreker en inhoud over door het transcript heen zoals een taalmodel dat doet, en dat is het verschil tussen geluid transcriberen en een gesprek volgen.

Nauwkeurigheid: de ene leverancier drukte cijfers af, de andere een afbeelding

Op basis van het bewijs ligt Granite Speech 5.0 470M TurboCTC een volledige publiceerbare benchmark voor op VibeVoice-ASR-Streaming-1.5B. IBM liet het model op de releasedag door de officiële Open ASR-leaderboard-harness draaien en rapporteert een gemiddeld woordfoutpercentage van ongeveer 5,00% op de openbare Engelse short-form-sets — een cijfer dat door de leverancier is gemeten, door geen enkele derde partij is geverifieerd en volledig ontbreekt aan Microsofts kant van deze vergelijking. De modelkaart van VibeVoice-ASR-Streaming-1.5B bevat een afbeelding met evaluatieresultaten, maar geen numerieke WER, RTF of latentie in tekst; het enige numerieke anker in de VibeVoice-familie is de door de leverancier gerapporteerde 7,77% gemiddelde WER van de batch-VibeVoice-ASR-kaart over acht Engelse testsets, die het niet-streamingmodel beschrijft en niet overdraagbaar is. Hoe de uiteindelijke onafhankelijke runs ook uitvallen, de eerlijke samenvatting is vandaag: IBM publiceerde een getal en Microsoft publiceerde een afbeelding.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Talen en uitvoer: alleen Engels versus wie-zegt-wat in tien

Granite Speech 5.0 470M TurboCTC is uitsluitend Engelstalig en levert ruwe getranscribeerde tekst op. Dat is geen tekortkoming voor de workloads waar IBM op mikt — Engelstalige bedrijfstranscriptie op edge-hardware — maar daarmee eindigt de vergelijking zodra je audio niet Engelstalig is. VibeVoice-ASR-Streaming-1.5B vermeldt tien talen en claimt streaminguitvoer met sprekerstoewijzing: de modelkaart stelt dat het "continu transcribeert wie wat zei terwijl spraak binnenkomt", met hotwords voor domeintermen die als contextprompt worden meegegeven. Beide extra's verdienen een sceptische lezing — streamingdiarisatie over chunkgrenzen heen is werkelijk moeilijk en de bewering is ongeverifieerd — maar ze zijn de reden dat een team met live meertalige vergaderingen het model van Microsoft überhaupt zou bekijken.

Licenties en ecosysteem: Apache-2.0 versus MIT, Transformers versus een onderzoeksrepo

Beide licenties staan commercieel gebruik toe, wat dit paar al onderscheidt van IBM's eigen -NC-variant van dezelfde architectuur. Granite Speech 5.0 470M TurboCTC is Apache-2.0 met de gebruikelijke patentverlening, en het is native in Hugging Face Transformers (AutoModelForCTC van transformers >= 5.16) plus mlx-audio voor Apple Silicon — wat betekent dat het draait overal waar de grootste deploymentcommunity in het ecosysteem draait, op hardware van elke leverancier. VibeVoice-ASR-Streaming-1.5B is MIT, wat nog eenvoudiger is, maar het servingpad is een onderzoeksopstelling vanuit de bron: de architectuurklasse van de checkpoint, VibeVoiceForASRStreamingTraining, staat niet in de openbare Transformers-documentatie, en Microsofts eigen streamingdocumentatie verwijst naar de democode van de repo en een vLLM-plugin in plaats van een standaard bibliotheeklading. Voor een productieteam is het verschil reëel: het ene model past vandaag moeiteloos in een bestaande Transformers-pijplijn, en het andere vraagt je om een onderzoeksrepo op te zetten en het laadpad zelf te verifiëren.

A screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the model title Granite-Speech-5.0-470M-TurboCTC, the Apache-2.0 license tag, the English-language tag, the automatic-speech-recognition pipeline tag, and the model summary describing a compact 470 million parameter English ASR model for edge deployment.

Welke stille release moet je evalueren?

Evalueer Granite Speech 5.0 470M TurboCTC eerst als je workload in het Engels is, je hardware edge-class is of CPU-gebonden, en je een model wilt dat zo in Transformers past, met een getal op de kaart om een sanity-check tegen te doen. Het is in elke dimensie de keuze met het laagste risico, behalve één: het helpt je niet bij een tweede taal of een live transcript van een vergadering dat moet weten wie er aan het woord is.

Beoordeel VibeVoice-ASR-Streaming-1.5B als je meertalige streaming nodig hebt, als je de wie-zegt-wat-output of hotwords wilt testen, of als je liever inzet op een taalmodelbenadering van spraak dan op een pure encoder. Houd rekening met een NVIDIA GPU, een installatie vanuit de broncode, ~5,6 GB aan gewichten, en een evaluatie die je zelf ontwerpt, want niemand — Microsoft niet uitgezonderd — heeft nog een getal gepubliceerd waar je op kunt vertrouwen.

Wat geen van beide stille releases verandert, is de waarde van het verwisselbaar houden van de ASR-laag terwijl je ontdekt welke gok loont. Beide modellen zijn jong en geen van beide wordt op dit moment via OrcaRouter aangeboden. Wanneer een provider een van beide host, kun je het zonder veel risico uitproberen via een routeringslaag die toegang biedt tot 200+ modellen tegen de prijslijst van de provider — 0% opslag, dus prijswijzigingen worden dezelfde dag doorgevoerd — met automatische failover naar wat je al vertrouwt. Stuur een deel van de echte audio door naar het nieuwe model, lees de transcripties en laat je eigen verkeer — niet de benchmarkresultaten van de releasedag — beslissen welke stille gok de juiste was.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube