
VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe: Twee streaming-uitdagers, één dag verschil
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2658Intelligentie72Coderen
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
Binnen ruwweg zesendertig uur in het begin van september 2026 brachten twee grote labs streaming spraak-naar-tekstmodellen uit die dezelfde headline-belofte doen: een live transcript dat ook vertelt wie wat zegt, terwijl de woorden worden uitgesproken. Op 1 september lanceerde Meta Superintelligence Labs Muse Voice Transcribe als een gehoste API met een prijs van $3,00 per 1.000 audiominuten, ongeveer $0,18 per uur, met streamingherkenning, sprekersdiarisatie voor 20+ sprekers en endpointing in één doorgang. Op 2 september uploadde Microsoft Research VibeVoice-ASR-Streaming-7B naar Hugging Face: MIT-gelicentieerde open gewichten, geen aankondiging, een modelkaart die streaming transcriptie met sprekerstoewijzing claimt, met hotwords en tien talen, en nergens een gehoste thuisbasis. Dezelfde pitch, tegengestelde bedrijfsmodellen, en bewijs aan beide kanten dat dunner is dan de labs je zouden willen laten merken.
Deze pagina beschrijft de huidige stand van kennis, omdat geen van beide modellen een onafhankelijk geverifieerd nauwkeurigheidscijfer heeft. De cijfers van Muse Voice Transcribe zijn Meta's claims van de lanceringsdag — door de leverancier gerapporteerd en niet onafhankelijk gereproduceerd; VibeVoice-ASR-Streaming-7B heeft in het geheel geen streaming-nauwkeurigheidscijfer in tekstvorm gepubliceerd. De onderstaande vergelijking steunt daarom op wat structureel en kenbaar is — architectuur, prijs, licentie, gedocumenteerd gedrag — en voorziet de enkele leverancierscijfers waar ze verschijnen van een label.
Twee uitdagers voor de batchpijplijn, met een dag verschil
Beide modellen zijn aanvallen op dezelfde aanname: dat spraak-naar-tekst iets is dat je draait op een afgewerkte opname. Muse Voice Transcribe is het eerste product dat Meta een "real-time audio perception model" noemt — één streamingdoorgang die zorgt voor herkenning, sprekerdiarisatie over meer dan twintig stemmen en endpointdetectie, de taak om vast te stellen wanneer een spreker daadwerkelijk is uitgepraat in plaats van slechts even te pauzeren. Het komt tegelijkertijd op drie platformen uit: de Meta Model API voor $0,18 per audio-uur, Meta AI voor Mac, waar je door de Fn-toets ingedrukt te houden in elke applicatie kunt dicteren, en Muse Code. Microsofts VibeVoice-ASR-Streaming-7B is het streaminglid van de open VibeVoice-familie, en de release ervan is veel stiller verlopen: een Hugging Face-repository die op 2 september is aangemaakt (tijdstempels tonen 15:46 UTC, voor het laatst gewijzigd drie minuten later), acht safetensors-shards onder MIT-licentie, en een nieuwslogregel gedateerd 3 september in de microsoft/VibeVoice GitHub-repository, die het "een uniform streaming-ASR-model dat continu transcribeert wie wat zei terwijl spraak binnenkomt, met ondersteuning voor aangepaste hotwords en 10 talen" noemt. Een dag na upload liet het nog steeds nul downloads zien.

De functiebotsing
• Streamingmechanisme — Muse Voice Transcribe verwerkt audio in chunks van 80 milliseconden en legt woorden vast zodra ze stabiliseren, terwijl VibeVoice-ASR-Streaming-7B chunks van ~2,9 seconden verwerkt met een vooruitblik van ~0,5 seconde, en per afgeronde chunk tekst genereert.
• Sprekerattributie — 20+ sprekers in één doorgang, door leverancier gerapporteerde gemiddelde diariseringsfout van 17,5% versus streaming wie-zegt-wat-output, geclaimd op de modelkaart, niet geverifieerd.
• Endpointing — ingebouwd: de stream bevat een grens van een afgeronde uiting versus niet gedocumenteerd als een uitgangssignaal.
• Contextcontroles — taal, trefwoord en contextbias versus aangepaste hotwords via een contextprompt (--context_info).
• Talen — getraind op 70+, 25 bij lancering uitgebreid geverifieerd, native code-switching versus een opgegeven 10 (en, zh, es, pt, de, ja, ko, fr, ru, it).
• Bewijs — claims van de leverancier op de lanceringsdag: 3,1% WER op eindresultaten bij 0,16 s na spraak, 3,6% op eerste partiële resultaten, verwijzend naar het Artificial Analysis streaming-leaderboard, terwijl er geen streaming-WER- of latentiecijfer als tekst is gepubliceerd.
• Kosten en licentie — $0,18 per audio-uur, gehost, gesloten gewichten versus $0 voor de gewichten (MIT), ongeveer 18 GB bf16, zelf gehost.

Twee zeer verschillende ideeën over 'streaming'
Het woord streaming bestrijkt een breed tempobereik, en de kloof tussen deze twee is breed genoeg om te veranderen wat je op elk kunt bouwen. Muse Voice Transcribe streamt op woordniveau. Meta's architectuur consumeert audio in brokken van 80 milliseconden en gebruikt wat het 'adaptieve vertraging' noemt — een vertragingsbeleid dat is aangeleerd via reinforcement learning, dat elk woord vastlegt zodra het model zeker is, en meer context vasthoudt voor woorden waarover het minder zeker is, in plaats van één vast latentiebudget toe te passen. De leverancier claimt definitieve transcripties 0,16 seconden nadat de spreker stopt en eerste gedeeltelijke resultaten na 0,13 seconden. Dat tempo is gebouwd voor interactieve loops: live ondertiteling, dicteren, een spraakagent die bijna onmiddellijk op een voltooide uiting moet reageren.
VibeVoice-ASR-Streaming-7B streamt op een grovere granulariteit. De preprocessorconfiguratie toont audio die binnenkomt op 24 kHz, 3.200× gecomprimeerd tot tokens met ongeveer 7,5 frames per seconde, en vervolgens verwerkt in chunks van 22 frames met een vooruitblik van 4 frames — ruwweg 2,9 seconden audio per chunk, ongeveer een halve seconde vooruitblik; cijfers afgeleid uit de configuratie, niet uit gemeten latentie. Tekst wordt uitgevoerd zodra elke chunk wordt opgelost, waarbij context van eerdere chunks behouden blijft via de KV-cache, zodat een lange sessie niet vanaf nul hoeft te herberekenen. Een transcript dat in stappen van ongeveer drie seconden groeit, is prima voor vergadernotities en gespreksanalyses; het is een ander product dan woord-voor-woord-streaming onder de seconde voor live conversatie. Geen van beide laboratoria heeft een end-to-end-latentiemeting voor de streaming-checkpoint gepubliceerd, dus behandel de cadans als het ontwerp en het gevoel in de praktijk als ongetest.
Sprekerlabels en endpointing: op de ene ingebouwd, op de andere geclaimd
Op het gebied van sprekerstoewijzing overdrijven streamingproducten het vaakst, en beide beweren dat te kunnen. De versie van Muse Voice Transcribe is concreet en structureel: diarisatie draait binnen dezelfde streamingpass als herkenning, dus een opname van een gesprek met twintig personen kan labels per spreker bevatten zonder een afzonderlijke "uploaden, wachten, sprekers terugkrijgen"-stap, en Meta meldt een gemiddeld diarisatiefoutpercentage van 17,5% — een leverancierscijfer, niet onafhankelijk gereproduceerd, maar een cijfer dat aan een echt mechanisme is gekoppeld. Het levert ook beurtgrenzen op, de stillere functionaliteit: een applicatie krijgt een helder "de beurt van deze spreker is voorbij"-signaal zonder een spraakactiviteitsdetector te hoeven bouwen, en daarom onderbreken spraakagenten die zijn gebouwd op ruwe ASR mensen zo vaak.
VibeVoice-ASR-Streaming-7B claimt op zijn modelkaart streaming wie-zegt-wat-output te leveren, in lijn met de gestructureerde Who/When/What-output van de batch-VibeVoice-ASR — maar voor het streaming-checkpoint is de claim niet geverifieerd: geen onafhankelijke test heeft hem gereproduceerd en er is geen gedocumenteerd endpointing-signaal zoals Muse dat levert. Als je workload werkelijk live-audio met meerdere sprekers is, biedt Muse op dit moment een completer mechanisme; als je wilt beoordelen of een open-weights-model hetzelfde kan doen op hardware die je zelf beheert, is de VibeVoice-claim precies iets om met je eigen vergaderopnamen te testen voordat je hem gelooft.
Het bewijs: beweringen op de lanceerdag tegenover een blanco kaart.
Het is de moeite waard om precies te zijn over wat elke kant heeft, want geen van beide heeft wat een koper daadwerkelijk wil. Muse Voice Transcribe heeft een dichte reeks leverancierscijfers — 3,1% woordfoutpercentage op definitieve transcripten, 3,6% op eerste gedeeltelijke resultaten, 0,16 seconde eindlatentie, 17,5% gemiddelde diarizationfout — allemaal door Meta op de lanceringsdag gepubliceerd en verwijzend naar de Artificial Analysis-streaming-speech-to-text-ranglijst, waar Meta de eerste plaats claimt. Dat zijn beweringen — door niemand buiten het lab gereproduceerd — maar ze zijn specifiek genoeg om te falsifiëren, wat een vorm van vooruitgang is.
VibeVoice-ASR-Streaming-7B heeft niets van dat alles. Zijn modelkaart bevat een afbeelding van de evaluatieresultaten en het technisch rapport over streaming is een pdf, maar in lopende tekst is er geen cijfer voor streaming-WER of latentie te citeren. Het enige numerieke ankerpunt in de VibeVoice-familie is de door de leverancier gerapporteerde tabel op de modelkaart van batch VibeVoice-ASR — met over acht Engelse testsets een gemiddelde WER van 7,77% en op LibriSpeech clean een WER van 2,20% — en die waarden gelden uitdrukkelijk niet voor dit checkpoint. Wanneer een claim bij de lancering een lege modelkaart tegenkomt, is de eerlijke beslissende factor alles behalve de headline-WER: prijs, licentie, streamingcadans en de functionaliteiten die elke partij daadwerkelijk documenteert.
Talen: 25 geverifieerd tegenover 10 opgegeven
Taaldekking onderscheidt de twee meer dan de nauwkeurigheidsclaims in de koppen doen. Muse Voice Transcribe is getraind op 70+ talen, maar Meta valideert er 25 bij de lancering — en de gevalideerde lijst, niet de trainingslijst, is de productiedekking, met native code-switching als onderscheidende factor: het is ontworpen om midden in een zin van taal te wisselen zonder dat daarom wordt gevraagd. VibeVoice-ASR-Streaming-7B vermeldt 10 talen op zijn modelkaart — Engels, Chinees, Spaans, Portugees, Duits, Japans, Koreaans, Frans, Russisch, Italiaans — tegenover de 50+ van de batch VibeVoice-ASR. Als uw verkeer gesprekken met code-switching omvat, heeft Muse de specifiekere propositie; als het binnen die tien talen valt, is de dekking van het Microsoft-model in ieder geval expliciet, wat meer is dan de meeste introductiematerialen bieden.
Kosten en wat u overhoudt
Het verschil in businessmodel is de duidelijkste manier om te beslissen. Muse Voice Transcribe kost $0,18 per audio-uur en onderbiedt daarmee qua catalogusprijs elke grote streaming-transcriptie-API — geen GPU, geen beheer, closed weights, en de prijs wordt door Meta bepaald. VibeVoice-ASR-Streaming-7B kost niets om te downloaden, maar het zelf hosten op een GPU uit de 24 GB-klasse vergt ongeveer 18 GB aan bf16-gewichten vóór de KV-cache, met de microsoft/VibeVoice-demoscripts of de vLLM-plugin als gedocumenteerde serveerroutes, en er is nog geen enkele inference-provider die het model host. De MIT-licentie is de blijvende troef: de gewichten zijn van jou om te houden en te finetunen op een manier die geen enkel API-abonnement biedt. Dat is ook waar het prijsbeeld interessant kan worden — zodra een provider het open checkpoint wél host, wordt die kwestie van $0,18 per uur een marktprijs in plaats van de catalogusprijs van één leverancier, en dat is precies de situatie waarin een pass-through-router zijn waarde bewijst. OrcaRouter routert vandaag geen spraak-naar-tekst en geen van deze modellen staat in zijn catalogus; wat het wél doet, is de catalogusprijzen van providers met 0% opslag doorgeven voor de 200+ taalmodellen die een live transcript verbruiken, zodat een prijsverlaging van een leverancier waar dan ook in die stack al dezelfde dag dat ze wordt aangekondigd aan de kant van de koper doorwerkt.

Veelgestelde vragen
Betekent de 3,1%-WER van Muse Voice Transcribe dat het nauwkeuriger is dan VibeVoice-ASR-Streaming-7B?
Nee, en de vergelijking is nog niet zinvol. Meta's 3,1% is een claim van de lanceringsdag voor het streamingpad, door de leverancier gerapporteerd en niet gereproduceerd. VibeVoice-ASR-Streaming-7B heeft in het geheel geen streamingnauwkeurigheidscijfer in tekst gepubliceerd. Totdat beide modellen door dezelfde openbare testopstelling op dezelfde audio zijn gedraaid, is de enige eerlijke uitspraak dat Muse een specifieke claim heeft die getest kan worden en VibeVoice er nog geen heeft.
Kan ik een van beide modellen gebruiken op audio die al is opgenomen?
Ja op beide, met verschillende vormen. Muse Voice Transcribe verwerkt opnames langer dan een uur via dezelfde streaming-API. De vLLM-plugin van VibeVoice-ASR-Streaming-7B biedt een transcriptie-endpoint voor volledige bestanden naast het WebSocket-stream-endpoint. Maar beide zijn ontworpen en geprijsd voor het live-geval — Muse door het streaming-only-bedrijfsmodel, VibeVoice door de chunk-architectuur die uitvoer produceert zodra audio binnenkomt — dus als je workload puur uit batchbestanden bestaat, zal een speciale bestandstranscriptie-API meestal goedkoper en beter meetbaar zijn dan beide.
