
Grok Voice Transcribe 2.0 vs Muse Voice Transcribe: Een 17-daagse heerschappij en een kwart seconde
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Op 1 september 2026 zei Meta dat Muse Voice Transcribe de eerste plaats had ingenomen in de streaming-spraakherkenningsevaluatie van Artificial Analysis met een uiteindelijk woordfoutpercentage van 3,1%, en die claim bleef zeventien dagen onbetwist. Op 18 september bracht SpaceXAI Grok Voice Transcribe 2.0 uit met 2,7% op dezelfde ranglijst en nam de koppositie over. Twee modellen, één ranglijst, zeventien dagen na elkaar — en de interessantere vergelijking is niet het verschil van 0,4 punt in nauwkeurigheid, want Meta's model is nog steeds ongeveer drie keer sneller om een zin af te ronden: 0,16 seconden na het einde van de spraak tegenover 0,49 seconden voor Grok Voice Transcribe 2.0. Muse Voice Transcribe is een realtime-audioperceptiemodel dat door Meta Superintelligence Labs is gebouwd om in Meta's eigen producten te draaien, waar een kwart seconde het verschil is tussen een assistent die aanwezig aanvoelt en een die traag aanvoelt. Grok Voice Transcribe 2.0 is een transcriptie-API die bedoeld is om door iedereen te worden aangeroepen, tegen een prijs die batchwerk haalbaar maakt. Beide cijfers zijn op de dag van de lancering door de leverancier gerapporteerd, en slechts één van de twee is sindsdien onafhankelijk op een openbare ranglijst geplaatst.
Wat het leaderboard nu eigenlijk zegt
Het AA-WER Streaming board is een gewogen composiet — AA-AgentTalk voor 50%, VoxPopuli voor 25%, Earnings22 voor 25%, ongeveer acht uur grotendeels agentachtige Engelstalige audio — en beide modellen worden erop gemeten, wat dit de zeldzame directe vergelijking maakt waarin de cijfers ten minste onderling vergelijkbaar zijn. Naast elkaar, inclusief door leveranciers gerapporteerde cijfers:
• Eindnauwkeurigheid van transcriptie — Grok Voice Transcribe 2.0 met 2,7% WER vs Muse Voice Transcribe met 3,1%
• Nauwkeurigheid eerste gedeeltelijke transcript — 3,4% vs 3,6%
• Tijd tot eerste deelresultaat — 0,49 seconden vs 0,13 seconden
• Tijd na het einde van de spraak tot het eindtranscript — 0,49 seconden versus 0,16 seconden
• Foutpercentage bij sprekerdiarisatie — opgenomen, geen cijfer gepubliceerd tegenover een gemiddelde van 17,5% in de evaluatie van Meta
Lees de nauwkeurigheidsrijen en de latentierijen apart, want ze wijzen in tegengestelde richtingen en beide zijn waar. Qua nauwkeurigheid liggen de twee modellen binnen vier tienden van een punt van elkaar voor definitieve transcripties en twee tienden voor eerste partiële resultaten — een verschil dat klein genoeg is om bij de volgende release van een van beide bedrijven om te slaan, en klein genoeg dat niemand met gezond verstand daarop tussen hen zou moeten kiezen. Qua latentie liggen ze niet dicht bij elkaar. Het model van Meta geeft een partiële uitkomst terug in ongeveer een achtste seconde en finaliseert in ongeveer een zesde seconde, tegenover ongeveer een halve seconde in beide gevallen voor dat van SpaceXAI.
Dat is de hele vergelijking in één zin: Grok Voice Transcribe 2.0 besteedde latentie om nauwkeurigheid te kopen, en Muse Voice Transcribe deed het tegenovergestelde. SpaceXAI verlaagde zijn foutpercentage voor de eerste partiële resultaten van 18,3% in versie 1.0 naar 3,4% in 2.0, en de prijs daarvoor was dat het op dezelfde maatstaf van 0,25 seconden naar 0,49 seconden ging. Het model van Meta was de andere kant op ontworpen, met audioblokjes van 80 milliseconden en een adaptieve vertraging, geleerd met reinforcement learning, die bepaalt hoe lang er moet worden gewacht voordat er tekst wordt vastgelegd — een mechanisme waarvan het hele doel is om de nauwkeurigheid vast te houden terwijl het vastleggen snel blijft. Geen van beide keuzes is een fout. Het zijn antwoorden op verschillende vragen.
Welke vraag stel je?
Als het transcript een spraakagent voedt die binnen een gesprekspauze moet reageren, dan zijn 0,16 seconden en 0,49 seconden verschillende producten. Menselijke beurtwisseling verdraagt een gat van een paar honderd milliseconden voordat de interactie onnatuurlijk begint aan te voelen, en het latentiebudget wordt gedeeld: transcriptie, dan redeneren, dan spraaksynthese. Een model dat een definitief transcript in een zesde van een seconde teruggeeft, laat ruimte voor de rest van de pijplijn; een model dat een halve seconde nodig heeft, verbruikt het grootste deel van het budget voordat het model ook maar ergens over heeft nagedacht. Dat is waar Meta het voor heeft gebouwd, en dat is waarom het model binnen Meta AI op de Mac en binnen Muse Code draait in plaats van in de eerste plaats te worden aangeboden als eindpunt voor de pijplijnen van anderen.
Als het transcript een document is — een gespreksopname, een vergadering, een videobibliotheek, een compliance-archief — dan stelt een halve seconde niets voor, stelt het nauwkeurigheidsverschil nog steeds niets voor, en is het enige getal dat ertoe doet wat een uur audio kost. En dat is precies waar deze twee scherp uiteenlopen, en in een richting die mensen verrast die alleen naar het streamingtarief kijken.
De helft van de prijs bij batch, een tiende meer bij streaming
Meta vermeldt Muse Voice Transcribe voor $0,18 per uur audio, of $3,00 per 1.000 minuten. Grok Voice Transcribe 2.0 staat vermeld voor $0,10 per uur voor batch en $0,20 per uur voor streaming. Dus:
• Streaming — Grok Voice Transcribe 2.0 voor $0,20 per uur versus Muse Voice Transcribe voor $0,18, dus Meta is ongeveer 10% goedkoper
• Batch of opgenomen — $0,10 per uur vs $0,18, dus SpaceXAI is 44% goedkoper
• Inbegrepen in de lijstprijs — diarisatie, woordtijdstempels met betrouwbaarheidsscores, beïnvloeding van sleuteltermen en inverse tekstnormalisatie aan de kant van SpaceXAI versus streamingtranscriptie, diarisatie en eindpuntdetectie als één model aan de kant van Meta
• Gratis abonnement of zelf hosten — geen van beide, op beide punten
Een team dat alleen maar streamt, zou tussen beide qua prijs onverschillig moeten zijn en op latentie moeten kiezen, wat neerkomt op Meta. Een team met een noemenswaardig volume aan opgenomen audio zou naar de batch-rij moeten kijken, want $0,08 per uur tikt aan: 5.000 uur per maand is $500 bij de een en $900 bij de ander, en het nauwkeurigheidsverschil tussen beide is kleiner dan de afronding op elk van beide getallen.
De licentiepositie is identiek op de manier die ertoe doet en verschillend op de manier die er niet toe doet. Beide zijn closed weights: Muse Voice Transcribe is propriëtair en alleen beschikbaar via Meta's gehoste API, en Grok Voice Transcribe 2.0 is een commerciële API zonder download. Geen van beide is een optie als je eis is dat audio nooit de infrastructuur die je beheert verlaat, en beide stellen je bloot aan een leverancier die de prijs, de modelversie of het deprecatieschema onder je vandaan verandert. Dat is een reële overweging en geen hypothetische: Grok Voice Transcribe 1.0 bevindt zich al op een deprecatiepad, minder dan twee weken nadat zijn opvolger werd uitgebracht.

Diarisatie, de functie die geen van beide vooropstelt.
Beide modellen doen sprekerattributie in één enkele doorgang, wat twee jaar geleden een apart systeem was dat er achteraf aan vastgeplakt werd, en de vergelijking hier is ongewoon concreet omdat Meta een getal publiceerde en SpaceXAI niet.
Meta rapporteert een gemiddeld diarisatiefoutpercentage van 17,5% over zijn evaluatie, verwerkt 20 of meer sprekers zonder nabewerking, en doet dat als onderdeel van het streamingmodel in plaats van als een downstream-stap — het "wie zei wat" komt samen met de tekst binnen in plaats van erna. Dat is echt moeilijk in een streamingcontext, waar een sprekersbeurt pas te identificeren is als je er genoeg van hebt gehoord, en 17,5% is een echt getal met een echte kanttekening: het is Meta's eigen cijfer, gemiddeld over een evaluatieset die Meta zelf heeft gekozen.
Het model van SpaceXAI bevat diarisatie zonder extra kosten en ondersteunt ook maximaal acht onafhankelijke audiokanalen in één verzoek. Dat is een andere manier om hetzelfde probleem op te lossen: als je audio binnenkomt als afzonderlijke kanalen per deelnemer, wat bij telefonie in contactcenters vaak het geval is, is kanaalscheiding betrouwbaarder dan diarisatie en kent deze helemaal geen foutpercentage. Als je audio als één gemengde stream binnenkomt, ben je afhankelijk van de kwaliteit van de diarisatie, en slechts één van deze twee leveranciers heeft je verteld wat die kwaliteit is.
Er is een verschil van de tweede orde dat het vermelden waard is: Muse Voice Transcribe behandelt diarisatie, transcriptie en eindpuntdetectie als één model dat één uitvoer produceert, wat betekent dat de componenten niet onafhankelijk kunnen falen. Grok Voice Transcribe 2.0 laat je kanalen, sleuteltermen en diarisatie als afzonderlijke hefbomen gebruiken. Een enkel model is eenvoudiger te draaien en moeilijker te debuggen.

Talen, en waar de twee modelkaarten niet meer vergelijkbaar zijn
Meta trainde Muse Voice Transcribe op meer dan 70 talen en verifieerde 25 daarvan uitgebreid bij de lancering, met native code-switching binnen en tussen zinnen en ondersteuning voor audio van langer dan een uur. Grok Voice Transcribe 2.0 ondersteunt automatische taaldetectie met wisseling midden in een opname en past inverse tekstnormalisatie toe — gesproken datums, valuta, telefoonnummers en e-mailadressen weergegeven in geschreven vorm — in 25 talen.
De overlap is de 25 uitgebreid geverifieerde talen aan de ene kant en de 25 normalisatietalen aan de andere kant, en de twee sets zijn niet dezelfde 25 en geen van beide leveranciers heeft de lijst gepubliceerd. "70+ talen getraind" en "25 talen met opmaakondersteuning" zijn geen vergelijkbare claims en mogen niet van elkaar worden afgetrokken. Wat wel gezegd kan worden, is dat Meta een bredere meertalige claim maakt en SpaceXAI een smallere maar meer operationele: het detecteren van de taal is een basisvereiste, en het formatteren van wat het model heeft gehoord tot iets dat een downstreamsysteem kan parseren, is het onderdeel dat integraties breekt wanneer het ontbreekt.
De keuze, en de reden waarom die misschien niet aan jou is om te maken
Haal de marketing weg en de beslissing komt neer op drie zinnen. Kies Muse Voice Transcribe als het transcript live binnen een gesprek wordt gebruikt, want 0,16 seconde is geen detail. Kies Grok Voice Transcribe 2.0 als je grote hoeveelheden opgenomen audio hebt, want de helft van de batchprijs is ook geen detail. Als je geen van beide uitersten nodig hebt, kies dan op basis van wat je verder beperkt — regio, contract, bestaande integratie — want het verschil in nauwkeurigheid zal de beslissing niet beslechten.
De complicatie is dat een van deze twee modellen niet echt in de gebruikelijke zin te koop is. Muse Voice Transcribe bestaat om Meta's eigen assistent snel te laten aanvoelen, en het is beschikbaar via de Meta Model API, grotendeels omdat Meta heeft besloten dat de ecosysteemwaarde van zichtbaarheid groter is dan de waarde van exclusiviteit. Dat kan veranderen, en het kan snel veranderen: Meta besteedde diezelfde week aan het openstellen van Muse's connectorplatform voor externe ontwikkelaars, wat een bedrijf is dat investeert in zijn eigen distributiekanaal in plaats van een neutrale leverancier te zijn voor dat van alle anderen. Een productieafhankelijkheid opbouwen van het interne model van een concurrent is een gok dat de voorwaarden niet zullen veranderen, en die gok heeft een slechte historische staat van dienst.
Die asymmetrie is het argument om geen van beide hard te coderen. OrcaRouter biedt 200+ modellen achter één OpenAI-compatibele sleutel, met automatische failover tussen providers en 0% markup op de lijstprijs van de provider — dus wanneer SpaceXAI de standaard naar 2.0 verzet en 1.0 deprecieert, of wanneer Meta zijn spraak-API herpositioneert, is de wijziging een modelstring in plaats van een migratieproject. Voor een categorie waarin de leider in drie weken tijd twee keer is gewisseld, is de routeringslaag het deel van de stack dat stabiel hoort te zijn, en het model het deel dat dat niet hoort te zijn.

Eén ding om de komende maand in de gaten te houden: of Artificial Analysis Muse Voice Transcribe opnieuw meet op het streamingboard nu Grok Voice Transcribe 2.0 het heeft verdrongen. Meta's 3,1% en SpaceXAI's 2,7% werden beide bij de lancering gerapporteerd, maar alleen die van SpaceXAI is onafhankelijk geplaatst. Als Meta's cijfer standhoudt wanneer iemand het opnieuw uitvoert, is het nauwkeurigheidsverschil zo klein als het lijkt en bepaalt het latencyverschil alles. Als dat niet zo is, was de zeventiendaagse heerschappij het hele verhaal.
