Artikel-herokaart met de tekst 'Daily AI Brief — 19 september', met de badge 'NEWS' en de ondertitel 'Grok Voice Transcribe 2.0 uitgebracht, en Meta opent Muse', met chips die luiden: $0,10 per batchuur, 2,7% streaming WER, 3,4% eerste partial en Muse-connectors live, over een wit-naar-blauw verloop met het OrcaRouter-logo rechtsonder.
Engineering & Research

Dagelijkse AI-brief, 19 september: Grok Voice Transcribe 2.0 gaat live en Meta stelt Muse open voor ontwikkelaars

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Grok Voice Transcribe 2.0 is sinds 18 september 2026 live in de Grok Voice API, voor $0,10 per audio-uur voor transcriptie van opnames en $0,20 per uur voor streaming — dezelfde tarieven die SpaceXAI voor versie 1.0 rekende. In dezelfde week opende Meta het Muse-connectorplatform voor externe ontwikkelaars, waardoor elke dienst zijn bestaande API beschikbaar kan stellen en Meta's Muse-agent deze namens een gebruiker kan laten aanroepen. Dat lijken ongerelateerde koppen van twee verschillende bedrijven over twee verschillende producten, en dat zouden ze het grootste deel van de afgelopen twee jaar ook zijn geweest. Samen gelezen zijn het hetzelfde verhaal: transcriptie verandert in een input, en de strijd is verschoven naar wie de aanroep bezit die deze consumeert.

Begin met de prijzen, want dat is het onderdeel waar een lezer vandaag iets mee kan doen. Dan de nauwkeurigheid, die reëel is maar beperkter dan de framing rond de lancering suggereert. Dan het Meta-stuk, het onderdeel dat over zes maanden belangrijk zal zijn.

Een vast tarief, en wat dat betekent als je al voor transcriptie betaalt

Grok Voice Transcribe 2.0 kost hetzelfde als 1.0. Niet 'vanaf' hetzelfde tarief, geen promotietarief dat verloopt — identiek, tegen $0,10 per uur audio voor batchverwerking en $0,20 per uur voor streaming, wat neerkomt op $1,67 en $3,33 per 1.000 minuten. Sprekerdiarisatie, tijdstempels op woordniveau met betrouwbaarheidsscores, inverse tekstnormalisatie, verwijdering van vulwoorden en biasing van sleuteltermen zijn allemaal in die prijs inbegrepen in plaats van als add-ons te worden verkocht, wat niet de norm is voor de categorie.

Het praktische effect is eerder rekenkundig dan dramatisch. Een team dat maandelijks 5.000 uur contactcenter-audio transcribeert, betaalt voor de batchroute hoe dan ook $500, en het nieuwe model levert hetzelfde volume met een wezenlijk lager foutenpercentage. Niets aan de migratie verandert wat je betaalt, en dat is precies waarom de migratie gemakkelijk te rechtvaardigen is: er valt geen kostebeslissing te nemen, alleen een kwaliteitsbeslissing, en de kwaliteit is gestegen.

Bestaande integraties stappen over door grok-voice-transcribe-2.0 als de modelparameter mee te geven aan /v1/stt, of door die te selecteren wanneer de WebSocket-sessie voor streaming wordt geopend. Geen schemawijziging, geen nieuw endpoint, geen hercodering van je audiopijplijn. SpaceXAI heeft 1.0 voorlopig als standaard laten staan, dus een integratie die de modelparameter nooit aanraakt, blijft de oude versie krijgen totdat het bedrijf de standaard omzet — wat volgens het bedrijf de komende weken zal gebeuren, samen met de afschaffing van 1.0. Dat venster is het waard om bewust te benutten: richt een schaduwkopie van je productieaudio op 2.0 en vergelijk de transcripties met wat je vandaag uitlevert, want zodra de standaard omklapt, draai je het of je het nu hebt getest of niet.

De rest van het specificatieblad is qua opzet ongewijzigd en de moeite waard om te weten als je een deployment dimensioneert in plaats van alleen nauwkeurigheid te evalueren: 12 invoeraudioformaten van 8 kHz telefoonaudio tot 48 kHz, tot acht onafhankelijke audiokanalen in één verzoek, 100 sleuteltermen per verzoek voor domeinwoordenschat, automatische taalherkenning met wisselen tijdens de opname, en inverse tekstnormalisatie in 25 talen zodat gesproken datums, valuta, telefoonnummers en e-mailadressen terugkomen zoals een mens ze zou schrijven. Servicelimieten zijn 10 verzoeken per seconde en 100 gelijktijdige streaming-sessies per team, en de service draait in één regio — us-east-1 — de enige regel op het blad die een productieteam aan het denken zou moeten zetten, want een spraak-API in één regio is een storing in één regio.

Waar de nauwkeurigheid daadwerkelijk verschoof

De claim bij de lancering is 'twee keer zo nauwkeurig', en de onderliggende cijfers zijn specifieker en minder uniform dan die formulering. Op het AA-WER Streaming-board van Artificial Analysis, de onafhankelijke meting hier, lopen de twee versies als volgt uiteen:

• Nauwkeurigheid van het eindtranscript — Grok Voice Transcribe 2.0 met een woordfoutpercentage van 2,7% tegenover Grok Voice Transcribe 1.0 met 3,9%, beide gemeten nadat de spreker stopt

• Nauwkeurigheid van het eerste gedeeltelijke transcript — 3,4% WER tegenover 18,3%, wat met een ruime marge het grootste individuele verschil tussen de twee versies is

• Tijd tot definitief transcript — 0,49 seconden tegen 0,37 seconden, dus 2.0 is op deze maatstaf langzamer in plaats van sneller

• Tijd tot eerste partial — 0,49 seconden tegen 0,25 seconden, dezelfde trade in de andere richting

Dat laatste paar is het meest interessante ding op het blad. Grok Voice Transcribe 2.0 betaalde voor zijn nauwkeurigheid met ongeveer een kwart seconde latentie, in beide richtingen. Voor een voice-agent is dat een echte kostenpost — het is het verschil tussen een natuurlijke pauze en een pauze die een beller opmerkt — en voor een batchpijplijn is het onzichtbaar. De verbetering van de eerste partial is degene die verandert wat je kunt bouwen, want een gedeeltelijk transcript is de tekst waarover een agent kan redeneren terwijl de beller nog praat. Van 18,3% naar 3,4% gaan op dat getal is het verschil tussen een partial die een ruwe hint is en een partial die bruikbaar is. Het uiteindelijke transcript dat van 3,9% naar 2,7% gaat, is een goede verbetering die geen enkele gebruiker zal opmerken.

Screenshot of the SpaceXAI Speech to Text API documentation page showing the 'Speech to Text' heading, the line 'Transcribe audio files into text with a single API call, or stream audio in real time over WebSocket', and a Python quick-start code block that posts an audio file to https://api.x.ai/v1/stt with the model parameter set to grok-voice-transcribe-2.0 alongside a keyterm parameter.

SpaceXAI heeft ook vier interne evaluaties gepubliceerd, en ze zijn het lezen waard met de kanttekening erbij — dit zijn de eigen cijfers van het bedrijf over zijn eigen audio, niet onafhankelijk gereproduceerd:

• 8 kHz klantenservicegesprekken — 10,6% WER in 1.0, gedaald naar 7,1% in 2.0

• Gesprekken met Grok — gedaald van 8,7% naar 3,3%

• Mondelinge inloggegevens, oftewel namen, e-mails en accountgegevens die hardop worden voorgelezen — 7,2% gedaald naar 3,2%

• Korte zinnen in 19 talen — van 20,6% naar 6,8%

Het is de 8 kHz-rij die je moet onthouden. Telefoonaudio is de moeilijkste gangbare input in deze categorie en degene die de meeste contactcenter-inkopers daadwerkelijk hebben, en een daling van 10,6% naar 7,1% daarin is voor die kopers belangrijker dan het opvallende cijfer op het scorebord.

De bewering over het klassement, eerlijk gelezen

SpaceXAI zegt dat het model op nauwkeurigheid als eerste eindigt van de 32 streamingmodellen. De ranglijst van Artificial Analysis plaatst het wel eerste op zowel de final-transcript- als de first-partial-ranglijsten — maar de ranglijstpagina toont 27 van de 33 modellen, dus de "32" is het eigen aantal van het bedrijf, en de rangschikking gaat over een verzameling waarvan de lezer de vorm zou moeten begrijpen. AA-WER Streaming is een gewogen composiet van drie Engelstalige sets: AA-AgentTalk tegen 50%, VoxPopuli tegen 25% en Earnings22 tegen 25%, ongeveer acht uur audio in totaal, en het is sterk gewogen naar agent-achtige conversationele spraak. Het meet geen accenten, telefoniecodecs, domeinwoordenschat of multikanaals callcenter-audio op een gestructureerde manier.

Niets daarvan maakt het getal onjuist. Het maakt het specifiek. Een model dat bovenaan een op agent-talk gewogen Engelse ranglijst staat, is de juiste keuze voor Engelse audio in de vorm van agent-talk, en de eerlijke reden om te geloven dat het 8 kHz-resultaat uit de interne evaluatie van de leverancier komt en niet van de openbare ranglijst. Kopers met een ander audioprofiel zouden op hun eigen audio moeten testen in plaats van de rangschikking als een algemeen oordeel te lezen — wat waar was vóór deze lancering en waar zal zijn na de volgende.

A generated infographic titled 'Grok Voice Transcribe 2.0 — what changed from 1.0', showing two columns of four rows: final transcript 3.9% to 2.7% WER, first partial 18.3% to 3.4% WER, time to first partial 0.25s to 0.49s, and streaming price $0.20 per hour unchanged, with a footer reading 'Board figures per Artificial Analysis AA-WER Streaming; internal evaluations vendor-reported.'

Meta opent Muse-connectors voor ontwikkelaars

Het tweede verhaal van de week is dat van Meta. Muse, de persoonlijke agent die Meta op 8 september lanceerde op iOS, Android, muse.ai en WhatsApp, accepteert nu connectors van derden: een dienst stelt zijn API beschikbaar, en Muse levert de agent, de browser en de gebruikerscontext die van die API iets maken dat iemand kan aanroepen door er gewoon om te vragen. De framing die Meta eraan gaf, is een arbeidsverdeling — jij levert de API, wij leveren de intentie en de gebruiker. De eerste connectors die werden genoemd, waren Notion en de vergadernotitietool Granola, bovenop de connectors die Meta zelf al had uitgebracht.

Het loont de moeite om precies te zijn over wat dit wel en niet is. Het is geen open cross-agentprotocol. Een connector bouwen levert je distributie binnen de eigen gebruikersbasis van Muse op, en nergens anders; bouwen tegen een open protocol levert je bereik op bij elke compatibele agent, maar geen specifieke gebruikersbasis. Meta heeft ook niet de onderdelen gepubliceerd waarmee een ontwikkelaar rekening zou moeten houden — het beoordelingsproces voor connectors, het technische integratieoppervlak, hoe Muse kiest tussen twee connectors die elkaar overlappen, of hoe een ontwikkelaar meet of een connector daadwerkelijk enig gebruik heeft opgeleverd.

Wat buiten kijf staat, is de richting. Muse draait de agent van elke gebruiker in zijn eigen virtuele machine met een eigen browser en een aparte beoordelingslaag vóór uitgaande acties, en bewaart surrogaattokens in plaats van echte API-sleutels. Die architectuur heeft alleen zin als het de bedoeling is dat de agent heel veel dingen aanroept. Transcriptie-API's behoren tot de dingen die een agent aanroept, en Meta heeft zijn eigen — Muse Voice Transcribe, het realtime-model dat Meta begin september uitbracht voor $0,18 per audio-uur. Een platform dat zowel de agent als een spraakmodel bezit, heeft een voor de hand liggende reden om zijn eigen verkeer naar zijn eigen model te routeren, en ontwikkelaars die op connectors bouwen, moeten aannemen dat dit de standaard is, tenzij iets ervoor zorgt dat dit niet de standaard is.

Screenshot of the Artificial Analysis Speech to Text AI Model and Provider Leaderboard with the Streaming filter selected, showing the WER Index - Final Transcription, Latency and Price highlight cards, the 'See Non-streaming Benchmarks' toggle, and the AA-WER Streaming Index versus Time to Final Transcription chart.

Wat een team dat deze maand voice uitbrengt eigenlijk zou moeten doen

Beide verhalen wijzen dezelfde kant op. Spraaknauwkeurigheid convergeert — drie modellen binnen anderhalf punt van elkaar op dezelfde ranglijst binnen drie weken — en de overgebleven onderscheidende factoren zijn prijs, latentie, licentie en wie de routering controleert. Dat maakt de keuze waar je transcriptieaanroep naartoe gaat van grotere gevolgen dan de keuze welk model erop antwoordt, want je zult dat antwoord het komende jaar meerdere keren willen veranderen.

Dit is de laag waarin OrcaRouter zich bevindt. Eén API-sleutel dekt meer dan 200 modellen achter OpenAI-compatibele endpoints, met automatische failover tussen providers, zodat een spraakdienst in één regio die een slechte middag heeft, niet langer jouw storing is. Wij geven de listprijs van de provider door met 0% markup, wat betekent dat een prijsverlaging van een leverancier of een nieuwe modelversie dezelfde dag aan onze kant live staat in plaats van te wachten op een herprijzing. En omdat elk model achter één contract zit, is het verplaatsen van een transcriptieworkload van het ene model naar het andere een wijziging van de model-string in plaats van een tweede inkooptraject.

Drie concrete acties voor deze week. Als je op Grok Voice Transcribe 1.0 zit, schaduwtest dan nu 2.0 met je eigen audio, terwijl 1.0 nog de standaard is en jij nog steeds de schakelaar in de hand hebt. Als je streaming spraak voor een agent evalueert, meet dan de tijd tot de eerste partiële uitkomst binnen je eigen latencybudget in plaats van iemands benchmark te vertrouwen — het kwartseconde dat dit model besteedde aan nauwkeurigheid is ofwel niets ofwel fataal, afhankelijk van wat je agent met de tekst doet. En als je iets bouwt dat een persoonlijke agent ooit zou kunnen aanroepen, volg dan het Muse-connectorprogramma nauwlettend, want het distributieargument dat het maakt is sterker dan het technische detail waarmee het is uitgebracht.