
Realtime-Venus vs Grok Voice Think Fast 2.0: Slechts één van deze heeft een prijs
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Zet Realtime-Venus en Grok Voice Think Fast 2.0 naast elkaar en het eerste verschil is geen benchmark, het is een inkooporder. Grok Voice Think Fast 2.0 is een gehost spraak-naar-spraakmodel dat op 29 juli 2026 te koop werd aangeboden voor $0,08 per audiominuut met een gepubliceerde tijd-tot-eerste-audio van 0,70 seconden en benchmarkscores van een derde partij. Realtime-Venus is een 9B full-duplex systeem van het Venus Team van Ant Group en Tsinghua Universiteit dat bestaat als Apache-2.0-gewichten, een technisch rapport gedateerd 12 september 2026, en niets dat je kunt bellen. Een van deze kun je voor het einde van de week op een telefoonlijn aansluiten. De andere kun je lezen. Die asymmetrie blijkt een veel nuttiger vergelijking te zijn dan een scorebord zou zijn, omdat de twee modellen bijna dezelfde architecturale gok waagden en vervolgens volledig uiteenliepen over wat ze ermee moesten doen.
Het korte antwoord
Kies Grok Voice Think Fast 2.0 als je nu een werkende voice-agent nodig hebt, in productie, met een tariefkaart die je in een budget kunt opnemen en een latentiegarantie die je kunt testen. Kies Realtime-Venus als je de stack zelf wilt bezitten — als je data je infrastructuur niet mogen verlaten, als je de front-end wilt fine-tunen, of als je de architectuur evalueert in plaats van een product te leveren. Er is geen derde geval waarin ze concurreren, want de ene heeft een API en de andere niet.
Ze zijn het eens over het moeilijke probleem.
Het interessante is hoe vergelijkbaar de diagnose is. Beide modellen bestaan vanwege dezelfde tegenstelling: gespreksbesturing moet op subsecondeniveau draaien, en redeneren kost seconden. Een model dat stopt om na te denken, voelt niet langer aanwezig.
Grok Voice Think Fast 2.0 lost dit op door te redeneren terwijl het spreekt. De Think Fast-reeks is gebouwd op het idee dat het model niet eerst moet infereren en daarna spraak moet genereren; in plaats daarvan streamt het spraak en denkt het parallel, zodat een tool-call kan afgaan voordat de agent zijn eerste zin heeft afgemaakt. xAI meldt dat versie 2.0 ongeveer 0,4 keer de redeneertokens van zijn voorganger gebruikt, wat wordt gepresenteerd als een verbetering op het gebied van kosten en latentie, niet op het gebied van kwaliteit.
Realtime-Venus lost het op door het helemaal niet in de frontend op te lossen. De dual-loop-runtime houdt een interactielus van één seconde draaiende — perceptie, beurtbeheer, spraakgeneratie — en draagt alles wat duur is over aan een aparte component genaamd Realtime-Venus-Harness via asynchrone delegatiemarkeringen die in de eigen verborgen sequentie van het model worden uitgezonden. Het voorgrondgesprek pauzeert nooit. Achtergrondresultaten worden opnieuw geïntegreerd wanneer ze binnenkomen.
Dat zijn verschillende technische antwoorden op dezelfde vraag, en ze hebben verschillende faalmodi. Redeneren tijdens het spreken legt de last bij het model om beide sporen coherent te houden. Delegeren legt de last bij de runtime om te voorkomen dat de twee lussen elkaar corrumperen — daarom is de causale taakvastlegging uit het Realtime-Venus-artikel, een geïsoleerde statusmomentopname per gedelegeerde taak, het detail dat het ontwerp draagt.
De enige metriek waarop ze beide gemeten kunnen worden.
Full-duplex benchmarks zijn de enige plek waar deze twee elkaar overlappen, en ze overlappen niet netjes.
• Interruptieafhandeling — Realtime-Venus meldt dat het reageert op 75% van de onderbrekingen van gebruikers op Full-Duplex-Bench v1.5. Grok Voice Think Fast 2.0 scoort 95,1% op Full Duplex Bench volgens Artificial Analysis, een stijging van 77,8% voor versie 1.0.
• Continuatie bij overlap — Realtime-Venus rapporteert 97% continuatie bij backchannels, 88% bij spraak gericht tot anderen, en 86% bij achtergrondspraak, en stelt dat het Gemini 3.1 Live en GPT-4o op alle drie overtreft.
• Verschillende instrumenten, verschillende auteurs — de Realtime-Venus-cijfers komen uit het eigen technische rapport, zonder externe reproductie. De Grok-cijfers komen van een derde partij die het model heeft gedraaid. Een zelfgerapporteerd getal vergelijken met een onafhankelijk gemeten getal is geen vergelijking, en het verschil hierboven is even waarschijnlijk methodologisch als reëel.
De eerlijke lezing: op basis van het beschikbare bewijs is Grok Voice Think Fast 2.0 de enige van de twee waarvan het full-duplexgedrag is gemeten door iemand die geen belang heeft bij de uitkomst.
Waar de onafhankelijke cijfers Grok Voice Think Fast 2.0 plaatsen
De zuiverste huidige meting komt van de Speech Agent Arena van Artificial Analysis, die modellen beoordeelt op basis van blinde voorkeur in live spraakgesprekken bij taken zoals het maken van een tandartsafspraak en het bestellen van afhaaleten. Per 18 september 2026 staat Grok Voice Think Fast 2.0 High op de zevende plaats van meer dan twintig inzendingen met een Elo van 1.011 op basis van 552 samples — achter Gemini 3.1 Flash Live Minimal van Google op 1.096, Gemini 3.8 Live op 1.083 en GPT-Live-1 op 1.053, en ruim boven de eigen voorganger, Grok Voice Think Fast 1.0, op 908.
De kolom naast de Elo is de interessantere. Qua taaksuccespercentage scoort Grok Voice Think Fast 2.0 94,6%, het hoogste cijfer in de hele zichtbare top twintig — boven de 93,2% van Gemini 3.8 Live, de 91,5% van GPT-Realtime-2.1 High en de 90,9% van GPT-Live-1. Zevende qua voorkeur, eerste qua taakvoltooiing, is een ongebruikelijk en vrij specifiek profiel: luisteraars houden niet van de stem, maar hij klaart de klus. Als je product dingen doet in plaats van te chatten, is dat de kolom die je uitkomst voorspelt, en het is het sterkste onafhankelijke bewijs dat een van deze twee modellen heeft.

De cijfers die xAI bij de lancering publiceerde, zijn een ander instrument en moeten apart worden gelezen: 82,9% op de spraak-naar-spraakkwaliteitsindex van Artificial Analysis, een eerste plaats op de agentische benchmark τ-Voice met 56,5%, 97,2% op Big Bench Audio en 95,1% op Full Duplex Bench. Dat waren de standen toen het model eind juli 2026 werd uitgebracht, en ranglijsten in deze categorie veranderen maandelijks — precies daarom is de arenatabel hierboven, vandaag gelezen, meer waard dan de lanceringscijfers.

De rekening, en de delen ervan die niet op de rekening staan
Grok Voice Think Fast 2.0 kost $0,08 per minuut audio, ongeveer $4,80 per uur, plus $0,004 voor elk tekstbericht dat je invoert. Dat is een stijging van 60% ten opzichte van de $0,05 per minuut die versie 1.0 bij de lancering rekende, en xAI heeft de rollende grok-voice-latest-alias op 5 augustus 2026 automatisch naar 2.0 verplaatst, dus teams die de oude prijs wilden aanhouden, moesten vóór die datum een expliciete versie vastzetten. Het model per minuut betekent ook dat efficiëntieverbeteringen ten goede komen aan de leverancier: als het model beter wordt in het sneller afronden van gesprekken, daalt je rekening per gesprek, maar je kosten per minuut niet.
Realtime-Venus heeft geen factuur, omdat er geen service is. Wat het in plaats daarvan heeft, is een hardware-ondergrens. Twee 9B-checkpoints in BF16 zijn elk ongeveer achttien gigabyte aan gewichten, nog vóór activatiegeheugen, en de kaart beschrijft een streaminglus per seconde die continu moet draaien. Een GPU-node die dat aankan, heeft maandelijkse kosten, en die zijn vast — je betaalt ze of er nu iemand gebruik van maakt of niet. Voor een product met gelijkmatig verkeer is dat goedkoper dan $4.80 per uur. Voor een product met intermitterend verkeer is het dramatisch duurder, en het omslagpunt is de enige financiële kwestie die hier telt.
Gewichten, bediening en wat je met elk daarvan kunt wijzigen
Dit is het punt waarop de twee modellen helemaal niet meer te vergelijken zijn.
• Fine-tuning — Realtime-Venus wordt geleverd met gewichten. Je kunt ze fine-tunen, kwantiseren, air-gapped draaien en elke laag inspecteren. Grok Voice Think Fast 2.0 is een gesloten, gehost model; wat je kunt wijzigen zijn de prompt, de stemselectie en de tools die je registreert.
• Stem — Grok Voice Think Fast 2.0 wordt geleverd met vooraf ingestelde stemmen en ondersteunt het klonen van aangepaste stemmen op basis van ongeveer één minuut spraak. Realtime-Venus wordt geleverd met een referentiestem en een meegeleverde token-naar-golfvorm-decoder, en alles daarbuiten is jouw probleem.
• Bereik — Grok Voice Think Fast 2.0 ondersteunt meer dan 25 talen en levert standaard PCM16 op 24 kHz, met μ-law voor telefonie, via een WebSocket-sessie die compatibel is met OpenAI Realtime. Die compatibiliteit is een echt migratievoordeel: de meeste bestaande realtime-spraakcode vereist alleen een aanpassing van de basis-URL en de sleutel. Realtime-Venus documenteert Engels en Chinees.
• Video — Realtime-Venus-Omni verwerkt streamingvideo en afbeeldingen via een SigLIP2-encoder en doet aan continue visuele perceptie. Grok Voice Think Fast 2.0 is audio en tekst; er is geen camerapad.
• Lange context — Realtime-Venus heeft een context van 40.960 tokens en een trainingsvrij geheugen voor lange video's dat kan worden ingeschakeld voor een venster van veertig minuten. Grok Voice Think Fast 2.0 is een sessiemodel zonder vergelijkbare gepubliceerde geheugenfunctie.

Waar elk van breekt
De faalwijzen waar het de moeite loont om je op voor te bereiden, zijn tegengesteld. De blootstelling van Grok Voice Think Fast 2.0 is leveranciersconcentratie en niet-verifieerbare marketing: de Starlink A/B-resultaten van xAI, de vermenigvuldigingsfactoren voor transcriptienauwkeurigheid en de framing van de snelheid zijn allemaal door het bedrijf gerapporteerd zonder gepubliceerde onderliggende data, en een model met een prijs per minuut dat tussen versies met 60% verandert, heeft aangetoond dat het de prijs zal veranderen. Zet je versie vast en voer je eigen evaluaties uit op je eigen audio.
De kwetsbaarheid van Realtime-Venus is dat niemand het heeft gedraaid. De benchmarks zijn zelfgerapporteerd, het testharnas is niet gedocumenteerd in verhouding tot het belang ervan, en de latentie in een echte deployment is onbekend — het rapport beschrijft een interactiecadans van één seconde, wat een ontwerpparameter is, geen gemeten tijd-tot-eerste-audio. Een model zonder API en zonder reproductie heeft geen trackrecord, alleen een specificatie.
Er is een middenweg die het waard is om ronduit te benoemen, want dat is wat de meeste teams in de praktijk zullen doen. Als je een op delegatie gebaseerd systeem bouwt — kies je eigen front-end, geef het dure werk aan een tekstmodel — dan hoeven de front-end en het redeneergedeelte niet van dezelfde plek te komen. OrcaRouter heeft noch Realtime-Venus noch Grok Voice Think Fast 2.0 in huis; beide spraaklagen vallen buiten wat wij aanbieden, en dat zeggen we ook in plaats van iets anders te suggereren. Het gedelegeerde gedeelte is een ander verhaal. Bijna 200 tekstmodellen zitten achter één sleutel tegen de adviesprijs van de provider, zonder opslag, met automatische failover zodat een storing upstream een lopend gesprek niet laat wegvallen, een routing-DSL om meerdere modellen in één aanroep samen te brengen, en model fusion voor beslissingen die meer dan één mening verdienen. Dat is het deel van een spraakagent dat er baat bij heeft om uitwisselbaar te zijn, en het is het deel dat je kunt veranderen zonder het model aan te raken dat het gesprek gaande houdt.
Welke moet je kiezen?
Kies dit kwartaal voor Grok Voice Think Fast 2.0. Het is beschikbaar, het is onafhankelijk gebenchmarkt, het staat bovenaan de agentische evaluatie die voorspelt of je agent iets nuttigs kan doen, en 0,70 seconden tot eerste audio is een getal waar je een gebruikerservaring omheen kunt bouwen. Reken in je budget met de prijsstijging van 60% ten opzichte van 1.0 en zet je modelversie vast.
Kies Realtime-Venus alleen als de beperking eigenaarschap is. Als je implementatie geen externe API kan aanroepen, als je de conversationele front-end wilt fine-tunen, of als je de camera nodig hebt — die drie gevallen vormen het hele verhaal, en het zijn sterke gevallen wanneer ze van toepassing zijn.
Wat niet de doorslag zou moeten geven, is de benchmarktabel, omdat de twee kanten ervan door verschillende mensen onder verschillende omstandigheden zijn geproduceerd. De cijfers van Grok Voice Think Fast 2.0 zijn door iemand anders gemeten. Die van Realtime-Venus niet. Totdat dat verandert, is de vergelijking die daadwerkelijk beschikbaar is, er een tussen een product en een paper.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
