Hero-titelkaart voor 'Realtime-Venus vs Grok Voice Think Fast 2.0', met ondertitel 'De ene is vanmiddag te koop. De andere is een download.', met drie kaarten met de tekst 'Grok Voice Think Fast 2.0: $0,08 per audiominuut, 0,70 s tot eerste audio', 'Realtime-Venus: Apache-2.0-gewichten, geen API, geen tariefkaart' en 'De gedeelde gok: redeneren terwijl je praat, niet ervoor', boven een voetbalk met de tekst 'Grok-cijfers volgens Artificial Analysis en xAI-documentatie; Realtime-Venus-cijfers uit het technisch rapport, niet gereproduceerd.' Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Guides & Insights

Realtime-Venus vs Grok Voice Think Fast 2.0: Slechts één van deze heeft een prijs

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zet Realtime-Venus en Grok Voice Think Fast 2.0 naast elkaar en het eerste verschil is geen benchmark, het is een inkooporder. Grok Voice Think Fast 2.0 is een gehost spraak-naar-spraakmodel dat op 29 juli 2026 te koop werd aangeboden voor $0,08 per audiominuut met een gepubliceerde tijd-tot-eerste-audio van 0,70 seconden en benchmarkscores van een derde partij. Realtime-Venus is een 9B full-duplex systeem van het Venus Team van Ant Group en Tsinghua Universiteit dat bestaat als Apache-2.0-gewichten, een technisch rapport gedateerd 12 september 2026, en niets dat je kunt bellen. Een van deze kun je voor het einde van de week op een telefoonlijn aansluiten. De andere kun je lezen. Die asymmetrie blijkt een veel nuttiger vergelijking te zijn dan een scorebord zou zijn, omdat de twee modellen bijna dezelfde architecturale gok waagden en vervolgens volledig uiteenliepen over wat ze ermee moesten doen.

Het korte antwoord

Kies Grok Voice Think Fast 2.0 als je nu een werkende voice-agent nodig hebt, in productie, met een tariefkaart die je in een budget kunt opnemen en een latentiegarantie die je kunt testen. Kies Realtime-Venus als je de stack zelf wilt bezitten — als je data je infrastructuur niet mogen verlaten, als je de front-end wilt fine-tunen, of als je de architectuur evalueert in plaats van een product te leveren. Er is geen derde geval waarin ze concurreren, want de ene heeft een API en de andere niet.

Ze zijn het eens over het moeilijke probleem.

Het interessante is hoe vergelijkbaar de diagnose is. Beide modellen bestaan vanwege dezelfde tegenstelling: gespreksbesturing moet op subsecondeniveau draaien, en redeneren kost seconden. Een model dat stopt om na te denken, voelt niet langer aanwezig.

Grok Voice Think Fast 2.0 lost dit op door te redeneren terwijl het spreekt. De Think Fast-reeks is gebouwd op het idee dat het model niet eerst moet infereren en daarna spraak moet genereren; in plaats daarvan streamt het spraak en denkt het parallel, zodat een tool-call kan afgaan voordat de agent zijn eerste zin heeft afgemaakt. xAI meldt dat versie 2.0 ongeveer 0,4 keer de redeneertokens van zijn voorganger gebruikt, wat wordt gepresenteerd als een verbetering op het gebied van kosten en latentie, niet op het gebied van kwaliteit.

Realtime-Venus lost het op door het helemaal niet in de frontend op te lossen. De dual-loop-runtime houdt een interactielus van één seconde draaiende — perceptie, beurtbeheer, spraakgeneratie — en draagt alles wat duur is over aan een aparte component genaamd Realtime-Venus-Harness via asynchrone delegatiemarkeringen die in de eigen verborgen sequentie van het model worden uitgezonden. Het voorgrondgesprek pauzeert nooit. Achtergrondresultaten worden opnieuw geïntegreerd wanneer ze binnenkomen.

Dat zijn verschillende technische antwoorden op dezelfde vraag, en ze hebben verschillende faalmodi. Redeneren tijdens het spreken legt de last bij het model om beide sporen coherent te houden. Delegeren legt de last bij de runtime om te voorkomen dat de twee lussen elkaar corrumperen — daarom is de causale taakvastlegging uit het Realtime-Venus-artikel, een geïsoleerde statusmomentopname per gedelegeerde taak, het detail dat het ontwerp draagt.

De enige metriek waarop ze beide gemeten kunnen worden.

Full-duplex benchmarks zijn de enige plek waar deze twee elkaar overlappen, en ze overlappen niet netjes.

• Interruptieafhandeling — Realtime-Venus meldt dat het reageert op 75% van de onderbrekingen van gebruikers op Full-Duplex-Bench v1.5. Grok Voice Think Fast 2.0 scoort 95,1% op Full Duplex Bench volgens Artificial Analysis, een stijging van 77,8% voor versie 1.0.

• Continuatie bij overlap — Realtime-Venus rapporteert 97% continuatie bij backchannels, 88% bij spraak gericht tot anderen, en 86% bij achtergrondspraak, en stelt dat het Gemini 3.1 Live en GPT-4o op alle drie overtreft.

• Verschillende instrumenten, verschillende auteurs — de Realtime-Venus-cijfers komen uit het eigen technische rapport, zonder externe reproductie. De Grok-cijfers komen van een derde partij die het model heeft gedraaid. Een zelfgerapporteerd getal vergelijken met een onafhankelijk gemeten getal is geen vergelijking, en het verschil hierboven is even waarschijnlijk methodologisch als reëel.

De eerlijke lezing: op basis van het beschikbare bewijs is Grok Voice Think Fast 2.0 de enige van de twee waarvan het full-duplexgedrag is gemeten door iemand die geen belang heeft bij de uitkomst.

Waar de onafhankelijke cijfers Grok Voice Think Fast 2.0 plaatsen

De zuiverste huidige meting komt van de Speech Agent Arena van Artificial Analysis, die modellen beoordeelt op basis van blinde voorkeur in live spraakgesprekken bij taken zoals het maken van een tandartsafspraak en het bestellen van afhaaleten. Per 18 september 2026 staat Grok Voice Think Fast 2.0 High op de zevende plaats van meer dan twintig inzendingen met een Elo van 1.011 op basis van 552 samples — achter Gemini 3.1 Flash Live Minimal van Google op 1.096, Gemini 3.8 Live op 1.083 en GPT-Live-1 op 1.053, en ruim boven de eigen voorganger, Grok Voice Think Fast 1.0, op 908.

De kolom naast de Elo is de interessantere. Qua taaksuccespercentage scoort Grok Voice Think Fast 2.0 94,6%, het hoogste cijfer in de hele zichtbare top twintig — boven de 93,2% van Gemini 3.8 Live, de 91,5% van GPT-Realtime-2.1 High en de 90,9% van GPT-Live-1. Zevende qua voorkeur, eerste qua taakvoltooiing, is een ongebruikelijk en vrij specifiek profiel: luisteraars houden niet van de stem, maar hij klaart de klus. Als je product dingen doet in plaats van te chatten, is dat de kolom die je uitkomst voorspelt, en het is het sterkste onafhankelijke bewijs dat een van deze twee modellen heeft.

A screenshot of the Artificial Analysis Speech Agent Arena Leaderboard captured 18 September 2026. The table reads, in rank order: Gemini 3.1 Flash Live Minimal Elo 1,096 with a 74.6% task success rate; Gemini 3.8 Live Elo 1,083 and 93.2%; Gemini 3.1 Flash Live High Elo 1,063 and 71.8%; GPT-Live-1 (Sol, low) Elo 1,053 and 90.9%; GPT-Live-1 (Astra, medium) Elo 1,048 and 87.4%; Cartesia Line Elo 1,027 and 77.5%; Grok Voice Think Fast 2.0 High Elo 1,011, 552 samples and 94.6%; GPT-Realtime-1.5 Elo 1,000 and 85.1%; and further down Grok Voice Think Fast 1.0 at Elo 908 with 80.7%.

De cijfers die xAI bij de lancering publiceerde, zijn een ander instrument en moeten apart worden gelezen: 82,9% op de spraak-naar-spraakkwaliteitsindex van Artificial Analysis, een eerste plaats op de agentische benchmark τ-Voice met 56,5%, 97,2% op Big Bench Audio en 95,1% op Full Duplex Bench. Dat waren de standen toen het model eind juli 2026 werd uitgebracht, en ranglijsten in deze categorie veranderen maandelijks — precies daarom is de arenatabel hierboven, vandaag gelezen, meer waard dan de lanceringscijfers.

A two-column comparison scoreboard titled 'Realtime-Venus vs Grok Voice Think Fast 2.0 — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Availability: Apache-2.0 weights, no API', 'Price: none published', 'Modality: audio, video and text', 'Interruption response: 75% reported', 'Continuation under overlap: 97 / 88 / 86% reported', 'Independent scores: none'. The right column, labelled Grok Voice Think Fast 2.0, reads 'Availability: hosted API since 29 July 2026', 'Price: $0.08 per audio minute', 'Modality: audio and text', 'Interruption handling: 95.1% Full Duplex Bench at launch', 'Time to first audio: 0.70 s', 'Independent scores: Elo 1,011 and 94.6% task success on the Speech Agent Arena'. The footer reads 'Realtime-Venus figures from its technical report, unreproduced; Grok figures per Artificial Analysis and xAI documentation.'

De rekening, en de delen ervan die niet op de rekening staan

Grok Voice Think Fast 2.0 kost $0,08 per minuut audio, ongeveer $4,80 per uur, plus $0,004 voor elk tekstbericht dat je invoert. Dat is een stijging van 60% ten opzichte van de $0,05 per minuut die versie 1.0 bij de lancering rekende, en xAI heeft de rollende grok-voice-latest-alias op 5 augustus 2026 automatisch naar 2.0 verplaatst, dus teams die de oude prijs wilden aanhouden, moesten vóór die datum een expliciete versie vastzetten. Het model per minuut betekent ook dat efficiëntieverbeteringen ten goede komen aan de leverancier: als het model beter wordt in het sneller afronden van gesprekken, daalt je rekening per gesprek, maar je kosten per minuut niet.

Realtime-Venus heeft geen factuur, omdat er geen service is. Wat het in plaats daarvan heeft, is een hardware-ondergrens. Twee 9B-checkpoints in BF16 zijn elk ongeveer achttien gigabyte aan gewichten, nog vóór activatiegeheugen, en de kaart beschrijft een streaminglus per seconde die continu moet draaien. Een GPU-node die dat aankan, heeft maandelijkse kosten, en die zijn vast — je betaalt ze of er nu iemand gebruik van maakt of niet. Voor een product met gelijkmatig verkeer is dat goedkoper dan $4.80 per uur. Voor een product met intermitterend verkeer is het dramatisch duurder, en het omslagpunt is de enige financiële kwestie die hier telt.

Gewichten, bediening en wat je met elk daarvan kunt wijzigen

Dit is het punt waarop de twee modellen helemaal niet meer te vergelijken zijn.

• Fine-tuning — Realtime-Venus wordt geleverd met gewichten. Je kunt ze fine-tunen, kwantiseren, air-gapped draaien en elke laag inspecteren. Grok Voice Think Fast 2.0 is een gesloten, gehost model; wat je kunt wijzigen zijn de prompt, de stemselectie en de tools die je registreert.

• Stem — Grok Voice Think Fast 2.0 wordt geleverd met vooraf ingestelde stemmen en ondersteunt het klonen van aangepaste stemmen op basis van ongeveer één minuut spraak. Realtime-Venus wordt geleverd met een referentiestem en een meegeleverde token-naar-golfvorm-decoder, en alles daarbuiten is jouw probleem.

• Bereik — Grok Voice Think Fast 2.0 ondersteunt meer dan 25 talen en levert standaard PCM16 op 24 kHz, met μ-law voor telefonie, via een WebSocket-sessie die compatibel is met OpenAI Realtime. Die compatibiliteit is een echt migratievoordeel: de meeste bestaande realtime-spraakcode vereist alleen een aanpassing van de basis-URL en de sleutel. Realtime-Venus documenteert Engels en Chinees.

• Video — Realtime-Venus-Omni verwerkt streamingvideo en afbeeldingen via een SigLIP2-encoder en doet aan continue visuele perceptie. Grok Voice Think Fast 2.0 is audio en tekst; er is geen camerapad.

• Lange context — Realtime-Venus heeft een context van 40.960 tokens en een trainingsvrij geheugen voor lange video's dat kan worden ingeschakeld voor een venster van veertig minuten. Grok Voice Think Fast 2.0 is een sessiemodel zonder vergelijkbare gepubliceerde geheugenfunctie.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Any-to-Any, Transformers, Safetensors, audio, video, speech, streaming and full-duplex tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Waar elk van breekt

De faalwijzen waar het de moeite loont om je op voor te bereiden, zijn tegengesteld. De blootstelling van Grok Voice Think Fast 2.0 is leveranciersconcentratie en niet-verifieerbare marketing: de Starlink A/B-resultaten van xAI, de vermenigvuldigingsfactoren voor transcriptienauwkeurigheid en de framing van de snelheid zijn allemaal door het bedrijf gerapporteerd zonder gepubliceerde onderliggende data, en een model met een prijs per minuut dat tussen versies met 60% verandert, heeft aangetoond dat het de prijs zal veranderen. Zet je versie vast en voer je eigen evaluaties uit op je eigen audio.

De kwetsbaarheid van Realtime-Venus is dat niemand het heeft gedraaid. De benchmarks zijn zelfgerapporteerd, het testharnas is niet gedocumenteerd in verhouding tot het belang ervan, en de latentie in een echte deployment is onbekend — het rapport beschrijft een interactiecadans van één seconde, wat een ontwerpparameter is, geen gemeten tijd-tot-eerste-audio. Een model zonder API en zonder reproductie heeft geen trackrecord, alleen een specificatie.

Er is een middenweg die het waard is om ronduit te benoemen, want dat is wat de meeste teams in de praktijk zullen doen. Als je een op delegatie gebaseerd systeem bouwt — kies je eigen front-end, geef het dure werk aan een tekstmodel — dan hoeven de front-end en het redeneergedeelte niet van dezelfde plek te komen. OrcaRouter heeft noch Realtime-Venus noch Grok Voice Think Fast 2.0 in huis; beide spraaklagen vallen buiten wat wij aanbieden, en dat zeggen we ook in plaats van iets anders te suggereren. Het gedelegeerde gedeelte is een ander verhaal. Bijna 200 tekstmodellen zitten achter één sleutel tegen de adviesprijs van de provider, zonder opslag, met automatische failover zodat een storing upstream een lopend gesprek niet laat wegvallen, een routing-DSL om meerdere modellen in één aanroep samen te brengen, en model fusion voor beslissingen die meer dan één mening verdienen. Dat is het deel van een spraakagent dat er baat bij heeft om uitwisselbaar te zijn, en het is het deel dat je kunt veranderen zonder het model aan te raken dat het gesprek gaande houdt.

Welke moet je kiezen?

Kies dit kwartaal voor Grok Voice Think Fast 2.0. Het is beschikbaar, het is onafhankelijk gebenchmarkt, het staat bovenaan de agentische evaluatie die voorspelt of je agent iets nuttigs kan doen, en 0,70 seconden tot eerste audio is een getal waar je een gebruikerservaring omheen kunt bouwen. Reken in je budget met de prijsstijging van 60% ten opzichte van 1.0 en zet je modelversie vast.

Kies Realtime-Venus alleen als de beperking eigenaarschap is. Als je implementatie geen externe API kan aanroepen, als je de conversationele front-end wilt fine-tunen, of als je de camera nodig hebt — die drie gevallen vormen het hele verhaal, en het zijn sterke gevallen wanneer ze van toepassing zijn.

Wat niet de doorslag zou moeten geven, is de benchmarktabel, omdat de twee kanten ervan door verschillende mensen onder verschillende omstandigheden zijn geproduceerd. De cijfers van Grok Voice Think Fast 2.0 zijn door iemand anders gemeten. Die van Realtime-Venus niet. Totdat dat verandert, is de vergelijking die daadwerkelijk beschikbaar is, er een tussen een product en een paper.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt