
Grok Voice Think Fast 2.0: xAI's snelste, duurste stemagent, uitgelegd
- qwenNIEUWQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 per 1 mln tokens · 56 tok/s
- deepseekNIEUWDeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligentie69Coderen
- qwenNIEUWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens · 201 tok/s
- orcaNIEUWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNIEUWAnthropic: Claude Opus 52026-07-2461Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2150Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1651Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1557Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0854Intelligentie72Coderen
- tencentTencent: Hy32026-07-0641Intelligentie59Coderen
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligentie42Coderen
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligentie39Coderen
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligentie72Coderen
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligentie52Coderen57Wiskunde
- z-aiZ.ai: GLM 5.22026-06-1651Intelligentie69Coderen60Wiskunde
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligentie61Coderen61Wiskunde
xAI heeft Grok Voice Think Fast 2.0 uitgebracht op 29 juli 2026 — volgens eigen zeggen het "meest capabele spraak-naar-spraak-stemmodel" en het nieuwe vlaggenschip van zijn voice-agentlijn. Het reageert sneller dan elke concurrent in de top vijf (0,70 s tot de eerste audio), staat bovenaan de agentic voice-benchmark en transcribeert nauwkeuriger dan de vorige generatie. Het is ook 60% duurder per minuut dan het model dat het vervangt, draait op een per-minuut-meter die uw rekening stilletjes verhoogt, en wordt geleverd met een versie-alias-schakelaar die over een week automatisch wordt omgezet. Deze gids legt uit wat Think Fast 2.0 eigenlijk is, wat xAI onder de motorkap heeft veranderd, hoe het benchmarkverhaal uiteenvalt in onafhankelijke scores en door leveranciers gerapporteerde beweringen, wat het werkelijk kost als u de som maakt, en hoe u het kunt aanroepen — plus de kanttekeningen die u verstandig zou doen te lezen voordat u een productie-callflow erdoorheen routeert.
Nauwkeurigheidsnotitie: de lanceringsdetails, prijzen en de belangrijkste nauwkeurigheids- en zakelijke claims zijn afkomstig van de aankondiging en documentatie van xAI (2026-07-29). De samengestelde scores van Artificial Analysis zijn onafhankelijk en door derden gemeten. Door xAI gerapporteerde claims — de Starlink A/B-resultaten, de transcriptievermenigvuldigers, de "60% minder redeneertokens" en de "bijna 5x snellere" formulering — hebben geen gepubliceerde onderliggende data; behandel ze als richtinggevende leverancierscijfers en voer je eigen evaluaties uit. Specificaties, prijzen en het alias-gedrag kunnen veranderen; verifieer voordat je bouwt.
TL;DR. Grok Voice Think Fast 2.0 is xAI's end-to-end spraak-naar-spraakmodel voor voice-agents: audio in, audio uit via een WebSocket, zonder aparte ASR→LLM→TTS-pipeline. Het is echt snel (0,70 s time-to-first-audio, het enige model uit de top vijf dat onder de seconde blijft) en echt sterk in agentisch spraakwerk: het staat eerste op de τ-Voice-agentbenchmark van Artificial Analysis (56,5%) en tweede op de algehele speech-to-speech-kwaliteitsindex (82,9%), achter Qwen Audio 3.0 Realtime Plus (84,1%). Het redeneert terwijl het praat — het mediane verbruik van reasoning-tokens zakt naar circa 40% van het oude model — en het kost $0,08 per minuut, tegenover $0,05 voorheen. Het addertje onder het gras zit in de meter: spraak wordt gefactureerd per minuut werkelijke audiotijd, dus een prijsstijging van 60% op een model dat goedkoper is om te draaien, slaat direct op je factuur neer. En op 5 augustus gaat het alias grok-voice-latest automatisch naar 2.0 routeren; teams op de oude versie moeten die vóór die tijd bewust vastpinnen.
Belangrijkste conclusies
• Native spraak-naar-spraak: één model van microfoon naar luidspreker, geen ASR→LLM→TTS-keten — daarom komt de eerste audio al binnen 0,70s binnen.
Agentische leider: #1 op Artificial Analysis's {{1}}τ-Voice agent benchmark{{/1}} (56,5%), ruim voor op GPT-Realtime-2.1 (45,7%) en Gemini 3.1 Flash (37,7%).
• Niet de algemene leider: #2 op de spraak-tot-spraak kwaliteitsindex (82.9%), achter Qwen Audio 3.0 Realtime Plus (84.1%); OpenAI wint nog steeds op conversationele dynamiek (95.7% vs 95.1%).
• 60% duurder: $0.08/min (~$4.80/uur) versus $0.05/min voor Think Fast 1.0 — ondanks dat het model naar verluidt ~60% minder redeneertokens gebruikt.
Alias-wijziging op 5 augustus: grok-voice-latest routeert automatisch naar 2.0; pin grok-voice-think-fast-1.0 vóór die tijd vast om op de goedkopere versie te blijven.
• Label elke bewering: de Artificial Analysis-scores zijn onafhankelijk; de Starlink A/B, transcriptiemultipliers en snelheidsframing zijn door xAI gerapporteerd en niet gepubliceerd.
Wat Grok Voice Think Fast 2.0 is
Grok Voice is xAI's familie van realtime spraak-naar-spraakmodellen. "Think Fast" is de snelle-responslijn, oorspronkelijk gelanceerd met de Voice Agent Builder in april 2026; Think Fast 2.0 is de tweede generatie van die lijn, uitgebracht op 29 juli 2026. Het model is end-to-end: het verwerkt ruwe audio, redeneert en produceert direct audio, in plaats van een pijplijn te draaien van een spraakherkenningsmodel dat een tekst-LLM voedt die een tekst-naar-spraakmodel voedt. Die architectuurkeuze is de kern van zijn latentievoordeel — er zijn geen seriële tussenstappen en geen tussentekst, dus het model kan een reactie beginnen terwijl het nog luistert.
xAI positioneert het expliciet voor voice AI-agents: klantenservicelijnen, telefonische verkoop, receptie, telefonie en andere toepassingen waarbij een systeem in realtime met een persoon praat en daadwerkelijk zaken moet afhandelen — een gesprek boeken, een lead kwalificeren, een record bijwerken, het web doorzoeken — in plaats van alleen maar te chatten. De nadruk op agentic mogelijkheden, niet op ruwe transcriptie of synthese, is het strijdperk waar de lancering zich op richt.
Wat is er nieuw ten opzichte van Think Fast 1.0
De upgrade van 1.0 is meer dan een numerieke sprong; xAI beschrijft drie structurele veranderingen:
• Parallelle spraakredenering. Het model redeneert over een query terwijl het spreekt, in plaats van eerst te denken en daarna te praten. In de praktijk kunnen toolcalls worden geactiveerd voordat de agent zijn eerste zin heeft afgemaakt — een groot voordeel voor latentiegevoelige voice-flows.
• Veel minder redeneertokens. xAI meldt dat het mediane gebruik van redeneertokens daalde tot ongeveer 0,4x dat van de voorganger (ruwweg 60% minder), wat mede verklaart waarom het bedrijf zegt dat het model goedkoper is om te draaien, ook al ging de prijs omhoog.
• Gespreksstijl aangeleerd via reinforcement learning. RL veranderde hoe het praat: kortere zinnen, één vraag tegelijk, geen stopwoorden — een bondigere, meer "menselijke" belstijl die past bij telefoonwerk waar uitweiden minuten kost (en, met een per-minuutteller, geld).
Wat betreft meetbare snelheid daalde de tijd tot de eerste audio van 1,25 s in 1.0 naar 0,70 s in 2.0. Wat betreft transcriptie rapporteert xAI een verbetering van ongeveer 1,4x in 24 talen (door de leverancier gerapporteerd, hieronder).

De benchmarks, benchmark voor benchmark
De lancering is gebaseerd op Artificial Analysis, een onafhankelijk benchmarkinstituut. Dat is belangrijk: in tegenstelling tot de meeste andere cijfers in de aankondiging worden deze door een neutrale partij gemeten, en zijn dit de cijfers die het waard zijn om op gelijke voet te vergelijken. Het samengestelde beeld is beter dan één enkele kop.
Spraak-naar-spraak-kwaliteitsindex: 82,9% (tweede plaats). Dit is de algehele spraak-naar-spraakscore, gestegen van 75,7% voor Think Fast 1.0. Het verslaat GPT-Realtime-2.1 (79,1%) en Gemini 3.1 Flash (69,5%) — maar het staat niet op de eerste plaats. Qwen Audio 3.0 Realtime Plus staat bovenaan met 84,1%. Dus "beste algemene spraakmodel" is een overdrijving die de data niet ondersteunen; "snelste agentische spraakmodel in de topklasse" is correct.
τ-Voice agent benchmark: 56.5% (eerste plaats).Dit is de maatstaf waar xAI het meest om geeft, en de ranglijst is echt: 56.5% verslaat Think Fast 1.0 (52.1%), GPT-Realtime-2.1 (45.7%) en Gemini 3.1 Flash (37.7%). τ-Voice meet agentische spraakprestaties — hoe goed een model taken voltooit via een spraakkanaal, inclusief toolgebruik midden in een gesprek. Op de smalle "kan het de klus klaren"-as leidt Grok. Musk promootte precies deze ranglijst.
Big Bench Audio: 97.2%. Een benchmark voor spraakredenering; sterk, hoewel Qwen een record van 99.2% behaalde.
Full Duplex Bench: 95,1%. Conversatiedynamiek — onderbrekingsafhandeling, beurtwisseling, barge-in. Het is een grote sprong ten opzichte van de 77,8% van 1.0, maar OpenAI overtreft het nog net met 95,7%, en Qwen leidt met 98,4%.
Tijd tot eerste audio: 0.70s. Het belangrijkste getal voor echte spraakproducten. Het is gedaald van 1.25s en is het enige getal onder de seconde bij de top vijf gerangschikte modellen; onafhankelijke tests bevestigen grotendeels een reactie onder de seconde. De latentie van de eerste token bij streaming TTS is ongeveer 285ms. Voor telefoon- en realtimegebruik is latentie de metriek die gebruikers bij elke beurt voelen, en dit is waar 2.0 overtuigend de beste is.
Als je de rijen afleest, is het profiel specifiek: het snelst in spreken, het best in het uitvoeren van taken, tweede overall, derde op gespreksfinesse. Dat is een uitstekend voice-agentmodel, maar een matige claim voor 'beste chatbot-stem'. Kies het voor de taken die bij de bovenste rij passen.
Transcriptienauwkeurigheid
Naast gesprekken claimt xAI aanzienlijk betere transcriptie. Interne evaluatie over 24 talen en duizenden zinnen zou ongeveer 1,4x de nauwkeurigheid van Think Fast 1.0 laten zien, en 1,5–2x de nauwkeurigheid van speciale transcriptiemodellen zoals Deepgram Nova 3 en ElevenLabs Scribe v2. In lawaaierige, realistische omstandigheden — achtergrondgeluid, telefooncompressie, lage-bandbreedte gesprekken — groeit het gerapporteerde nauwkeurigheidsverschil ten opzichte van speciale STT-modellen tot ongeveer 10x.
Dit zijn precies de beweringen die met voorzichtigheid moeten worden behandeld. Ze worden door xAI gerapporteerd; de evaluatieomgeving, de zinsverzamelingen en de ruisprofielen zijn niet gepubliceerd. Een onafhankelijke test van de transcriptie van ruizige telefoongesprekken van 2.0 tegenover Deepgram of ElevenLabs zou waardevol zijn en is, op het moment van schrijven, nog niet gepubliceerd. Wat de richting betreft is het aannemelijk dat end-to-end-modellen die tijdens de training meer telefonie verwerken, een echte verbetering opleveren — maar "10x" moet worden geverifieerd, niet als feit worden herhaald.
Prijzen: $0.08 per minuut en de 60%-vraag
Dit is waar de lancering omstreden wordt. Think Fast 2.0 kost $0,08 per minuut audio — ongeveer $4,80 per uur — plus $0,004 per tekstinvoerbericht. Think Fast 1.0 was $0,05 per minuut ($3,00/uur). Dat is een stijging van 60%, en die kwam in dezelfde maand waarin OpenAI de prijzen van GPT-5.6 Luna met 80% en Terra met 20% verlaagde, daarbij verwijzend naar dezelfde dalende serverkosten die xAI voor dit model claimt.
De meter is het hele verhaal. Tekstmodellen brengen per token in rekening, dus wanneer een model efficiënter wordt, krimpt de rekening van de klant automatisch. Spraakmodellen brengen per minuut kloktijd-audio in rekening, en de lengte van een gesprek wordt bepaald door de persoon die spreekt, niet door het model. Efficiëntiewinsten bij een product dat per minuut wordt afgerekend, komen ten goede aan de aanbieder, niet aan de koper. Daarom kost een model dat naar verluidt ~60% minder redeneertokens gebruikt — en daardoor goedkoper is voor xAI om te leveren — 60% meer om te huren.
Reken de som eens uit voor een echte belstroom. Een gesprek van 4 minuten op 1.0 kost $0,20; hetzelfde gesprek op 2.0 kost $0,32. Tienduizend van zulke gesprekken per maand is 40.000 minuten: $2.000/maand op 1.0 versus $3.200/maand op 2.0 — een verschil van $1.200/maand, of ruwweg $14.400/jaar, dat uitsluitend voortkomt uit een routeringswijziging, niet uit het belvolume. Zelfs een ruime snelheidswinst helpt nauwelijks: een volledige 10 seconden per gesprek besparen levert ongeveer $0,013 op, terwijl de prijsstijging $0,12 toevoegt — je wint ruwweg een negende van de stijging terug. Elke businesscase die 2.0 als het goedkopere model verkoopt, verwart 'sneller' met 'goedkoper'.
Ter context: 2.0 is nog steeds ruwweg 2,2x goedkoper dan GPT-Realtime-2.1 High, tegen ongeveer $10,75/uur. Het is dus in absolute termen niet duur — het is duur ten opzichte van zijn eigen voorganger en ten opzichte van de richting die elke andere modelleverancier die maand insloeg.
De migratieval van 5 augustus
Er zit een deadline aan vast. Op 5 augustus 2026 zal het alias grok-voice-latest automatisch naar Think Fast 2.0 gaan routeren. Als je via dat alias live bent op Think Fast 1.0, dan brengt "niets doen" je — en je rekening — op die datum naar de nieuwe versie. Om op 1.0 te blijven, moet je vóór 5 augustus expliciet het model-ID grok-voice-think-fast-1.0 vastzetten.
De twee verdedigbare standpunten vereisen allebei actie vóór de deadline: of bewust bij 1.0 blijven omdat je gescripte flows prima werkten tegen $3,00 per uur, of bewust overstappen naar 2.0 en opnieuw begroten tegen $4,80 per uur, {{1}}gerechtvaardigd op basis van kwaliteit in plaats van besparingen{{/1}}. Wat onverdedigbaar is, is {{2}}de wijziging ontdekken in een septemberfactuur{{/2}}. Een goede vuistregel: behandel elke alias die eindigt op "latest" als een vaste opdracht om te accepteren wat de leverancier ook als volgende versie levert — inclusief de prijs.
Hoe krijg je er toegang toe en gebruik je het
Think Fast 2.0 is beschikbaar via xAI's Speech-to-Speech API onder de model-id grok-voice-think-fast-2.0, met grok-voice-latest als het rolling alias. Het is een realtime, full-duplex model over een WebSocket: wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0, geauthenticeerd met een Authorization: Bearer header tijdens de handshake. Voor browser-apps kun je tijdelijke tokens server-side aanmaken via het realtime sessions endpoint, zodat de bovenliggende API-sleutel nooit de client bereikt.
De API is OpenAI Realtime-compatibel, dus bestaande realtime-spraakcode hoeft over het algemeen alleen de basis-URL en de sleutel te vervangen. De sessieopbouw verloopt via een session.update-gebeurtenis: kies een vooraf ingestelde stem (eve, ara, rex, sal, leo), stel het invoer- en uitvoeraudioformaat in (standaard PCM16 bij 24 kHz; μ-law voor telefonie), schakel spraakactiviteitsdetectie aan de serverzijde in en registreer tools — waaronder een ingebouwde webzoektool — zodat de agent midden in het gesprek kan handelen. De gebeurtenisstroom volgt het standaardpatroon: de client voegt audiobufferframes toe, de server streamt respons-audio-delta's, en tool-call-argumentgebeurtenissen worden geactiveerd wanneer het model besluit te handelen, waarbij resultaten worden teruggestuurd als functieaanroepuitvoer. Het model ondersteunt meer dan 25 talen en stemklonen op maat op basis van ongeveer een minuut spraak.
Let op wat het niet is: het is een spraak-naar-spraak-agentmodel, geen algemene transcriptie- of vertaalservice. Als de kerntaak van je product is om audio goedkoop naar tekst om te zetten, is een dedicated STT-model een ander hulpmiddel — en bij de per-minuut-meter betaal je voor het hele gesprek, dus alleen-transcriptie-workloads worden snel duur.

Hoe het in een voice-agent stack past
Think Fast 2.0 is een gespecialiseerd realtime spraakmodel dat via de speciale API van xAI wordt benaderd, geen algemeen LLM dat door een modelrouter wordt gehost. Het spraakkanaal loopt rechtstreeks via de WebSocket van xAI — daar zit de latentie van minder dan een seconde, en die overleeft geen tussenliggende hop.
Al het andere rondom een voiceproduct — de natuurlijke-taallogica die niet tijdkritisch is, de fallback-redenering wanneer een gesprek van het script afwijkt, de samenvatting, de analyses, de e-mailfollow-up die de agent na een gesprek activeert — is algemeen tekst- en multimodaal werk. Voor dat deel biedt een vendorneutraal endpoint zoals OrcaRouter je één OpenAI-compatibele API voor veel LLM's, zodat je niet vastzit aan één leverancier voor de delen van de stack die geen realtime voice-lane nodig hebben. De heldere scheiding: de dedicated API van xAI voor de streaming voice zelf, OrcaRouter (of vergelijkbaar) voor de tekst- en multimodale redenering eromheen.
De concurrentie: agentische snelheid versus ruwe intelligentie
Think Fast 2.0 belandt midden in de meest competitieve markt in AI op dit moment — realtime voice-agents — en de benchmarktabel maakt de afwegingen opvallend zichtbaar.
Qwen Audio 3.0 Realtime Plus is de intelligentieleider: 84,1% op de spraak-naar-spraak kwaliteitsindex (eerste), een record van 99,2% op Big Bench Audio, en 98,4% op full duplex. Maar de gemiddelde tijd tot de eerste audio is ongeveer 4,02 seconden — ruwweg 5,7x langzamer dan Grok's 0,70s. Voor in de auto, wearables en telefoongesprekken is dat verschil niet "snel versus langzaam," maar bruikbaar versus onbruikbaar. Qwen splitst zich ook op in een Plus-tier (kwaliteit) en een Flash-tier (ongeveer 300ms eerste pakket) voor verschillende scenario's, wat een doordacht antwoord is op dezelfde spanning.
GPT-Realtime-2.1 zit bij de meeste rijen in het midden (79,1% kwaliteit, 45,7% agentisch) en wint op conversatiedynamiek (95,7%). Het High-niveau kost ongeveer 2,2x het uurtarief van Grok. Voor teams die al diep in het OpenAI-ecosysteem zitten, blijft het de standaard met de minste frictie.
Gemini 3.1 Flash blijft achter op het gebied van de kwaliteits- en agentische composieten (69,5%, 37,7%), maar maakt deel uit van een bredere Gemini-spraakstack en het Google-ecosysteem dat veel teams om andere redenen verkiezen.
De praktische conclusie: kies op basis van de werkbelasting. Als je voice-agent direct moet aanvoelen en betrouwbaar tool-ondersteunde taken moet afronden (support, kwalificatie, boekingen), is Think Fast 2.0 vandaag de sterkst gemeten optie. Als je prioriteit de diepste redenering is en je meerdere seconden latentie kunt absorberen, wint Qwen Plus. Als gespreksverfijning en ecosysteem-aansluiting het belangrijkst zijn, blijft GPT-Realtime-2.1 de gevestigde speler om te verslaan.

Drie scenario's waarin het past
1. Telefonische ondersteuning en telefonie
De combinatie die er het meest toe doet: eerste audio in minder dan een seconde, sterke transcriptie van rumoerige telefoongesprekken (volgens de leverancier) en full-duplex onderbrekingsafhandeling. Een supportlijn waarbij de agent vrijwel direct begint te spreken en tussendoor accountgegevens kan opzoeken, is precies waar 2.0 op is afgestemd. Zijn kortere RL-spreekstijl met telkens één vraag past ook goed bij telefonie, waar minuten de factureerbare eenheid zijn — op welke leveranciersmeter dan ook.
2. Leadkwalificatie en follow-up na het gesprek
Bij agentic voice is 2.0 werkelijk de eerste, en leadkwalificatie is de canonieke agentic voice-taak: kwalificeer, routeer en trigger vervolgacties zolang de intentie vers is. Het kan al tools aanroepen voordat de eerste zin eindigt, dus een agent kan een CRM-record aanmaken terwijl hij nog met de prospect praat. Plan voor attributie op sessieniveau en strikte toolmachtigingen — een voice-agent kan in realtime fouten maken, en het opruimen is aan jou.
3. Voice-agentproducten in actieve ontwikkeling
Voor bouwers die hun eigen voice-agents uitbrengen — de Tradecraft- en GrokTerm-integraties die xAI noemt, hebben precies deze vorm — maken de snelheid van 2.0 en de OpenAI-compatibele API er een laagdrempelige drop-in voor GPT-Realtime-code. Pin de versie vast, voer een beperkte pilot uit met een duidelijke succesvoorwaarde (bijv. "bezoekers van de prijspagina kwalificeren en routeren"), en meet de kosten per voltooid resultaat, niet de kosten per minuut.
Beperkingen en kanttekeningen
Think Fast 2.0 is vijf dagen oud op het moment van schrijven, en dat is terug te zien in de kanttekeningen. De Starlink A/B-resultaten (hogere conversie en supportbeheersing) zijn door xAI gerapporteerd zonder gepubliceerde cijfers; de transcriptievermenigvuldigers en de formulering 'bijna 5x sneller' zijn eveneens beweringen van de leverancier, geen onafhankelijke benchmarks. Het enige artikel dat je zult tegenkomen over 'prestatieregressie en verzonnen testrapporten' verwijst naar dezelfde onverifieerbaarheid — de door xAI gepubliceerde cijfers zijn niet onafhankelijk gereproduceerd, en de op betrouwbaarheid gerichte voice-gemeenschap is terecht achterdochtig over ongepubliceerde leveranciersstatistieken. Benchmarks kunnen ook je slechtste gesprek niet meten: een reactietijd van 0,70 seconde is niets waard als de agent een lead vol vertrouwen naar het verkeerde team doorspeelt. Voice-facturering is per minuut met een reeds ingebouwde prijsverhoging, dus de kostenblootstelling is reëel. En zoals bij elk gloednieuw realtimemodel, kun je API-verloop verwachten. Verifieer de nauwkeurigheidsclaims op je eigen audio, zet versies vast in productie, en zorg voor escalatie en opname voordat je de eerste live oproep doet.
Veelgestelde vragen
Wat is Grok Voice Think Fast 2.0?
xAI's vlaggenschip spraak-naar-spraakmodel voor voice agents, uitgebracht op 29 juli 2026: native end-to-end audio-naar-audio via een WebSocket, met een time-to-first-audio van 0,70s en de eerste plaats op de τ-Voice agentic benchmark.
Hoeveel kost Grok Voice Think Fast 2.0?
$0,08 per minuut audio (ongeveer $4,80 per uur) plus $0,004 per tekstinvoerbericht — een stijging van 60% ten opzichte van de $0,05 per minuut van Think Fast 1.0.
Is Think Fast 2.0 het beste spraakmodel?
Het is de snelste en beste bij agentische taken (56,5% τ-Voice, eerste plaats) en tweede overall op de kwaliteitsindex voor spraak-naar-spraak (82,9%), achter Qwen Audio 3.0 Realtime Plus (84,1%). „Beste” hangt af van de workload.
Wat is er veranderd ten opzichte van Think Fast 1.0?
Parallelle spraakredenering (het denkt terwijl het praat), ongeveer 60% minder redeneertokens, een RL-getunede kortere gespreksstijl, een transcriptieverbetering van 1.4x (volgens de leverancier) en een tijd tot de eerste audio die is verlaagd van 1.25s naar 0.70s.
Zal mijn Think Fast 1.0-verkeersswitch automatisch overschakelen?
Ja, op 5 augustus 2026, als je het grok-voice-latest alias gebruikt. Pin grok-voice-think-fast-1.0 vóór die tijd vast om op 1.0 te blijven, of kies bewust voor 2.0 en herbereken de kosten.
Hoe roep ik Grok Voice Think Fast 2.0 aan?
Via de Speech-to-Speech API van xAI — een realtime WebSocket (wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0) die compatibel is met de OpenAI Realtime API, met vooraf ingestelde stemmen, server-VAD en tool calling.
Met welke stemmodellen concurreert het?
Qwen Audio 3.0 Realtime Plus (intelligenter, veel langzamer: eerste audio na 4,02s), GPT-Realtime-2.1 (betere gespreksdynamiek, ~2,2x duurder in de High-tier), en Gemini 3.1 Flash.
Zijn de benchmarkclaims betrouwbaar?
De scores van Artificial Analysis zijn onafhankelijk en degelijk. De Starlink A/B-resultaten, transcriptievermenigvuldigers en snelheidskaders zijn door xAI gerapporteerd zonder gepubliceerde gegevens — behandel ze als richtinggevend en verifieer ze op je eigen audio.
Is Grok Voice goed voor transcriptie?
Het transcribeert binnen een gesprek, en xAI claimt grote winsten ten opzichte van speciale STT-modellen in ruis — maar het wordt per conversatieminuten gefactureerd, dus speciale transcriptieworkloads zijn beter af met een speciaal STT-model.
Kortom
Grok Voice Think Fast 2.0 is het sterkste agentische spraakmodel dat tot nu toe is gemeten, en met afstand de snelste in de topklasse — 0,70 seconden tot de eerste audio is een echte, onafhankelijke, voor de gebruiker zichtbare overwinning, en de eerste plaats op τ-Voice is een echte rangschikking. De eerlijke samenvatting is specifiek: het is het beste hulpmiddel in zijn klasse voor realtime, door tools ondersteunde spraakagenten, niet het beste spraakmodel op elke rij — Qwen leidt op intelligentie en OpenAI op conversationele finesse. De controverses gaan niet over de snelheid. Ze gaan over de meetlat: een prijsverhoging van 60% voor een model waarvan xAI zegt dat het goedkoper is om te serveren, een automatische aliasmigratie met een harde deadline, en kopclaims die steunen op ongepubliceerde leverancierscijfers. Gebruik het voor de agentische snelheid, pin je versie, label de leveranciersclaims en verifieer de nauwkeurigheid op je eigen aanroepen — en houd de algemene tekst en redenering rond je spraakproduct op een leveranciersneutraal eindpunt zoals OrcaRouter.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
