Een hero-titelkaart met de tekst 'GPT-Live-1 vs Grok Voice Think Fast 2.0', met de ondertitel 'Twee spraak-API's die in tegengestelde prijsrichtingen bewegen' en de regel '$0.05 per minuut vs $0.08 per minuut', boven twee panelen: links een prijskaartje met een neerwaartse pijl met het label '$0.05', rechts een prijskaartje met een opwaartse pijl met het label '$0.08' en het bijschrift '+60%', elk met een full-duplex audiogolfvormstrook, en het OrcaRouter-logo dat in de hoek is gecompositeerd.
Guides & Insights

GPT-Live-1 vs Grok Voice Think Fast 2.0: Twee spraak-API's die in tegengestelde prijsrichtingen bewegen

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het nuttigste feit over deze matchup is een richting, niet een getal. Toen xAI in eind juli 2026 Grok Voice Think Fast 2.0 uitbracht, verhoogde xAI het audiotarief per minuut met 60%, van de $0,05 die Think Fast 1.0 rekende naar $0,08. Zes weken later, op 10 september 2026, zette OpenAI GPT-Live-1 in de developer-API tegen precies de prijs die xAI zojuist had laten vallen. Dat levert de zeldzame situatie op waarin de twee toonaangevende full-duplex spraak-API's direct op prijs kunnen worden vergeleken, en waarin de nieuwere toetreder de goedkopere is — terwijl het oudere, duurdere model degene is met benchmarkscores van derden erachter.

Het grootboek, vóór eventuele benchmarks

Beide zijn spraak-naar-spraakmodellen die zijn gebouwd voor workloads in de vorm van telefoongesprekken: een live gesprek met een klant, een onderbreking, een tool-call en een factuur die in minuten wordt gemeten. Daarbuiten lopen ze al snel uiteen.

• Prijs per minuut audio — GPT-Live-1 $ 0,05 vs Gr​ok Voice Think Fast 2.0 $ 0,08

• Facturatie-eenheid — GPT-Live-1 factureert per seconde, zonder afronding naar de volgende hele minuut; Gr​ok Voice Think Fast 2.0 wordt per minuut audio geprijsd en komt neer op ongeveer $4,80 per uur

• Release — GPT-Live-1 werd op 8 juli 2026 uitgebracht binnen ChatGPT en bereikte de API op 10 september 2026; Gr​ok Voice Think Fast 2.0 werd rond 29–30 juli 2026 aangekondigd, ongeveer drie maanden na Think Fast 1.0

• Endpoints — GPT-Live-1 is alleen Live Sessions, op v1/live/sessions, via WebRTC; Gr​ok Voice Think Fast 2.0 draait op de Speech-to-Speech API van x​AI, via zowel WebSocket als WebRTC

• Tool-oppervlak — GPT-Live-1 delegeert naar een backend-redeneermodel via de Responses API; Gr​ok Voice Think Fast 2.0 heeft webzoekopdracht, X search, bestandszoekopdracht, MCP-servers en client-side functies beschikbaar binnen de sessie

• Stemmenportabiliteit — GPT-Live-1 gebruikt Ope​OpenAI's geremasterde set van twaalf stemmen; Gr​ok Voice Think Fast 2.0 ondersteunt ingebouwde en aangepaste stemmen

De WebSocket-lijn is kleiner dan hij lijkt en doet er meer toe dan zou moeten. Een groot deel van de telefonie-infrastructuur — de media-streaminfrastructuur in de meeste CPaaS-producten — spreekt WebSocket, niet WebRTC. Gr​ok Voice Think Fast 2.0 komt die infrastructuur tegemoet waar die zich bevindt; GPT-Live-1 doet dat niet, en het migreren van een oproeproute die uitsluitend WebSocket ondersteunt naar WebRTC is een echte engineeringopgave in plaats van een configuratievlag.

A two-column comparison scoreboard titled 'GPT-Live-1 vs Grok Voice Think Fast 2.0 - the scoreboard'. The GPT-Live-1 column lists Price $0.05 / minute; Price direction new entrant at $0.05; Transport WebRTC only; Quality evidence vendor-run, unreproduced; Tool calling delegated to backend model; Model ID single fixed ID. The Grok Voice Think Fast 2.0 column lists Price $0.08 / minute; Price direction raised 60% from $0.05; Transport WebSocket + WebRTC; Quality evidence 82.9 third-party speech index; Tool calling in-session search, MCP, functions; Model ID versioned ID plus floating alias. A footer reads 'Grok quality figure is a third-party index; GPT-Live-1 benchmarks are OpenAI's own and unreproduced.'

De benchmarkasymmetrie is het echte verhaal

Hier is waar de vergelijking niet langer in evenwicht is, en waar de meeste artikelen het omgekeerd voorstellen door beide reeksen cijfers als hetzelfde soort bewijs te behandelen.

De hoofdscores van Gr​ok Voice Think Fast 2.0 komen van de Speech-to-Speech Quality Index van Artificial Analysis, een meting door een derde partij die het model op 82,9% zet, een stijging ten opzichte van 75,7% in versie 1.0, en daarmee voorligt op GPT-Realtime-2.1 met 79,1% en Gemini 3.1 Flash met 69,5%. x​AI meldt ook een eerste plaats op de τ-voice Bench voor agentisch gedrag met 56,5%, vóór GPT-Realtime-2.1 met 45,7%. Dat zijn extern uitgevoerde metingen van het model van x​AI.

De belangrijkste scores van GPT-Live-1 zijn die van Ope​nAI zelf. Het bedrijf meldt een full-duplex interactiviteit van 80,1% tegenover 45,4% voor GPT-Realtime-2.1, een latentie bij beurtwisseling die is teruggebracht van 1,4 seconden naar 0,8, en een nauwkeurigheid bij het aanroepen van tools die is gestegen van 60% naar 87%. Al deze cijfers zijn door de leverancier gerapporteerd, zijn niet gereproduceerd door een onafhankelijk laboratorium, en vergelijken het nieuwe model van Ope​nAI met het eigen vorige model van Ope​nAI in plaats van met een concurrent.

Dat is geen reden om de cijfers weg te wuiven — de richting waarin het zich ontwikkelt komt overeen met wat vroege implementeerders melden — maar het betekent wel dat de enige momenteel beschikbare vergelijking tussen leveranciers in het voordeel van het model van x​AI uitvalt bij onafhankelijk uitgevoerde tests, terwijl het enige beschikbare cijfer voor het latentievoordeel van Ope​nAI van Ope​nAI zelf afkomstig is. Zie 0,8 seconden en 0,70 seconden niet als een echte wedstrijd; slechts een van die twee cijfers is gemeten door iemand die geen belang heeft bij de uitkomst.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

De aliasval, en waarom de prijsstijging mensen overrompelde

De toename van 60% zou in de meeste release-opmerkingen een afrondingsfout zijn geweest als xAI hem niet ook via een alias had uitgerold. Applicaties die naar de alias grok-voice-latest verwezen, erfden op 5 augustus 2026 automatisch zowel het nieuwe model als het hogere tarief, tenzij ze expliciet grok-voice-think-fast-1.0 hadden vastgezet. Dat is een ontwerpbeslissing die het begrijpen waard is, in plaats van een klacht: zwevende aliases leveren je gratis upgrades op en veranderen ook je kosteneconomie per eenheid zonder erom te vragen.

Het voor de hand liggende middel is zwakker dan het lijkt. Gr​ok Voice Think Fast 1.0 — het model van $0,05 per minuut, uitgebracht op 23 april 2026 — staat nu als verouderd gemarkeerd op x​AI's eigen modellenlijst. Het vastzetten ervan beschermt je tegen de automatische upgrade, en het koopt tijd in plaats van een permanent goedkopere route, want een verouderd model heeft ergens in de toekomst een einddatum. Plan de migratie volgens je eigen schema in plaats van dat van de alias.

Het prijsoverzicht zelf is de moeite waard om aandachtig te lezen voordat je een bedrag vastlegt. De modellenpagina van x​AI vermeldt de tarieven per versie expliciet — grok-voice-think-fast-2.0 tegen $0,08 per minuut audio, $4,80 per uur, plus $0,004 per tekstinvoer — terwijl de afzonderlijke Voice API-kaart op dezelfde pagina adverteert met een agentprijs van "vanaf $0,05 per minuut", wat het instappunt is en niet het tarief waartegen het 2.0-model factureert. Als je capaciteitsplanning op basis van het marketingcijfer is gedaan, is die ongeveer 60% te laag.

Het model van OpenAI heeft dit probleem niet in dezelfde vorm, omdat er niets is om naar te floaten. GPT-Live-1 heeft precies één model-ID, gpt-live-1, dat tevens zijn eigen standaardsnapshot is — er zijn geen gedateerde varianten om vast te pinnen, en dus ook geen alias die stilletjes het model of de prijs kan veranderen. De keerzijde is dat je ook geen bekend-goed gedrag kunt bevriezen en ermee door kunt gaan terwijl iets nieuws zich nestelt.

Beide modellen factureren de reasoninglaag apart van de spraaklaag, en dat is waar het geadverteerde tarief ophoudt de volledige kosten te zijn. De gedelegeerde Responses-aanroepen van GPT-Live-1 worden gefactureerd tegen de normale per-token tarieven van het geconfigureerde backendmodel. x​AI rekent $0,004 per tekstinvoer in de spraaksessie, plus tool-aanroepen, een toegewezen telefoonnummer van ongeveer $0,01 per minuut waar je er een nodig hebt, telefonie en opslag, bovenop het audiotarief per minuut. Een spraakagent die vooral luistert en af en toe iets opzoekt, blijft dicht bij zijn geadverteerde tarief; een agent die bij elke beurt tools aanroept niet, en die twee zullen niet in dezelfde richting uit elkaar lopen, omdat het ontwerp met een gedelegeerde backend en het ontwerp met tools in de sessie op verschillende plekken tokens verbruiken.

Aan onze kant is de reden dat veranderingen in tarieven per minuut nauwlettend in de gaten moeten worden gehouden, dat OrcaRouter de lijstprijs van de provider zonder opslag doorgeeft. Wanneer een leverancier een gepubliceerd tarief wijzigt, verandert het getal aan onze kant dezelfde dag nog in plaats van bij de volgende contractcyclus.

A screenshot of xAI's developer Models documentation page, showing a Voice API card with an agent price of 'Starting at $0.05 / min' alongside Text to Speech at $15.00 / 1M chars and Speech to Text at $0.10 / hour batch and $0.20 / hour streaming, plus a Grok 4.6 card listing a 500k-token context with $2.00 / 1M input and $6.00 / 1M output tokens, and an Imagine API card for image and video generation.

Wat de delegatieopsplitsing je kost qua engineering

Als je tussen deze twee kiest op basis van architectuur in plaats van op prijs, is de beslissende vraag waar de naad ligt.

Het model van x​AI houdt de tools binnen de sessie. Dat is eenvoudiger te beredeneren — één verbinding, één gesprek, één plek waar een functieaanroep plaatsvindt — en het betekent dat het model midden in een zin kan beslissen dat het moet zoeken en kan blijven praten terwijl het wacht.

Het model van OpenAI besteedt dat werk uit. De spraaklaag houdt het gesprek gaande en draagt de taak via de Responses API over aan een apart redeneermodel, wat betekent dat je tooldefinities, je retrieval en je bedrijfslogica zich in een normale tekstmodel-integratie bevinden in plaats van in een sessie-eventstream. Het zijn meer bewegende delen, en het is ook beter overdraagbaar: de gedelegeerde helft is een gewone API-aanroep die je onafhankelijk van de spraaklaag kunt vervangen, beprijzen en failoveren.

Dat maakt om precies één reden uit. Noch GPT-Live-1, noch Grok Voice Think Fast 2.0 wordt door iemand anders dan de eigen leverancier aangeboden — beide zijn single-source, en een router kan je niet helpen met de audiohelft. Wat een router wél kan, is de helft consolideren die je daadwerkelijk kunt kiezen. GPT-5.6 Terra, de backend in OpenAI's eigen delegatievoorbeeld, is beschikbaar via OrcaRouter voor $2,00 per miljoen inputtokens en $12,00 per miljoen output, met zowel /v1/chat/completions als /v1/responses beschikbaar, naast ongeveer 190 andere modellen op één sleutel. Als je spraakagent per beurt een reasoningmodel aanroept, is dat de kostenpost waarin routering echt iets oplevert.

Het verdict, opgesplitst naar workload

• Kies GPT-Live-1 als de prijs per minuut de beperkende factor is, als je callpath al WebRTC spreekt, of als je wilt dat het redeneerbrein achter de stem een verwisselbaar tekstmodel is in plaats van een vast onderdeel van de sessie.

• Kies Gr​ok Voice Think Fast 2.0 als je onafhankelijk geverifieerde kwaliteit op tafel wilt hebben voordat je je vastlegt, als je telefonie-stack WebSocket-native is, of als in-session tools — in het bijzonder X search — essentieel zijn voor het product in plaats van bijkomstig.

• Houd de alias in het oog als je al op x​AI zit. Het vastpinnen van een model-ID met versienummer is het enige dat tussen jou en de volgende automatische tariefswijziging staat, en dezelfde discipline is het waard om toe te passen overal waar een zwevende alias opduikt.

De ongemakkelijke samenvatting is dat het goedkopere model het model is zonder bewijs van derden erachter, en het beter gedocumenteerde model het model is dat net 60% duurder is geworden. Als je nog vroeg genoeg in de build zit dat geen van beide integraties al vastligt, is de minst risicovolle zet om tegen beide te prototypen — het audiopad is hoe dan ook een paar honderd regels — en je eigen transcriptkwaliteit te laten beslissen, want het openbare bewijs geeft momenteel geen uitsluitsel.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt