Titelkaart voor het artikel GPT-Live-1 Speech to Speech Index met de drie hoogste scores: GPT-Live-1 met GPT-6 Astra op gemiddelde inspanning met 81,5, Grok Voice Think Fast 2.0 High met 81,3, en GPT-Live-1 met GPT-5.6 Sol op lage inspanning met 80,1
Guides & Insights

GPT-Live-1 voert de Speech to Speech Index aan met 81,5 — maar de ranking komt toe aan zijn backend.

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

GPT-Live-1, het full-duplex spraakmodel dat op 8 juli 2026 voor het eerst in ChatGPT werd uitgebracht, staat nu op de eerste plaats in de Artificial Analysis Speech to Speech Index met 81,5 — een rij die alleen bestaat doordat het model op GPT-6 Astra werd gericht om zijn denkwerk te doen. Draai dezelfde spraakfront-end met GPT-5.6 Sol als gedelegeerde backend bij lage redeneerinspanning en hij scoort 80,1, waarmee hij derde staat. De tweede plaats, met 81,3, is voor Grok Voice Think Fast 2.0 High.

Twee eerlijkheden voor de cijfers. Het model is niet nieuw: GPT-Live-1 bereikte de ontwikkelaars-API op 10 september 2026, na twee maanden als standaardstem van ChatGPT. Wat nieuw is, gemeten op 15 september, is dat een externe evaluator het heeft beoordeeld — het enige dat ontbrak in elk verslag over dit model tot nu toe, inclusief het onze, waar de enige beschikbare cijfers de cijfers waren die OpenAI over zichzelf publiceerde. En de marge van 0,2 punt ten opzichte van de tweede plaats is kleiner dan het gat van 1,4 punt tussen de eigen twee configuraties van GPT-Live-1, wat het nuttigste cijfer op het bord is.

Dus de kop "GPT-Live-1 is het beste spraakmodel" is niet helemaal wat de index zegt. Die zegt dat GPT-Live-1 met GPT-6 Astra op gemiddelde inspanning dat is, met een vijfde punt verschil, en dat de keuze van backend het resultaat meer verschuift dan welk concurrerend model dan ook.

Wat de index eigenlijk meet

Artificial Analysis stelt de Speech to Speech Index samen als een gelijkgewogen composiet van vier onderdelen: Speech Reasoning, gemeten met Big Bench Audio; Agentic Performance, gemeten met τ-Voice; Arena Preference, een paarsgewijze Elo voor menselijke voorkeur; en Task Success Rate. Alleen modellen waarvoor alle vier de componenten beschikbaar zijn, krijgen een indexwaarde — al het overige toont een streepje, waardoor de tabel veel meer rijen dan scores heeft. De index zelf is gelanceerd op 23 juni 2026 en is sindsdien tweemaal herzien, meest recent om Conversational Dynamics te vervangen door Task Success, dus een score uit de ene herziening is niet strikt vergelijkbaar met een score uit een andere.

Twee extra methodologische details zijn van belang wanneer je de ranglijst leest. Arena Elo ligt vast op de waarde die het had toen een model voor het eerst publiceerbaar werd, dus de voorkeurcomponent beloont vroeg arriveren in plaats van vandaag de beste zijn. En de index beoordeelt een heel systeem in plaats van één model: voor GPT-Live-1 omvat het cijfer de voice-frontend plus welk backendmodel dan ook waaraan het werk doorgeeft. Dat is een bewuste ontwerpkeuze, en het is de reden dat hetzelfde model twee keer met verschillende scores verschijnt.

De top van het veld, zoals gepubliceerd:

• GPT-Live-1 (Astra, medium) — index 81,5, eerste

• Grok Voice Think Fast 2.0 High — index 81,3, tweede

• GPT-Live-1 (Sol, laag) — index 80,1, derde

• GPT-Realtime-2.1 High — index 73,9, vierde

• GPT-Realtime-2 High — index 73.6, vijfde

• Grok Voice Think Fast 1.0 — index 72,3, zesde

• Gemini 3.1 Flash Live High — index 71,5, zevende

Artificial Analysis Speech to Speech leaderboard showing GPT-Live-1 with Astra at medium effort first at 81.5, Grok Voice Think Fast 2.0 High second at 81.3, and GPT-Live-1 with Sol at low effort third at 80.1, with the rest of the field from GPT-Realtime-2.1 High at 73.9 down to GPT-Realtime-2.1 Mini Minimal at 52.8

Ter vergelijking: het model dat GPT-Live-1 vervangt, staat 7,6 punten onder het. Dat is een echte generatiekloof, en dat staat niet ter discussie.

De overwinning met 0,2 punt komt van precies één component

Haal de composiet uit elkaar en de twee koplopers lijken niet langer op hetzelfde soort model. Op de onderdelen, volgens Artificial Analysis:

• Agentische prestaties (τ-Voice) — GPT-Live-1 67,9% vs Grok Voice Think Fast 2.0 High 56,5%

• Spraakredenering (Big Bench Audio) — 90% vs 97%

• Succespercentage van taken — 87,4% vs 94,6%

• Arena Elo — 1048 vs 1011

• Tijd tot eerste audio — 1,34s vs 0,70s

• Kosten per uur, backend inbegrepen — $ 5,83 vs. $ 4,80

Comparison scoreboard for GPT-Live-1 with Astra at medium effort against Grok Voice Think Fast 2.0 High, contrasting their Speech to Speech Index scores of 81.5 and 81.3, agentic performance of 67.9% and 56.5%, speech reasoning of 90% and 97%, task success of 87.4% and 94.6%, time to first audio of 1.34 and 0.70 seconds, and cost per hour of $5.83 and $4.80

GPT-Live-1 wint twee van de zes regels en verliest er vier, maar wint toch de index. De rekensom is geen raadsel: het τ-Voice-verschil is 11,4 punten, veel groter dan welk ander verschil in de tabel dan ook, en bij gelijke weging trekt het de samengestelde score over de streep. Simpel gezegd: GPT-Live-1 is de betere agent en Grok Voice Think Fast 2.0 High is de betere luisteraar en de snellere — en de index geeft toevallig net zwaar genoeg gewicht aan datgene waarin GPT-Live-1 goed is om het op de eerste plaats te laten eindigen.

Als uw product een spraakagent is die reserveert, oplost of transacties uitvoert, is de τ-Voice-voorsprong van 11,4 punt het getal dat uw ervaring voorspelt. Als uw product een gesprek is dat direct moet aanvoelen en de gebruiker nooit mag onderbreken, is de tijd tot eerste audio van 0,70 seconde het getal dat uw ervaring voorspelt, en Grok wint die met ongeveer een factor twee. Bij gereguleerde taakuitvoering is er een tweede waarschuwing: het taaksuccespercentage van 94,6% van Grok is het hoogste in de zichtbare tabel, en de 87,4% van GPT-Live-1 betekent dat ongeveer één op de acht taken niet wordt voltooid. Beide zijn verbeteringen ten opzichte van de vorige generatie. Geen van beide is een opgelost probleem.

Rij #1 is een routeringsconfiguratie, geen model

Dit is het deel dat meer aandacht verdient dan de positie op de ranglijst. GPT-Live-1 is een full-duplex spraaklaag die zelf luisteren, spreken, onderbrekingen en beurtwisseling afhandelt, en redeneren, tool-aanroepen en zoeken delegeert aan een apart backendmodel terwijl het gesprek doorgaat. Artificial Analysis scoorde twee van die combinaties als afzonderlijke vermeldingen. Astra bij gemiddelde inspanning leverde 81,5 op. Sol bij lage inspanning leverde 80,1 op.

Dat verschil van 1,4 punt is het verhaal. Het verschil tussen de eerste en tweede plaats is 0,2 punt. Het verschil tussen de twee gescoorde configuraties van GPT-Live-1 is zeven keer groter. Er veranderde niets aan het spraakmodel tussen die rijen — alleen welk model het denkwerk deed, en met welk inspanningsniveau. Een ranglijst die systemen rangschikt, vertelt je nauwkeurig dat de configuratie het product is.

Het herziet ook onze eigen verslaggeving. Op 11 september 2026 registreerden we GPT-Live-1 op 69,8% in deze index, achter zowel GPT-Realtime-2.1 als Grok. Dat was de meting die toen beschikbaar was, en die ondersteunde een redelijke conclusie: dat OpenAI de beste gespreksmechanica had gebouwd, en niet de beste spraakagent. De index bevat nu twee gedelegeerde GPT-Live-1-configuraties op 81,5 en 80,1. Artificial Analysis publiceert geen changelog, en het heeft in augustus de componenten van de index herzien, dus we kunnen niet met zekerheid zeggen of de eerdere waarde een ongescoorde of gedeeltelijk gescoorde configuratie was, of een run onder de oudere weging; wat waarneembaar is, is dat de gedelegeerde combinaties nu als hun eigen volledige rijen verschijnen, en dat het antwoord veranderde toen ze dat deden.

De praktische consequentie is dat "welk stemmodel" de verkeerde vraag is en "welk stemmodel plus welke backend, bij welke inspanning" de juiste. Dat is een routeringsvraag, en het is precies de vraag die ons eigen product bestaat om te beantwoorden. OrcaRouter stelt de delegatiebackend van GPT-Live-1, GPT-6 Astra, beschikbaar via hetzelfde OpenAI-compatibele endpoint als 200+ andere modellen, dus het verwisselen van de denklaag is een wijziging van het model-ID in plaats van een integratie. De routerings-DSL combineert meerdere modellen in één aanroep, en automatische failover betekent dat een onbewezen combinatie geen productiegok is — als de backend degradeert, belandt het verzoek ergens anders in plaats van te mislukken. Om precies te zijn over wat we niet doen: GPT-Live-1 zelf staat niet in onze catalogus en wij serveren het niet. De backend waaraan het delegeert is een andere kwestie.

Wat een uur hiervan kost

De front-end van GPT-Live-1 wordt gefactureerd tegen $0,05 per spraakminuut, per seconde afgerekend, wat $3,00 is voor een uur open lijn. Dat is niet de volledige rekening: gedelegeerd redeneren, tool calls en webzoekopdrachten worden apart getarifeerd tegen wat het backendmodel in rekening brengt. Artificial Analysis heeft het totaalbedrag gemeten, daarom is de kostenkolom daarvan de kolom die je moet gebruiken:

• GPT-Live-1 (Sol, low) — $4,47 per uur

• Grok Voice Think Fast 2.0 High — $4,80 per uur

• GPT-Live-1 (Astra, medium) — $5,83 per uur

• GPT-Realtime-2.1 High — $10,75 per uur

De nummer één van de ranglijst is de duurste van de drie huidige opties, en de configuratie die won is 30% meer per uur dan de configuratie die als derde eindigde. Anders gelezen is de verdeling leerzaam: $3,00 van elk uur is de spraaklaag, en de rest — $1,47 op Sol, $2,83 op Astra — bestaat uit backendtokens. De denklaag vormt ergens tussen een derde en de helft van je rekening, wat een groot aandeel is voor een component die de ranglijst als voetnoot behandelt.

OrcaRouter model page for GPT-6 Astra showing the model id openai/gpt-6-astra, a 1M-token context window, 128K max output, a p50 time to first token of 6.75 seconds, and pricing of $10.00 per million input tokens and $50.00 per million output tokens

Vergeleken met het model dat het vervangt, is de hele familie echter ongeveer half zo duur — de front-end van $0,05 per minuut is een echte verlaging, geen herverpakking. Omdat backendtokens tegen backendtarieven worden gefactureerd, zijn de kosten van een GPT-Live-1-implementatie grotendeels afhankelijk van naar welk redeneermodel je routeert, en backends kunnen OpenAI's eigen modellen of modellen van derden zijn. Op OrcaRouter worden die backends tegen de catalogusprijs van de provider doorgegeven met 0% opslag, zodat een prijswijziging van een leverancier op de denklaag dezelfde dag ingaat in plaats van bij de volgende factureringscyclus.

Wat de index niet beslecht

Drie kanttekeningen, door de bron genoemd in plaats van afgeleid. Zowel de GPT-Live-1-vermeldingen als Grok Voice Think Fast 2.0 High zijn gemarkeerd als gebaseerd op één enkele proef, wat mager is voor een beslissing van 0,2 punt — een nieuwe run zou de eerste en tweede plaats kunnen omwisselen zonder dat er iets aan een van beide modellen verandert. Arena Elo was, zoals opgemerkt, bevroren op de eerste publiceerbare meting van elk model. En de index bevat geen vermelding voor hoe deze systemen zich gedragen tijdens een lang gesprek: de componenten hebben door hun opzet een korte horizon, terwijl de faalwijze die spraakagenten in productie echt de das omdoet, drift is gedurende een gesprek van twintig minuten.

Los daarvan, en van de leverancier in plaats van de index: de API van GPT-Live-1 werd uitgebracht zonder beeld- of video-invoer, zonder gestructureerde uitvoer en zonder een gratis laag, en de snelheidslimieten worden geteld in gelijktijdige sessies in plaats van verzoeken per minuut. Dat zijn beperkingen van de dag van de lancering die inmiddels kunnen zijn gewijzigd; controleer ze voordat u eromheen ontwerpt.

Wat te doen met dit

Als je deze week een architectuur kiest in plaats van een model, beloont de index het gedelegeerde patroon bij agentisch werk en het cascadepatroon bij latentie. GPT-Live-1 op 81,5 is het sterkste bewijs tot nu toe dat het splitsen van gesprek en redenering de juiste vorm is voor taakvoltooierende spraakagenten. Grok Voice Think Fast 2.0 High op 81,3, met 0,70 seconden tot eerste audio en een taaksuccespercentage van 94,6%, is het sterkste bewijs dat de gedelegeerde vorm niet de enige is die werkt — en dat die nog niet de snelste is.

De beslissing die uit de cijfers volgt, is goedkoper dan het lijkt. Beide configuraties van GPT-Live-1, en het model dat het op vier van de zes componenten versloeg, ontlopen elkaar qua kosten niet meer dan $1,36 per uur. Bij dat verschil is de juiste zet om te stoppen met het lezen van ranglijsten en je eigen transcripten door beide heen te halen. De index vertelt je de vorm van de afweging; hij kan je niet vertellen aan welke kant daarvan je gebruikers staan.

Vragen die het getal oproept

Is GPT-Live-1 nu het beste stemmodel?

Wat de samengestelde score betreft: ja — met 0,2 punt en met slechts één enkele test erachter. Per component hangt het volledig af van wat je aan het bouwen bent: het leidt bij agentische prestaties en arena-voorkeur, en blijft achter op spraakredenering, taaksuccespercentage en tijd tot eerste audio. Een voorsprong van 0,2 punt in de samengestelde score, die op één componentvoordeel van 11,4 punt rust, is een verdedigbare eerste plaats, geen beslissende.

Moet je GPT-6 Astra gebruiken om de 81,5 te halen?

Voor die exacte rij, ja — de 81,5 is van GPT-Live-1 geconfigureerd met Astra bij gemiddelde reasoning-inspanning. Sol bij lage inspanning is een gedocumenteerd alternatief met 80,1 en $1,36 per uur goedkoper, en OpenAI ondersteunt het inzetten van modellen van derden als backend, dus de vermeldingen op het leaderboard zijn twee punten op een curve in plaats van de enige opties. Welke combinatie het beste is voor jouw workload is niet iets wat een publieke index voor je kan beantwoorden.

Waarom scoorde hetzelfde model 69,8 in onze eerdere berichtgeving en nu 81,5?

De twee cijfers hebben betrekking op verschillende zaken. De eerdere meting plaatste GPT-Live-1 als één enkele vermelding op de index; de huidige tabel bevat de twee gedelegeerde configuraties als afzonderlijke, volledig gescoorde rijen, met de Astra-combinatie op 81,5 en de Sol-combinatie op 80,1. Artificial Analysis heeft de componenten van de index in augustus herzien en publiceert geen changelog, dus beschouw de delta als een verandering in wat werd gemeten in plaats van als bewijs dat het model is verbeterd — en beschouw elke enkele samengestelde score voor een delegerend model als een uitspraak over een configuratie.