
GPT-Live-1 bereikt de API: full-duplex spraak voor $0,05 per minuut, zonder drop-in-pad vanaf GPT-Realtime-2.1.
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
GPT-Live-1 staat sinds 10 september in de API, en het getal dat budgetten echt zal hervormen is geen benchmark — het is de facturatie-eenheid. Het full-duplex spraakmodel van OpenAIOpenAI wordt nu gefactureerd tegen een vast tarief van $0,05 per minuut spraak, per seconde afgerekend, terwijl het model waarmee het wordt vergeleken, GPT-Realtime-2.1, werd afgerekend in audiotokens tegen $32 per miljoen voor input en $64 per miljoen voor output. Het model zelf is niet nieuw: GPT-Live-1 werd op 8 juli 2026 in ChatGPT uitgebracht als vervanging van Advanced Voice Mode. Wat nieuw is, is dat ontwikkelaars het eindelijk kunnen aanroepen — en dat het aanroepen ervan bijna niets lijkt op de Realtime-integratie die de meeste teams al hebben. De eigen documentatie van OpenAIOpenAI koppelt de spraaklaag aan een aparte redeneerbackend, en in het gepubliceerde WebRTC-voorbeeld is die backend GPT-5.6 Terra.
Wat er op 10 september is uitgebracht, en wat niet
Het API-oppervlak is bewust smal. Er is precies één model-ID, gpt-live-1, dat tevens zijn eigen standaardsnapshot is — geen gedateerde varianten om vast te pinnen. Er is precies één endpoint, het Live Sessions-endpoint op v1/live/sessions. Al het andere op het platform van OpenAIOpenAI is uitgeschakeld voor dit model: geen Chat Completions, geen Responses, geen Realtime (inclusief de vertaal- en transcriptievarianten), geen Assistants, geen Batch, geen fine-tuning, geen embeddings, geen beeld- of videogeneratie, geen audio-spraak- of transcriptie-endpoints, geen moderatie.
Invoer en uitvoer zijn audio en tekst. Streaming en functieaanroepen worden ondersteund; gestructureerde outputs, fine-tuning en voorspelde outputs worden niet ondersteund. Beeld- en video-invoer worden expliciet niet ondersteund — dus de 'voice with video'-functionaliteit die OpenAI heeft gesuggereerd, maakt geen deel uit van deze release. De gratis tier kan het helemaal niet aanroepen, en snelheidslimieten worden gemeten in gelijktijdige sessies in plaats van verzoeken per minuut: 25 op Tier 1, oplopend tot 50, 200, 300 en 500 in Tiers 2 tot en met 5.

Die concurrency-framing is de eerste aanwijzing dat dit geen plug-invervanging is. Snelheidslimieten uitgedrukt in gelijktijdige livegesprekken vertellen je wat OpenAIOpenAI als schaaleenheid verwacht: een telefoonlijn, niet een verzoek.
De prijswijziging is het rustigere, grotere verhaal
Een vast tarief per minuut is een echte breuk met het verleden. Bij tokenmeting moest je de audiobrand modelleren — hoeveel tokens een seconde stilte kost, hoe een beller die blijft praten door de agent heen de uitvoerlengte verandert — voordat je één gesprek kon voorspellen. Bij $0,05 per minuut valt de berekening terug tot eenvoudige vermenigvuldiging:
• Een supportoproep van 5 minuten — $0,25 aan spreektijd
• Een telefoongesprek van 10 minuten — $ 0,50
• Een gemiddelde van 4 minuten bij 1.000 calls per dag — $200 per dag, ongeveer $6.000 per maand
• Eén uur ononderbroken open lijn — $3,00
Drie details scherpen dat aan. Ten eerste wordt de duur niet naar boven afgerond op de volgende hele minuut, dus een gesprek van 40 seconden kost ongeveer 3,3 cent in plaats van een volledige nickel. Ten tweede brengt sessie-initialisatie vooraf 15 seconden spraakduur in rekening — maar dat wordt verrekend met latere duurkosten, niet er bovenop gestapeld, dus een gesprek korter dan 15 seconden komt nog steeds uit op de prijs voor 15 seconden. Ten derde is spraak slechts de helft van de rekening. Het backend-redeneermodel, de tool-aanroepen en elke webzoekopdracht worden apart gefactureerd tegen de normale tarieven van dat model, wat betekent dat een "goedkoop spraakmodel" alsnog een duur gesprek kan opleveren als je delegatie op een frontier-reasoner richt en het bij elke beurt laat zoeken.
Die structuur van twee meter is waar routing ophoudt een luxe te zijn. Op OrcaRouter is de backendhelft van een GPT-Live-1-sessie gewoon weer een modelaanroep — ongeveer 190 modellen van elf upstreamproviders achter één sleutel, tegen de lijstprijs van de provider en zonder enige markup doorgegeven, met automatische failover als je gekozen backend een fout geeft of een time-out krijgt. De spraaklaag zelf kun je niet routeren; het Live Sessions-endpoint is alleen van OpenAIOpenAI. Je kunt absoluut alles routeren waaraan de spraaklaag delegeert, en dat is de helft die meeschaalt met hoe hard je bellers nadenken.
Alleen WebRTC — waarom je Realtime-code niet te porten is
Dit is de praktische prijs van de overstap, en de meeste berichtgeving rond de lancering slaat dit over. GPT-Live-1-sessies verlopen via WebRTC, niet via het WebSocket-transport waarop veel bestaande Realtime-integraties zijn gebouwd. Als je het oudere pad test met een GPT-Live-model-ID, krijg je een foutmelding die je met zoveel woorden te kennen geeft dat sessies WebRTC vereisen.
De handshake, volgens OpenAI's WebRTC-gids: je browser opent een RTCPeerConnection, voegt microfoontracks toe, opent een datakanaal en registreert listeners voordat hij een offer aanmaakt, stelt de lokale beschrijving in, wacht op ICE-gathering en stuurt de offer naar je eigen server. Je server roept vervolgens POST /v1/live/sessions aan met de sessieconfiguratie plus transport: { type: "webrtc", sdp: ... }. Bij succes wordt HTTP 201 geretourneerd met session.id en transport.sdp, die de browser toepast als de remote description. Media reist via de onderhandelde tracks; het datakanaal — label oai-events — draagt transcripties, sessie-updates en gedelegeerd werk. Om op te hangen stuur je session.close en blijf je lezen tot session.closed arriveert.
Twee valkuilen die je op de monitor zou moeten plakken. De HTTP-aanroep zelf start de sessie, dus je mag session.start niet ook op het datakanaal sturen. En je moet geen input-audio toevoegen of wachten op output-audiodelta's via dat kanaal — laat audio.format uit de config en laat SDP het afhandelen. De servervoorbeelden beperken de request body tot 64 KB, laten ICE-gathering na 10 seconden time-out lopen en de sessiefinalisatie na 15 seconden.
Niets hiervan is moeilijk. Het is allemaal nieuwe code. Als je product een beurtgebaseerde realtime-agent is, dan is migreren naar GPT-Live-1 een herschrijving van de transportlaag plus een herschrijving van de delegatie, niet het omwisselen van een model-ID — iets om als een sprint te begroten, niet als een middag.
De benchmarks, en wie ze allemaal heeft gedraaid
Elk cijfer hieronder is afkomstig van OpenAIOpenAI zelf, gepubliceerd bij de API-release, en op het moment van schrijven door niemand onafhankelijk gereproduceerd. Dat voorbehoud weegt hier zwaarder dan anders, omdat de verschillen groot genoeg zijn om te worden aangehaald als een vaststaand feit.

• Full-duplex interactiviteit — GPT-Live-1 80,1% tegen 45,4% voor GPT-Realtime-2.1
• Beurtwisselingslatentie — 0,8s vs 1,4s
• Nauwkeurigheid van tool-aanroepen — 87% vs 60%
• Benchmark voor telefonische klantenondersteuning in het bankwezen, slagingspercentage — 32% vs 12,4%
Lees de laatste regel twee keer. Een slagingspercentage van 32% is een grote verbetering ten opzichte van 12,4% en betekent nog steeds dat het systeem ongeveer twee derde van de taken in die evaluatie niet haalde. De sprongen in interactiviteit en het aanroepen van tools zijn wat een werkelijk ander product beschrijft; het bankgetal is het eerlijke getal over hoe ver spraakagenten nog verwijderd zijn van het zonder toezicht afhandelen van een gereguleerde workflow.
Het klantbewijs is dunner dan de benchmarktabel en wijst in dezelfde richting. Yelp gebruikt GPT-Live-1 voor telefonische reserveringen, waarbij CTO Alex Levy wordt aangehaald over verbeterde gespreksafhandeling. Taalleerplatform Speak meldde bijna 80% minder onderbrekingen dan zijn vorige beurtgebaseerde systeem — een zelfgerapporteerd cijfer van een bedrijf dat belang heeft bij het resultaat, en nog steeds het meest concrete implementatiecijfer dat beschikbaar is.
De stemlaag is een front-end; jij kiest het brein
De architectonische gok is delegatie, en het is het onderdeel van deze release waar een routeringslaag natuurlijk in past. GPT-Live-1 doet het diepe denkwerk niet. Wanneer een beller iets vraagt waarvoor redenering, retrieval of een tool nodig is, draagt het model de taak over een asynchrone grens heen over aan een aparte backend die blijft doorwerken terwijl het gesproken gesprek doorgaat, en voegt het het antwoord er vervolgens weer in zodra het klaar is.
De configuratie is expliciet, en het loont de moeite het voorbeeld in de documentatie aandachtig te lezen. Naast model: "gpt-live-1" en de instructies bevat de sessie een delegation-object van het type responses, waarvan het binnenste responses blok de naam van het backend-model noemt, zijn eigen instructies, zijn tools — het voorbeeld gebruikt web_search — en een tool_choice. In het gepubliceerde WebRTC-voorbeeld van OpenAIOpenAI is dat backend-model GPT-5.6 Terra.

Dat is de echte claim van het ontwerp: vervang de backend en de spraakervaring wordt slimmer zonder dat het spraakmodel opnieuw getraind hoeft te worden. Het betekent ook dat de delegatiebackend overdraagbaar is op een manier waarop de spraaklaag dat niet is. OrcaRouter heeft gpt-live-1 niet in huis — het Live Sessions-endpoint is alleen van OpenAI, en daarvan routeren wij niets. Maar de delegatiehelft spreekt de Responses API, en die helft is volledig aan jou om te kiezen. GPT-5.6 Terra is live op OrcaRouter tegen de lijstprijs van OpenAIOpenAI — $2,00 per miljoen invoertokens en $12,00 per miljoen uitvoertokens, met het Responses-endpoint beschikbaar — dus het exacte model uit het eigen voorbeeld van OpenAIOpenAI is één aanroep verwijderd, zonder een tweede contract of SDK.
In de praktijk maakt dat de keuze van de backend tot configuratie. Je kunt een goedkoop redeneermodel A/B-testen tegen een frontier-model op live gespreksverkeer door één regel aan te passen en de kosten per gesprek te bekijken, of het delegatiemodel achter automatische failover houden, zodat een slechte middag upstream je telefoonlijn niet mee onderuit haalt. De spraaklaag waarvoor je $0,05 per minuut betaalt, blijft waar die is; alles wat die delegeert, loopt via één sleutel over ongeveer 190 modellen van elf upstreamproviders, tegen de lijstprijs van de provider zonder opslag.
Wat ontbreekt er nog?
• Geen beeld- of video-invoer — stilstaande beelden en schermdeling zitten niet in deze release, dus het multimodale spraakoppervlak dat oudere ChatGPT-modi nog hebben, blijft onbehandeld
• Geen gestructureerde outputs — als je agent schema-gevalideerde toolargumenten nodig heeft, moet die validatie in je backendmodel zitten, niet in de spraaklaag
• Geen toegang tot het gratis niveau en geen fine-tuning — zowel kosten als maatwerk beginnen pas bij de betaalde niveaus
• Geen onafhankelijke evaluatie van welk kerncijfer dan ook — elk cijfer hierboven is door de leverancier geproduceerd
• Een gelijktijdigheidsplafond van 25 gelijktijdige sessies op Tier 1 — royaal voor een pilot, krap voor een callcenter op dag één
Wie moet zich verplaatsen, en wie moet wachten
Stap nu over als je telefonie bouwt — reserveringslijnen, afspraken maken, eerstelijnsondersteuning — en je huidige stack de klassieke ASR-naar-LLM-naar-TTS-cascade is. De latentie en het omgaan met onderbrekingen zijn precies wat die pijplijn verliest, de prijs per minuut is voorspelbaar genoeg om in een spreadsheet te zetten, en OpenAIOpenAI's eigen documentatie bevat nu een Twilio-achtig servervoorbeeld om van te kopiëren. Stap nu ook over als je al op een Realtime-model zit en je product echt conversationeel is in plaats van beurtgestuurd, want het omgaan met onderbrekingen is het onderdeel waarin GPT-Realtime-2.1 het slechtst was.
Wacht als je integratie beurtgebaseerd is en werkt. De herschrijving van de transportlaag is echt werk, het endpoint ondersteunt niets anders, en er is geen migratiepad dat je bestaande WebSocket-code behoudt. Wacht ook als je gebruiksscenario afhankelijk is van gestructureerde uitvoer van tools of video-invoer, die beide hier ontbreken.
Waar je de komende weken op moet letten: de eerste onafhankelijke reproductie van het interactiviteitscijfer van 80,1%, of het tarief van $0,05 een introductietarief is, of een kleinere GPT-Live-1 mini de API net zo bereikt als aan de consumentenkant, en of beeld- en scherminvoer het gat dichten. Totdat een extern lab die evaluatie uitvoert, is de eerlijke samenvatting dat dit het meest capabele spraakmodel is dat iemand aan ontwikkelaars heeft geleverd, met het bewijs voor die claim geschreven door de mensen die het verkopen.
