Een hero-titelkaart met de tekst 'GPT-Live-1 bereikt de API', met de ondertitel '$0,05 per minuut voor full-duplex spraak' en de regel 'Het model is van 8 juli 2026; de ontwikkelaars-API werd uitgebracht op 10 september 2026', naast twee overlappende audiogolfvormen met pijlen die in beide richtingen buigen, met het OrcaRouter-logo samengevoegd in de hoek.
Guides & Insights

GPT-Live-1 bereikt de API: full-duplex spraak voor $0,05 per minuut, zonder drop-in-pad vanaf GPT-Realtime-2.1.

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

GPT-Live-1 staat sinds 10 september in de API, en het getal dat budgetten echt zal hervormen is geen benchmark — het is de facturatie-eenheid. Het full-duplex spraakmodel van OpenAIOpe​nAI wordt nu gefactureerd tegen een vast tarief van $0,05 per minuut spraak, per seconde afgerekend, terwijl het model waarmee het wordt vergeleken, GPT-Realtime-2.1, werd afgerekend in audiotokens tegen $32 per miljoen voor input en $64 per miljoen voor output. Het model zelf is niet nieuw: GPT-Live-1 werd op 8 juli 2026 in ChatGPT uitgebracht als vervanging van Advanced Voice Mode. Wat nieuw is, is dat ontwikkelaars het eindelijk kunnen aanroepen — en dat het aanroepen ervan bijna niets lijkt op de Realtime-integratie die de meeste teams al hebben. De eigen documentatie van OpenAIOpe​nAI koppelt de spraaklaag aan een aparte redeneerbackend, en in het gepubliceerde WebRTC-voorbeeld is die backend GPT-5.6 Terra.

Wat er op 10 september is uitgebracht, en wat niet

Het API-oppervlak is bewust smal. Er is precies één model-ID, gpt-live-1, dat tevens zijn eigen standaardsnapshot is — geen gedateerde varianten om vast te pinnen. Er is precies één endpoint, het Live Sessions-endpoint op v1/live/sessions. Al het andere op het platform van OpenAIOpenAI is uitgeschakeld voor dit model: geen Chat Completions, geen Responses, geen Realtime (inclusief de vertaal- en transcriptievarianten), geen Assistants, geen Batch, geen fine-tuning, geen embeddings, geen beeld- of videogeneratie, geen audio-spraak- of transcriptie-endpoints, geen moderatie.

Invoer en uitvoer zijn audio en tekst. Streaming en functieaanroepen worden ondersteund; gestructureerde outputs, fine-tuning en voorspelde outputs worden niet ondersteund. Beeld- en video-invoer worden expliciet niet ondersteund — dus de 'voice with video'-functionaliteit die OpenAI heeft gesuggereerd, maakt geen deel uit van deze release. De gratis tier kan het helemaal niet aanroepen, en snelheidslimieten worden gemeten in gelijktijdige sessies in plaats van verzoeken per minuut: 25 op Tier 1, oplopend tot 50, 200, 300 en 500 in Tiers 2 tot en met 5.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Die concurrency-framing is de eerste aanwijzing dat dit geen plug-invervanging is. Snelheidslimieten uitgedrukt in gelijktijdige livegesprekken vertellen je wat OpenAIOpe​nAI als schaaleenheid verwacht: een telefoonlijn, niet een verzoek.

De prijswijziging is het rustigere, grotere verhaal

Een vast tarief per minuut is een echte breuk met het verleden. Bij tokenmeting moest je de audiobrand modelleren — hoeveel tokens een seconde stilte kost, hoe een beller die blijft praten door de agent heen de uitvoerlengte verandert — voordat je één gesprek kon voorspellen. Bij $0,05 per minuut valt de berekening terug tot eenvoudige vermenigvuldiging:

• Een supportoproep van 5 minuten — $0,25 aan spreektijd

• Een telefoongesprek van 10 minuten — $ 0,50

• Een gemiddelde van 4 minuten bij 1.000 calls per dag — $200 per dag, ongeveer $6.000 per maand

• Eén uur ononderbroken open lijn — $3,00

Drie details scherpen dat aan. Ten eerste wordt de duur niet naar boven afgerond op de volgende hele minuut, dus een gesprek van 40 seconden kost ongeveer 3,3 cent in plaats van een volledige nickel. Ten tweede brengt sessie-initialisatie vooraf 15 seconden spraakduur in rekening — maar dat wordt verrekend met latere duurkosten, niet er bovenop gestapeld, dus een gesprek korter dan 15 seconden komt nog steeds uit op de prijs voor 15 seconden. Ten derde is spraak slechts de helft van de rekening. Het backend-redeneermodel, de tool-aanroepen en elke webzoekopdracht worden apart gefactureerd tegen de normale tarieven van dat model, wat betekent dat een "goedkoop spraakmodel" alsnog een duur gesprek kan opleveren als je delegatie op een frontier-reasoner richt en het bij elke beurt laat zoeken.

Die structuur van twee meter is waar routing ophoudt een luxe te zijn. Op OrcaRouter is de backendhelft van een GPT-Live-1-sessie gewoon weer een modelaanroep — ongeveer 190 modellen van elf upstreamproviders achter één sleutel, tegen de lijstprijs van de provider en zonder enige markup doorgegeven, met automatische failover als je gekozen backend een fout geeft of een time-out krijgt. De spraaklaag zelf kun je niet routeren; het Live Sessions-endpoint is alleen van OpenAIOpe​nAI. Je kunt absoluut alles routeren waaraan de spraaklaag delegeert, en dat is de helft die meeschaalt met hoe hard je bellers nadenken.

Alleen WebRTC — waarom je Realtime-code niet te porten is

Dit is de praktische prijs van de overstap, en de meeste berichtgeving rond de lancering slaat dit over. GPT-Live-1-sessies verlopen via WebRTC, niet via het WebSocket-transport waarop veel bestaande Realtime-integraties zijn gebouwd. Als je het oudere pad test met een GPT-Live-model-ID, krijg je een foutmelding die je met zoveel woorden te kennen geeft dat sessies WebRTC vereisen.

De handshake, volgens OpenAI's WebRTC-gids: je browser opent een RTCPeerConnection, voegt microfoontracks toe, opent een datakanaal en registreert listeners voordat hij een offer aanmaakt, stelt de lokale beschrijving in, wacht op ICE-gathering en stuurt de offer naar je eigen server. Je server roept vervolgens POST /v1/live/sessions aan met de sessieconfiguratie plus transport: { type: "webrtc", sdp: ... }. Bij succes wordt HTTP 201 geretourneerd met session.id en transport.sdp, die de browser toepast als de remote description. Media reist via de onderhandelde tracks; het datakanaal — label oai-events — draagt transcripties, sessie-updates en gedelegeerd werk. Om op te hangen stuur je session.close en blijf je lezen tot session.closed arriveert.

Twee valkuilen die je op de monitor zou moeten plakken. De HTTP-aanroep zelf start de sessie, dus je mag session.start niet ook op het datakanaal sturen. En je moet geen input-audio toevoegen of wachten op output-audiodelta's via dat kanaal — laat audio.format uit de config en laat SDP het afhandelen. De servervoorbeelden beperken de request body tot 64 KB, laten ICE-gathering na 10 seconden time-out lopen en de sessiefinalisatie na 15 seconden.

Niets hiervan is moeilijk. Het is allemaal nieuwe code. Als je product een beurtgebaseerde realtime-agent is, dan is migreren naar GPT-Live-1 een herschrijving van de transportlaag plus een herschrijving van de delegatie, niet het omwisselen van een model-ID — iets om als een sprint te begroten, niet als een middag.

De benchmarks, en wie ze allemaal heeft gedraaid

Elk cijfer hieronder is afkomstig van OpenAIOpe​nAI zelf, gepubliceerd bij de API-release, en op het moment van schrijven door niemand onafhankelijk gereproduceerd. Dat voorbehoud weegt hier zwaarder dan anders, omdat de verschillen groot genoeg zijn om te worden aangehaald als een vaststaand feit.

A two-column comparison scoreboard titled 'GPT-Live-1 vs GPT-Realtime-2.1 — the scoreboard'. The GPT-Live-1 column lists price $0.05 per minute, billing unit per second, interactivity 80.1%, turn-taking latency 0.8 s, tool-calling accuracy 87%, and endpoint 'Live Sessions only'. The GPT-Realtime-2.1 column lists price $32 / $64 per 1M audio tokens, billing unit per audio token, interactivity 45.4%, turn-taking latency 1.4 s, tool-calling accuracy 60%, and endpoint 'Realtime + WebSocket'. A footer reads 'GPT-Live-1 figures are OpenAI's own, unreproduced; Realtime-2.1 pricing per OpenAI API docs.'

• Full-duplex interactiviteit — GPT-Live-1 80,1% tegen 45,4% voor GPT-Realtime-2.1

• Beurtwisselingslatentie — 0,8s vs 1,4s

• Nauwkeurigheid van tool-aanroepen — 87% vs 60%

• Benchmark voor telefonische klantenondersteuning in het bankwezen, slagingspercentage — 32% vs 12,4%

Lees de laatste regel twee keer. Een slagingspercentage van 32% is een grote verbetering ten opzichte van 12,4% en betekent nog steeds dat het systeem ongeveer twee derde van de taken in die evaluatie niet haalde. De sprongen in interactiviteit en het aanroepen van tools zijn wat een werkelijk ander product beschrijft; het bankgetal is het eerlijke getal over hoe ver spraakagenten nog verwijderd zijn van het zonder toezicht afhandelen van een gereguleerde workflow.

Het klantbewijs is dunner dan de benchmarktabel en wijst in dezelfde richting. Yelp gebruikt GPT-Live-1 voor telefonische reserveringen, waarbij CTO Alex Levy wordt aangehaald over verbeterde gespreksafhandeling. Taalleerplatform Speak meldde bijna 80% minder onderbrekingen dan zijn vorige beurtgebaseerde systeem — een zelfgerapporteerd cijfer van een bedrijf dat belang heeft bij het resultaat, en nog steeds het meest concrete implementatiecijfer dat beschikbaar is.

De stemlaag is een front-end; jij kiest het brein

De architectonische gok is delegatie, en het is het onderdeel van deze release waar een routeringslaag natuurlijk in past. GPT-Live-1 doet het diepe denkwerk niet. Wanneer een beller iets vraagt waarvoor redenering, retrieval of een tool nodig is, draagt het model de taak over een asynchrone grens heen over aan een aparte backend die blijft doorwerken terwijl het gesproken gesprek doorgaat, en voegt het het antwoord er vervolgens weer in zodra het klaar is.

De configuratie is expliciet, en het loont de moeite het voorbeeld in de documentatie aandachtig te lezen. Naast model: "gpt-live-1" en de instructies bevat de sessie een delegation-object van het type responses, waarvan het binnenste responses blok de naam van het backend-model noemt, zijn eigen instructies, zijn tools — het voorbeeld gebruikt web_search — en een tool_choice. In het gepubliceerde WebRTC-voorbeeld van OpenAIOpe​nAI is dat backend-model GPT-5.6 Terra.

A screenshot of the OrcaRouter model page for GPT-5.6 Terra, showing the model ID openai/gpt-5.6-terra, OpenAI as the provider with a 2026-07-09 release date, a 1M-token context window with 128K max output, pricing of $2.00 per 1M input tokens and $12.00 per 1M output tokens, a p50 TTFT of 2.38 s, and the exposed endpoints /v1/chat/completions and /v1/responses.

Dat is de echte claim van het ontwerp: vervang de backend en de spraakervaring wordt slimmer zonder dat het spraakmodel opnieuw getraind hoeft te worden. Het betekent ook dat de delegatiebackend overdraagbaar is op een manier waarop de spraaklaag dat niet is. OrcaRouter heeft gpt-live-1 niet in huis — het Live Sessions-endpoint is alleen van OpenAI, en daarvan routeren wij niets. Maar de delegatiehelft spreekt de Responses API, en die helft is volledig aan jou om te kiezen. GPT-5.6 Terra is live op OrcaRouter tegen de lijstprijs van OpenAIOpe​nAI — $2,00 per miljoen invoertokens en $12,00 per miljoen uitvoertokens, met het Responses-endpoint beschikbaar — dus het exacte model uit het eigen voorbeeld van OpenAIOpe​nAI is één aanroep verwijderd, zonder een tweede contract of SDK.

In de praktijk maakt dat de keuze van de backend tot configuratie. Je kunt een goedkoop redeneermodel A/B-testen tegen een frontier-model op live gespreksverkeer door één regel aan te passen en de kosten per gesprek te bekijken, of het delegatiemodel achter automatische failover houden, zodat een slechte middag upstream je telefoonlijn niet mee onderuit haalt. De spraaklaag waarvoor je $0,05 per minuut betaalt, blijft waar die is; alles wat die delegeert, loopt via één sleutel over ongeveer 190 modellen van elf upstreamproviders, tegen de lijstprijs van de provider zonder opslag.

Wat ontbreekt er nog?

• Geen beeld- of video-invoer — stilstaande beelden en schermdeling zitten niet in deze release, dus het multimodale spraakoppervlak dat oudere ChatGPT-modi nog hebben, blijft onbehandeld

• Geen gestructureerde outputs — als je agent schema-gevalideerde toolargumenten nodig heeft, moet die validatie in je backendmodel zitten, niet in de spraaklaag

• Geen toegang tot het gratis niveau en geen fine-tuning — zowel kosten als maatwerk beginnen pas bij de betaalde niveaus

• Geen onafhankelijke evaluatie van welk kerncijfer dan ook — elk cijfer hierboven is door de leverancier geproduceerd

• Een gelijktijdigheidsplafond van 25 gelijktijdige sessies op Tier 1 — royaal voor een pilot, krap voor een callcenter op dag één

Wie moet zich verplaatsen, en wie moet wachten

Stap nu over als je telefonie bouwt — reserveringslijnen, afspraken maken, eerstelijnsondersteuning — en je huidige stack de klassieke ASR-naar-LLM-naar-TTS-cascade is. De latentie en het omgaan met onderbrekingen zijn precies wat die pijplijn verliest, de prijs per minuut is voorspelbaar genoeg om in een spreadsheet te zetten, en OpenAIOpe​nAI's eigen documentatie bevat nu een Twilio-achtig servervoorbeeld om van te kopiëren. Stap nu ook over als je al op een Realtime-model zit en je product echt conversationeel is in plaats van beurtgestuurd, want het omgaan met onderbrekingen is het onderdeel waarin GPT-Realtime-2.1 het slechtst was.

Wacht als je integratie beurtgebaseerd is en werkt. De herschrijving van de transportlaag is echt werk, het endpoint ondersteunt niets anders, en er is geen migratiepad dat je bestaande WebSocket-code behoudt. Wacht ook als je gebruiksscenario afhankelijk is van gestructureerde uitvoer van tools of video-invoer, die beide hier ontbreken.

Waar je de komende weken op moet letten: de eerste onafhankelijke reproductie van het interactiviteitscijfer van 80,1%, of het tarief van $0,05 een introductietarief is, of een kleinere GPT-Live-1 mini de API net zo bereikt als aan de consumentenkant, en of beeld- en scherminvoer het gat dichten. Totdat een extern lab die evaluatie uitvoert, is de eerlijke samenvatting dat dit het meest capabele spraakmodel is dat iemand aan ontwikkelaars heeft geleverd, met het bewijs voor die claim geschreven door de mensen die het verkopen.