Hero-titelkaart voor het artikel 'OpenAI's September Platform Day', met ondertitel 'GPT-Live-1 komt naar de API, de Agents API opent in bèta', voorzien van een badge met de tekst 'Beide aankondigingen gedateerd 10 september 2026' en drie kaarten met de tekst 'GPT-Live-1 in de API: $0,05 per spraakminuut, Live Sessions-endpoint, één model-ID', 'Agents API: publieke bèta, Codex-harness, gehoste sandboxes of neem je eigen mee' en 'Waarom het ertoe doet: het model wordt een component die je kiest, de harness wordt een product dat je huurt', boven een voetbalk met de tekst 'Spraakcijfers door OpenAI gerapporteerd en niet gereproduceerd; prijsstelling van Agents API wordt doorberekend.' Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Guides & Insights

OpenAI's Platform Day in september: GPT-Live-1 bereikt de API nu de Agents API in bèta opent

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee dingen verlieten op 10 september 2026 het platform van OpenAI, en het rustigere heeft de grotere impact. GPT-Live-1 — het full-duplex spraakmodel dat sinds 8 juli in ChatGPT draait — is nu aanroepbaar door ontwikkelaars voor $0,05 per minuut spraak. Daarnaast, en veel minder genoemd in de berichtgeving, ging de Agents API in publieke bèta: dezelfde harness die Codex laat draaien, beschikbaar gemaakt als een gehost product met beheerde sandboxes. Het ene is een betere stem. Het andere is dat OpenAI verkoopt wat vroeger het moeilijkste deel van het bouwen van een agent was.

Beide zijn afgelezen van de primaire bronnen voor dit stuk: de aankondiging van OpenAI's Agents API, de post in de ontwikkelaarscommunity van OpenAI waarin GPT-Live-1 in de API wordt geïntroduceerd, en de ontwikkelaarsdocumentatie voor beide. Wanneer een cijfer afkomstig is van OpenAI en niet van een externe beoordelaar, wordt dat hieronder als zodanig aangeduid — en één cijfer komt wel van buitenaf, wat het verhaal enigszins verandert.

A two-column scoreboard titled 'September 10, 2026 — what Ope​nAI shipped'. The left column, labelled GPT-Live-1 in the API, reads 'What it is: full-duplex voice model', 'Access: Live Sessions API, one model ID', 'Price: $0.05 per voice minute', 'Status: generally available since Sept 10, 2026', 'Independent score: 69.8% on the Artificial Analysis Speech to Speech Index', 'Catch: delegates its thinking to a backend model'. The right column, labelled Agents API, reads 'What it is: hosted agent runtime', 'Access: public beta, Codex harness', 'Price: no API fee; sandbox time is billed', 'Status: public beta since Sept 10, 2026', 'Evidence: Ope​nAI documentation only, no independent evaluation', 'Catch: US-only data residency, no Zero Data Retention'. The footer reads 'GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced; the AA index figure is independently run.' The OrcaRouter logo is composited in the bottom-right corner.

Artificial Analysis begon dit jaar een Speech to Speech Index te publiceren, en GPT-Live-1 heeft er een regel op: 69,8%, een gewogen gemiddelde over spraakredenering, agentische prestaties, arena-voorkeur en taaksucces. Dat plaatst het op de zevende plaats van de elf gescoorde modellen — achter GPT-Realtime-2.1 met 73,9%, het model dat het vervangt, en achter Grok Voice Think Fast 2.0 met 79,0%. Het onafhankelijke scorebord en OpenAI's eigen benchmarktabel vertellen niet hetzelfde verhaal, en beide zijn waar.

Wat is uitgebracht, in de volgorde waarin het je architectuur zal veranderen

• Spraak — GPT-Live-1 is live in de API als gpt-live-1, gefactureerd tegen $0,05 per minuut spraak, per seconde in rekening gebracht, waarbij het backend-redeneermodel afzonderlijk wordt gefactureerd tegen zijn eigen tarieven.

• Agents — de Agents API is in openbare bèta. Ope​nAI zegt dat er geen extra kosten zijn voor de API zelf; je betaalt voor modeltokens, tools en de tijd van gehoste sandboxcontainers.

• Sandboxen — OpenAI host nu de uitvoeringsomgeving, met hergebruik van dezelfde sandboxing-infrastructuur als Codex en ChatGPT, configureerbaar met bestanden, pakketten, vaardigheden en plug-ins.

• Omgevingen — naast Ope​nAI's eigen sandbox kunnen teams agents laten richten op hun eigen infrastructuur of op sandboxleveranciers van derden in de bètapartnerlijst.

De voice-release is een modelverhaal. De Agents API is een platformverhaal, en het zijn platformverhalen die geruisloos een codebase een nieuwe richting geven.

De Agents API: een agent in één POST

De kernaanroep is POST /v1/agents/sessions, verzonden met een Ope​nAI-Beta: agents=v1-header, en de belofte is dat taak, model, tools en omgeving genoeg zijn om een draaiende agent terug te krijgen. SDK's dekken Python, TypeScript/JavaScript, Go, Java en Ruby.

Wat het meer dan een wrapper maakt, is dat OpenAI de harness draait in plaats van deze te leveren. De AgentKit-harness is open source en te inspecteren, maar de draaiende kopie is die van OpenAI — contextcompactie over lange sessies, het zoeken naar tools, programmatische toolaanroepen, MCP-ondersteuning, aangepaste functies, ingebouwde webzoekopdracht en subagent-orchestratie met configureerbare gelijktijdigheid. Geversioneerde harness-mogelijkheden verschijnen samen met modelreleases, en dat is de interessante toezegging: de scaffolding beweegt in dezelfde cadans als de modellen.

Voor iedereen die een kwartaal lang een loop heeft onderhouden — retry-logica, context trimming, tool routing, de subagent fan-out die altijd state lekt — is dat het echte product. Niet de modelaanroep. De infrastructuur eromheen die je niet meer schrijft.

Gehoste sandboxes zijn het onderdeel waar een rekening aan vastzit.

Agents die code uitvoeren, hebben een plek nodig om die uit te voeren, en de bèta levert Ope​nAI's eigen antwoord: een beheerde sandbox die code uitvoert, met bestanden werkt en artefacten produceert, configureerbaar met pakketten, vaardigheden en plug-ins. Ontwikkelaars die al een geharde uitvoeringsomgeving hebben, worden niet gedwongen om daarop over te stappen — bring-your-own-infrastructure en een reeks genoemde sandboxpartners bevinden zich beide in de bèta.

Twee operationele kanttekeningen zijn het waard om vast te leggen voordat je hierop voortbouwt. Data residency is in de bèta alleen in de VS beschikbaar, en Zero Data Retention wordt niet ondersteund. Voor een gereguleerde workload bepalen die twee regels of dit een pilot of een productiepad is, en het zijn de details die doorgaans laat worden ontdekt.

GPT-Live-1 in de API: vaste facturering per minuut is de echte verandering

Het spraakmodel zelf is niet nieuw — het verving Advanced Voice Mode in ChatGPT op 8 juli — maar de commerciële vorm wel. Onder de Realtime-lijn werd audio in tokens gemeten, wat betekende dat het voorspellen van een gesprek het modelleren van audiogebruik vereiste: hoeveel tokens een seconde stilte kost, hoe een beller die door de agent heen praat de lengte van de uitvoer verandert. Een vast tarief van $0,05 per spraakminuut reduceert dat tot een simpele vermenigvuldiging. Een uur continu open lijn is $3,00. Een gemiddelde van vier minuten over duizend gesprekken per dag is ongeveer $200 per dag.

Sessies lopen via een Live Sessions-endpoint met één model-ID en geen gedateerde snapshots om vast te zetten. De documentatie behandelt WebRTC, WebSockets en telefonie/SIP als verbindingspaden, en de gepubliceerde quickstart bouwt de WebRTC-variant. Facturering kent twee meters, en slechts één daarvan is de voice: elke gedelegeerde reasoning-aanroep, tool-aanroep en webzoekopdracht wordt gefactureerd tegen de normale tarieven van het backendmodel.

De architectuur is delegatie. GPT-Live-1 verzorgt het gesprek — het beslist vele malen per seconde of het moet blijven luisteren, pauzeren, onderbreken of werk overdragen — en stuurt alles wat echt redeneerwerk vereist via een asynchrone grens naar een aparte backend, die blijft doorwerken terwijl het gesproken gesprek doorgaat. De documentatie definieert twee modi: Responses-delegatie, waarbij OpenAI een ondersteund Responses-model voor je aanroept en de gesprekscontext aanlevert, en clientdelegatie, waarbij je eigen applicatie de backend levert en de controle houdt over de uitvoering, de context en welke resultaten de spraaklaag bereiken. In het gepubliceerde Responses-voorbeeld is die backend GPT-5.6 Terra, genoemd in een delegatieobject, samen met zijn eigen instructies en tools. Bij de consumentenlancering in juli was dat GPT-5.5; communityartikelen wijzen sindsdien op GPT-6 Astra.

A screenshot of Ope​nAI's developer documentation page 'Agents' under the API section, headed 'Choose a runtime, connect tools, and manage multi-step work', showing a routing row reading 'Run an agent with the Codex harness managed by Ope​nAI — Agents API', and a comparison table with columns Agents API, Agents SDK and Responses API whose rows read 'Where the agent runs: Ope​nAI runs a managed Codex harness', 'State between tasks: saved session configuration, turns, and items' and 'Execution environment: Ope​nAI hosted sandbox, self-hosted sandbox, or no sandbox'.

Elk prominent cijfer voor de spraaklaag is van OpenAI zelf en is op het moment van schrijven door niemand onafhankelijk gereproduceerd: 80,1% op de interactiviteit van Full Duplex Bench v1.5 tegenover 45,4% voor GPT-Realtime-2.1, een beurtwisselingslatentie van 0,798 seconde tegenover 1,41 seconde, 87% succes bij het aanroepen van tools, en een slagingspercentage van 32% op een evaluatie van spraakondersteuning voor banken tegenover 12,4% voor het model dat het vervangt. Dat laatste paar is het eerlijke paar — een grote verbetering, en toch een systeem dat ongeveer twee derde van een gereguleerde workflow niet aankan. Bewijs van derde klanten is er wel, maar het is mager en partijdig: Yelp voor telefonische reserveringen, EliseAI, en leerplatform Speak melden bijna 80% minder onderbrekingen dan hun vorige beurtgebaseerde stack.

Het onafhankelijke resultaat is minder flatteus en verdient het om naast de bovenstaande lijst te worden geplaatst in plaats van eronder. Op de Artificial Analysis Speech to Speech Index — één samengestelde score voor spraakredenering, agentische prestaties, arena-voorkeur en taaksucces — staat GPT-Live-1 op 69,8%, onder de 73,9% van GPT-Realtime-2.1 en ruim onder de 79,0% van Grok Voice Think Fast 2.0. Als je de twee samen leest, wordt de vorm van het product duidelijk: OpenAI bouwde de beste beschikbare gespreksmechanica en bouwde niet de beste spraakagent, omdat het redeneren is gedelegeerd aan een model dat de index afzonderlijk beoordeelt.

A screenshot of the Artificial Analysis Speech to Speech Index chart, updated September 2026, ranking eleven speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success rate. Bars run left to right: Grok Voice Think Fast 2.0 at 79.0%, GPT-Realtime-2.1 at 73.9%, GPT-Realtime-2 at 73.6%, Grok Voice Think Fast at 72.3%, Gemini 3.1 Flash Live at 71.5%, GPT-Live-1 mini at 70.3%, GPT-Live-1 at 69.8%, Qwen-Audio-Omni at 66.8%, RealTime Omni at 64.2%, Qwen 3.x Omni at 63.9% and Gemini 2.5 Flash at 52.6%. Companion charts show time to first audio, where GPT-Live-1 sits mid-pack at 0.78 seconds, and cost per hour of input audio, where GPT-Live-1 is $4.42 against GPT-Realtime-2.1 at $10.75.

De twee aankondigingen zijn één aankondiging

Samengelezen beschrijven de releases dezelfde reorganisatie vanuit twee richtingen. De Agents API verplaatst de loop, de sandbox en het contextbeheer naar een gehost product. GPT-Live-1 verplaatst het conversatieoppervlak naar een dunne front-end die het denkwerk elders delegeert. In beide gevallen houdt het model op het ding te zijn waar je omheen bouwt en wordt het een component die je selecteert — en in beide gevallen is die selectie een configuratieregel in plaats van een architecturale verbintenis.

Dat is precies de naad waarin een routeringslaag zit. OrcaRouter levert geen gpt-live-1: het Live Sessions-endpoint is alleen van Ope​nAI, en wij routeren daar niets van. De delegatiehelft is een ander verhaal. De backend waaraan de spraaklaag werk overdraagt, spreekt de Responses API, en dat is een normale modelaanroep — het model dat Ope​nAI's eigen voorbeeld noemt, GPT-5.6 Terra, is beschikbaar via OrcaRouter tegen Ope​nAI's lijstprijs van $2,00 per miljoen inputtokens en $12,00 per miljoen output, met het Responses-endpoint beschikbaar. Clientdelegatie gaat verder: het laat je applicatie de backend direct leveren, wat betekent dat het model achter de stem elk endpoint kan zijn dat jij beheert. Hetzelfde geldt voor de modelslot van de Agents API: de harness is van Ope​nAI, maar het model daarbinnen is een keuze die jij houdt, en ongeveer 190 modellen van elf upstream-providers zitten achter één sleutel tegen de lijstprijs van de provider zonder opslag erbovenop.

Concreet volgen hieruit drie dingen. Backends kunnen op liveverkeer worden A/B-getest door één regel aan te passen, en zo kom je erachter of een goedkope reasoner goed genoeg is voordat je er een telefoonlijn aan toewijst. Failover kan onder het delegatiemodel zitten, zodat een slechte middag upstream het gesprek niet mee onderuit haalt. En een taak kan in één aanroep via de routerings-DSL tegen meerdere backends worden uitgevoerd, of in één keer door een panel van modellen worden beantwoord met model fusion — nuttig op het moment dat de output van een agent moet worden vertrouwd in plaats van alleen maar gegenereerd.

Wat zit er in geen van beide releases?

• Geen beeld- of video-invoer op GPT-Live-1 — het multimodale spraakoppervlak dat oudere ChatGPT-modi bieden, is nog steeds niet aangepakt.

• Geen gestructureerde outputs op de spraaklaag, dus schema-gevalideerde toolargumenten moeten in het backendmodel worden afgedwongen.

• Geen toegang tot GPT-Live-1 in de gratis laag, en snelheidslimieten worden uitgedrukt in gelijktijdige sessies — 25 op Tier 1, oplopend tot 500 bij Tier 5.

• Geen Zero Data Retention en geen dataresidentie buiten de VS in de Agents API-bèta.

• Geen onafhankelijke reproductie van enig {{1}}GPT-Live-1{{/1}} benchmarkcijfer.

De gok die OpenAI op 10 september deed, is dat ontwikkelaars de harness willen kopen en het brein apart willen kiezen. De eerste helft daarvan is nu een regelpost. De tweede helft is waar de concurrentiedruk van de komende twaalf maanden zal neerslaan — want een gehoste harness met een verwisselbaar modelslot is slechts zo goed als de modellen die je erin kunt stoppen, en juist dat is op dit moment het onderdeel van de stack dat OpenAI niet in zijn eentje beheerst.

Het delegatiegedeelte is een ander verhaal — de backend waaraan de spraaklaag werk overdraagt, is een normale modelaanroep, en GPT-5.6 Terra is beschikbaar via OrcaRouter tegen OpenAI's lijstprijs met het Responses-endpoint beschikbaar.