
OpenAI's Platform Day in september: GPT-Live-1 bereikt de API nu de Agents API in bèta opent
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Twee dingen verlieten op 10 september 2026 het platform van OpenAI, en het rustigere heeft de grotere impact. GPT-Live-1 — het full-duplex spraakmodel dat sinds 8 juli in ChatGPT draait — is nu aanroepbaar door ontwikkelaars voor $0,05 per minuut spraak. Daarnaast, en veel minder genoemd in de berichtgeving, ging de Agents API in publieke bèta: dezelfde harness die Codex laat draaien, beschikbaar gemaakt als een gehost product met beheerde sandboxes. Het ene is een betere stem. Het andere is dat OpenAI verkoopt wat vroeger het moeilijkste deel van het bouwen van een agent was.
Beide zijn afgelezen van de primaire bronnen voor dit stuk: de aankondiging van OpenAI's Agents API, de post in de ontwikkelaarscommunity van OpenAI waarin GPT-Live-1 in de API wordt geïntroduceerd, en de ontwikkelaarsdocumentatie voor beide. Wanneer een cijfer afkomstig is van OpenAI en niet van een externe beoordelaar, wordt dat hieronder als zodanig aangeduid — en één cijfer komt wel van buitenaf, wat het verhaal enigszins verandert.

Artificial Analysis begon dit jaar een Speech to Speech Index te publiceren, en GPT-Live-1 heeft er een regel op: 69,8%, een gewogen gemiddelde over spraakredenering, agentische prestaties, arena-voorkeur en taaksucces. Dat plaatst het op de zevende plaats van de elf gescoorde modellen — achter GPT-Realtime-2.1 met 73,9%, het model dat het vervangt, en achter Grok Voice Think Fast 2.0 met 79,0%. Het onafhankelijke scorebord en OpenAI's eigen benchmarktabel vertellen niet hetzelfde verhaal, en beide zijn waar.
Wat is uitgebracht, in de volgorde waarin het je architectuur zal veranderen
• Spraak — GPT-Live-1 is live in de API als gpt-live-1, gefactureerd tegen $0,05 per minuut spraak, per seconde in rekening gebracht, waarbij het backend-redeneermodel afzonderlijk wordt gefactureerd tegen zijn eigen tarieven.
• Agents — de Agents API is in openbare bèta. OpenAI zegt dat er geen extra kosten zijn voor de API zelf; je betaalt voor modeltokens, tools en de tijd van gehoste sandboxcontainers.
• Sandboxen — OpenAI host nu de uitvoeringsomgeving, met hergebruik van dezelfde sandboxing-infrastructuur als Codex en ChatGPT, configureerbaar met bestanden, pakketten, vaardigheden en plug-ins.
• Omgevingen — naast OpenAI's eigen sandbox kunnen teams agents laten richten op hun eigen infrastructuur of op sandboxleveranciers van derden in de bètapartnerlijst.
De voice-release is een modelverhaal. De Agents API is een platformverhaal, en het zijn platformverhalen die geruisloos een codebase een nieuwe richting geven.
De Agents API: een agent in één POST
De kernaanroep is POST /v1/agents/sessions, verzonden met een OpenAI-Beta: agents=v1-header, en de belofte is dat taak, model, tools en omgeving genoeg zijn om een draaiende agent terug te krijgen. SDK's dekken Python, TypeScript/JavaScript, Go, Java en Ruby.
Wat het meer dan een wrapper maakt, is dat OpenAI de harness draait in plaats van deze te leveren. De AgentKit-harness is open source en te inspecteren, maar de draaiende kopie is die van OpenAI — contextcompactie over lange sessies, het zoeken naar tools, programmatische toolaanroepen, MCP-ondersteuning, aangepaste functies, ingebouwde webzoekopdracht en subagent-orchestratie met configureerbare gelijktijdigheid. Geversioneerde harness-mogelijkheden verschijnen samen met modelreleases, en dat is de interessante toezegging: de scaffolding beweegt in dezelfde cadans als de modellen.
Voor iedereen die een kwartaal lang een loop heeft onderhouden — retry-logica, context trimming, tool routing, de subagent fan-out die altijd state lekt — is dat het echte product. Niet de modelaanroep. De infrastructuur eromheen die je niet meer schrijft.
Gehoste sandboxes zijn het onderdeel waar een rekening aan vastzit.
Agents die code uitvoeren, hebben een plek nodig om die uit te voeren, en de bèta levert OpenAI's eigen antwoord: een beheerde sandbox die code uitvoert, met bestanden werkt en artefacten produceert, configureerbaar met pakketten, vaardigheden en plug-ins. Ontwikkelaars die al een geharde uitvoeringsomgeving hebben, worden niet gedwongen om daarop over te stappen — bring-your-own-infrastructure en een reeks genoemde sandboxpartners bevinden zich beide in de bèta.
Twee operationele kanttekeningen zijn het waard om vast te leggen voordat je hierop voortbouwt. Data residency is in de bèta alleen in de VS beschikbaar, en Zero Data Retention wordt niet ondersteund. Voor een gereguleerde workload bepalen die twee regels of dit een pilot of een productiepad is, en het zijn de details die doorgaans laat worden ontdekt.
GPT-Live-1 in de API: vaste facturering per minuut is de echte verandering
Het spraakmodel zelf is niet nieuw — het verving Advanced Voice Mode in ChatGPT op 8 juli — maar de commerciële vorm wel. Onder de Realtime-lijn werd audio in tokens gemeten, wat betekende dat het voorspellen van een gesprek het modelleren van audiogebruik vereiste: hoeveel tokens een seconde stilte kost, hoe een beller die door de agent heen praat de lengte van de uitvoer verandert. Een vast tarief van $0,05 per spraakminuut reduceert dat tot een simpele vermenigvuldiging. Een uur continu open lijn is $3,00. Een gemiddelde van vier minuten over duizend gesprekken per dag is ongeveer $200 per dag.
Sessies lopen via een Live Sessions-endpoint met één model-ID en geen gedateerde snapshots om vast te zetten. De documentatie behandelt WebRTC, WebSockets en telefonie/SIP als verbindingspaden, en de gepubliceerde quickstart bouwt de WebRTC-variant. Facturering kent twee meters, en slechts één daarvan is de voice: elke gedelegeerde reasoning-aanroep, tool-aanroep en webzoekopdracht wordt gefactureerd tegen de normale tarieven van het backendmodel.
De architectuur is delegatie. GPT-Live-1 verzorgt het gesprek — het beslist vele malen per seconde of het moet blijven luisteren, pauzeren, onderbreken of werk overdragen — en stuurt alles wat echt redeneerwerk vereist via een asynchrone grens naar een aparte backend, die blijft doorwerken terwijl het gesproken gesprek doorgaat. De documentatie definieert twee modi: Responses-delegatie, waarbij OpenAI een ondersteund Responses-model voor je aanroept en de gesprekscontext aanlevert, en clientdelegatie, waarbij je eigen applicatie de backend levert en de controle houdt over de uitvoering, de context en welke resultaten de spraaklaag bereiken. In het gepubliceerde Responses-voorbeeld is die backend GPT-5.6 Terra, genoemd in een delegatieobject, samen met zijn eigen instructies en tools. Bij de consumentenlancering in juli was dat GPT-5.5; communityartikelen wijzen sindsdien op GPT-6 Astra.

Elk prominent cijfer voor de spraaklaag is van OpenAI zelf en is op het moment van schrijven door niemand onafhankelijk gereproduceerd: 80,1% op de interactiviteit van Full Duplex Bench v1.5 tegenover 45,4% voor GPT-Realtime-2.1, een beurtwisselingslatentie van 0,798 seconde tegenover 1,41 seconde, 87% succes bij het aanroepen van tools, en een slagingspercentage van 32% op een evaluatie van spraakondersteuning voor banken tegenover 12,4% voor het model dat het vervangt. Dat laatste paar is het eerlijke paar — een grote verbetering, en toch een systeem dat ongeveer twee derde van een gereguleerde workflow niet aankan. Bewijs van derde klanten is er wel, maar het is mager en partijdig: Yelp voor telefonische reserveringen, EliseAI, en leerplatform Speak melden bijna 80% minder onderbrekingen dan hun vorige beurtgebaseerde stack.
Het onafhankelijke resultaat is minder flatteus en verdient het om naast de bovenstaande lijst te worden geplaatst in plaats van eronder. Op de Artificial Analysis Speech to Speech Index — één samengestelde score voor spraakredenering, agentische prestaties, arena-voorkeur en taaksucces — staat GPT-Live-1 op 69,8%, onder de 73,9% van GPT-Realtime-2.1 en ruim onder de 79,0% van Grok Voice Think Fast 2.0. Als je de twee samen leest, wordt de vorm van het product duidelijk: OpenAI bouwde de beste beschikbare gespreksmechanica en bouwde niet de beste spraakagent, omdat het redeneren is gedelegeerd aan een model dat de index afzonderlijk beoordeelt.

De twee aankondigingen zijn één aankondiging
Samengelezen beschrijven de releases dezelfde reorganisatie vanuit twee richtingen. De Agents API verplaatst de loop, de sandbox en het contextbeheer naar een gehost product. GPT-Live-1 verplaatst het conversatieoppervlak naar een dunne front-end die het denkwerk elders delegeert. In beide gevallen houdt het model op het ding te zijn waar je omheen bouwt en wordt het een component die je selecteert — en in beide gevallen is die selectie een configuratieregel in plaats van een architecturale verbintenis.
Dat is precies de naad waarin een routeringslaag zit. OrcaRouter levert geen gpt-live-1: het Live Sessions-endpoint is alleen van OpenAI, en wij routeren daar niets van. De delegatiehelft is een ander verhaal. De backend waaraan de spraaklaag werk overdraagt, spreekt de Responses API, en dat is een normale modelaanroep — het model dat OpenAI's eigen voorbeeld noemt, GPT-5.6 Terra, is beschikbaar via OrcaRouter tegen OpenAI's lijstprijs van $2,00 per miljoen inputtokens en $12,00 per miljoen output, met het Responses-endpoint beschikbaar. Clientdelegatie gaat verder: het laat je applicatie de backend direct leveren, wat betekent dat het model achter de stem elk endpoint kan zijn dat jij beheert. Hetzelfde geldt voor de modelslot van de Agents API: de harness is van OpenAI, maar het model daarbinnen is een keuze die jij houdt, en ongeveer 190 modellen van elf upstream-providers zitten achter één sleutel tegen de lijstprijs van de provider zonder opslag erbovenop.
Concreet volgen hieruit drie dingen. Backends kunnen op liveverkeer worden A/B-getest door één regel aan te passen, en zo kom je erachter of een goedkope reasoner goed genoeg is voordat je er een telefoonlijn aan toewijst. Failover kan onder het delegatiemodel zitten, zodat een slechte middag upstream het gesprek niet mee onderuit haalt. En een taak kan in één aanroep via de routerings-DSL tegen meerdere backends worden uitgevoerd, of in één keer door een panel van modellen worden beantwoord met model fusion — nuttig op het moment dat de output van een agent moet worden vertrouwd in plaats van alleen maar gegenereerd.
Wat zit er in geen van beide releases?
• Geen beeld- of video-invoer op GPT-Live-1 — het multimodale spraakoppervlak dat oudere ChatGPT-modi bieden, is nog steeds niet aangepakt.
• Geen gestructureerde outputs op de spraaklaag, dus schema-gevalideerde toolargumenten moeten in het backendmodel worden afgedwongen.
• Geen toegang tot GPT-Live-1 in de gratis laag, en snelheidslimieten worden uitgedrukt in gelijktijdige sessies — 25 op Tier 1, oplopend tot 500 bij Tier 5.
• Geen Zero Data Retention en geen dataresidentie buiten de VS in de Agents API-bèta.
• Geen onafhankelijke reproductie van enig {{1}}GPT-Live-1{{/1}} benchmarkcijfer.
De gok die OpenAI op 10 september deed, is dat ontwikkelaars de harness willen kopen en het brein apart willen kiezen. De eerste helft daarvan is nu een regelpost. De tweede helft is waar de concurrentiedruk van de komende twaalf maanden zal neerslaan — want een gehoste harness met een verwisselbaar modelslot is slechts zo goed als de modellen die je erin kunt stoppen, en juist dat is op dit moment het onderdeel van de stack dat OpenAI niet in zijn eentje beheerst.
Het delegatiegedeelte is een ander verhaal — de backend waaraan de spraaklaag werk overdraagt, is een normale modelaanroep, en GPT-5.6 Terra is beschikbaar via OrcaRouter tegen OpenAI's lijstprijs met het Responses-endpoint beschikbaar.
