
OpenAI:s september Platform Day: GPT-Live-1 når API:et när Agents API öppnas i beta
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Två saker lämnade OpenAI:s plattform den 10 september 2026, och den tystare har den större sprängradien. GPT-Live-1 — den full-duplexa röstmodellen som har körts inuti ChatGPT sedan den 8 juli — kan nu anropas av utvecklare för 0,05 dollar per röstminut. Vid sidan av den, och med långt färre omnämnanden i bevakningen, gick Agents API in i offentlig beta: samma ramverk som driver Codex, exponerat som en hostad produkt med hanterade sandlådor. Den ena är en bättre röst. Den andra är OpenAI som säljer det som brukade vara den svåra delen av att bygga en agent.
Båda lästes från primärkällorna för den här artikeln: OpenAIs Agents API-tillkännagivande, dess utvecklargemenskapsinlägg som introducerar GPT-Live-1 i API:et, och utvecklardokumentationen för båda. Där en siffra kommer från OpenAI i stället för en extern utvärderare märks den som sådan nedan — och en siffra kommer faktiskt utifrån, vilket förändrar historien något.

Artificial Analysis började publicera ett Speech to Speech Index i år, och GPT-Live-1 har en rad där: 69,8 %, ett viktat genomsnitt över talresonemang, agentisk prestanda, arenapreferens och uppgiftsframgång. Det placerar den på sjunde plats av de elva modeller som poängsatts – bakom GPT-Realtime-2.1 på 73,9 %, vilket är modellen den ersätter, och bakom Grok Voice Think Fast 2.0 på 79,0 %. Den oberoende resultattavlan och OpenAI:s egen benchmarktabell berättar inte samma historia, och båda är sanna.
Vad som har släppts, i den ordning det kommer att förändra din arkitektur
• Röst — GPT-Live-1 är live i API:et som gpt-live-1, faktureras med $0,05 per minut röst, debiteras per sekund, med backend-resonemangsmodellen fakturerad separat enligt sina egna priser.
• Agents – Agents-API:et är i offentlig beta. OpenAI säger att det inte tillkommer någon extra avgift för själva API:et; du betalar för modelltokens, verktyg och tid i värdbaserade sandbox-containrar.
• Sandboxar — OpenAI tillhandahåller nu exekveringsmiljön och återanvänder samma sandbox-infrastruktur som Codex och ChatGPT, konfigurerbar med filer, paket, färdigheter och plugins.
• Miljöer — förutom OpenAI:s egen sandlåda kan team rikta agenter mot sin egen infrastruktur eller mot tredjepartsleverantörer av sandlådor i betapartnerlistan.
Röstsläppet är en modellhistoria. Agents API är en plattformshistoria, och plattformshistorier är de som i tysthet pekar om en kodbas.
Agents API: en agent i en POST
Det centrala anropet är POST /v1/agents/sessions, som skickas med headern OpenAI-Beta: agents=v1, och poängen är att uppgift, modell, verktyg och miljö räcker för att få tillbaka en körande agent. SDK:er finns för Python, TypeScript/JavaScript, Go, Java och Ruby.
Det som gör det mer än en wrapper är att OpenAI driver harnessen i stället för att leverera den. AgentKit-harnessen är öppen källkod och möjlig att granska, men den körande kopian tillhör OpenAI — kontextkomprimering över långa sessioner, verktygssökning, programmatiska verktygsanrop, MCP-stöd, anpassade funktioner, inbyggd webbsökning och orkestrering av underagenter med konfigurerbar samtidighet. Versionerade harness-funktioner lanseras tillsammans med modellanseringar, vilket är det intressanta åtagandet: stödstrukturen rör sig i samma takt som modellerna.
För alla som har lagt ett kvartal på att underhålla en loop – retry-logik, kontexttrimning, verktygsroutning, subagent-fan-outen som alltid läcker state – är det den faktiska produkten. Inte modellanropet. Rördragningen runt det som du inte längre skriver.
Värdbaserade sandlådor är den del som har en räkning kopplad till sig.
Agenter som exekverar kod behöver någonstans att exekvera den, och betan levererar OpenAI:s eget svar: en hanterad sandbox som kör kod, arbetar med filer och producerar artefakter, konfigurerbar med paket, färdigheter och plugins. Utvecklare som redan har en härdad exekveringsmiljö tvingas inte att använda den — egen infrastruktur och en uppsättning namngivna sandbox-partner finns båda i betan.
Två operativa förbehåll är värda att dokumentera innan du bygger vidare på det. Data residency i betan är endast USA, och Zero Data Retention stöds inte. För en reglerad arbetsbelastning avgör dessa två rader om detta är en pilot eller en väg till produktion, och det är detaljerna som tenderar att upptäckas sent.
GPT-Live-1 i API:et: fast minutpris är den verkliga förändringen
Röstmodellen i sig är inte ny – den ersatte Advanced Voice Mode i ChatGPT den 8 juli – men den kommersiella formen är ny. Under Realtime-linjen mättes ljud i tokens, vilket innebar att prognostisera ett samtal krävde modellering av ljudförbrukning: hur många tokens en sekunds tystnad kostar, hur en uppringare som talar över agenten förändrar utdatans längd. Ett fast pris på 0,05 USD per röstminut kokar ned det till en multiplikation. En timmes oavbruten öppen linje kostar 3,00 USD. Ett genomsnitt på fyra minuter över tusen samtal per dag landar på cirka 200 USD per dag.
Sessioner körs från en Live Sessions-slutpunkt med ett enda modell-ID och inga daterade snapshots att låsa. Dokumentationen täcker WebRTC, WebSockets och telefoni/SIP som anslutningsvägar, och den publicerade snabbstarten bygger den för WebRTC. Faktureringen har två mätare, och endast en av dem är rösten: varje delegerat resonemangsanrop, verktygsanrop och webbsökning faktureras enligt backendmodellens normala priser.
Arkitekturen är delegering. GPT-Live-1 sköter konversationen — den avgör många gånger i sekunden om den ska fortsätta lyssna, pausa, avbryta eller lämna över arbete — och skickar allt som kräver riktigt resonemang över en asynkron gräns till en separat backend, som fortsätter arbeta medan det talade samtalet fortsätter. Dokumentationen definierar två lägen: Responses-delegering, där OpenAI anropar en Responses-modell som stöds åt dig och tillhandahåller samtalskontext, och klientdelegering, där din egen applikation tillhandahåller backenden och behåller kontrollen över exekvering, kontext och vilka resultat som når röstlagret. I det publicerade Responses-exemplet är den backenden GPT-5.6 Terra, namngiven i ett delegation-objekt tillsammans med sina egna instruktioner och verktyg. Vid konsumentlanseringen i juli var det GPT-5.5; community-sammanställningar sedan dess har pekat på GPT-6 Astra.

Varje framträdande siffra för röstlagret är OpenAI:s egen och har vid tidpunkten för skrivandet inte oberoende reproducerats av någon: 80,1 % i interaktivitet på Full Duplex Bench v1.5 mot 45,4 % för GPT-Realtime-2.1, 0,798 sekunders latens vid turtagning mot 1,41 sekunder, 87 % lyckade verktygsanrop och en godkännandegrad på 32 % i en utvärdering av röstsupport för bank mot 12,4 % för modellen den ersätter. Det sista paret är det ärliga – en stor förbättring, och fortfarande ett system som misslyckas i ungefär två tredjedelar av ett reglerat arbetsflöde. Bevis från tredjepartskunder finns men är svaga och egenintresserade: Yelp för telefonbokningar, EliseAI och lärplattformen Speak rapporterar nära 80 % färre avbrott än sin tidigare turbaserade stack.
Det oberoende resultatet är mindre smickrande och förtjänar att stå bredvid listan ovan snarare än under den. På Artificial Analysis Speech to Speech Index – ett sammanvägt betyg över talresonemang, agentisk prestanda, arenapreferens och uppgiftsframgång – ligger GPT-Live-1 på 69,8 %, under GPT-Realtime-2.1:s 73,9 % och långt under Grok Voice Think Fast 2.0:s 79,0 %. Läser man de två tillsammans framträder produktens form tydligt: OpenAI byggde de bästa samtalsmekanismerna som finns och byggde inte den bästa röstagenten, eftersom resonemanget delegeras till en modell som indexet betygsätter separat.

De två meddelandena är ett meddelande
Lästa tillsammans beskriver släppen samma omorganisation från två håll. Agents API flyttar loopen, sandlådan och kontexthanteringen till en hostad produkt. GPT-Live-1 flyttar den konversationella ytan till ett tunt front end som delegerar sitt tänkande någon annanstans. I båda fallen slutar modellen vara något man bygger runt och blir en komponent man väljer — och i båda fallen är valet en konfigurationsrad snarare än ett arkitektoniskt åtagande.
Det är precis i den skarven ett routinglager sitter. OrcaRouter hanterar inte gpt-live-1: Live Sessions-endpointen tillhör enbart OpenAI, och vi routar inget av det. Delegeringshalvan är en annan historia. Backenden som röstlagret lämnar över arbete till talar Responses API, och det är ett vanligt modellanrop — modellen som OpenAIs eget exempel namnger, GPT-5.6 Terra, finns tillgänglig via OrcaRouter till OpenAIs listpris på 2,00 USD per miljon input-tokens och 12,00 USD per miljon output, med Responses-endpointen exponerad. Klientdelegering går längre: den låter din applikation tillhandahålla backenden direkt, vilket innebär att modellen bakom rösten kan vara vilken endpoint du själv kontrollerar. Samma sak gäller modellplatsen i Agents API: ramverket är OpenAIs, men modellen inuti det är ett val du behåller, och ungefär 190 modeller från elva uppströmsleverantörer ligger bakom en enda nyckel till leverantörens listpris utan något påslag ovanpå.
Konkret följer tre saker av det. Backends kan A/B-testas på live-trafik genom att redigera en rad, vilket är hur du tar reda på om en billig resonemangsmotor är tillräckligt bra innan du binder en telefonlinje till den. Failover kan ligga under delegationsmodellen, så en dålig eftermiddag uppströms inte tar ner konversationen med sig. Och en uppgift kan köras mot flera backends i ett anrop via routing-DSL:en, eller besvaras av en panel av modeller samtidigt med modellfusion – användbart i samma stund som en agents utdata måste kunna litas på snarare än bara genereras.
Vad finns i varken den ena eller den andra utgåvan?
• Ingen bild- eller videoinmatning på GPT-Live-1 — den multimodala röstytan som äldre ChatGPT-lägen har är fortfarande oåtgärdad.
• Inga strukturerade utdata i röstlagret, så schemavaliderade verktygsargument måste verkställas i backendmodellen.
• Ingen åtkomst till GPT-Live-1 på gratisnivån, och hastighetsbegränsningar anges i samtidiga sessioner — 25 på nivå 1, som stiger till 500 vid nivå 5.
• Ingen Zero Data Retention och ingen dataresident utanför USA i betaversionen av Agents API.
• Ingen oberoende reproduktion av någon benchmark-siffra för GPT-Live-1.
Vadet som OpenAI gjorde den 10 september är att utvecklare vill köpa ramverket och välja hjärnan separat. Den första halvan av det är nu en budgetpost. Den andra halvan är där de kommande tolv månadernas konkurrenstryck kommer att landa – eftersom ett hostat ramverk med en utbytbar modellplats bara är så bra som de modeller man kan stoppa in i det, och just nu är det den del av stacken som OpenAI inte kontrollerar på egen hand.
Delegeringshalvan är en annan historia — backenden som röstlagret lämnar över arbete till är ett vanligt modellanrop, och GPT-5.6 Terra finns tillgänglig via OrcaRouter till OpenAI:s listpris med Responses-slutpunkten exponerad.
