Hjälterubrikkort för artikeln 'Ope​nAI:s septemberplattformsdag', med underrubriken 'GPT-Live-1 når API:et, Agents API öppnar i beta', ett märke med texten 'Båda tillkännagivandena daterade den 10 september 2026' och tre kort med texterna 'GPT-Live-1 i API:et: $0,05 per röstminut, Live Sessions-slutpunkt, ett modell-ID', 'Agents API: offentlig beta, Codex-harness, hostade sandlådor eller ta med din egen' och 'Varför det spelar roll: modellen blir en komponent du väljer, harnessen blir en produkt du hyr', ovanför en sidfotsremsa med texten 'Röstsiffror Ope​nAI-rapporterade och ej reproducerade; prissättningen för Agents API är vidarefakturerad.' OrcaRouter-logotypen är komponerad i nedre högra hörnet.
Guides & Insights

Ope​nAI:s september Platform Day: GPT-Live-1 når API:et när Agents API öppnas i beta

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Två saker lämnade Ope​nAI:s plattform den 10 september 2026, och den tystare har den större sprängradien. GPT-Live-1 — den full-duplexa röstmodellen som har körts inuti ChatGPT sedan den 8 juli — kan nu anropas av utvecklare för 0,05 dollar per röstminut. Vid sidan av den, och med långt färre omnämnanden i bevakningen, gick Agents API in i offentlig beta: samma ramverk som driver Codex, exponerat som en hostad produkt med hanterade sandlådor. Den ena är en bättre röst. Den andra är Ope​nAI som säljer det som brukade vara den svåra delen av att bygga en agent.

Båda lästes från primärkällorna för den här artikeln: Ope​nAIs Agents API-tillkännagivande, dess utvecklargemenskapsinlägg som introducerar GPT-Live-1 i API:et, och utvecklardokumentationen för båda. Där en siffra kommer från Ope​nAI i stället för en extern utvärderare märks den som sådan nedan — och en siffra kommer faktiskt utifrån, vilket förändrar historien något.

A two-column scoreboard titled 'September 10, 2026 — what Ope​nAI shipped'. The left column, labelled GPT-Live-1 in the API, reads 'What it is: full-duplex voice model', 'Access: Live Sessions API, one model ID', 'Price: $0.05 per voice minute', 'Status: generally available since Sept 10, 2026', 'Independent score: 69.8% on the Artificial Analysis Speech to Speech Index', 'Catch: delegates its thinking to a backend model'. The right column, labelled Agents API, reads 'What it is: hosted agent runtime', 'Access: public beta, Codex harness', 'Price: no API fee; sandbox time is billed', 'Status: public beta since Sept 10, 2026', 'Evidence: Ope​nAI documentation only, no independent evaluation', 'Catch: US-only data residency, no Zero Data Retention'. The footer reads 'GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced; the AA index figure is independently run.' The OrcaRouter logo is composited in the bottom-right corner.

Artificial Analysis började publicera ett Speech to Speech Index i år, och GPT-Live-1 har en rad där: 69,8 %, ett viktat genomsnitt över talresonemang, agentisk prestanda, arenapreferens och uppgiftsframgång. Det placerar den på sjunde plats av de elva modeller som poängsatts – bakom GPT-Realtime-2.1 på 73,9 %, vilket är modellen den ersätter, och bakom Gr​ok Voice Think Fast 2.0 på 79,0 %. Den oberoende resultattavlan och Ope​nAI:s egen benchmarktabell berättar inte samma historia, och båda är sanna.

Vad som har släppts, i den ordning det kommer att förändra din arkitektur

• Röst — GPT-Live-1 är live i API:et som gpt-live-1, faktureras med $0,05 per minut röst, debiteras per sekund, med backend-resonemangsmodellen fakturerad separat enligt sina egna priser.

• Agents – Agents-API:et är i offentlig beta. Ope​nAI säger att det inte tillkommer någon extra avgift för själva API:et; du betalar för modelltokens, verktyg och tid i värdbaserade sandbox-containrar.

• Sandboxar — OpenAI tillhandahåller nu exekveringsmiljön och återanvänder samma sandbox-infrastruktur som Codex och ChatGPT, konfigurerbar med filer, paket, färdigheter och plugins.

• Miljöer — förutom OpenAI:s egen sandlåda kan team rikta agenter mot sin egen infrastruktur eller mot tredjepartsleverantörer av sandlådor i betapartnerlistan.

Röstsläppet är en modellhistoria. Agents API är en plattformshistoria, och plattformshistorier är de som i tysthet pekar om en kodbas.

Agents API: en agent i en POST

Det centrala anropet är POST /v1/agents/sessions, som skickas med headern Ope​nAI-Beta: agents=v1, och poängen är att uppgift, modell, verktyg och miljö räcker för att få tillbaka en körande agent. SDK:er finns för Python, TypeScript/JavaScript, Go, Java och Ruby.

Det som gör det mer än en wrapper är att Ope​nAI driver harnessen i stället för att leverera den. AgentKit-harnessen är öppen källkod och möjlig att granska, men den körande kopian tillhör Ope​nAI — kontextkomprimering över långa sessioner, verktygssökning, programmatiska verktygsanrop, MCP-stöd, anpassade funktioner, inbyggd webbsökning och orkestrering av underagenter med konfigurerbar samtidighet. Versionerade harness-funktioner lanseras tillsammans med modellanseringar, vilket är det intressanta åtagandet: stödstrukturen rör sig i samma takt som modellerna.

För alla som har lagt ett kvartal på att underhålla en loop – retry-logik, kontexttrimning, verktygsroutning, subagent-fan-outen som alltid läcker state – är det den faktiska produkten. Inte modellanropet. Rördragningen runt det som du inte längre skriver.

Värdbaserade sandlådor är den del som har en räkning kopplad till sig.

Agenter som exekverar kod behöver någonstans att exekvera den, och betan levererar Ope​nAI:s eget svar: en hanterad sandbox som kör kod, arbetar med filer och producerar artefakter, konfigurerbar med paket, färdigheter och plugins. Utvecklare som redan har en härdad exekveringsmiljö tvingas inte att använda den — egen infrastruktur och en uppsättning namngivna sandbox-partner finns båda i betan.

Två operativa förbehåll är värda att dokumentera innan du bygger vidare på det. Data residency i betan är endast USA, och Zero Data Retention stöds inte. För en reglerad arbetsbelastning avgör dessa två rader om detta är en pilot eller en väg till produktion, och det är detaljerna som tenderar att upptäckas sent.

GPT-Live-1 i API:et: fast minutpris är den verkliga förändringen

Röstmodellen i sig är inte ny – den ersatte Advanced Voice Mode i ChatGPT den 8 juli – men den kommersiella formen är ny. Under Realtime-linjen mättes ljud i tokens, vilket innebar att prognostisera ett samtal krävde modellering av ljudförbrukning: hur många tokens en sekunds tystnad kostar, hur en uppringare som talar över agenten förändrar utdatans längd. Ett fast pris på 0,05 USD per röstminut kokar ned det till en multiplikation. En timmes oavbruten öppen linje kostar 3,00 USD. Ett genomsnitt på fyra minuter över tusen samtal per dag landar på cirka 200 USD per dag.

Sessioner körs från en Live Sessions-slutpunkt med ett enda modell-ID och inga daterade snapshots att låsa. Dokumentationen täcker WebRTC, WebSockets och telefoni/SIP som anslutningsvägar, och den publicerade snabbstarten bygger den för WebRTC. Faktureringen har två mätare, och endast en av dem är rösten: varje delegerat resonemangsanrop, verktygsanrop och webbsökning faktureras enligt backendmodellens normala priser.

Arkitekturen är delegering. GPT-Live-1 sköter konversationen — den avgör många gånger i sekunden om den ska fortsätta lyssna, pausa, avbryta eller lämna över arbete — och skickar allt som kräver riktigt resonemang över en asynkron gräns till en separat backend, som fortsätter arbeta medan det talade samtalet fortsätter. Dokumentationen definierar två lägen: Responses-delegering, där Ope​nAI anropar en Responses-modell som stöds åt dig och tillhandahåller samtalskontext, och klientdelegering, där din egen applikation tillhandahåller backenden och behåller kontrollen över exekvering, kontext och vilka resultat som når röstlagret. I det publicerade Responses-exemplet är den backenden GPT-5.6 Terra, namngiven i ett delegation-objekt tillsammans med sina egna instruktioner och verktyg. Vid konsumentlanseringen i juli var det GPT-5.5; community-sammanställningar sedan dess har pekat på GPT-6 Astra.

A screenshot of Ope​nAI's developer documentation page 'Agents' under the API section, headed 'Choose a runtime, connect tools, and manage multi-step work', showing a routing row reading 'Run an agent with the Codex harness managed by Ope​nAI — Agents API', and a comparison table with columns Agents API, Agents SDK and Responses API whose rows read 'Where the agent runs: Ope​nAI runs a managed Codex harness', 'State between tasks: saved session configuration, turns, and items' and 'Execution environment: Ope​nAI hosted sandbox, self-hosted sandbox, or no sandbox'.

Varje framträdande siffra för röstlagret är OpenAI:s egen och har vid tidpunkten för skrivandet inte oberoende reproducerats av någon: 80,1 % i interaktivitet på Full Duplex Bench v1.5 mot 45,4 % för GPT-Realtime-2.1, 0,798 sekunders latens vid turtagning mot 1,41 sekunder, 87 % lyckade verktygsanrop och en godkännandegrad på 32 % i en utvärdering av röstsupport för bank mot 12,4 % för modellen den ersätter. Det sista paret är det ärliga – en stor förbättring, och fortfarande ett system som misslyckas i ungefär två tredjedelar av ett reglerat arbetsflöde. Bevis från tredjepartskunder finns men är svaga och egenintresserade: Yelp för telefonbokningar, EliseAI och lärplattformen Speak rapporterar nära 80 % färre avbrott än sin tidigare turbaserade stack.

Det oberoende resultatet är mindre smickrande och förtjänar att stå bredvid listan ovan snarare än under den. På Artificial Analysis Speech to Speech Index – ett sammanvägt betyg över talresonemang, agentisk prestanda, arenapreferens och uppgiftsframgång – ligger GPT-Live-1 på 69,8 %, under GPT-Realtime-2.1:s 73,9 % och långt under Gr​ok Voice Think Fast 2.0:s 79,0 %. Läser man de två tillsammans framträder produktens form tydligt: Ope​nAI byggde de bästa samtalsmekanismerna som finns och byggde inte den bästa röstagenten, eftersom resonemanget delegeras till en modell som indexet betygsätter separat.

A screenshot of the Artificial Analysis Speech to Speech Index chart, updated September 2026, ranking eleven speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success rate. Bars run left to right: Grok Voice Think Fast 2.0 at 79.0%, GPT-Realtime-2.1 at 73.9%, GPT-Realtime-2 at 73.6%, Grok Voice Think Fast at 72.3%, Gemini 3.1 Flash Live at 71.5%, GPT-Live-1 mini at 70.3%, GPT-Live-1 at 69.8%, Qwen-Audio-Omni at 66.8%, RealTime Omni at 64.2%, Qwen 3.x Omni at 63.9% and Gemini 2.5 Flash at 52.6%. Companion charts show time to first audio, where GPT-Live-1 sits mid-pack at 0.78 seconds, and cost per hour of input audio, where GPT-Live-1 is $4.42 against GPT-Realtime-2.1 at $10.75.

De två meddelandena är ett meddelande

Lästa tillsammans beskriver släppen samma omorganisation från två håll. Agents API flyttar loopen, sandlådan och kontexthanteringen till en hostad produkt. GPT-Live-1 flyttar den konversationella ytan till ett tunt front end som delegerar sitt tänkande någon annanstans. I båda fallen slutar modellen vara något man bygger runt och blir en komponent man väljer — och i båda fallen är valet en konfigurationsrad snarare än ett arkitektoniskt åtagande.

Det är precis i den skarven ett routinglager sitter. OrcaRouter hanterar inte gpt-live-1: Live Sessions-endpointen tillhör enbart Ope​nAI, och vi routar inget av det. Delegeringshalvan är en annan historia. Backenden som röstlagret lämnar över arbete till talar Responses API, och det är ett vanligt modellanrop — modellen som Ope​nAIs eget exempel namnger, GPT-5.6 Terra, finns tillgänglig via OrcaRouter till Ope​nAIs listpris på 2,00 USD per miljon input-tokens och 12,00 USD per miljon output, med Responses-endpointen exponerad. Klientdelegering går längre: den låter din applikation tillhandahålla backenden direkt, vilket innebär att modellen bakom rösten kan vara vilken endpoint du själv kontrollerar. Samma sak gäller modellplatsen i Agents API: ramverket är Ope​nAIs, men modellen inuti det är ett val du behåller, och ungefär 190 modeller från elva uppströmsleverantörer ligger bakom en enda nyckel till leverantörens listpris utan något påslag ovanpå.

Konkret följer tre saker av det. Backends kan A/B-testas på live-trafik genom att redigera en rad, vilket är hur du tar reda på om en billig resonemangsmotor är tillräckligt bra innan du binder en telefonlinje till den. Failover kan ligga under delegationsmodellen, så en dålig eftermiddag uppströms inte tar ner konversationen med sig. Och en uppgift kan köras mot flera backends i ett anrop via routing-DSL:en, eller besvaras av en panel av modeller samtidigt med modellfusion – användbart i samma stund som en agents utdata måste kunna litas på snarare än bara genereras.

Vad finns i varken den ena eller den andra utgåvan?

• Ingen bild- eller videoinmatning på GPT-Live-1 — den multimodala röstytan som äldre ChatGPT-lägen har är fortfarande oåtgärdad.

• Inga strukturerade utdata i röstlagret, så schemavaliderade verktygsargument måste verkställas i backendmodellen.

• Ingen åtkomst till GPT-Live-1 på gratisnivån, och hastighetsbegränsningar anges i samtidiga sessioner — 25 på nivå 1, som stiger till 500 vid nivå 5.

• Ingen Zero Data Retention och ingen dataresident utanför USA i betaversionen av Agents API.

• Ingen oberoende reproduktion av någon benchmark-siffra för GPT-Live-1.

Vadet som OpenAI gjorde den 10 september är att utvecklare vill köpa ramverket och välja hjärnan separat. Den första halvan av det är nu en budgetpost. Den andra halvan är där de kommande tolv månadernas konkurrenstryck kommer att landa – eftersom ett hostat ramverk med en utbytbar modellplats bara är så bra som de modeller man kan stoppa in i det, och just nu är det den del av stacken som OpenAI inte kontrollerar på egen hand.

Delegeringshalvan är en annan historia — backenden som röstlagret lämnar över arbete till är ett vanligt modellanrop, och GPT-5.6 Terra finns tillgänglig via OrcaRouter till Ope​nAI:s listpris med Responses-slutpunkten exponerad.