Hero-Titelkarte für den Artikel „Ope​nAI's September Platform Day“, mit dem Untertitel „GPT-Live-1 kommt in die API, die Agents API startet in der Beta“, mit einem Badge mit der Aufschrift „Beide Ankündigungen datiert auf den 10. September 2026“ und drei Karten mit der Aufschrift „GPT-Live-1 in der API: 0,05 $ pro Sprachminute, Live-Sessions-Endpunkt, eine Modell-ID“, „Agents API: öffentliche Beta, Codex-Harness, gehostete Sandboxes oder eigene mitbringen“ und „Warum es wichtig ist: Das Modell wird zu einer Komponente, die Sie auswählen, das Harness wird zu einem Produkt, das Sie mieten“, über einem Footer-Streifen mit der Aufschrift „Sprachkennzahlen von Ope​nAI gemeldet und nicht reproduziert; die Preisgestaltung der Agents API wird durchgereicht.“ Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

OpenAIs September Platform Day: GPT-Live-1 erreicht die API, während die Agents API in der Beta startet

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 10. September 2026 verließen zwei Dinge Ope​nAIs Plattform, und das leisere hat den größeren Auswirkungsradius. GPT-Live-1 – das Vollduplex-Sprachmodell, das seit dem 8. Juli in ChatGPT läuft – ist jetzt für Entwickler für 0,05 US-Dollar pro Minute Sprache aufrufbar. Daneben – und in der Berichterstattung weit weniger erwähnt – ging die Agents API in die öffentliche Beta: derselbe Harness, der Codex ausführt, jetzt als gehostetes Produkt mit verwalteten Sandboxes verfügbar. Das eine ist eine bessere Stimme. Bei dem anderen verkauft Ope​nAI das, was früher der schwierige Teil beim Bauen eines Agenten war.

Beide wurden den Primärquellen für diesen Beitrag entnommen: der Ankündigung der Agents API von Ope​nAI, dem Developer-Community-Beitrag von Ope​nAI, der GPT-Live-1 in der API vorstellt, und der Entwicklerdokumentation für beide. Wenn eine Zahl von Ope​nAI statt von einem externen Evaluator stammt, wird sie unten als solche gekennzeichnet — und eine Zahl stammt tatsächlich von außerhalb, was die Geschichte leicht verändert.

A two-column scoreboard titled 'September 10, 2026 — what Ope​nAI shipped'. The left column, labelled GPT-Live-1 in the API, reads 'What it is: full-duplex voice model', 'Access: Live Sessions API, one model ID', 'Price: $0.05 per voice minute', 'Status: generally available since Sept 10, 2026', 'Independent score: 69.8% on the Artificial Analysis Speech to Speech Index', 'Catch: delegates its thinking to a backend model'. The right column, labelled Agents API, reads 'What it is: hosted agent runtime', 'Access: public beta, Codex harness', 'Price: no API fee; sandbox time is billed', 'Status: public beta since Sept 10, 2026', 'Evidence: Ope​nAI documentation only, no independent evaluation', 'Catch: US-only data residency, no Zero Data Retention'. The footer reads 'GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced; the AA index figure is independently run.' The OrcaRouter logo is composited in the bottom-right corner.

Artificial Analysis hat dieses Jahr begonnen, einen Speech-to-Speech-Index zu veröffentlichen, und GPT-Live-1 hat darin eine Zeile: 69,8 %, ein gewichteter Durchschnitt über Sprachschlussfolgerung, agentische Leistung, Arena-Präferenz und Aufgabenerfolg. Damit belegt es Platz sieben von elf bewerteten Modellen — hinter GPT-Realtime-2.1 mit 73,9 %, dem Modell, das es ersetzt, und hinter Gr​ok Voice Think Fast 2.0 mit 79,0 %. Das unabhängige Scoreboard und Ope​nAIs eigene Benchmark-Tabelle erzählen nicht dieselbe Geschichte, und beide sind wahr.

Was ausgeliefert wurde, in der Reihenfolge, in der es Ihre Architektur verändern wird

• Sprache — GPT-Live-1 ist jetzt in der API als gpt-live-1 verfügbar, abgerechnet mit 0,05 $ pro Minute Sprache, sekundengenau, wobei das Backend-Reasoning-Modell separat nach eigenen Tarifen abgerechnet wird.

• Agents — Die Agents API ist in der öffentlichen Beta. OpenAI zufolge fallen für die API selbst keine zusätzlichen Gebühren an; Sie zahlen für Modell-Tokens, Tools und die Laufzeit gehosteter Sandbox-Container.

• Sandboxes — OpenAI hostet jetzt die Ausführungsumgebung und nutzt dieselbe Sandboxing-Infrastruktur wie Codex und ChatGPT, konfigurierbar mit Dateien, Paketen, Skills und Plugins.

• Umgebungen — neben der eigenen Sandbox von OpenAI können Teams Agenten auf ihre eigene Infrastruktur oder auf Sandbox-Anbieter von Drittanbietern in der Beta-Partnerliste ausrichten.

Das Voice-Release ist eine Modell-Story. Die Agents API ist eine Plattform-Story, und Plattform-Stories sind die, die eine Codebasis im Stillen neu ausrichten.

Die Agents API: ein Agent mit einem POST

Der zentrale Aufruf ist POST /v1/agents/sessions, gesendet mit einem Ope​nAI-Beta: agents=v1-Header, und das Versprechen lautet, dass Aufgabe, Modell, Tools und Umgebung ausreichen, um einen laufenden Agenten zurückzubekommen. SDKs decken Python, TypeScript/JavaScript, Go, Java und Ruby ab.

Was es zu mehr als einem Wrapper macht, ist, dass Ope​nAI den Harness betreibt, statt ihn auszuliefern. Der AgentKit-Harness ist Open Source und einsehbar, doch die laufende Kopie gehört Ope​nAI — Kontextkomprimierung über lange Sitzungen hinweg, Tool-Suche, programmatisches Aufrufen von Tools, MCP-Unterstützung, benutzerdefinierte Funktionen, integrierte Websuche und Subagenten-Orchestrierung mit konfigurierbarer Parallelität. Versionierte Harness-Funktionen erscheinen zusammen mit Modellstarts, und genau das ist die interessante Verpflichtung: Das Gerüst entwickelt sich im selben Takt wie die Modelle.

Für alle, die ein Quartal damit verbracht haben, eine Schleife zu pflegen – Wiederholungslogik, Kontextkürzung, Tool-Routing, das Subagenten-Fan-out, das stets Zustand verliert –, ist genau das das eigentliche Produkt. Nicht der Modellaufruf. Die Infrastruktur drumherum, die du nicht mehr schreibst.

Gehostete Sandboxen sind der Teil, an dem eine Rechnung hängt

Agenten, die Code ausführen, brauchen einen Ort, an dem sie ihn ausführen können, und die Beta bringt die eigene Antwort von Ope​nAI: eine verwaltete Sandbox, die Code ausführt, mit Dateien arbeitet und Artefakte erzeugt und sich mit Paketen, Skills und Plugins konfigurieren lässt. Entwickler, die bereits über eine gehärtete Ausführungsumgebung verfügen, werden nicht dazu gezwungen, sie zu nutzen — sowohl Bring-your-own-Infrastructure als auch eine Reihe namentlich genannter Sandbox-Partner sind in der Beta enthalten.

Zwei operative Einschränkungen sollten festgehalten werden, bevor Sie darauf aufbauen. Die Datenresidenz ist in der Beta auf die USA beschränkt, und Zero Data Retention wird nicht unterstützt. Für eine regulierte Workload entscheiden diese beiden Zeilen, ob dies ein Pilot oder ein Produktionspfad ist, und sie sind die Details, die typischerweise erst spät entdeckt werden.

GPT-Live-1 in der API: Die Pauschalabrechnung pro Minute ist die eigentliche Neuerung

Das Voice-Modell selbst ist nicht neu – es hat am 8. Juli den Advanced Voice Mode in ChatGPT ersetzt –, aber die kommerzielle Ausgestaltung schon. Unter der Realtime-Linie wurde Audio in Tokens abgerechnet, was bedeutete, dass man für die Prognose eines Anrufs den Audio-Verbrauch modellieren musste: wie viele Tokens eine Sekunde Stille kostet, wie sich die Ausgabelänge ändert, wenn ein Anrufer dem Agenten ins Wort fällt. Ein Pauschalpreis von 0,05 $ pro Sprachminute reduziert das auf eine Multiplikation. Eine Stunde durchgehend offener Leitung kostet 3,00 $. Ein Vier-Minuten-Durchschnitt bei tausend Anrufen pro Tag liegt bei rund 200 $ pro Tag.

Sitzungen laufen von einem Live-Sessions-Endpunkt aus, mit einer einzigen Modell-ID und ohne datierte Snapshots zum Anheften. Die Dokumentation deckt WebRTC, WebSockets und Telefonie/SIP als Verbindungspfade ab, und der veröffentlichte Quickstart baut den WebRTC-Pfad auf. Die Abrechnung hat zwei Zähler, und nur einer davon ist die Stimme: Jeder delegierte Reasoning-Aufruf, jeder delegierte Tool-Aufruf und jede delegierte Websuche werden zu den normalen Tarifen des Backend-Modells abgerechnet.

Die Architektur ist Delegation. GPT-Live-1 führt das Gespräch – entscheidet viele Male pro Sekunde, ob es weiterhin zuhören, pausieren, unterbrechen oder Arbeit abgeben soll – und übergibt alles, was echtes Reasoning erfordert, über eine asynchrone Grenze an ein separates Backend, das weiterarbeitet, während das gesprochene Gespräch weiterläuft. Die Dokumentation definiert zwei Modi: Responses-Delegation, bei der Ope​nAI ein unterstütztes Responses-Modell für Sie aufruft und Gesprächskontext bereitstellt, und Client-Delegation, bei der Ihre eigene Anwendung das Backend bereitstellt und die Kontrolle über Ausführung, Kontext und darüber behält, welche Ergebnisse die Sprachschicht erreichen. Im veröffentlichten Responses-Beispiel ist dieses Backend GPT-5.6 Terra, benannt in einem Delegation-Objekt zusammen mit seinen eigenen Anweisungen und Tools. Bei der Markteinführung für Verbraucher im Juli war es GPT-5.5; Community-Beiträge haben seitdem auf GPT-6 Astra verwiesen.

A screenshot of Ope​nAI's developer documentation page 'Agents' under the API section, headed 'Choose a runtime, connect tools, and manage multi-step work', showing a routing row reading 'Run an agent with the Codex harness managed by Ope​nAI — Agents API', and a comparison table with columns Agents API, Agents SDK and Responses API whose rows read 'Where the agent runs: Ope​nAI runs a managed Codex harness', 'State between tasks: saved session configuration, turns, and items' and 'Execution environment: Ope​nAI hosted sandbox, self-hosted sandbox, or no sandbox'.

Jede Schlagzeilenzahl für die Voice-Ebene stammt von OpenAI selbst und wurde zum Zeitpunkt des Verfassens von niemandem unabhängig reproduziert: 80,1 % bei der Interaktivität von Full Duplex Bench v1.5 gegenüber 45,4 % für GPT-Realtime-2.1, 0,798 Sekunden Turn-Taking-Latenz gegenüber 1,41 Sekunden, 87 % Erfolg bei Tool-Aufrufen und eine Bestehensquote von 32 % bei einer Banking-Voice-Support-Bewertung gegenüber 12,4 % für das Modell, das es ersetzt. Dieses letzte Paar ist das ehrliche – eine große Verbesserung und dennoch ein System, das bei etwa zwei Dritteln eines regulierten Arbeitsablaufs versagt. Es gibt Kundenbelege von Drittanbietern, aber sie sind dünn und eigeninteressiert: Yelp für Telefonreservierungen, EliseAI und die Lernplattform Speak berichten von fast 80 % weniger Unterbrechungen als bei ihrem vorherigen turn-basierten Stack.

Das unabhängige Ergebnis ist weniger schmeichelhaft und gehört eher neben die obige Liste als darunter. Im Artificial Analysis Speech to Speech Index – einer zusammengesetzten Punktzahl über Sprachschlussfolgerung, agentische Leistung, Arena-Präferenz und Aufgabenerfolg – liegt GPT-Live-1 bei 69,8 %, unter GPT-Realtime-2.1 mit 73,9 % und deutlich unter Grok Voice Think Fast 2.0 mit 79,0 %. Liest man beide zusammen, wird die Gestalt des Produkts klar: OpenAI hat die besten verfügbaren Konversationsmechaniken gebaut und nicht den besten Voice-Agent, weil das Reasoning an ein Modell delegiert wird, das der Index separat bewertet.

A screenshot of the Artificial Analysis Speech to Speech Index chart, updated September 2026, ranking eleven speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success rate. Bars run left to right: Grok Voice Think Fast 2.0 at 79.0%, GPT-Realtime-2.1 at 73.9%, GPT-Realtime-2 at 73.6%, Grok Voice Think Fast at 72.3%, Gemini 3.1 Flash Live at 71.5%, GPT-Live-1 mini at 70.3%, GPT-Live-1 at 69.8%, Qwen-Audio-Omni at 66.8%, RealTime Omni at 64.2%, Qwen 3.x Omni at 63.9% and Gemini 2.5 Flash at 52.6%. Companion charts show time to first audio, where GPT-Live-1 sits mid-pack at 0.78 seconds, and cost per hour of input audio, where GPT-Live-1 is $4.42 against GPT-Realtime-2.1 at $10.75.

Die beiden Ankündigungen sind eine einzige Ankündigung.

Zusammen gelesen beschreiben die Releases dieselbe Reorganisation aus zwei Richtungen. Die Agents API verlagert die Schleife, die Sandbox und die Kontextverwaltung in ein gehostetes Produkt. GPT-Live-1 verlagert die Konversationsoberfläche in ein dünnes Frontend, das sein Denken an anderer Stelle delegiert. In beiden Fällen ist das Modell nicht länger das, um das herum man baut, sondern wird zu einer Komponente, die man auswählt – und in beiden Fällen ist die Auswahl eine Konfigurationszeile statt einer architektonischen Festlegung.

Genau das ist die Naht, in der eine Routing-Schicht sitzt. OrcaRouter führt gpt-live-1 nicht: Der Live-Sessions-Endpunkt gehört allein OpenAI, und wir leiten nichts davon weiter. Die Delegationshälfte ist eine andere Geschichte. Das Backend, an das die Voice-Schicht Arbeit übergibt, spricht die Responses API, und das ist ein ganz normaler Modellaufruf — das Modell, das OpenAIs eigenes Beispiel nennt, GPT-5.6 Terra, ist über OrcaRouter zu OpenAIs Listenpreis von 2,00 $ pro Million Eingabe-Tokens und 12,00 $ pro Million Ausgabe verfügbar, mit offengelegtem Responses-Endpunkt. Die Client-Delegation geht noch weiter: Sie lässt Ihre Anwendung das Backend direkt stellen, was bedeutet, dass das Modell hinter der Stimme jeder Endpunkt sein kann, den Sie kontrollieren. Dasselbe gilt für den Modell-Slot der Agents API: Das Harness ist OpenAIs, aber das Modell darin ist eine Wahl, die bei Ihnen bleibt, und rund 190 Modelle von elf Upstream-Anbietern stehen hinter einem Schlüssel zum Listenpreis des Anbieters ohne Aufschlag obendrauf.

Konkret folgen daraus drei Dinge. Backends lassen sich per A/B-Test anhand von Live-Traffic vergleichen, indem man eine Zeile ändert; so findet man heraus, ob ein günstiger Reasoner gut genug ist, bevor man ihm eine Telefonleitung anvertraut. Failover kann unter dem Delegationsmodell sitzen, sodass ein schlechter Nachmittag upstream das Gespräch nicht mit hinunterzieht. Und eine Aufgabe kann in einem Aufruf über die Routing-DSL gegen mehrere Backends laufen oder von einem Panel von Modellen gleichzeitig mit Model Fusion beantwortet werden – nützlich, sobald der Ausgabe eines Agenten vertraut werden muss, statt sie bloß zu generieren.

Was ist in keinem der beiden Releases enthalten

• Keine Bild- oder Videoeingabe bei GPT-Live-1 — die multimodale Sprachoberfläche, die ältere ChatGPT-Modi aufweisen, bleibt weiterhin unberücksichtigt.

• Keine strukturierten Ausgaben auf der Voice-Ebene, daher müssen schema-validierte Tool-Argumente im Backend-Modell erzwungen werden.

• Kein Zugang zu GPT-Live-1 in der Free-Tier, und Rate Limits werden in gleichzeitigen Sitzungen bemessen — 25 in Tier 1, steigend auf 500 bis Tier 5.

• Keine Zero Data Retention und keine Datenresidenz außerhalb der USA in der Agents API Beta.

• Keine unabhängige Reproduktion irgendeiner GPT-Live-1-Benchmark-Zahl.

Die Wette, die OpenAI am 10. September eingegangen ist, lautet: Entwickler wollen das Harness kaufen und das Gehirn getrennt dazu wählen. Die erste Hälfte davon ist inzwischen ein eigener Posten. Die zweite Hälfte ist der Punkt, an dem der Wettbewerbsdruck der nächsten zwölf Monate ansetzen wird – denn ein gehostetes Harness mit austauschbarem Modell-Slot ist nur so gut wie die Modelle, die man hineinsetzen kann, und genau das ist derzeit der eine Teil des Stacks, den OpenAI nicht allein kontrolliert.

Die Delegationshälfte ist eine andere Sache — das Backend, an das die Sprachschicht Arbeit übergibt, ist ein normaler Modellaufruf, und GPT-5.6 Terraist über OrcaRouter zu Ope​nAIs Listenpreis verfügbar, wobei der Responses-Endpunkt exponiert wird.