Card del titolo di apertura per l'articolo «Il Platform Day di settembre di OpenAI», con sottotitolo «GPT-Live-1 arriva nell'API, l'Agents API apre in beta», con un badge che recita «Entrambi gli annunci datati 10 settembre 2026» e tre card che recitano «GPT-Live-1 nell'API: 0,05 $ al minuto vocale, endpoint Live Sessions, un solo ID modello», «Agents API: beta pubblica, harness Codex, sandbox ospitate o le tue» e «Perché conta: il modello diventa un componente che scegli, l'harness diventa un prodotto che noleggi», sopra una fascia di piè di pagina che recita «Dati vocali riportati da OpenAI e non riprodotti; il prezzo dell'Agents API è pass-through». Il logo OrcaRouter è compositato nell'angolo in basso a destra.
Guides & Insights

Il Platform Day di settembre di OpenAI: GPT-Live-1 raggiunge l'API mentre l'Agents API apre in beta

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due cose hanno lasciato la piattaforma di Ope​nAI il 10 settembre 2026, e quella più silenziosa ha il maggiore raggio d'impatto. GPT-Live-1 — il modello vocale full-duplex che gira dentro ChatGPT dall'8 luglio — ora è richiamabile dagli sviluppatori a 0,05 $ al minuto di voce. Accanto a esso, e menzionata molto meno nella copertura, l'Agents API è entrata in beta pubblica: lo stesso harness che esegue Codex, esposto come prodotto in hosting con sandbox gestiti. Una è una voce migliore. L'altra è Ope​nAI che vende la cosa che un tempo era la parte difficile della costruzione di un agente.

Entrambi sono stati ricavati dalle fonti primarie per questo articolo: l'annuncio dell'Agents API di Ope​nAI, il suo post nella community degli sviluppatori che introduce GPT-Live-1 nell'API, e la documentazione per sviluppatori di entrambi. Laddove un numero proviene da Ope​nAI anziché da un valutatore esterno, è etichettato come tale di seguito — e una cifra proviene effettivamente dall'esterno, il che cambia leggermente la storia.

A two-column scoreboard titled 'September 10, 2026 — what Ope​nAI shipped'. The left column, labelled GPT-Live-1 in the API, reads 'What it is: full-duplex voice model', 'Access: Live Sessions API, one model ID', 'Price: $0.05 per voice minute', 'Status: generally available since Sept 10, 2026', 'Independent score: 69.8% on the Artificial Analysis Speech to Speech Index', 'Catch: delegates its thinking to a backend model'. The right column, labelled Agents API, reads 'What it is: hosted agent runtime', 'Access: public beta, Codex harness', 'Price: no API fee; sandbox time is billed', 'Status: public beta since Sept 10, 2026', 'Evidence: Ope​nAI documentation only, no independent evaluation', 'Catch: US-only data residency, no Zero Data Retention'. The footer reads 'GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced; the AA index figure is independently run.' The OrcaRouter logo is composited in the bottom-right corner.

Artificial Analysis ha iniziato a pubblicare quest'anno uno Speech to Speech Index, e GPT-Live-1 vi figura con una riga: 69,8%, una media ponderata di ragionamento vocale, prestazioni agentiche, preferenza in arena e successo nei compiti. Questo lo colloca al settimo posto tra gli undici modelli valutati — dietro GPT-Realtime-2.1 al 73,9%, che è il modello che sostituisce, e dietro Gr​ok Voice Think Fast 2.0 al 79,0%. La classifica indipendente e la tabella di benchmark di Ope​nAI non raccontano la stessa storia, ed entrambe sono vere.

Cosa è stato rilasciato, nell'ordine in cui cambierà la vostra architettura

• Voce — GPT-Live-1 è disponibile nell'API come gpt-live-1, fatturato a 0,05 $ al minuto di voce, con addebito al secondo, mentre il modello di ragionamento backend viene fatturato separatamente secondo le sue tariffe.

• Agenti — l'API Agents è in beta pubblica. Ope​nAI afferma che non c'è alcun costo aggiuntivo per l'API stessa; si paga per i token del modello, gli strumenti e il tempo di container sandbox ospitati.

• Sandbox — Ope​nAI ora ospita l'ambiente di esecuzione, riutilizzando la stessa infrastruttura di sandboxing di Codex e ChatGPT, configurabile con file, pacchetti, skill e plugin.

• Ambienti — oltre alla sandbox di OpenAI stessa, i team possono indirizzare gli agenti verso la propria infrastruttura o verso fornitori di sandbox di terze parti nell'elenco dei partner beta.

Il rilascio vocale è una storia di modello. L'API Agents è una storia di piattaforma, e sono le storie di piattaforma quelle che silenziosamente riorientano una base di codice.

L'API Agents: un agente in una sola POST

La chiamata principale è POST /v1/agents/sessions, inviata con un Ope​nAI-Beta: agents=v1 header, e la promessa è che il task, il modello, gli strumenti e l'ambiente siano sufficienti per ottenere in risposta un agente in esecuzione. Gli SDK supportano Python, TypeScript/JavaScript, Go, Java e Ruby.

Ciò che lo rende più di un wrapper è che Ope​nAI gestisce l'harness invece di distribuirlo. L'harness di AgentKit è open source e ispezionabile, ma la copia in esecuzione è di Ope​nAI — compattazione del contesto su sessioni lunghe, ricerca di strumenti, chiamata programmatica di strumenti, supporto MCP, funzioni personalizzate, ricerca web integrata e orchestrazione di subagent con concorrenza configurabile. Le capacità versionate dell'harness vengono rilasciate insieme ai lanci dei modelli, il che è l'impegno interessante: l'impalcatura si muove allo stesso ritmo dei modelli.

Per chiunque abbia passato un trimestre a mantenere un loop — logica di retry, riduzione del contesto, instradamento degli strumenti, il fan-out dei subagenti che perde sempre lo stato — quello è il prodotto vero. Non la chiamata al modello. L'infrastruttura che la circonda e che non scrivi più.

Le sandbox in hosting sono la parte con un conto da pagare.

Agli agenti che eseguono codice serve un luogo in cui eseguirlo, e la beta offre la risposta di OpenAI: una sandbox gestita che esegue codice, lavora con file e produce artefatti, configurabile con pacchetti, competenze e plugin. Gli sviluppatori che dispongono già di un ambiente di esecuzione irrobustito non sono costretti a usarla — bring-your-own-infrastructure e una serie di partner sandbox designati sono entrambi presenti nella beta.

Due avvertenze operative vale la pena annotarle prima di costruirci sopra. Nella beta la residenza dei dati è solo negli Stati Uniti, e Zero Data Retention non è supportato. Per un carico di lavoro regolamentato, queste due righe decidono se si tratta di un progetto pilota o di un percorso di produzione, e sono i dettagli che tendono a essere scoperti tardi.

GPT-Live-1 nell'API: la fatturazione flat al minuto è il vero cambiamento

Il modello vocale in sé non è nuovo — ha sostituito Advanced Voice Mode all'interno di ChatGPT l'8 luglio — ma la sua forma commerciale sì. Nell'ambito della linea Realtime, l'audio veniva misurato in token, il che significava che prevedere una chiamata richiedeva modellare il consumo audio: quanti token costa un secondo di silenzio, come cambia la lunghezza dell'output se un chiamante parla sopra l'agente. Un costo fisso di $0,05 al minuto vocale riduce tutto a una moltiplicazione. Un'ora di linea continua aperta è $3,00. Una media di quattro minuti su mille chiamate al giorno è circa $200 al giorno.

Le sessioni vengono eseguite da un endpoint Live Sessions con un singolo ID modello e nessuno snapshot datato da fissare. La documentazione copre WebRTC, WebSockets e telefonia/SIP come percorsi di connessione, e la guida introduttiva pubblicata costruisce quello WebRTC. La fatturazione ha due contatori, e solo uno di essi è la voce: ogni chiamata di ragionamento delegata, invocazione di strumento e ricerca web viene fatturata alle tariffe normali del modello backend.

L'architettura è la delega. GPT-Live-1 gestisce la conversazione — decidendo molte volte al secondo se continuare ad ascoltare, mettersi in pausa, interrompere o passare il lavoro ad altri — e trasferisce tutto ciò che richiede un ragionamento reale attraverso un confine asincrono a un backend separato, che continua a lavorare mentre la conversazione vocale prosegue. La documentazione definisce due modalità: la delega Responses, in cui Ope​nAI chiama per te un modello Responses supportato e fornisce il contesto della conversazione, e la delega client, in cui è la tua applicazione a fornire il backend e a mantenere il controllo dell'esecuzione, del contesto e di quali risultati raggiungono il livello vocale. Nell'esempio Responses pubblicato, quel backend è GPT-5.6 Terra, nominato in un oggettodelegation insieme alle proprie istruzioni e ai propri strumenti. Al lancio consumer di luglio era GPT-5.5; da allora gli articoli della community hanno indicato GPT-6 Astra.

A screenshot of Ope​nAI's developer documentation page 'Agents' under the API section, headed 'Choose a runtime, connect tools, and manage multi-step work', showing a routing row reading 'Run an agent with the Codex harness managed by Ope​nAI — Agents API', and a comparison table with columns Agents API, Agents SDK and Responses API whose rows read 'Where the agent runs: Ope​nAI runs a managed Codex harness', 'State between tasks: saved session configuration, turns, and items' and 'Execution environment: Ope​nAI hosted sandbox, self-hosted sandbox, or no sandbox'.

Ogni numero chiave per il livello vocale è di Ope​nAI stesso e, al momento della stesura, non è stato riprodotto in modo indipendente da nessuno: 80,1% su Full Duplex Bench v1.5 per l'interattività contro il 45,4% di GPT-Realtime-2.1, 0,798 secondi di latenza nell'alternanza dei turni contro 1,41 secondi, 87% di successo nelle chiamate agli strumenti e un tasso di superamento del 32% su una valutazione di supporto vocale bancario contro il 12,4% del modello che sostituisce. Quest'ultima coppia è quella onesta — un grande miglioramento, e comunque un sistema che fallisce circa due terzi di un flusso di lavoro regolamentato. Esistono evidenze di clienti terzi, ma sono scarse e di parte: Yelp per le prenotazioni telefoniche, EliseAI e la piattaforma di apprendimento Speak, che segnalano quasi l'80% in meno di interruzioni rispetto al proprio precedente stack basato sui turni.

Il risultato indipendente è meno lusinghiero, e vale la pena collocarlo accanto all'elenco qui sopra anziché sotto di esso. Nell'Artificial Analysis Speech to Speech Index — un punteggio composito su ragionamento vocale, prestazioni agentiche, preferenza in arena e successo nei task — GPT-Live-1 si colloca al 69,8%, sotto il 73,9% di GPT-Realtime-2.1 e ben sotto il 79,0% di Gr​ok Voice Think Fast 2.0. Leggendo i due insieme, la forma del prodotto diventa chiara: Ope​nAI ha costruito le migliori meccaniche conversazionali disponibili e non ha costruito il miglior agente vocale, perché il ragionamento è delegato a un modello che l'indice valuta separatamente.

A screenshot of the Artificial Analysis Speech to Speech Index chart, updated September 2026, ranking eleven speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success rate. Bars run left to right: Grok Voice Think Fast 2.0 at 79.0%, GPT-Realtime-2.1 at 73.9%, GPT-Realtime-2 at 73.6%, Grok Voice Think Fast at 72.3%, Gemini 3.1 Flash Live at 71.5%, GPT-Live-1 mini at 70.3%, GPT-Live-1 at 69.8%, Qwen-Audio-Omni at 66.8%, RealTime Omni at 64.2%, Qwen 3.x Omni at 63.9% and Gemini 2.5 Flash at 52.6%. Companion charts show time to first audio, where GPT-Live-1 sits mid-pack at 0.78 seconds, and cost per hour of input audio, where GPT-Live-1 is $4.42 against GPT-Realtime-2.1 at $10.75.

I due annunci sono un unico annuncio.

Lette insieme, le release descrivono la stessa riorganizzazione da due direzioni. L'Agents API sposta il loop, la sandbox e la gestione del contesto in un prodotto in hosting. GPT-Live-1 sposta la superficie conversazionale in un front end sottile che delega altrove il proprio ragionamento. In entrambi i casi, il modello smette di essere l'elemento attorno a cui si costruisce e diventa un componente che si seleziona — e in entrambi i casi, la selezione è una riga di configurazione anziché un impegno architetturale.

È esattamente la giunzione in cui si inserisce un livello di routing. OrcaRouter non trasporta gpt-live-1: l'endpoint Live Sessions è esclusivo di Ope​nAI, e noi non ne instradiamo nulla. La parte relativa alla delega è tutta un'altra storia. Il backend a cui il livello vocale affida il lavoro parla la Responses API, e quella è una normale chiamata a un modello: il modello che l'esempio di Ope​nAI stesso indica, GPT-5.6 Terra, è disponibile tramite OrcaRouter al prezzo di listino di Ope​nAI di 2,00 $ per milione di token in input e 12,00 $ per milione in output, con l'endpoint Responses esposto. La delega lato client va oltre: consente alla tua applicazione di fornire direttamente il backend, il che significa che il modello dietro la voce può essere qualsiasi endpoint tu controlli. Lo stesso vale per lo slot del modello dell'API Agents: l'harness è di Ope​nAI, ma il modello al suo interno è una scelta che resta tua, e circa 190 modelli provenienti da undici provider upstream stanno dietro a una sola chiave al prezzo di listino del provider, senza alcun ricarico aggiuntivo.

Concretamente, da ciò derivano tre cose. I backend possono essere messi a confronto A/B sul traffico live modificando una sola riga, ed è così che scopri se un reasoner economico è abbastanza buono prima di dedicargli una linea telefonica. Il failover può stare sotto il modello di delega, così un brutto pomeriggio a monte non trascina giù con sé la conversazione. E un'attività può essere eseguita su più backend in una sola chiamata tramite il DSL di routing, oppure ricevere risposta da un panel di modelli contemporaneamente con la fusione di modelli — utile nel momento in cui l'output di un agente deve essere affidabile e non solo generato.

Cosa non è presente in nessuna delle due release

• Nessun input di immagini o video su GPT-Live-1 — la superficie vocale multimodale che le modalità ChatGPT precedenti possiedono resta ancora non affrontata.

• Nessun output strutturato sul livello vocale, quindi gli argomenti degli strumenti convalidati dallo schema devono essere imposti nel modello backend.

• Nessun accesso Free-tier a GPT-Live-1, e i limiti di frequenza sono espressi in sessioni simultanee — 25 su Tier 1, che salgono a 500 al Tier 5.

• Nessuna conservazione zero dei dati e nessuna residenza dei dati al di fuori degli Stati Uniti nella beta dell'API Agents.

• Nessuna riproduzione indipendente di qualsiasi valore di benchmark di GPT-Live-1.

La scommessa che Ope​nAI ha fatto il 10 settembre è che gli sviluppatori vogliono acquistare l'harness e scegliere il cervello separatamente. La prima metà di quella scommessa ora è una voce separata. La seconda metà è dove si abbatterà la pressione competitiva dei prossimi dodici mesi — perché un harness ospitato con uno slot per il modello intercambiabile vale solo quanto i modelli che puoi inserirvi, e in questo momento è l'unica parte dello stack che Ope​nAI non controlla da sola.

La metà relativa alla delega è tutta un'altra storia: il backend a cui il livello vocale affida il lavoro è una normale chiamata al modello, e GPT-5.6 Terra è disponibile tramite OrcaRouter al prezzo di listino di OpenAI, con l'endpoint Responses esposto.