Scheda del titolo hero con scritto 'OpenAI's Decisions API', sottotitolo 'GPT-6 Luna smette di chattare e sceglie una sola risposta', con tre card arrotondate con scritto 'Una risposta da un elenco che definisci tu', 'Dichiarato dal fornitore ~150 ms' e 'Nessun prezzo pubblicato finora', un footer con scritto 'Dati OpenAI dichiarati dal fornitore; nessuna misurazione indipendente finora.', e il logo OrcaRouter compositato nell'angolo in basso a destra.
Guides & Insights

L'API Decisions di OpenAI: GPT-6 Luna smette di chattare e sceglie una sola risposta

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

GPT-6 Lunaè stato lanciato il 22 settembre 2026 come gradino economico della scala GPT-6 di OpenAI. La novità del 29 settembre è un compito affidatogli che non ha nulla a che fare con la conversazione. L'API Decisions di OpenAI prende una domanda che hai scritto, un elenco finito di risposte che consenti e un frammento di contesto — testo o un'immagine — e restituisce una di quelle risposte. Non prosa. Non un paragrafo da analizzare e sperare. Una singola scelta: così un ticket di assistenza viene instradato verso una di cinque code, un'immagine finisce in una categoria di moderazione, oppure un agente sceglie la sua prossima mossa in base a una policy che hai definito. È stato annunciato al DevDay 2026 ed è ora in anteprima limitata, con OpenAI che afferma che un rilascio ampio è previsto nei prossimi giorni.

Gran parte di ciò che serve a un team prima di costruirci sopra non è ancora pubblicato. Non c’è un prezzo per chiamata, nessun limite dichiarato su quante risposte candidate può contenere una richiesta, nessuna indicazione sulla possibilità di fine-tunarlo sui propri dati e — alla data del 30 settembre — nessuna voce al riguardo in nessuna parte dell’indice della documentazione per sviluppatori, del changelog o del riferimento API di OpenAI. Li abbiamo controllati tutti e tre. La funzionalità al momento esiste nel recap del DevDay di OpenAI e in ciò che un portavoce di OpenAI ha detto ai giornalisti il giorno del lancio. Quindi il resto di questo articolo tiene visibilmente separati tre livelli: ciò che OpenAI ha confermato, ciò che afferma una misurazione del giorno del lancio e ciò che nessuno può ancora sapere.

Che cos'è in realtà una decisione vincolata

Due approcci esistenti svolgono questo compito male, e l'API Decisions è mirata al divario tra i due. Il primo consiste nel fornire un prompt a un modello di chat: scrivi un'istruzione accurata chiedendogli di scegliere da un elenco, questo ti scrive una frase e, se sei fortunato, puoi estrarre le probabilità dei token dalla risposta per ottenere qualcosa che assomiglia a un punteggio di confidenza. Funziona, consuma token, e il numero di confidenza è una stima approssimativa. Il secondo consiste nell'addestrare un piccolo classificatore: veloce, economico, ma richiede dati etichettati più una nuova esecuzione di addestramento ogni volta che l'insieme delle etichette cambia.

Un modello decisionale si colloca tra questi. Accetta nuove etichette nel prompt — allo stesso modo in cui lo fa un prompt — ma restituisce un punteggio o una scelta su cui uno sviluppatore può diramarsi senza dover fare parsing, che è la proprietà che aveva un classificatore e che un modello di chat non ha mai avuto. OpenAI non è nuova a questa forma: la sua Moderation API restituisce punteggi per categoria anziché testo da anni, con una differenza che qui conta. Le categorie di Moderation sono di OpenAI. Le categorie della Decisions API sono le tue.

Il vincolo è il prodotto, e vale la pena essere precisi su ciò che offre e ciò che non offre. Uno spazio di output finito significa che ogni valore consentito è noto in anticipo, così la tua applicazione può rifiutare una risposta che non ha definito, assegnare un livello di autorizzazione diverso a ciascun ramo e ricorrere a un essere umano quando la confidenza o il contesto sono limitati. Rende inoltre trattabile la valutazione offline, perché ogni caso di test ha una classe target e un costo misurabile in caso di errore. Ciò che non offre è la correttezza. Un modello vincolato può comunque selezionare la risposta valida sbagliata, essere guidato da un contesto fuorviante o ereditare il bias delle categorie che hai scritto.

L'affermazione sui 150 millisecondi, e il numero che OpenAI non ha pubblicato

OpenAI afferma che l'API Decisions prende decisioni all'incirca dieci volte più velocemente di quanto faccia GPT-6 Luna tramite l'API standard — nell'ordine di 150 millisecondi contro circa 1,6 secondi. Quel dato è dichiarato dal fornitore e non riprodotto; non ne esiste alcuna misurazione indipendente nei due giorni successivi al lancio, e il riepilogo di OpenAI stesso dice soltanto "real-time decision-making". Nessuna distribuzione della latenza, nessuna regione, nessuna dimensione dell'input, nessun livello di concorrenza e nessun accordo sul livello di servizio accompagnano il numero.

I nostri dati sul traffico non sostituiscono quel test, ma spiegano perché la distribuzione mancante è importante. Nei sette giorni fino al 30 settembre, GPT-6 Luna servito attraverso la normale rotta chat-completions di OrcaRouter mostra una mediana di 699 millisecondi e un p95 di 7,6 secondi su 3,23 miliardi di token di carico misto — una differenza di più di un ordine di grandezza tra il centro e la coda. Si tratta di una forma di richiesta diversa da una decisione vincolata, quindi non è un confronto con l'affermazione dei 150 ms. È il motivo per cui un singolo p50 di riferimento è il numero sbagliato attorno a cui progettare una scadenza. Se provi l'anteprima, registra mediana, p95 e p99 separatamente per input di testo e immagini, includi il tempo di rete e i tentativi, e misura la scadenza che il tuo prodotto ha effettivamente — una decisione di instradamento per una coda asincrona e una che si trova tra un clic e un pagamento non condividono un budget di latenza.

A single-column scoreboard titled 'GPT-6 Luna and the Decisions API - the scoreboard' with six rows: Decisions API price 'not published', candidate-answer limit 'not published', fine-tuning on your data 'no statement', stated decision latency '~150 ms vendor-reported', GPT-6 Luna input / output '$0.10 / $0.50 per 1M', and AA Intelligence Index at max effort '37.3', with a footer reading 'OpenAI figures vendor-reported; Index per Artificial Analysis; unpublished means blank, not zero.' and the OrcaRouter logo composited in the bottom-right corner.

Prezzi: quanto costa il modello sottostante e perché non è il prezzo dell'API

OpenAI non ha pubblicato alcuna tariffa per l'API Decisions. Inoltre, non è sicuro presumere che si applichino le tariffe dei token Luna, perché l'API Decisions è un pacchetto a sé stante — un endpoint diverso con limiti diversi, e OpenAI ha dichiarato che condividerà maggiori dettagli "al rollout ampio". Chiunque ti quoti un costo per decisione in questo momento lo sta deducendo.

Ciò che è pubblicato è la scheda tariffaria per il modello su cui è basato, letta dalla pagina dei prezzi di OpenAI il 30 settembre 2026:

• Input — $0,10 per milione di token, che diventa $0,20 oltre 272.000 token di input
• Output — $0,50 per milione di token, che diventa $0,75 oltre 272.000 token di input
• Input in cache — $0,01 per milione di token; le scritture in cache vengono fatturate a $0,125, un sovrapprezzo del 25% rispetto alla tariffa non in cache
• Elaborazione Batch e Flex — 50% delle tariffe standard; modalità Fast — 2x le tariffe applicabili

La soglia del contesto lungo è quella che coglie di sorpresa, e funziona allo stesso modo in tutta la famiglia GPT-6: superare 272.000 token di input applica il prezzo della fascia superiore all'intera richiesta, non solo alla parte in eccesso. Un'API decisionale che passa al modello un documento lungo o un grande insieme di immagini è esattamente il tipo di chiamata che può superare quella soglia, il che è un ulteriore elemento lasciato in sospeso dai limiti non pubblicati dell'anteprima.

GPT-6 Luna alle sue condizioni

Togli l'API e il modello sottostante è un modello di ragionamento all'ultimo gradino di una famiglia a tre livelli — sotto GPT-6 Sol a $2,00/$10,00 e il modello di punta GPT-6 Astra a $10,00/$50,00 — con una finestra di contesto di 1.050.000 token, un limite di output di 128.000 token, un cutoff delle conoscenze al 18 maggio 2026 e uno sforzo di ragionamento impostabile su sei valori da none a max. Accetta input di testo e immagini e restituisce testo, e nella documentazione per sviluppatori di OpenAI stessa il valore predefinito dello sforzo è medium. Un'avvertenza pratica da quella stessa pagina, non correlata all'API Decisions ma rilevante se stai collegando Luna come fallback: su Chat Completions, la chiamata di funzioni funziona solo quando lo sforzo di ragionamento è impostato su none. Gli strumenti con qualsiasi altra impostazione dello sforzo richiedono l'API Responses.

Sulla qualità, il numero indipendente è l'Intelligence Index di Artificial Analysis: 37,3 per Luna con impegno massimo, contro 47,5 per GPT-6 Sol — un divario di circa dieci punti, che è il modo onesto di leggere il divario di prezzo di venti volte sull'input. Nessuno dei due valori è un'affermazione sulla Decisions API, il cui compito vincolato è una misurazione del tutto diversa e non ha un punteggio pubblicato.

OpenAI's developer documentation page for the gpt-6-luna model, showing the model heading with compare and playground controls, the reasoning, speed and price tiles, the '$0.1 - $0.5' price range, text and image input with text output, a 1,050,000-token context window, a 128,000-token maximum output, a May 18 2026 knowledge cutoff, the note that reasoning.effort supports none, low, medium (default), high, xhigh and max, and the note that Chat Completions supports function calling only with reasoning effort set to none.

Jev, Laya e l'inquadramento del "system one"

L'API Decisions non è arrivata in un campo vuoto. Il modello di TypeSafe AI, Jev, lanciato il 15 settembre 2026 da Diogo Almeida e disponibile in generale dal 21 settembre, è il modello che ha reso questa categoria leggibile agli sviluppatori: non genera alcun testo, restituendo invece risposte tipizzate con valori di confidenza, a $0,042 per milione di token di input con output fatturato a zero. Il primo test indipendente di Jev, eseguito da Every, ha prodotto 777 giudizi su 37 documenti in meno di 0,7 secondi per circa un quarto di centesimo, e un secondo test lo ha cronometrato a una mediana di 0,35 secondi per passaggio contro 8,83 secondi per Claude Fable 5.1 ad alto sforzo — circa 25 volte più veloce a circa 1/580 del costo, pur individuando sei dei sette difetti inseriti deliberatamente, mentre Fable 5 li ha individuati tutti e sette. "Buono ma non perfetto" è stato il verdetto di Every, ed è la giusta lettura in una riga. Laya è il terzo concorrente della stessa forma, un modello decisionale che risponde senza scrivere un token.

Che OpenAI abbia costruito la Decisions API a causa di Jev è speculazione. The New Stack, riportandolo il giorno del lancio, ha definito "probabile" una reazione a TypeSafe e ha osservato che OpenAI probabilmente ha affrettato l'annuncio prima del DevDay; OpenAI non ha detto nulla del genere, e la tempistica — la disponibilità generale di Jev il 21 settembre, il DevDay il 29 settembre — è suggestiva ma non una prova. Ciò che non è speculazione è che i due non sono ancora comparabili sull'asse che sta a cuore agli acquirenti. Jev pubblica un prezzo, una struttura per chiamata e una data di GA. La Decisions API non pubblica nessuna di queste tre.

Dove viene eseguito, e cosa tenere al caldo accanto

L'API Decisions è un pacchetto di OpenAI stessa. Non è un modello presente nel nostro catalogo e non lo instradiamo, quindi se vuoi questo specifico endpoint, è OpenAI il posto dove si trova. Il modello su cui è costruita è un'altra questione: GPT-6 Luna è una rotta attiva su OrcaRouter al prezzo di listino di OpenAI, senza alcun ricarico applicato — 0,10 $ per l'input e 0,50 $ per l'output per milione di token, con la fascia >272K applicata a 0,20 $/0,75 $ — e nei sette giorni fino al 30 settembre ha erogato 3,23 miliardi di token tramite noi con un tasso di errore dello 0,18%.

Questo conta per come si riducono i rischi di una preview. Il modo sensato di testare un endpoint per decisioni vincolate è mantenere caldo il percorso basato su prompt come fallback, perché una preview può cambiare limiti o prezzi senza preavviso e una decisione che si trova su un percorso critico ha bisogno di un posto dove andare. Mantenere quel fallback sulla stessa chiave dei tuoi altri modelli significa nessun secondo contratto e nessuna modifica al codice del percorso di fallback: una sola API per oltre 200 modelli, con failover automatico tra i provider quando uno vacilla. E se la tua decisione è un passo di una catena più lunga, il DSL di routing compone i modelli in un'unica chiamata, che è esattamente il pattern orchestratore-più-decisore reso popolare dalla copertura di Jev — un modello più grande che pianifica, un modello piccolo che sceglie ogni passo. Quel pattern è realizzabile oggi con i modelli che serviamo; la Decisions API stessa resterebbe fuori da esso finché OpenAI non la apre.

Chi dovrebbe muoversi, e chi dovrebbe aspettare

Se il tuo problema è un'attività di classificazione o instradamento ad alto volume in cui un ramo sbagliato è economico e reversibile, l'anteprima vale una forma di richiesta e un set etichettato questa settimana — la funzionalità è reale, il vincolo è un miglioramento autentico rispetto all'analisi di prosa, e un'anteprima è il momento più economico possibile per scoprire dove ricadono i costi dei suoi errori. Se la tua decisione autorizza denaro, invia messaggi a un cliente o si colloca tra un utente e un pagamento, nulla di questa settimana cambia il tuo calcolo: non c'è un prezzo pubblicato da modellare, nessun limite pubblicato su cui progettare, nessun SLA e nessuna indicazione se puoi mettere a punto la cosa sui tuoi dati. Quei quattro vuoti sono ciò che una "distribuzione su vasta scala" deve colmare, e finché OpenAI non li nomina, la lettura onesta della Decisions API è un'interfaccia promettente con un orologio veloce dichiarato dal fornitore e nessuna fattura allegata.

OrcaRouter's model page for openai/gpt-6-luna, showing the model name and OpenAI attribution dated 2026-09-22, capability pills for vision, tools, JSON and reasoning, the description of GPT-6 Luna as the fast cost-efficient model below GPT-6 Sol, the /v1/chat/completions route, a $0.10 input and $0.50 output rate per million tokens with a 699 ms p50 time to first token, a 1M-token context with 128K maximum output, and 3234.7M tokens of traffic.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno