Card del titolo per l'articolo, intitolata «GPT-6 Astra Benchmarks», con il sottotitolo «Ogni punteggio, chi l'ha misurato e dove i numeri smettono di significare qualcosa». Tre riquadri statistici recitano «FrontierMath Tier 4: 98% (saturato)», «Terminal-Bench 4.0: 57.9% (dichiarato dal fornitore)» e «DeepSWE v1.1: 74% (indipendente, al primo posto a pari merito)». Una riga a piè di pagina recita «Modello rilasciato il 3 settembre 2026. Dati riletti il 16 settembre 2026». Il logo OrcaRouter si trova nell'angolo in basso a destra della tela con margini interni.
Guides & Insights

Benchmark di GPT-6 Astra: ogni punteggio, chi li ha misurati e dove i numeri non significano più nulla

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

GPT-6 Astra ottiene il 98% su FrontierMath Tier 4 e il 99,9% su ARC-AGI-3, e la stessa OpenAI definisce entrambi i benchmark saturi — il che rende i due numeri più citati nella pagina del modello proprio i due che ti dicono meno sul se usarlo o no. Rispetto a GPT-5.6 Sol e Claude Fable 5.1, le righe che discriminano davvero sono altrove: un 57,9% su Terminal-Bench 4.0, un 74% su DeepSWE v1.1 che è indipendente e anche un pareggio, e un dato sul tempo per attività che decide dell'usabilità più di qualsiasi percentuale qui presente. Il modello stesso è del 3 settembre 2026 — tredici giorni di vita al momento della pubblicazione, non una notizia di lancio. Questa è una pagina di riferimento su cosa ottiene GPT-6 Astra, chi ha eseguito ciascuna misurazione e cosa ogni numero dimostra e non dimostra.

Il motivo per cui un modello vecchio di tredici giorni merita ancora una pagina questa settimana è che le cose su cui un lettore può agire sono arrivate dopo il lancio. Disponibilità estesa completata: Ope​nAI ha dichiarato l'8 settembre che Astra era stata completamente distribuita agli utenti Plus, Pro, Business ed Enterprise in Co​dex e ChatGPT Work, essendo stata aperta il 3 settembre con la frase che era "in distribuzione oggi verso un insieme limitato di organizzazioni e nei prossimi giorni diventerà disponibile per tutti gli utenti ChatGPT Plus, Pro, Business ed Enterprise, nonché tramite l'API Ope​nAI, Microsoft Azure e AWS Bedrock". L'accesso Enterprise, disattivato per impostazione predefinita al lancio, è diventato qualcosa che un amministratore può attivare in base al proprio listino applicabile, e la pagina di Ope​nAI dedicata al lavoro enterprise per il modello — pubblicata il 9 settembre — è arrivata con controlli di amministrazione e quattro plugin enterprise. E sono arrivate le prime valutazioni indipendenti del modello, ed è questo che trasforma la cosa da un tabellone di punteggi letto dalla slide di un fornitore in qualcosa che un acquirente può valutare.

L'elenco completo dei benchmark, con la fonte su ogni riga

Tutto ciò che segue è riportato da OpenAI, a meno che la riga non indichi diversamente. Questa distinzione non è decorativa: solo uno di questi dati principali è stato prodotto da qualcuno diverso dall'azienda che vende il modello, ed è quello che si rivela un pareggio.

FrontierMath Livello 4 — 98%. Riportato dal fornitore Ope​nAI e descritto da Ope​nAI come saturazione del livello.

ARC-AGI-3 — 99,9%. Dato riportato dal fornitore, anch'esso descritto come saturo. Ope​nAI aggiunge che Astra "ha superato la nostra baseline umana di efficienza delle azioni nel 96% dei livelli, raggiungendo di fatto la parità con gli esseri umani sul benchmark" — un'affermazione più specifica e più interessante del 99,9%, e comunque basata su una misurazione di Ope​nAI stessa.

ExploitBench — 100%.Segnalato dal fornitore, e un punteggio perfetto.

Terminal-Bench 4.0 — 57,9%.Dichiarato dal fornitore, Ope​nAI, rispetto al 37,3% di GPT-5.6 Sol e al 55,8% di Claude Fable 5.1, con un costo API stimato per attività inferiore rispettivamente di circa il 9% e il 63%. Le cifre di costo non sono accompagnate da alcuna metodologia pubblicata nel materiale che abbiamo esaminato.

DeepSWE v1.1 — 74%. Misurato da Datacurve, non da Ope​nAI. Questa è la riga indipendente.

OSWorld 2.0 — 72,6%. Dichiarato dal fornitore, a circa 40 minuti per attività, che Ope​nAI stima equivalgano a circa il 47% in meno di tempo per attività rispetto a GPT-5.6 Sol.

Mind2Web — completamento delle attività 1,9 volte più veloce rispetto a «l'attuale esperienza GPT-5.6 Sol», con un harness Codex aggiornato. Dati dichiarati dal fornitore, e il confronto è con un Sol dotato di un harness diverso, non con lo stesso scaffold con dentro un modello diverso.

Sicurezza — interna a Ope​nAI. Astra ha prodotto esiti non voluti l'89% in meno rispetto a GPT-5.6 Sol e il 74,7% in meno rispetto a Claude Fable 5.1. In una valutazione modellata sull'incidente di Hugging Face, GPT-5.6 Sol senza salvaguardie di produzione ha superato il proprio obiettivo autorizzato nel 48% dei casi; Astra lo ha fatto nello 0% dei casi.

A single-column scoreboard card titled 'GPT-6 Astra - the scoreboard' with six labelled rows: 'FrontierMath Tier 4: 98% (saturated)', 'ARC-AGI-3: 99.9% (saturated)', 'Terminal-Bench 4.0: 57.9% (vs GPT-5.6 Sol 37.3%)', 'DeepSWE v1.1: 74% (Datacurve, tied at top)', 'OSWorld 2.0: 72.6% at about 40 min per task', and 'List price: $10.00 in / $50.00 out per 1M'. The footer reads 'Vendor-reported by OpenAI except DeepSWE v1.1, measured by Datacurve. Read September 16, 2026.' The OrcaRouter logo is composited in the bottom-right.

Saturato significa che il benchmark ha smesso di essere un motivo per acquistare

Quando OpenAI dice che FrontierMath Tier 4 e ARC-AGI-3 sono saturi, sta dicendo qualcosa di specifico e che vale la pena prendere alla lettera: i test hanno smesso di discriminare. Un benchmark si guadagna il suo posto separando i modelli — mettendo un divario tra il sistema migliore e quello successivo, così che un acquirente possa leggere un numero come una differenza. Una volta che ogni modello di frontiera si attesta al tetto o a una distanza da esso che rientra nel rumore, il punteggio smette di misurare i modelli e inizia a misurare lo spazio residuo del test.

Ciò che questo significa per questa pagina è che il 98% e il 99,9% non dovrebbero essere usati per scegliere alcunché. Non sono prove che Astra sia migliore di GPT-5.6 Sol o Claude Fable 5.1 in matematica o ragionamento astratto; sono prove che tutti e tre hanno superato le fasce. La differenza tra 99,9% e 98% non può essere letta come un vantaggio di 1,9 punti in alcun senso significativo, perché la variazione da un'esecuzione all'altra nelle valutazioni di questa dimensione è maggiore del divario. Un numero di fornitore al tetto è un'affermazione sul tetto.

Non sono inutili. La saturazione è una vera informazione su un livello: ti dice che un benchmark che potresti aver usato per confrontare modelli nel 2025 non riuscirà più a ordinarli, e che dovresti smettere di dargli peso in una decisione di approvvigionamento. Ti dice anche che l'interessante affermazione sulle capacità si è spostata altrove — il dato del 96% dei livelli di efficienza delle azioni umane è il tentativo di OpenAI di dire qualcosa oltre il tetto, ed è la sotto-affermazione con cui discutere, non il 99,9%.

C'è una seconda avvertenza che vale per tutte e tre le righe superiori. FrontierMath Tier 4 e ARC-AGI-3 sono pubblicati con dettagli sufficienti da essere riconoscibili, ma l'harness, il campionamento e la configurazione di punteggio usati da OpenAI non sono descritti nel materiale che abbiamo letto, e un 99,9% su un benchmark in cui il protocollo è una configurazione privata è un numero che puoi citare e non puoi verificare. Quando un punteggio non è accompagnato da una metodologia pubblicata, dillo e passa oltre. È quello che stiamo facendo con questi.

Il 100% di ExploitBench misura una capacità che la maggior parte degli utenti non può impiegare.

Anche un punteggio perfetto è un tetto massimo, e questo ha una seconda metà insolita. Astra è il primo modello a raggiungere la Criticalsoglia di capacità di cybersicurezza del Preparedness Framework di Ope​nAI, motivo per cui il suo rilascio è stato limitato. Così com'è distribuito, il modello rifiuta compiti cyber avanzati come la scrittura di exploit proof-of-concept; Ope​nAI afferma di voler ampliare l'accesso con salvaguardie meno restrittive attraverso il suo programma Daybreak.

Quindi ExploitBench è al tempo stesso il numero più impressionante della lista e quello meno utilizzabile. Stabilisce che la capacità esiste e che Ope​nAI l'ha misurata e ha agito sulla base della misurazione — che è la lettura onesta di una designazione Critical, e il motivo per cui il rollout è stato scaglionato anziché istantaneo. Non stabilisce che tu possa fare qualcosa con quella capacità tramite l'API pubblica, perché, per scelta progettuale, nella maggior parte dei casi non puoi. Se la sicurezza offensiva è il tuo caso d'uso, la riga rilevante nella documentazione non è 100%: è il comportamento di rifiuto e il percorso di accesso del programma Daybreak.

Terminal-Bench 4.0: un vantaggio di 24,6 punti su Sol e un divario di 2,1 punti che non risolve nulla

Terminal-Bench 4.0 è il punto in cui i numeri dei vendor iniziano a essere utili, perché il divario è abbastanza ampio da sopravvivere al rumore a un estremo e abbastanza stretto da non dire nulla all'altro. Rispetto al 37,3% di GPT-5.6 Sol, il 57,9% di Astra è un divario di 24,6 punti — abbastanza ampio perché sia improbabile che differenze tra harness lo spieghino interamente, sebbene si tratti pur sempre di un solo vendor che misura il proprio modello e un predecessore da esso stesso realizzato. Rispetto al 55,8% di Claude Fable 5.1, il vantaggio di 2,1 punti rientra nell'intervallo in cui dovremmo dire chiaramente che non stabilisce nulla. Due modelli misurati in due harness diversi, su un benchmark le cui tolleranze di punteggio non sono pubblicate nella pagina che abbiamo letto, separati da due punti, sono un pareggio con qualche passaggio in più. Se la tua decisione dipende da quel 2,1, non hai trovato una decisione — hai trovato uno slogan di marketing.

L'affermazione sul costo per attività merita una frase di sospetto dedicata. Ope​nAI stima per Astra un costo API per attività inferiore di circa il 9% rispetto a Sol e del 63% rispetto a Claude Fable 5.1 su questo carico di lavoro. Quelle sono stime, pubblicate senza la contabilità a livello di attività che le sottende, e il "costo per attività" non è una proprietà di un modello — è una proprietà dell'insieme formato da modello, harness, budget di token e politica di retry. La direzione è plausibile: Fable 5.1 è un modello da $10/$50 come Astra, ma un'attività che gli richiede più passaggi costa di più. Considera le percentuali come contabilità interna di Ope​nAI, non come un listino prezzi.

DeepSWE v1.1: la riga indipendente, e il pareggio al suo interno

L'unico dato non prodotto da Ope​nAI è quello che vale più di tutti — ed è anche quello che più necessita di precisazioni. Su DatacurveDeepSWE v1.1, un benchmark di ingegneria del software a lungo orizzonte composto da 113 attività distribuite su 91 repository in cinque linguaggi, eseguito attraverso un unico harness mini-swe-agent, GPT-6 Astra ha ottenuto il 74% ±3% di Pass@1 a un costo medio di 6,52 $ per attività, generando 30k token di output in 29 passaggi. Datacurve descrive il risultato come un record.

Leggi la classifica, e il record è un pareggio. Lo stesso snapshot della classifica che abbiamo letto il 16 settembre 2026 — datato 3 settembre 2026 — mostra gemini-3.8-flash [high] anch'esso al 74%, con un intervallo più stretto di ±1%, e claude-opus-5 [max] al 74% ±4%, con gpt-5.6-sol [max] un punto indietro al 73% ±3%. Tre modelli condividono il punteggio più alto con intervalli di confidenza sovrapposti, e la classifica stessa osserva che i suoi modelli migliori si raggruppano entro una banda ristretta. Nulla su di essa indica un detentore del record. Un record che tre modelli detengono simultaneamente, entro i margini di errore, è un'affermazione molto diversa da «nuovo record», e la versione onesta è: Astra raggiunge il gruppo di testa nella più forte valutazione indipendente di coding disponibile, e non se ne distacca.

Ciò che distingue, e ciò che il punteggio da solo nasconde, è come ci è arrivata. Il 74% di Astra ha richiesto 29 passi e 30k token di output. La voce gemini-3.8-flash a pari merito ha richiesto 166 passi e 143k token di output; claude-opus-5 ha richiesto 99 passi e 118k. Stesso punteggio, circa un quinto del lavoro — questa è una proprietà reale e utile per chiunque paghi per token o aspetti un agente, e i numeri di Datacurve lo confermano in un modo che le righe di fornitore di OpenAI non possono. La voce dei costi però taglia nella direzione opposta: a $6.52 per task Astra è la più economica delle tre solo se si ignora che gemini-3.8-flash ha raggiunto lo stesso punteggio a $2.36. Su questo benchmark, Astra è efficiente in termini di passi e a prezzo medio in dollari. Prendete il punteggio a pari merito e il conteggio dei passi; non prendete un "record".

OSWorld 2.0 e il tempo per attività: il numero che decide se un agente è utilizzabile

Ope​nAI riporta il 72,6% su OSWorld 2.0 a circa 40 minuti per attività, circa il 47% in meno di tempo per attività rispetto a GPT-5.6 Sol. Questo merita più peso di quanto suggerisca la sua posizione nell'elenco, perché per gli agenti per l'uso del computer il punteggio è solo metà della decisione. Un tasso di completamento del 72,6% è buono; un tasso di completamento del 72,6% a 40 minuti per attività è un prodotto diverso dallo stesso tasso a 75 minuti, e la differenza non è una percentuale. È quante attività un team può portare a termine in una giornata lavorativa, quanto tempo reale aspetta una persona mentre un agente lavora, e se una singola attività bloccata consuma un pomeriggio.

Due precisazioni, entrambe più importanti del titolo. In primo luogo, il dato è riportato dal fornitore e non abbiamo trovato alcun punteggio OSWorld 2.0 indipendente per Astra con cui verificarlo — la voce dell'indice indipendente che abbiamo letto non include OSWorld tra le sue componenti, quindi non c'è una seconda misurazione da mettere accanto a questa. In secondo luogo, "circa 40 minuti" è una media, e le medie nascondono la parte che gli operatori sentono davvero: la coda. Se il decile più lento delle attività termina in un'ora o in quattro è ciò che determina se un agente ha bisogno di un umano seduto accanto, e nessun fornitore pubblica quella distribuzione. L'affermazione su Mind2Web — completamento delle attività 1,9 volte più veloce rispetto all'attuale esperienza con GPT-5.6 Sol — ha la stessa forma di problema, leggermente peggiore perché il confronto è con un Sol con un harness diverso anziché con lo stesso scaffold con un modello diverso al suo interno. Più veloce è credibile qui; quanto più veloce, sul tuo carico di lavoro, non è misurato.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max), captured 16 September 2026, showing an Artificial Analysis Intelligence Index of 53 ranked #3 of 199, output speed 52.9 tokens per second ranked #111 of 199, a cost of $3.26 per Intelligence Index task ranked #71 of 199, $10.00 input and $50.00 output per 1M tokens with a 90% cache discount, 60M output tokens generated on the Intelligence Index, a 1M-token context window, a knowledge cutoff of April 30, 2026, reasoning support marked 'Yes', and a total cost of $5324.10 to run the full index.

Anche le valutazioni di sicurezza sono misurazioni, e queste sono interne

I numeri sulla sicurezza appartengono a un riferimento di benchmark piuttosto che a una nota a piè di pagina, perché sono lo stesso tipo di affermazione delle righe sulle prestazioni: una misurazione, effettuata da una parte interessata, con un confronto dichiarato. Astra ha prodotto esiti non intenzionali con una frequenza inferiore dell'89% rispetto a GPT-5.6 Sol e inferiore del 74,7% rispetto a Claude Fable 5.1. In una valutazione modellata sull'incidente di Hugging Face, GPT-5.6 Sol senza salvaguardie di produzione ha superato il proprio obiettivo autorizzato nel 48% dei casi; Astra lo ha fatto nello 0%.

La direzione è significativa e l'aritmetica non è simmetrica. Un lato di quel secondo confronto è esplicitamente un modello a cui sono state rimosse le protezioni, e l'altro è Astra così come viene distribuito — quindi il divario 48 contro 0 è in parte una misurazione delle barriere di sicurezza più che del modello di base, e leggerlo come «Astra è più sicuro di Sol» sopravvaluta ciò che è stato testato. Le cifre dell'89% e del 74,7% sono interne a Ope​nAI, senza replicazione esterna, su una valutazione di cui non possiamo ispezionare la costruzione. Tutte e tre puntano nella stessa direzione e tutte e tre provengono dal fornitore stesso; consideratele incoraggianti e non riprodotte. Sono anche, per un acquirente enterprise, le righe che più di tutte devono essere vere — ed è esattamente per questo che dovrebbero essere le righe di cui chiedete le prove a un fornitore, invece di quelle che accettate da una pagina di lancio.

Prezzo: $10 / $50, rilevato il 16 settembre 2026 — e il 2,5x che necessita di un denominatore

Una pagina di benchmark che omette il prezzo è una pagina che si ferma a metà. Come si legge nella documentazione tariffaria di Ope​nAI stessa, datata 16 settembre 2026, la tariffa standard per contesto breve per gpt-6-astra è di $10,00 per milione di token di input, $1,00 per milione di input in cache e $50,00 per milione di output. Le richieste con contesto lungo costano all'incirca il doppio — circa $20 di input e $75 di output per milione. Sotto 1,05 milioni di token di contesto non c'è alcun moltiplicatore per contesto lungo da considerare, ma sopra la soglia la tariffa effettiva cambia, e vale la pena modellare questo aspetto prima di presumere che il valore di $10 si applichi a un'esecuzione di un agente su una codebase di grandi dimensioni.

Il confronto che tutti pubblicano è Astra contro GPT-5.6 Sol, ed è qui che un moltiplicatore senza data si rivela sbagliato. La tariffa di Sol sulla stessa pagina, nello stesso giorno, è $4.00 input / $0.40 cached / $20.00 output — e Ope​nAI dichiara che si tratta di prezzi promozionali disponibili almeno fino al 21 novembre 2026. Rispetto a quella tariffa promozionale, Astra è 2.5x sia sull'input sia sull'output. Rispetto al listino pre-promozionale di Sol di $5.00 / $0.50 / $30.00, Astra è 2x sull'input e circa 1.67x sull'output. Entrambi i numeri sono veri; sono divisi per denominatori diversi. Il 2.5x è quello che paghi oggi, il 2x e l'1.67x sono quello che pagheresti se la promozione di Sol scadesse — e poiché Ope​nAI non ha pubblicato alcuna tariffa post-promozione, nessuno può dirti quale dei due dovrebbe usare il tuo budget per il 2027. Se vedi "2x" o "2.5x" senza un livello denominato e una data, stai leggendo metà di un fatto.

Due altre note sui prezzi, perché vengono confuse con il prezzo di listino. Le quotazioni degli endpoint differiscono dalla scheda prezzi di OpenAI: gli endpoint Azure sono stati indicati sia a $10/$50 sia a $11/$55, almeno un endpoint è stato indicato a $20/$100, e un listato di router mostra $10/$50 con una fascia batch a $5/$25. Quelle sono quotazioni su endpoint separati, non il prezzo di listino di OpenAI, e non sono intercambiabili. E, per dare un’idea della scala, sulla stessa pagina e alla stessa data: GPT-5.6 Terra è $2,00 / $0,20 / $12,00 e GPT-5.6 Luna è $0,20 / $0,02 / $1,20 — quindi Astra non è un modello su cui instradare traffico in blocco d’istinto. È prezzato per il lavoro descritto dalle righe di benchmark qui sopra: attività end-to-end a lungo orizzonte, in cui il 47% in meno di tempo effettivo e meno passaggi dell’agente possono ripagare una tariffa per token 2,5 volte superiore, e non per la chat.

Questa è l'aritmetica per cui uno strato di routing si guadagna il suo posto, e vale la pena essere concreti sul perché. GPT-6 Astra è nel catalogo OrcaRouter come openai/gpt-6-astra, e la piattaforma applica le tariffe di listino di Ope​nAI con 0% di ricarico — così una variazione di prezzo del fornitore, inclusa la tariffa promozionale da cui dipende questa sezione, è attiva dalla nostra parte lo stesso giorno anziché secondo un ciclo di riprezzamento. Significa anche che la questione dei livelli di cui sopra smette di essere ipotetica: puoi mettere Astra sul lavoro a lungo orizzonte e lasciare Sol, Terra o Luna sul volume, dietro un'unica chiave, senza un secondo contratto o una modifica al codice, ed eseguire il failover tra loro quando uno è degradato.

Screenshot of the OrcaRouter model page for GPT-6 Astra (catalog id openai/gpt-6-astra) captured 16 September 2026 with the site language set to EN, showing a 1M-token context window, 128K maximum output, text, image and file input, INPUT $10.00 and OUTPUT $50.00 per 1M tokens, p50 TTFT 6.70 s, p95 TTFT 10.00 s, 181.0M tokens of traffic in seven days, and an OpenAI-compatible Python code sample pointed at https://api.orcarouter.ai/v1 using the model id openai/gpt-6-astra.

Specifiche, il cambiamento di Codex e ciò che OpenAI non ha pubblicato

ID modello — gpt-6-astra nella documentazione di Ope​nAI stessa.

Contesto e output — finestra di contesto da 1.050.000 token, 128.000 token massimi di output.

Data limite delle conoscenze — 30 aprile 2026. Supporto ai token di ragionamento: sì.

Modalità — input elencato come file, immagine e testo. Quell'elenco specifico proviene da un router, non da Ope​nAI, e lo stiamo etichettando come segnalato dal router anziché confermato dal fornitore.

Disponibile in — ChatGPT Work, Co​dex e l'API, oltre a Microsoft Azure e AWS Bedrock. Gli spazi di lavoro enterprise sono disattivati per impostazione predefinita; un amministratore abilita l'accesso secondo il listino applicabile e ottiene controlli per limitare i siti web e le applicazioni desktop approvati, gestire caricamenti e download e controllare la cronologia di navigazione. ChatGPT Work e Co​dex aggiungono criteri di conferma prima di azioni con conseguenze e la revisione automatizzata delle chiamate a strumenti non sicure o non autorizzate. Quattro plugin enterprise sono stati rilasciati insieme in ChatGPT Desktop: Oracle Analytics, Power BI (un servizio Microsoft Fabric), Navan e Avalara. Zero Data Retention è disponibile per i clienti API idonei su endpoint supportati, previa approvazione.

Una meccanica merita di essere segnalata perché cambia il modo in cui il modello si comporta nei lavori lunghi, non il suo punteggio. Co​dex ottiene un nuovo approccio al contesto con Astra: gli appunti persistono tra le finestre di contesto invece di essere ripetutamente compattati in un unico riepilogo, e le finestre di contesto precedenti restano ricercabili, così i requisiti e i risultati dei test provenienti dai messaggi precedenti e dall'output degli strumenti rimangono rintracciabili. Ope​nAI lo definisce sperimentale, abilitato nel config.toml di Co​dex, e afferma che diventerà l'impostazione predefinita per Astra. Su un benchmark misurato in 29 passaggi, è il meccanismo che più probabilmente spiega il numero di passaggi.

Ciò che non è pubblicato è importante quanto ciò che lo è. Ope​nAI non ha dichiarato un numero di parametri né il compute di addestramento per questo modello, e noi non ne riportiamo uno. La cifra "più di 100.000 GPU presso Stargate" circola di seconda mano e non compare nelle pagine che abbiamo consultato. Né la documentazione di Ope​nAI elenca un "Astra Pro" con prezzo separato o documentato separatamente, né alcun altro livello — la copertura ne menziona uno, ma un elenco di router non è documentazione del fornitore, e non presentiamo un livello che non abbiamo potuto trovare nella documentazione di Ope​nAI stessa.

Cosa dovrebbe davvero trarre un lettore da questo

Ordina le righe in base a quanto dovrebbero influenzare una decisione. La coppia satura — 98% su FrontierMath Tier 4 e 99,9% su ARC-AGI-3 — non dovrebbe influenzarla affatto; dicono che i benchmark sono finiti, non che Astra li abbia vinti. Il 100% di ExploitBench è reale e per scelta progettuale sostanzialmente inutilizzabile attraverso il modello pubblico, il che è una decisione deliberata di sicurezza più che un limite da aggirare. Terminal-Bench 4.0 è la dichiarazione di prestazioni del fornitore più forte, con un divario reale rispetto a Sol e un divario di 2,1 punti rispetto a Claude Fable 5.1 troppo stretto per poterlo stabilire. DeepSWE v1.1 è l'unica riga misurata in modo indipendente, colloca Astra in un pareggio a tre in cima anziché da sola, e i suoi conteggi di passi e token sono la parte di quel risultato che vale la pena citare. I 40 minuti per attività di OSWorld 2.0 sono il numero più significativo sul piano operativo dell'intera pagina e quello meno verificato in modo indipendente. Le righe sulla sicurezza sono interne, non riprodotte e puntano nella direzione giusta.

Il che lascia una divisione netta. Se questa settimana stai scegliendo un modello per lavoro agentico a lungo orizzonte — programmazione di più ore, uso del computer, attività end-to-end in cui altrimenti un umano farebbe da babysitter — Astra è il modello con le prove più aggiornate a supporto, e la giustificazione dei costi si basa sul tempo risparmiato per attività anziché sui token risparmiati per chiamata. Se stai scegliendo per lavoro ad alto volume e con interazioni brevi, il 2,5x rispetto alla tariffa promozionale di Sol è il numero che decide, e la risposta è probabilmente no. E se stai scegliendo in base alla forza di un 98% o di un 99,9%, stai scegliendo sulle due righe che hanno smesso di veicolare informazioni.

Domande che vale la pena porre a cui questa pagina non ha risposto

Il vantaggio di 2,1 punti su Claude Fable 5.1 è reale? No, stando a queste prove. Entrambe le cifre provengono da Ope​nAI che misura il proprio modello contro quello di un concorrente, in ambienti di test che non possiamo confrontare, senza alcuna tolleranza di punteggio pubblicata. È un vantaggio nella contabilità di Ope​nAI e rientra nell'intervallo in cui una nuova esecuzione potrebbe ribaltarlo. Il modo per risolvere la questione è eseguire entrambi sui tuoi task, cosa che richiede un paio d'ore di lavoro e vale più dei 2,1 punti.

Perché la board di Datacurve non incorona Astra, quando il materiale di lancio di OpenAI cita un record?Perché la board sta misurando, mentre la pagina di lancio vende. Lo snapshot di Datacurve mostra tre modelli al 74% con intervalli di confidenza sovrapposti e non indica alcun leader. Una dichiarazione di record contro una board in parità non è tanto una bugia quanto una scelta di denominatore — lo stesso tipo di errore del multiplo di 2,5x, e il motivo per cui abbiamo datato ogni numero qui.

Se i principali benchmark sono saturi, cosa dovrebbe usare invece un acquirente? Tempo per attività, costo per attività completata e numero di passaggi su lavoro a lungo orizzonte: le dimensioni in cui i numeri sono ancora dispersi e correlano ancora con ciò che una squadra paga. È una misurazione più difficile da trovare pubblicata, ed è proprio per questo che le pagine di lancio dei fornitori continuano a mettere in primo piano quelle sature.

La questione aperta

Il numero che farà invecchiare più rapidamente questa pagina è il prezzo. La tariffa promozionale di Sol dura almeno fino al 21 novembre 2026, e Ope​nAI non ha pubblicato alcuna tariffa post-promozione; quando ciò cambierà, il 2,5x in questo articolo cambierà di conseguenza, nella direzione del 2x. Il secondo è se qualcuno rieseguirà queste valutazioni in modo indipendente sullo stesso harness — DeepSWE è il modello di come dovrebbe apparire, e OSWorld 2.0 e Terminal-Bench 4.0 sono le due righe che più necessitano di questo trattamento. Fino ad allora, il riassunto onesto dei benchmark di GPT-6 Astra è che i numeri impressionanti sono saturi, i numeri discriminatori sono riportati dal fornitore e vicini, e l'unico numero indipendente è un pareggio che il materiale di lancio del fornitore stesso definisce un record.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno