
GPT-6 Astra vs Qwen3.8-Max: Due flagship agentici e le clausole in piccolo di ciascuno
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Settembre 2026 ha due storie "flagship agentiche", e GPT-6 Astra e Qwen3.8-Max sono i protagonisti di entrambe. OpenAI ha lanciato GPT-6 Astra il 3 settembre come il modello che, a suo dire, è il migliore al mondo per uso del computer, ingegneria del software, scienza e cybersecurity; Qwen3.8-Max di Alibaba, disponibile dal 3 agosto, è la flagship agentica del laboratorio cinese più forte — quello che Artificial Analysis colloca ai vertici del settore nel suo indice agentico e il rivale più vicino in ambito open-ecosystem alle pretese di lavoro autonomo della frontiera. Entrambi sono davvero solidi, ed entrambi sono venduti con numeri eclatanti che si ridimensionano sotto esame: il risultato del 99,9% su ARC-AGI-3 di OpenAI scende al 62,7% quando ARC Prize esegue il proprio harness neutrale, e la brillantezza agentica di Qwen3.8-Max arriva con una regressione delle allucinazioni misurata in modo indipendente e l'abitudine di impiegare 64 turni e oltre un dollaro su compiti che il suo predecessore completava in 14. Questo è un confronto tra due modelli — e tra due modi di leggere un benchmark.
I due titoli
La proposta di OpenAI per GPT-6 Astra è ampiezza più autonomia: un singolo modello che pilota un browser, scrive e corregge codice, esegue analisi scientifiche e — cosa unica — trova nuove vulnerabilità di sicurezza così bene che OpenAI ha valutato l'intero modello "critico" nel suo Preparedness Framework e ha limitato le impostazioni più avanzate a partner verificati. I materiali di lancio dichiarano un perfetto 100% su ExploitBench, 97,6% su FrontierMath Tier 4, 96,0% su GPQA Diamond e il punteggio di saturazione ARC-AGI-3. La proposta di Alibaba per Qwen3.8-Max è più ristretta ma mirata: un cavallo da lavoro agentico a $2/$6 che ottiene punteggi ai vertici o quasi dei benchmark agentici indipendenti, con i pesi sottostanti pubblicati (sotto una licenza personalizzata) invece che chiusi in una scatola nera.
Cosa dice il tabellone segnapunti indipendente
Artificial Analysis attualmente valuta GPT-6 Astra (max) con un punteggio di Intelligence pari a 61 — all'8º posto tra i 202 modelli che monitora — e Qwen3.8-Max con Intelligence 58, al 24º posto. Questo scarto di tre punti è più piccolo del divario di prezzo e più piccolo del marketing di entrambi i fornitori; nell'indice agentico separato di AA, Qwen3.8-Max registra un 58 che l'ha portato allo stesso livello dei migliori modelli proprietari di frontiera, mentre AA non pubblica ancora alcun indice agentico per GPT-6 Astra. La lettura onesta: in termini di pura intelligenza misurata, questi due modelli sono vicini, e la cornice del "modello più intelligente del mondo" nei materiali di lancio di OpenAI non è ciò che mostra la valutazione indipendente di AA.
• Intelligenza — GPT-6 Astra (max): AA Intelligence 61, posizione #8/202. Qwen3.8-Max: AA Intelligence 58, posizione #24/202; AA Agentic 58.
• Prezzo di listino — GPT-6 Astra: $10,00 / $50,00 per 1M, $1,00 letture cache, 2× sul prezzo di input oltre 272K token. Qwen3.8-Max: $2,00 / $6,00 per 1M, $0,25 letture cache.
• Contesto / output — GPT-6 Astra: 1,05M in ingresso / 128K in uscita. Qwen3.8-Max: 1M in ingresso / ~128K in uscita.
• Evidenza agenticaGPT-6 Astra: ARC-AGI-3 99,9% (harness OpenAI) contro il 62,7% (harness standard ARC Prize); WANDR 0,682 a $11,98 per attività (riportato da Perplexity). Qwen3.8-Max: AA GDPval 1.739 Elo a 64 turni per attività (~$1,14 per attività); Code Arena WebDev #1 a 1.691 Elo.
• Segnali d'allarme indipendentiGPT-6 Astra: non ancora presente nel selettore di ChatGPT, API in fase di staging, concessione sulla monitorabilità. Qwen3.8-Max: regressione delle allucinazioni AA-Omniscience dal 23% al 40% rispetto alla generazione precedente.
• Pesi — GPT-6 Astra: proprietario. Qwen3.8-Max: checkpoint di classe Max (Qwen3.8-2.4T-A95B) reso pubblico con licenza personalizzata dal 12 agosto; AA continua a elencare il modello di punta ospitato come proprietario.

Le clausole in piccolo, annotate
Prendiamo prima la cifra ARC-AGI-3, perché è l'esempio più chiaro di come un numero possa essere allo stesso tempo vero e fuorviante. OpenAI riporta il 99,9% per GPT-6 Astra sul proprio harness provider-adapter — una configurazione calibrata sul modello. ARC Prize, l'organizzazione che mantiene il benchmark, ha eseguito GPT-6 Astra sul proprio harness standard neutrale rispetto al provider e ha misurato il 62,7%. Entrambi sono all'avanguardia; nessuno dei due è un 99,9% su un harness che il produttore del modello non controlla. La stessa cautela vale per il punteggio WANDR di Perplexity, pari a 0,682 — il più alto mai registrato da Perplexity, ma misurato da un'azienda che sta contemporaneamente integrando GPT-6 Astra nei propri prodotti, e che quindi ha un interesse commerciale. Questo schema merita un nome: i numeri più spettacolari di OpenAI provengono tutti da harness controllati da OpenAI o dai suoi partner, e l'unico numero completamente indipendente — l'Intelligence 61 di AA — è semplicemente eccellente.
I dettagli in piccolo di Qwen3.8-Max vanno nella direzione opposta: i suoi punti di forza sono misurati in modo indipendente, e anche la sua debolezza è misurata in modo indipendente. Il punteggio GDPval di 1.739 Elo è autentico — ma le esecuzioni di Artificial Analysis mostrano che Qwen3.8-Max lo raggiunge spendendo 64 turni e circa 1,14 dollari per attività, contro i 14 turni e 0,53 dollari della generazione precedente. È una tassa sullo sforzo: il modello compra il suo tetto di capacità agentiche con token di ragionamento, e questo conta per chiunque paghi per token. E la valutazione Omniscience di AA ha misurato una regressione nelle allucinazioni, dal 23% al 40% rispetto alla precedente generazione Qwen — un vero campanello d'allarme indipendente proprio per i carichi di lavoro autonomi e multi-step in cui una risposta sbagliata ma sicura di sé è più costosa. Un modello che arriva a convincersi dei propri errori in 64 turni non è evidentemente più sicuro da scatenare di uno il cui produttore ammette che la sua monitorabilità è diminuita.

Prezzo, distribuzione e il modo onesto di scegliere
Sul prezzo non c’è confronto: Qwen3.8-Max a $2,00/$6,00 per milione di token costa un quinto del prezzo di input di GPT-6 Astra e un ottavo del suo prezzo di output, con un contesto da 1 milione di token che non include il sovrapprezzo di Astra per i prompt lunghi. Sul fronte del deployment, Qwen3.8-Max ha un ulteriore vantaggio questa settimana: è invocabile oggi, e su OrcaRouter è live al prezzo di listino di Alibaba, con un ricarico dello 0% e failover automatico. GPT-6 Astra, ancora in fase di rollout e non ancora selezionabile in ChatGPT per la maggior parte degli utenti al 4 settembre, è raggiungibile tramite l’API di OpenAI e i principali marketplace cloud mentre l’accesso si amplia. Il pattern pratico per un team che costruisce pipeline agentiche è mettere il carico di lavoro sul modello che puoi chiamare oggi e trattare l’altro come benchmark da osservare. Se vuoi valutare le affermazioni “agentiche” senza prenderle per buone, lo strumento giusto è un layer di routing: Qwen3.8-Max, Kimi K3, Grok 4.6 e oltre 200 altri modelli sono richiamabili con un’unica chiave su OrcaRouter, e il DSL di routing può comporne diversi in un’unica chiamata — così puoi eseguire la tua suite di task sui contendenti e leggere i risultati da solo, invece di scegliere tra le scritte in piccolo di due fornitori.
Due domande che questo confronto continua a sollevare
Perché OpenAI riporta il 99,9% su ARC-AGI-3 quando ARC Prize misura il 62,7%? Perché non sono lo stesso test. L'harness con adattatore specifico del provider di OpenAI è una versione del benchmark configurata per come GPT-6 Astra viene chiamato in produzione; l'harness standard di ARC Prize è una configurazione neutra progettata per confrontare qualsiasi modello in modo equo. Il risultato del 62,7% è quello che generalizza a "cosa succede se chiamo io stesso questo modello", ed è ancora il punteggio migliore che ARC Prize abbia registrato su quell'harness.
Qwen3.8-Max ha pesi aperti? In parte, con una clausola di licenza. Alibaba ha pubblicato il checkpoint di classe Max Qwen3.8-2.4T-A95B il 12 agosto con una licenza personalizzata: i pesi sono scaricabili, ma non si tratta dell'apertura in stile Apache-2.0 del più piccolo Qwen3.8-27B, e Artificial Analysis elenca ancora il modello di punta ospitato come proprietario. Se il tuo requisito è "posso eseguire il modello esatto per cui pago", questa distinzione conta; se il tuo requisito è "posso ispezionare l'architettura e ospitare autonomamente una variante vicina", Qwen3.8-Max è idoneo e GPT-6 Astra no.
Il punto chiave
Scegli GPT-6 Astra se ti servono le cose specifiche che oggi solo lui sa fare — lavoro di sicurezza offensiva, ragionamento scientifico all'avanguardia, i compiti più difficili di uso autonomo del computer — e la tua organizzazione può superare i suoi controlli di accesso e permettersi il suo prezzo. Scegli Qwen3.8-Max se vuoi un modello agente di alto livello che puoi davvero implementare questa settimana a $2/$6, con i pesi come via di fuga e una regressione delle allucinazioni che ora sai di dover testare. La lezione più ampia sta proprio nella stampa fine: a settembre 2026 i due principali "agenti" di punta vengono venduti con numeri di facciata che nessuno dei due produttori controlla del tutto, e l'acquirente razionale legge l'harness, conta i turni ed esegue i propri task prima di scegliere da che parte stare.

Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
