
Qwen 4 Max vs Claude Opus 5: il benchmark che si è spostato sotto entrambi
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen 4 Max è stato presentato in anteprima alla conferenza Yunqi di Hangzhou il 22 settembre 2026 — il livello di punta di una linea Qwen 4 composta da quattro modelli, annunciata ma non ancora rilasciata, senza prezzo, senza finestra di contesto e senza punteggio pubblicato. Claude Opus 5 è disponibile in generale dal 24 luglio 2026 a 5,00 $ per milione di token in input e 25,00 $ per milione di token in output, ed è stato il bersaglio a cui ha puntato ogni modello di punta da quando è uscita Qwen3.8-Max. Il modo ovvio di scrivere questo confronto è una scheda tecnica con una colonna vuota. Il modo utile è notare che il 19 settembre 2026, tre giorni prima dell'annuncio, Artificial Analysis ha ricalcolato il suo Intelligence Index e Claude Opus 5 ha smesso di essere il modello in cima alla classifica. Quel singolo cambiamento ridefinisce ciò che Qwen 4 Max deve superare.
Cosa è cambiato il 19 settembre?
Artificial Analysis ha pubblicato la revisione dell'indice v4.3.2 il 19 settembre 2026. In base alla revisione attuale, Claude Opus 5 ottiene 51 sull'Intelligence Index al suo massimo sforzo di ragionamento — 50 con xhigh, 48 con high, 45 con medium e 39 con low — e si colloca dietro Claude Fable 5.1 e GPT-6 Astra, entrambi a 53. Il costo per attività su tale indice è di $5,86.
Se sembra un declassamento, non lo è. Il modello non è cambiato. È cambiato l'indice. La nostra stessa copertura di luglio e agosto citava Claude Opus 5 a 61-63 e in cima alla tabella, e quei numeri erano corretti secondo le revisioni in vigore all'epoca. Chiunque li citi ancora senza una data di revisione sta citando un dato ritirato, e questo è l'errore più comune nei confronti scritti questo mese. La conseguenza pratica è che un'affermazione come "Claude Opus 5 è il modello disponibile con il punteggio più alto" non è più vera, e un confronto costruito su di essa crolla.
Sul fronte Qwen, la conseguenza è ancora più netta. Un tier di punta annunciato a settembre 2026 è puntato verso un obiettivo che è stato ridefinito a settembre 2026. Qualunque cosa Alibaba finirà per pubblicare per Qwen 4 Max sarà letta in rapporto a una classifica in cui 53 è il numero da battere, non 63.

Il confronto, detto onestamente
Un lato di questa tabella è completo e l'altro è vuoto, e fingere il contrario sarebbe esattamente il modo in cui questo articolo fallisce. Ecco ciò che è effettivamente noto:
• Stato — Claude Opus 5 disponibile a livello generale dal 24 luglio 2026, contro Qwen 4 Max annunciato il 22 settembre 2026 senza data di rilascio
• Prezzo di input — Claude Opus 5: 5,00 $ per 1 milione di token, mentre quello di Qwen 4 Max non è pubblicato
• Prezzo di output — Claude Opus 5: 25,00 $ per 1 milione di token, mentre per Qwen 4 Max non è pubblicato
• Input in cache — Claude Opus 5 $0,50 per 1M di token per una lettura dalla cache, mentre Qwen 4 Max non è pubblicato
• Contesto — Claude Opus 5 con 1M di token sia di default sia come valore massimo, a fronte di Qwen 4 Max non pubblicato
• Limite di output — Claude Opus 5 128K token in modo sincrono e 300K sulla Batches API con un header beta, contro Qwen 4 Max non pubblicato
• Modalità — Claude Opus 5 input di testo, immagini e file con output di testo, rispetto a Qwen 4 Max non pubblicato
• Prezzi per contesto lungo — Claude Opus 5 non applica sovrapprezzi, quindi una richiesta da 900.000 token viene fatturata alla stessa tariffa per token di una da 9.000 token, mentre per Qwen 4 Max non è pubblicato.
• Punteggio indipendente — Claude Opus 5 51 sull'Artificial Analysis Intelligence Index v4.3.2 con sforzo massimo, contro Qwen 4 Max non esiste alcuna valutazione indipendente
• Punteggi dichiarati dal fornitore — Claude Opus 5 SWE-bench Verified 96,0%, SWE-bench Pro 79,2%, OSWorld 2.0 70,6%, Terminal-Bench 2.1 intorno all'85% a seconda dell'harness, contro Qwen 4 Max per cui non è stato riportato nulla
• Controllo del ragionamento — Claude Opus 5 pensiero adattivo attivo per impostazione predefinita con una scala di impegno a cinque livelli, rispetto a Qwen 4 Max non pubblicato
Dieci righe di "non pubblicato" non sono un espediente retorico. È lo stato delle prove, e la conclusione onesta che se ne trae è che nessuno può ancora fare un confronto delle capacità tra questi due modelli.
La parte del divario che non si chiuderà
I prezzi e il contesto verranno pubblicati prima o poi. Una differenza sopravvivrà al rilascio, e vale la pena deciderla ora anziché nella settimana in cui Qwen 4 Max sarà distribuito: i due modelli sono progettati per essere acquistati in modi diversi.
Claude Opus 5 è un singolo modello chiuso a un singolo prezzo da un singolo fornitore, con un impegno di dismissione pubblicato non prima del 24 luglio 2027. È un obiettivo stabile per la pianificazione della capacità. Qwen 4 Max è il flagship di una famiglia che Alibaba ha ripetutamente rilasciato su una fascia di prezzo molto più ampia — la generazione Qwen 3.8 comprende un flagship di frontiera a 2,00 $ per input e un tier Flash ben al di sotto di esso — e il tier flagship della linea Qwen è stato storicamente quello con la vita utile più breve prima che un tier più economico colmi il divario.
L'altra differenza sono i pesi aperti, e punta nella direzione opposta. La generazione Qwen 3.8 ha pubblicato i pesi del suo modello più grande con una licenza Qwen personalizzata, ed è proprio questo che rende possibile, in primo luogo, il fine-tuning, la quantizzazione e l'auto-hosting. Claude Opus 5 non ha alcun rilascio di pesi e non ne avrà uno. Se il tuo carico di lavoro richiede un modello che puoi eseguire all'interno del tuo perimetro, o modificare, si tratta di un vantaggio strutturale che nessuna revisione dei benchmark può togliere ad Alibaba — ed è la ragione più forte per interessarsi a questo particolare confronto invece di trattarlo come un flagship contro un altro.

Come eseguire questo confronto oggi
Claude Opus 5 è ora disponibile, e OrcaRouter lo instrada come anthropic/claude-opus-5 al prezzo di listino di Anthropic con 0% di ricarico — la tariffa del provider passata inalterata, quindi le cifre di $5,00 e $25,00 sopra sono ciò che ti viene fatturato anziché un equivalente maggiorato. Questo conta più del solito per un modello in questa fascia di prezzo: un margine di piattaforma del 10 percento su una tariffa di output di $25,00 è $2,50 per milione di token, che è più dell'intero costo di input della maggior parte delle alternative open-weight. Accanto ad esso, il catalogo offre quasi 200 modelli su un unico endpoint compatibile con OpenAI, con failover automatico quando un percorso del provider si degrada e un DSL di routing per esprimere esplicitamente la policy invece di codificare in modo fisso il nome di un modello nella tua applicazione.
Ciò che OrcaRouter non offre è Qwen 4 Max, né alcun livello di Qwen 4. Il catalogo non contiene alcuna voce per questa famiglia, il che è quanto ci si aspetterebbe per un modello annunciato ma non rilasciato. Quando i livelli saranno effettivamente disponibili, compariranno nello stesso punto e, fino ad allora, il modello Qwen che vale la pena confrontare con Claude Opus 5 è quello che si può effettivamente chiamare: Qwen3.8-Max, disponibile in generale dal 3 agosto 2026 a 2,00 $ per l'input e 6,00 $ per l'output per milione di token, con pesi pubblicati e un punteggio di intelligenza indipendente registrato di 56 a 1,14 $ per attività — un dato ottenuto nell'ambito di una precedente revisione dell'indice, quindi va confrontato con il 51 di Claude Opus 5 solo con questa avvertenza.
Cosa fare con questo prima che esista una model card
Non c'è alcun verdetto da dare qui, perché uno dei due modelli non esiste come prodotto. Ciò che si può dire è che il confronto ha cambiato forma il 19 settembre 2026 senza che nessuno dei due fornitori abbia fatto nulla: Claude Opus 5 non è più il modello con il punteggio più alto sull'indice indipendente su cui si basano la maggior parte dei confronti, e ora si trova due punti dietro ad altri due modelli. Il lancio di Qwen 4 Max arriverà in quella tabella, non in quella di luglio.
Quindi la decisione per i prossimi mesi non è Qwen 4 Max contro Claude Opus 5. È Claude Opus 5 contro il modello Qwen già rilasciato — un flagship a un quinto del prezzo di input con pesi pubblicati — e quel confronto è disponibile ora, con numeri reali da entrambe le parti. Rivedila quando Alibaba pubblicherà una model card, e considera non verificata qualsiasi tabella di benchmark di Qwen 4 Max che vedi prima di allora.

Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
