Una card con titolo hero per "Qwen 4 Max vs Claude Opus 5", con il sottotitolo "Il benchmark che si è spostato sotto entrambi", tre badge a pillola con scritto "Revisione dell'indice v4.3.2", "51 vs 53" e "$5.00 e $25.00", e il logo di OrcaRouter nell'angolo in basso a destra.
Engineering & Research

Qwen 4 Max vs Claude Opus 5: il benchmark che si è spostato sotto entrambi

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Qwen 4 Max è stato presentato in anteprima alla conferenza Yunqi di Hangzhou il 22 settembre 2026 — il livello di punta di una linea Qwen 4 composta da quattro modelli, annunciata ma non ancora rilasciata, senza prezzo, senza finestra di contesto e senza punteggio pubblicato. Claude Opus 5 è disponibile in generale dal 24 luglio 2026 a 5,00 $ per milione di token in input e 25,00 $ per milione di token in output, ed è stato il bersaglio a cui ha puntato ogni modello di punta da quando è uscita Qwen3.8-Max. Il modo ovvio di scrivere questo confronto è una scheda tecnica con una colonna vuota. Il modo utile è notare che il 19 settembre 2026, tre giorni prima dell'annuncio, Artificial Analysis ha ricalcolato il suo Intelligence Index e Claude Opus 5 ha smesso di essere il modello in cima alla classifica. Quel singolo cambiamento ridefinisce ciò che Qwen 4 Max deve superare.

Cosa è cambiato il 19 settembre?

Artificial Analysis ha pubblicato la revisione dell'indice v4.3.2 il 19 settembre 2026. In base alla revisione attuale, Claude Opus 5 ottiene 51 sull'Intelligence Index al suo massimo sforzo di ragionamento — 50 con xhigh, 48 con high, 45 con medium e 39 con low — e si colloca dietro Claude Fable 5.1 e GPT-6 Astra, entrambi a 53. Il costo per attività su tale indice è di $5,86.

Se sembra un declassamento, non lo è. Il modello non è cambiato. È cambiato l'indice. La nostra stessa copertura di luglio e agosto citava Claude Opus 5 a 61-63 e in cima alla tabella, e quei numeri erano corretti secondo le revisioni in vigore all'epoca. Chiunque li citi ancora senza una data di revisione sta citando un dato ritirato, e questo è l'errore più comune nei confronti scritti questo mese. La conseguenza pratica è che un'affermazione come "Claude Opus 5 è il modello disponibile con il punteggio più alto" non è più vera, e un confronto costruito su di essa crolla.

Sul fronte Qwen, la conseguenza è ancora più netta. Un tier di punta annunciato a settembre 2026 è puntato verso un obiettivo che è stato ridefinito a settembre 2026. Qualunque cosa Alibaba finirà per pubblicare per Qwen 4 Max sarà letta in rapporto a una classifica in cui 53 è il numero da battere, non 63.

A two-column scoreboard titled "Qwen 4 Max vs Claude Opus 5 - the scoreboard". Left column Qwen 4 Max: Status announced, no date; Input price not published; Output price not published; Context window not published; Independent score none exists; Open weights not published. Right column Claude Opus 5: Status generally available; Input price $5.00 per 1M tokens; Output price $25.00 per 1M tokens; Context window 1M tokens; Independent score 51 on index v4.3.2; Open weights none. Footer reads "Claude Opus 5 from Anthropic published pricing and Artificial Analysis index v4.3.2, September 19 2026.", with the OrcaRouter logo bottom-right.

Il confronto, detto onestamente

Un lato di questa tabella è completo e l'altro è vuoto, e fingere il contrario sarebbe esattamente il modo in cui questo articolo fallisce. Ecco ciò che è effettivamente noto:

• Stato — Claude Opus 5 disponibile a livello generale dal 24 luglio 2026, contro Qwen 4 Max annunciato il 22 settembre 2026 senza data di rilascio

• Prezzo di input — Claude Opus 5: 5,00 $ per 1 milione di token, mentre quello di Qwen 4 Max non è pubblicato

• Prezzo di output — Claude Opus 5: 25,00 $ per 1 milione di token, mentre per Qwen 4 Max non è pubblicato

• Input in cache — Claude Opus 5 $0,50 per 1M di token per una lettura dalla cache, mentre Qwen 4 Max non è pubblicato

• Contesto — Claude Opus 5 con 1M di token sia di default sia come valore massimo, a fronte di Qwen 4 Max non pubblicato

• Limite di output — Claude Opus 5 128K token in modo sincrono e 300K sulla Batches API con un header beta, contro Qwen 4 Max non pubblicato

• Modalità — Claude Opus 5 input di testo, immagini e file con output di testo, rispetto a Qwen 4 Max non pubblicato

• Prezzi per contesto lungo — Claude Opus 5 non applica sovrapprezzi, quindi una richiesta da 900.000 token viene fatturata alla stessa tariffa per token di una da 9.000 token, mentre per Qwen 4 Max non è pubblicato.

• Punteggio indipendente — Claude Opus 5 51 sull'Artificial Analysis Intelligence Index v4.3.2 con sforzo massimo, contro Qwen 4 Max non esiste alcuna valutazione indipendente

• Punteggi dichiarati dal fornitore — Claude Opus 5 SWE-bench Verified 96,0%, SWE-bench Pro 79,2%, OSWorld 2.0 70,6%, Terminal-Bench 2.1 intorno all'85% a seconda dell'harness, contro Qwen 4 Max per cui non è stato riportato nulla

• Controllo del ragionamento — Claude Opus 5 pensiero adattivo attivo per impostazione predefinita con una scala di impegno a cinque livelli, rispetto a Qwen 4 Max non pubblicato

Dieci righe di "non pubblicato" non sono un espediente retorico. È lo stato delle prove, e la conclusione onesta che se ne trae è che nessuno può ancora fare un confronto delle capacità tra questi due modelli.

La parte del divario che non si chiuderà

I prezzi e il contesto verranno pubblicati prima o poi. Una differenza sopravvivrà al rilascio, e vale la pena deciderla ora anziché nella settimana in cui Qwen 4 Max sarà distribuito: i due modelli sono progettati per essere acquistati in modi diversi.

Claude Opus 5 è un singolo modello chiuso a un singolo prezzo da un singolo fornitore, con un impegno di dismissione pubblicato non prima del 24 luglio 2027. È un obiettivo stabile per la pianificazione della capacità. Qwen 4 Max è il flagship di una famiglia che Alibaba ha ripetutamente rilasciato su una fascia di prezzo molto più ampia — la generazione Qwen 3.8 comprende un flagship di frontiera a 2,00 $ per input e un tier Flash ben al di sotto di esso — e il tier flagship della linea Qwen è stato storicamente quello con la vita utile più breve prima che un tier più economico colmi il divario.

L'altra differenza sono i pesi aperti, e punta nella direzione opposta. La generazione Qwen 3.8 ha pubblicato i pesi del suo modello più grande con una licenza Qwen personalizzata, ed è proprio questo che rende possibile, in primo luogo, il fine-tuning, la quantizzazione e l'auto-hosting. Claude Opus 5 non ha alcun rilascio di pesi e non ne avrà uno. Se il tuo carico di lavoro richiede un modello che puoi eseguire all'interno del tuo perimetro, o modificare, si tratta di un vantaggio strutturale che nessuna revisione dei benchmark può togliere ad Alibaba — ed è la ragione più forte per interessarsi a questo particolare confronto invece di trattarlo come un flagship contro un altro.

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, English UI), showing the 1M token context badge, the model ID anthropic/claude-opus-5, a 128K maximum output, text plus image plus file input with text output, the Vision, Tools, JSON and Reasoning tags, the listing date 2026-07-24 credited to Anthropic, a p50 time-to-first-token of 5.75s, the OpenAI-compatible code sample, the Public benchmarks block, and the opening of the model description calling Claude Opus 5 Anthropic flagship for demanding reasoning, coding and long-horizon agentic work.

Come eseguire questo confronto oggi

Claude Opus 5 è ora disponibile, e OrcaRouter lo instrada come anthropic/claude-opus-5 al prezzo di listino di Anthropic con 0% di ricarico — la tariffa del provider passata inalterata, quindi le cifre di $5,00 e $25,00 sopra sono ciò che ti viene fatturato anziché un equivalente maggiorato. Questo conta più del solito per un modello in questa fascia di prezzo: un margine di piattaforma del 10 percento su una tariffa di output di $25,00 è $2,50 per milione di token, che è più dell'intero costo di input della maggior parte delle alternative open-weight. Accanto ad esso, il catalogo offre quasi 200 modelli su un unico endpoint compatibile con OpenAI, con failover automatico quando un percorso del provider si degrada e un DSL di routing per esprimere esplicitamente la policy invece di codificare in modo fisso il nome di un modello nella tua applicazione.

Ciò che OrcaRouter non offre è Qwen 4 Max, né alcun livello di Qwen 4. Il catalogo non contiene alcuna voce per questa famiglia, il che è quanto ci si aspetterebbe per un modello annunciato ma non rilasciato. Quando i livelli saranno effettivamente disponibili, compariranno nello stesso punto e, fino ad allora, il modello Qwen che vale la pena confrontare con Claude Opus 5 è quello che si può effettivamente chiamare: Qwen3.8-Max, disponibile in generale dal 3 agosto 2026 a 2,00 $ per l'input e 6,00 $ per l'output per milione di token, con pesi pubblicati e un punteggio di intelligenza indipendente registrato di 56 a 1,14 $ per attività — un dato ottenuto nell'ambito di una precedente revisione dell'indice, quindi va confrontato con il 51 di Claude Opus 5 solo con questa avvertenza.

Cosa fare con questo prima che esista una model card

Non c'è alcun verdetto da dare qui, perché uno dei due modelli non esiste come prodotto. Ciò che si può dire è che il confronto ha cambiato forma il 19 settembre 2026 senza che nessuno dei due fornitori abbia fatto nulla: Claude Opus 5 non è più il modello con il punteggio più alto sull'indice indipendente su cui si basano la maggior parte dei confronti, e ora si trova due punti dietro ad altri due modelli. Il lancio di Qwen 4 Max arriverà in quella tabella, non in quella di luglio.

Quindi la decisione per i prossimi mesi non è Qwen 4 Max contro Claude Opus 5. È Claude Opus 5 contro il modello Qwen già rilasciato — un flagship a un quinto del prezzo di input con pesi pubblicati — e quel confronto è disponibile ora, con numeri reali da entrambe le parti. Rivedila quando Alibaba pubblicherà una model card, e considera non verificata qualsiasi tabella di benchmark di Qwen 4 Max che vedi prima di allora.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the 1M token context badge, the model ID qwen/qwen3.8-max, text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, the OpenAI-compatible Python code sample, and the model description naming Qwen3.8-Max Alibaba newest flagship and highest-capability tier to date.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno