Hero card intitolata Claude Sonnet 5.5 vs Qwen3.8 Max, con sottotitolo sei settimane due livelli un verdetto sul costo, con pillole che riportano input $2 entrambi, output $10 vs $6, e Index 56 vs 45, e un footer che cita Artificial Analysis v4.3.2 e i prezzi del fornitore.
Guides & Insights

Claude Sonnet 5.5 vs Qwen3.8 Max: sei settimane, due livelli, un verdetto sul costo

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Fai i calcoli su tre prompt e il confronto si risolve per lo più prima ancora di arrivare ai benchmark. Una breve chiamata per una risposta di supporto: 2.000 token di input, 500 di output. Su Qwen3.8 Max a 2 $ per milione in input e 6 $ per milione in output sono quattro decimi di centesimo; su Claude Sonnet 5.5 a 2 $ e 10 $ sono nove decimi. Un refactoring di repository: 400.000 input, 30.000 output — quarantatré centesimi contro ottantatré. Una lunga sessione agentica che spende davvero il suo budget: due milioni di token in input, 200.000 in output, quindi 5,20 $ contro 6,30 $ una volta che i numeri diventano abbastanza grandi da far dominare il lato input.

Il divario che inizia come una differenza di 2,25× sul prezzo di output si restringe a circa 1,2× su scala agentica, e questa scalatura non è una curiosità. Qwen3.8 Max e Claude Sonnet 5.5 sono entrambi modelli da 1M di token con tetti di output elevati, entrambi prezzati a 2 $ per milione in input, ed entrambi rilasciati a otto settimane di distanza l'uno dall'altro — quello del fornitore il 3 agosto 2026 con un aggiornamento datato il 2 settembre, quello di Anthro​pic il 28 settembre. La differenza tra loro non è il listino. È quanto ciascuno spende per finire.

Cosa è stato spedito, e quando

Qwen3.8 Max è il livello di capacità più elevato di Alibaba fino ad oggi. Alibaba lo posiziona direttamente in concorrenza con GPT-5.5, Claude Opus 4.7 e Gemini 3.1 Pro nella propria guida alla migrazione e lo consiglia ogni volta che un'attività richiede il ragionamento più potente disponibile. Dispone di una finestra di contesto di 1M di token, accetta input di testo, immagini e video e restituisce testo — la possibilità di input video è l'unica capacità qui che Claude Sonnet 5.5 non ha. Il prezzo è di 2 $ per milione di token in input e 6 $ per milione di token in output, con letture dalla cache a 0,25 $ e scritture nella cache a 2,50 $. Alla voce del 3 agosto del nostro catalogo si aggiunge un aggiornamento del 2 settembre elencato come Qwen3.8 Max (0902), che presenta le stesse tariffe principali e un limite di output di 131K.

Two-column scoreboard for Claude Sonnet 5.5 and Qwen3.8 Max across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, text and image input, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column Qwen3.8 Max: input $2.00 per million, output $6.00 per million, text image and video input, AA Intelligence Index 45, cost per Index task $5.41, September 2 2026 refresh. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 è il secondo modello della generazione 5.5 di Anthropic, rilasciato il 28 settembre 2026, sei giorni dopo Claude Opus 5.5. Viene distribuito come claude-sonnet-5-5 sull'API Claude e su Amazon Bedrock, Google Cloud e Microsoft Foundry, con una finestra di 1M token, un tetto di output sincrono di 128K che si estende a 300K sull'API Message Batches dietro l'header output-300k-2026-03-24, e con le tariffe di Claude Sonnet 5 mantenute esattamente: 2 $ in input, 10 $ in output, 0,20 $ per le letture dalla cache, 2,50 $ per le scritture in cache. Nessuna conservazione dei dati dal lancio, dismissione non prima del 28 settembre 2027.

Quindi la tariffa di input è identica, le finestre di contesto hanno la stessa dimensione, e i due fornitori hanno aggiornato a distanza di un mese l'uno dall'altro. Tutto ciò che li separa sta dal lato output della fattura o nei benchmark.

Benchmark: tabella del fornitore a confronto con un indice indipendente

Esistono qui due tipi di prove e non sono intercambiabili.

La tabella di lancio di Anthropic è dichiarata dal fornitore, non riprodotta da alcuna terza parte, e copre otto valutazioni. Le righe che contano

• Terminal-Bench 4.0 — Claude Sonnet 5.5 70,6% contro il 10,3% di Claude Sonnet 5

• CursorBench 4.0 — 55,5% rispetto al 34,1% di Claude Sonnet 5

• GDPval-AA v2.1 — 1844 contro 1449 per Claude Sonnet 5, 1846 per Claude Opus 5.5 e 1487 per GPT-6 Sol

• Humanity's Last Exam, con strumenti — 64,5% contro 54,9%; Claude Opus 5.5 si attesta al 67,7%

• OSWorld 2.1, parziale — 80,1% contro 57,0%

• Cartografia, senza strumenti — 61,6% contro 15,6%

Alibaba non pubblica una tabella a quattro colonne direttamente equivalente, quindi le uniche cifre che possono essere collocate sullo stesso asse sono quelle indipendenti. Artificial Analysis, revisione v4.3.2

• Indice di Intelligenza Composita — Claude Sonnet 5.5 56 al 3° posto su 216; Qwen3.8 Max 45 al 27° posto

• Costo per attività dell'Intelligence Index — $7.60 contro $5.41

• Velocità di output — il modello di Anthropic viene valutato rispetto a un baseline Claude Sonnet 5 misurato a 78,7 token al secondo; Qwen3.8 Max è misurato a 39,1

• Verbosità — 410M token di output sull'Index contro 190M

I punteggi per singola valutazione di Qwen3.8 Max sono rispettabili, non marginali: 92,8% su GPQA Diamond, 88,8% su Terminal-Bench 2.1, 80,3% sul richiamo a contesto lungo, 47,8% su tau-banking. Perde terreno sul composito perché non vince nulla in modo decisivo e il più recente livello Anthropic vince diverse cose nettamente. Si noti inoltre che la pagina indipendente per Qwen3.8 Max riporta una data di rilascio del 2 settembre 2026 e una lettura del contesto di 984K — sta descrivendo l'aggiornamento (0902), non la build di agosto, e mischiare i dati tra i due sarebbe un errore.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

Ciò che manca da entrambe le colonne è importante quanto ciò che contengono. Nessuno ha riprodotto in modo indipendente i numeri OSWorld o Terminal-Bench di Anthropic. Nessuno ha pubblicato un valore Chartography o CursorBench per Qwen3.8 Max. Il composito è l'unico numero misurato allo stesso modo su entrambi i modelli, ed è esattamente per questo che la cifra del costo per attività sotto di esso conta così tanto.

Il numero che lo decide, e non è su nessuno dei due tariffari.

Artificial Analysis applica a entrambi i modelli lo stesso criterio: esegue le dieci valutazioni dell'Indice, conta i token, moltiplica per il prezzo di listino. Claude Sonnet 5.5 risulta a $7.60 per attività e Qwen3.8 Max a $5.41, un sovrapprezzo del 40% per il modello Anthropic nonostante un punteggio composito più alto. Le rilevazioni di verbosità spiegano la direzione — 410M di token contro 190M — e le rilevazioni di velocità spiegano il resto: un modello che emette meno token e impiega più tempo per token non è quello che paga l'output al doppio della tariffa.

Anche l'affermazione di Anthropic sulla propria efficienza si inserisce nella stessa storia, anziché contraddirla. L'azienda afferma che Claude Sonnet 5.5 genera output oltre il 30% più rapidamente di Claude Sonnet 5 e costa "fino al 30% in meno per attività" a prezzi identici — un'affermazione sui token per attività, non sulle tariffe. Che regga rispetto a un modello che consuma meno della metà dei token è esattamente ciò che chiede la cifra di $7.60, e una singola esecuzione indipendente è un solo punto dati.

La conseguenza pratica: la tariffa di output da 6 $ contro 10 $ è il numero che il reparto acquisti guarderà, ed è il numero meno predittivo dell'articolo. Quello davvero predittivo è il numero di token per attività sui tuoi prompt, e nessuno dei due fornitori te lo darà.

Input, video e la trappola della migrazione

La differenza di capacità che emerge immediatamente è la modalità. Qwen3.8 Max accetta video insieme a testo e immagini; Claude Sonnet 5.5 accetta testo e immagini. Per l'analisi di registrazioni dello schermo, pipeline di filmati di riunioni o qualsiasi cosa che tratti il video come input di prima classe, non si tratta di un divario di benchmark — è una questione di idoneità binaria, e solo uno di questi modelli passa.

OrcaRouter model page for qwen/qwen3.8-max, attributed to Qwen and dated 2026-08-03, showing a 1M-token context window, text, image and video input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 2.25 seconds, and 53.0M tokens of traffic in the last seven days.

La differenza che si manifesta una settimana dopo è comportamentale. Claude Sonnet 5.5 introduce cinque modifiche incompatibili al codice in esecuzione su Claude Sonnet 5. Un valore non predefinito di temperature, top_p o top_k ora restituisce un 400. L'invio di thinking: {"type": "disabled"} restituisce un 400 che rimanda a between_tools, la nuova impostazione di thinking più bassa, accettata con effort low, medium e high e rifiutata con xhigh o max. Uso forzato degli strumenti — tool_choice di "any" o uno strumento denominato — restituisce direttamente un 400. Il più vecchio computer_20251124, lo strumento computer-use, viene rifiutato sulla Claude API e su Google Cloud. Inoltre, i blocchi di thinking sono legati al modello e all'account che li ha prodotti, quindi il ragionamento può essere portato avanti da Claude Sonnet 5 ma non verso un'altra famiglia, e un prefisso di conversazione modificato può trasformare un replay in un errore.

Qwen3.8 Max non richiede nulla di tutto ciò. È un modello in formato OpenAI con una superficie di richiesta convenzionale, e passare ad esso da un altro livello Qwen è un cambio di stringa del modello.

Valuta onestamente i due costi. Scegliere il modello Qwen ti costa il divario composito di undici punti e i numeri del fornitore Anthropic che comunque non puoi verificare in modo indipendente. Scegliere il modello Anthropic ti costa l'input video e una checklist di quattro modifiche API che falliranno ciascuna in modo eclatante con un 400 la prima volta che vengono colpite — che è il tipo buono di fallimento, ma comunque un giorno di lavoro.

Dove si colloca Orca

Il motivo per instradare anziché scegliere è che il numero decisivo — il costo per attività sul tuo traffico — non può essere calcolato dalla documentazione di nessuno dei due fornitori.

OrcaRouter è un unico endpoint compatibile con OpenAI su oltre 200 modelli, con il prezzo di listino del provider passato senza ricarichi, così un taglio di prezzo o un cambio di fascia da una parte o dall'altra è attivo lo stesso giorno in cui viene annunciato. Entrambe le versioni di Qwen3.8 Max sono in catalogo ai 2 $ / 6 $ di Alibaba stesso — quella di agosto e l'aggiornamento (0902) — accanto a Claude Sonnet 5, il modello su cui gira ancora la maggior parte del traffico dell'API Claude, instradabile dal 30 giugno ai 2 $ / 10 $ di Anthropic con una velocità misurata di 150 token di output al secondo. Claude Sonnet 5.5 stesso non è ancora nel nostro catalogo; finché è così, la via onesta per arrivarci è l'API del vendor stesso e i tre cloud elencati da Anthropic, e il modo per provarlo senza spostare un carico di lavoro è una fetta di traffico dietro failover automatico verso Claude Sonnet 5 o Qwen3.8 Max.

Quale, per quale lavoro?

Qwen3.8 Max vince sull'input video, sulla velocità di output, sul costo misurato per attività di indicizzazione e sullo sforzo di integrazione. È la scelta predefinita giusta per lavori ad alto volume e ben specificati, in cui un divario composito di dodici punti non si manifesta nella qualità dell'output.

Claude Sonnet 5.5 vince sul composito indipendente, sulle valutazioni di coding agentico in cui i numeri del fornitore di Anthropic mostravano un salto di 60 punti rispetto al proprio predecessore su Terminal-Bench 4.0, sul tetto di output batch di 300K e su una decisione modellata sul lavoro che un listino prezzi non può prendere: è il modello da scegliere quando il compito è così difficile che avere ragione conta più che spendere poco.

Ciò che cambierebbe la risposta per entrambi è la stessa cosa, e non è il rilascio di un nuovo benchmark. È un numero di token per attività sui tuoi prompt, con le tue impostazioni di effort, per entrambi i modelli. Il parametro effort di Anthropic e il tetto di output di Qwen sono entrambi leve su quel numero, ed entrambi sono impostati da te anziché dal listino prezzi del fornitore.

L'unica cosa che questo confronto chiarisce davvero: a 2 $ per milione sull'input, la parte di input della spesa non è più un elemento distintivo tra un modello di punta cinese e uno di fascia media di Anthropic. Quella gara si è spostata sull'output e sul conteggio dei token già mesi fa.

Confrontati in questo articolo3

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno