Qwen 3.8 vs GPT-5.6: Ora che entrambi hanno un prezzo, quale vince?
Guides & Insights

Qwen 3.8 vs GPT-5.6: Ora che entrambi hanno un prezzo, quale vince?

Autore

jinhao song

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Quando Alibaba ha presentato in anteprima Qwen3.8-Max a Shanghai il 19 luglio 2026, la reazione della comunità fu immediata: questo modello da 2,4 mila miliardi di parametri era "presumibilmente più avanti di GPT-5.6 e solo leggermente dietro a Fable 5." Il GPT-5.6 di OpenAI nella sua principale Sol configurazione si trova al #2 nell'indipendente Artificial Analysis Intelligence Index, un punto sotto Fable 5, quindi era un'affermazione azzardata senza numeri pubblicati a sostegno.

Due cose sono cambiate da allora. Qwen3.8-Max è diventato generalmente disponibile il 3 agosto 2026 con un vero listino prezzi e una vera tabella di benchmark. E il 31 luglio, OpenAI ha tagliato i prezzi dell'intera famiglia GPT-5.6 — Terra a $2 / $12, Luna a $0.20 / $1.20, con Sol invariato al livello premium. Quindi questo confronto non è più un'affermazione contro una classifica; si tratta di due modelli con prezzi e documentazione che possono essere realmente confrontati.

Nota per gli sviluppatori — il modo più rapido per risolvere una questione come questa è eseguire entrambi sui propri prompt. OrcaRouter mette a disposizione oltre 200 modelli dietro un unico endpoint compatibile con OpenAI, così puoi mettere Qwen 3.8 Max contro GPT-5.6 sullo stesso compito senza dover configurare due SDK.

Verdetto in sintesi. Qwen3.8-Max al GA ha un prezzo aggressivo — $2 / $6 per 1M, fisso su 1M token — che lo mette allo stesso prezzo di input di GPT-5.6 Terra ma a metà del costo di output di Terra, e molto sotto Sol. I suoi numeri auto-dichiarati sono forti (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6). Ma GPT-5.6 Sol vince ancora sulle due cose che determinano l'uso in produzione: è il #2 verificato nell'Artificial Analysis Intelligence Index (~59) ed è veloce — fino a 750 token/sec su hardware Cerebras. Qwen3.8-Max rimane senza punteggio da parte di ogni valutatore indipendente. Quindi Qwen potrebbe anche eguagliare GPT-5.6 sulla qualità one-shot e batte chiaramente Terra sul prezzo di output; GPT-5.6 vince sulla prova revisionata e sul throughput, che spesso è tutto.

Punti chiave

Qwen3.8-Max è GA dal 3 agosto 2026 con prezzi pubblicati di $2 / $6 per 1M token, fissi su tutto il contesto di 1M token.

Rispetto a GPT-5.6 Terra ($2 / $12 dopo il taglio del 31 luglio di OpenAI), Qwen eguaglia il prezzo dell'input e dimezza quello dell'output. Rispetto a Sol, Qwen è di gran lunga più economico.

GPT-5.6 Sol è classificato #2 nell'audit dell'AA Intelligence Index (~59), e Artificial Analysis osserva che è in testa nei problemi STEM più difficili. Qwen3.8-Max è ancora senza punteggio da AA e LMArena.

La velocità è il contrasto più netto. GPT-5.6 raggiunge fino a 750 token/sec su Cerebras. Qwen è stato il modello più lento nei test pratici in anteprima — un risultato che precede la distribuzione GA e necessita di nuovi test.

La tabella del fornitore di Qwen è credibile ma non sottoposta a revisione paritaria: GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (in aumento rispetto al 40.7 del predecessore).

L'apertura li divide definitivamente: Qwen promette pesi aperti entro la settimana, più un Qwen3.8-27B da circa 17GB di VRAM; GPT-5.6 è chiuso e solo API.

Nota sull'accuratezza: tutti i dati qualitativi di Qwen3.8-Max sono riportati da Alibaba e non verificati da terze parti. I dati di GPT-5.6 provengono da Artificial Analysis e potrebbero differire da quelli comunicati da OpenAI. I prezzi della famiglia GPT-5.6 riflettono la riduzione applicata da OpenAI il 31 luglio 2026. Il prezzo di Qwen è quello della scheda tariffaria GA e sostituisce lo sconto di anteprima di luglio.

Specifiche e prezzo, fianco a fianco

Ecco i dati concreti, con ogni cifra attribuita alla sua fonte.

• Produttore / stato — Qwen3.8-Max: Alibaba; GA (3 agosto 2026); GPT-5.6 Sol: OpenAI; flagship chiuso (varianti Sol / Terra / Luna)

• Architettura — Qwen3.8-Max: ~2.4T totali, MoE sparsa (parametri attivi non ancora divulgati); GPT-5.6 Sol: Chiuso; architettura non divulgata

• Finestra di contesto — Qwen3.8-Max: 1 milione di token (983.616 con thinking; output massimo 131.072); GPT-5.6 Sol: ammiraglia per contesti lunghi

• AA Intelligence Index — Qwen3.8-Max: Non ancora valutato; GPT-5.6 Sol: ~59 — #2 (Artificial Analysis)

• Punti di forza verificati — Qwen3.8-Max: nessuna terza parte; GPT-5.6 Sol: È in testa nei problemi STEM più difficili (Artificial Analysis)

• Punti di forza dichiarati dal fornitore — Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (dichiarato da Alibaba); GPT-5.6 Sol: n/a

• Velocità — Qwen3.8-Max: p50 TTFT 1.64s (telemetria OrcaRouter a 7 giorni); modello più lento nei test pratici in anteprima; GPT-5.6 Sol: Fino a 750 tok/s su Cerebras (Artificial Analysis)

• Prezzi (input / output) — Qwen3.8-Max: $2.00 / $6.00 per 1M, fisso; input in cache $0.25; GPT-5.6: Terra $2 / $12, Luna $0.20 / $1.20, Sol premium (~1/3 del costo di Fable per AA)

• Pesi aperti — Qwen3.8-Max: Promesso entro la settimana (nessuna licenza ancora); GPT-5.6: No — chiuso / solo API

Due cose inquadrano questo confronto, ed entrambe sono nuove da luglio.

Innanzitutto, la storia dei prezzi è diventata davvero interessante, e non solo conveniente. A luglio, il vantaggio di Qwen era uno sconto non preventivabile. Ora il confronto è concreto e si articola per fascia. Rispetto a Terra a $2 / $12, Qwen eguaglia esattamente la tariffa di input e dimezza quella di output — un vero vantaggio per i lavori ad alto contenuto di ragionamento, dove l'output domina la spesa. Rispetto a Luna a $0.20 / $1.20, Qwen è 10× più costoso, e Luna è la scelta migliore per attività semplici ad alto volume. Rispetto a Sol, Qwen è di gran lunga più economico. Quindi "qual è più economico" ora ha tre risposte diverse a seconda di quale GPT-5.6 intendi — e la lettura onesta è che il taglio del 31 luglio di OpenAI ha ridotto notevolmente il divario.

In secondo luogo, la voce della velocità è ancora il punto in cui questi due modelli divergono maggiormente, e continua a favorire OpenAI. Artificial Analysis registra GPT-5.6 Sol a un massimo di 750 token/sec su silicio Cerebras. Nulla nei materiali GA di Alibaba suggerisce che Qwen3.8-Max sia progettato per quel tipo di throughput, e il recensore della fase di anteprima che lo aveva definito il modello più lento mai usato stava misurando esattamente le lunghe esecuzioni agentiche in cui il throughput si accumula. Se il tuo carico di lavoro è interattivo, agentico o ad alto volume, quel divario può decidere l'esito del confronto prima ancora che la qualità entri in gioco.

Prova: ciò che la tabella di benchmark GA stabilisce e non stabilisce

La decisione di Alibaba di pubblicare i numeri alla GA è un vero miglioramento rispetto all'anteprima, dove l'affermazione della community di essere "avanti a GPT-5.6" non si basava su nulla di pubblicato. La tabella è solida: GPQA Diamond 92.6 su scienza a livello post-laurea, PaperBench 93.0 sulla riproduzione di risultati di ricerca, Terminal-Bench 2.1 86.6 sull'utilizzo di una shell reale, OSWorld-Verified 86.1 sul controllo di una GUI desktop. Il balzo generazionale nella programmazione è il dato di spicco — FrontierSWE 73.5 contro i 40.7 del predecessore, e DeepSWE 1.1 56.6 contro 21.6.

Ciò che la tabella non fa è risolvere il confronto con GPT-5.6, per due ragioni.

Il primo è la provenienza. Ogni dato è stato prodotto da Alibaba sul proprio banco di prova. Le tabelle dei vendor sono scelte, non campionate: un laboratorio pubblica i benchmark in cui brilla e omette il resto. La posizione n. 2 di OpenAI nell'Intelligence Index, al contrario, è stata assegnata da un valutatore senza alcun interesse nell'esito. In particolare, Artificial Analysis accredita specificamente GPT-5.6 Sol come leader nei più difficili problemi STEM, che è esattamente il territorio che Qwen intende rivendicare con GPQA Diamond 92.6. Una di queste affermazioni è stata verificata.

Il secondo punto è che il numero più debole di Alibaba è eloquente. IFBench 82.8 — seguire le istruzioni sotto vincolo — è il punteggio più basso nella sua tabella, e coincide esattamente con la critica più costante dell'era pre-lancio: il modello fornisce troppo, supera l'ambito richiesto e aggiunge cose che nessuno ha chiesto. Questo è affascinante in una demo, ma costoso quando l'output viene fatturato a $6 per milione di token e serve un formato esatto. Per le pipeline agenteiche in cui i passaggi a valle analizzano l'output, la disciplina nel seguire le istruzioni conta più di un punto GPQA.

Per riferimento: il predecessore Qwen3.7-Max ha ottenuto 46 sull'indice di intelligenza AA contro i ~59 di GPT-5.6 Sol. Chiudere tredici punti in una sola generazione sarebbe un balzo straordinario. Possibile — il quasi raddoppio di FrontierSWE di Alibaba suggerisce un progresso reale — ma finché un arbitro non pubblica un numero, "davanti a GPT-5.6" resta un'affermazione non provata, non un risultato.

Il costo in pratica: un esempio svolto attraverso i livelli

Prendi un agente di ragionamento che invia 100.000 token di contesto e genera 10.000 token di output per chiamata — una forma tipica dell'analisi documentale o della pianificazione multi-step.

Qwen3.8-Max: 0,1M × $2 = $0,20, più 0,01M × $6 = $0,06. ≈ $0,26 per chiamata.

GPT-5.6 Terra: 0.1M × $2 = $0.20, più 0.01M × $12 = $0.12. ≈ $0.32 per chiamata.

GPT-5.6 Luna: 0,1M × $0,20 = $0,02, più 0,01M × $1,20 = $0,012. ≈ $0,03 per chiamata.

• A 5.000 chiamate/giorno: Qwen ≈ $1.300, Terra ≈ $1.600, Luna ≈ $160.

Ne emergono due insegnamenti. Contro Terra il risparmio di Qwen è reale ma modesto — circa il 19% in questa configurazione — e ben lontano dal vantaggio di un ordine di grandezza che Qwen gode rispetto a modelli premium come Fable 5 o Sol. Chiunque avesse assunto che OpenAI fosse strutturalmente costoso dovrebbe aggiornare le proprie convinzioni: il taglio del 31 luglio ha fatto la maggior parte del lavoro per neutralizzare la narrativa sui prezzi di Qwen nella fascia media.

Il punto in cui Qwen si porta nettamente in vantaggio è il contesto lungo e il caching. Poiché la tariffa di $2/$6 è fissa su tutta la finestra da 1 milione di token, un prompt da 900.000 token costa lo stesso per token di uno breve, mentre molti concorrenti applicano un sovrapprezzo per gli input lunghi. E l'input in cache a $0.25 per 1M riduce il costo di input di 8× nei carichi di lavoro con contesto ripetuto: la chiamata di cui sopra scende da $0.26 a circa $0.09 una volta che il contesto è in cache. Se il tuo agente rilegge un contesto per lo più stabile a ogni turno, è lì che risiede il vantaggio duraturo — non nella tariffa pubblicizzata.

Apertura e il fratello 27B

GPT-5.6 non sarà mai auto-ospitabile. Qwen3.8-Max potrebbe esserlo — Alibaba ora dichiara che i pesi arriveranno entro la settimana — ma il modello di punta non è un obiettivo pratico: circa 1,2 TB a 4 bit contro circa 141 GB per H200 significa otto o più acceleratori di fascia alta, e con il conteggio dei parametri attivi ancora non divulgato, non è nemmeno possibile modellare il throughput che questo garantisce. Inoltre, non c'è ancora alcun testo di licenza, il che significa che l'usabilità commerciale è formalmente indeterminata.

Annunciato contemporaneamente, Qwen3.8-27B è il rilascio più importante per chiunque sia interessato a Qwen più per il controllo che per la capacità grezza. Inoltre, essendo a pesi aperti, secondo quanto riferito richiede circa 17GB di VRAM — una singola scheda consumer di fascia alta — che lo rende una vera opzione on-premise in un modo in cui l'ammiraglia 2.4T non lo sarà mai. Se stai valutando Qwen rispetto a GPT-5.6 perché hai bisogno della residenza dei dati, il 27B è il modello da valutare.

Domande frequenti

Qwen 3.8 è meglio di GPT-5.6?

Non secondo le prove esistenti. La tabella GA di Alibaba è solida (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6) ma interamente auto-dichiarata, e nessun valutatore indipendente ha valutato il modello. GPT-5.6 Sol detiene la posizione #2 certificata dell'Intelligence Index (~59), è in testa nei problemi STEM più difficili secondo Artificial Analysis, e arriva fino a 750 token/sec. GPT-5.6 vince per dimostrazione e velocità.

È vera l'affermazione "Qwen 3.8 è in vantaggio su GPT-5.6"?

È iniziato come sentimento della comunità e non è ancora verificato. La GA ha portato la tabella di benchmark di Alibaba ma nessun punteggio di terze parti — Artificial Analysis e LMArena restano senza punteggio. Il predecessore Qwen3.7-Max ha segnato 46 contro i ~59 di Sol, quindi l'affermazione richiede un salto generazionale molto ampio per reggere letteralmente.

Qual è più economico, Qwen 3.8 o GPT-5.6?

Dipende dal livello, e la risposta è cambiata il 31 luglio quando OpenAI ha tagliato i prezzi. Qwen3.8-Max costa $2 / $6 per 1M. GPT-5.6 Terra costa $2 / $12 — stesso input, doppio output, quindi Qwen vince lì. Luna costa $0.20 / $1.20, rendendola circa 10× più economica di Qwen. Sol è premium, quindi Qwen è molto più economica di Sol.

Qual è più veloce?

GPT-5.6, decisamente in termini di throughput. Artificial Analysis riporta fino a 750 token/sec su hardware Cerebras. Qwen3.8-Max mostra un p50 time-to-first-token di 1,64 secondi nella telemetria di 7 giorni di OrcaRouter, ma i recensori dell'era di anteprima lo hanno trovato molto lento su build agentiche lunghe — un risultato che precede il servizio GA e merita di essere ritestato.

Qwen 3.8 Max è uscito dall'anteprima?

Sì, il 3 agosto 2026. Ora ha un tariffario pubblicato e un endpoint compatibile con OpenAI e DashScope, quindi l'inquadramento di luglio di una campagna di crediti Qoder con uno sconto del 90% non descrive più come viene venduto.

Posso auto-ospitare Qwen 3.8 per evitare i costi di OpenAI?

Non è il modello di punta, realisticamente. I pesi sono promessi entro la settimana, ma nessuna licenza è stata pubblicata, e con ~1,2 TB in 4-bit servirebbero otto o più GPU di classe H200. L'annunciato Qwen3.8-27B, con circa ~17 GB di VRAM, è l'opzione pratica.

Quale dovrei usare oggi?

GPT-5.6 Sol per qualsiasi ambito sensibile alla latenza, interattivo o critico per il ragionamento, dove la qualità verificata conta. Luna per attività semplici ad alto volume, dove risulta la più economica con ampio margine. Qwen3.8-Max dove contesto lungo e caching dei prompt dominano la tua fattura — la sua tariffa fissa di 1 milione di token e l'input in cache a $0,25 sono i punti di forza della sua offerta.

Il risultato finale

Qwen 3.8 vs GPT-5.6è uno scontro più equilibrato di quanto non fosse a luglio, e leggermente meno sbilanciato sul fronte del prezzo di quanto i fan di Qwen si aspettassero. Qwen3.8-Max è arrivato alla GA con prezzi reali, una credibile tabella di benchmark auto-dichiarata e una tariffa piatta di 1M token più un caching economico che lo rendono davvero interessante per il lavoro su contesti lunghi. Questi sono vantaggi strutturali, non promozionali.

Ma il taglio dei prezzi del 31 luglio di OpenAI ha attenuato l'argomento dei costi nella fascia media — Terra ora eguaglia Qwen sull'input — e GPT-5.6 possiede ancora le due proprietà decisive: una classifica #2 verificata da un valutatore senza interessi nell'esito, e una velocità di elaborazione fino a 750 token/sec che Qwen non ha mostrato alcuna evidenza di avvicinare. Osserva due eventi: il primo punteggio indipendente Intelligence Index per Qwen3.8-Max, e il rilascio dei pesi con una licenza. Fino ad allora, instrada in base alla forma — GPT-5.6 quando contano velocità e prove, Qwen quando lunghezza del contesto e cache hit dominano la fattura — e verifica sui tuoi stessi prompt.

Confrontati in questo articolo4

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube