
GPT-6 Sol vs Qwen3.8-Max: L'unica riga in cui il modello chiuso non può competere
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Quasi ogni confronto tra GPT-6 Sol e Qwen3.8-Max verrà deciso sul costo, e quasi tutti lo sbaglieranno nella stessa direzione. Qwen3.8-Max, il modello di punta ospitato dal fornitore, ha un prezzo di 2,00 $ per milione di token in input e 6,00 $ per milione in output dalla sua disponibilità generale del 3 agosto 2026, con lo snapshot datato Qwen3.8-Max-0902 reso disponibile il 2 settembre. GPT-6 Sol ha raggiunto la disponibilità generale il 22 settembre 2026 a 2,00 $ in input e 10,00 $ in output. Prezzo identico per l'input, e output più economico del 40% secondo il listino di Qwen3.8-Max — e, sull'harness indipendente, circa cinque volte il costo per completare un'attività.
Ma c'è una seconda differenza, più netta, che l'argomentazione sui costi continua a sotterrare, ed è quella che in realtà decide alcuni carichi di lavoro. Qwen3.8-Max accetta i video. GPT-6 Sol no. Non è una voce di prezzo né una riga di benchmark; è una capacità che uno di questi modelli ha e che l'altro non può approssimare, ed è l'unico aspetto di questo confronto che nessuna quantità di lavoro sull'efficienza dei token potrà risolvere.

Due ammiraglie, due forme diverse
Qwen3.8-Max è un modello mixture-of-experts sparso da 2,4 trilioni di parametri con circa 95 miliardi di parametri attivi per query — il secondo modello ospitato più grande in produzione dopo Kimi K3. La sua finestra di contesto è di un milione di token con un limite di output di 131.072 token, le sue modalità di input sono testo, immagine e video, e supporta reasoning effort su basso, medio ed extra-alto con output strutturati e tool calling. Il flagship ospitato non è open weights; l'artefatto scaricabile della stessa generazione è una release separata con i suoi limiti.
GPT-6 Sol accetta testo e immagini in input e restituisce testo. La sua finestra di contesto è di 1.050.000 token, con un massimo di 922.000 token di input e un tetto di 128.000 token di output, al prezzo fisso di 2,00 $ e 10,00 $, con 0,20 $ per lettura dalla cache e 2,50 $ per scrittura nella cache, riprezzando l'intera richiesta oltre i 272.000 token di input a 4,00 $ e 15,00 $. È chiuso, con identificatore singolo, e OpenAI ha descritto le tariffe come permanenti anziché promozionali.
I valori della finestra sono entro circa il 7% l'uno dall'altro, e i limiti massimi di output sono nella stessa fascia. L'elenco delle modalità è l'unico divario strutturale — e va in una sola direzione.
Non vedo il testo da tradurre. Inviami il messaggio che vuoi farmi tradurre in italiano, includendo i relativi marcatori di span, e provvederò a restituirlo con i marcatori intatti.
• Input — GPT-6 Sol 2,00 $ per milione di token vs Qwen3.8-Max 2,00 $ per milione di token; il dato principale è identico
• Output — GPT-6 Sol 10,00 $ per milione di token contro Qwen3.8-Max 6,00 $ per milione di token; la tariffa di Alibaba è inferiore del 40%
• Input in cache — GPT-6 Sol 0,20 $ per milione di token contro Qwen3.8-Max 0,25 $ per milione di token per le letture implicite dalla cache, con una lettura esplicita dalla cache a 0,17 $ e una scrittura esplicita nella cache a 2,50 $
• Finestra di contesto — GPT-6 Sol 1.050.000 token vs Qwen3.8-Max 1.000.000 token
• Output massimo — GPT-6 Sol 128.000 token vs Qwen3.8-Max 131.072 token
• Modalità di input — testo e immagine di GPT-6 Sol vs testo, immagine e video di Qwen3.8-Max
• Gestione del contesto lungo — GPT-6 Sol rimodula il prezzo dell'intera richiesta al di sopra di 272.000 token di input, con tariffe di input e cache pari a 2× e output pari a 1,5×, rispetto a Qwen3.8-Max che applica una fascia fissa sull'intera finestra: è l'unico punto in cui il listino tariffario di Qwen è strutturalmente migliore anziché marginalmente più economico.
• Sforzo di ragionamento — GPT-6 Sol nessuno, basso, medio (predefinito), alto, xhigh, max vs Qwen3.8-Max basso, medio ed extra-alto
• Limite delle conoscenze — GPT-6 Sol 20 aprile 2026 vs Qwen3.8-Max non pubblicata come data unica
• Istantanea datata — GPT-6 Sol un unico identificatore in continuo aggiornamento vs Qwen3.8-Max-0902 disponibile come revisione fissata al 2 settembre 2026 allo stesso prezzo
La questione del contesto lungo merita più attenzione di quanta ne riceva di solito. Il sovrapprezzo di GPT-6 Sol è uno scaglione applicato all'intera richiesta, quindi un'esecuzione di un agente da 900.000 token viene fatturata a $4.00 e $15.00 su ogni token. Qwen3.8-Max applica un unico scaglione su tutta la finestra. Per un carico di lavoro che si mantiene oltre i 272.000 token, le due tabelle tariffarie smettono del tutto di essere confrontabili — il modello più economico in vetrina è quello più costoso, e di gran lunga, e la direzione del divario dipende interamente da dove si colloca il vostro contesto.

Il listino prezzi dice 40% in meno. L'harness dice cinque volte il conto.
Artificial Analysis ha misurato Qwen3.8-Max-0902 con un punteggio dell'Intelligence Index di 45, con un costo di 5,41 $ per ogni attività dell'indice completata, avendo generato 190 milioni di token di output durante l'esecuzione. Il suo riepilogo descrive il modello come "notevolmente lento e molto prolisso". GPT-6 Sol ha ottenuto 48 a 1,06 $ per attività su 77 milioni di token di output.
Leggi quelle tre coppie insieme e appare la forma del confronto. Qwen è tre punti indice indietro, ha generato due volte e mezzo i token ed è costato circa cinque volte tanto per attività completata — su un listino prezzi in cui il suo output è più economico del 40%. Il meccanismo non è sottile. A 6,00 $ per milione di token di output, 190 milioni di token costano 1,14 $ per esecuzione dell'indice solo in output, prima di contare l'input; a 10,00 $ per milione, i 77 milioni di Sol costano 0,77 $. La tariffa più economica sta comprando più token, non un conto più basso.
Questo è lo stesso schema che ricorre in tutto il panorama di settembre, e vale la pena enunciarlo come regola anziché come fatto riguardante questi due modelli: su una tariffa per token, uno sconto del 40% sull'output non vale nulla se il modello emette due volte e mezzo il numero di token. Il costo per attività completata è l'unico dato che regge.
Ciò che Alibaba ha pubblicato, e il problema della definizione dello sforzo
La tabella di benchmark propria di Alibaba è la più lunga in questo confronto e la meno comparabile. Le cifre riportate dai fornitori mettono Qwen3.8-Max in vantaggio su PaperBench e IFBench, ma in svantaggio su SWE-bench Pro e Humanity's Last Exam, con una scala di sforzo di ragionamento — basso, medio, extra-alto — che non ha una corrispondenza diretta con la scala a sei livelli di OpenAI. Un punteggio pubblicato a livello extra-alto non è lo stesso prodotto di un punteggio pubblicato a livello medio, e nessuno dei due fornitori indica quale livello ha prodotto un dato numero su un grafico di confronto.
Questa è la ragione onesta per non affidarsi alla tabella di nessuno dei due fornitori in questo caso. I numeri di Alibaba sono eseguiti sull'harness di Alibaba con l'impostazione di effort di Alibaba; quelli di OpenAI sono eseguiti su OpenAI. Le cifre di Artificial Analysis esistono proprio perché entrambi questi dati sono inutilizzabili come confronto diretto, e sono quelle usate sopra.
La riproducibilità è una vera funzionalità, e ha un prezzo pari a zero
Lo snapshot datato è la voce più sottovalutata di questo confronto. Qwen3.8-Max-0902 è una revisione bloccata del 2 settembre 2026 che, secondo Alibaba, offre le stesse capacità e lo stesso prezzo del modello base. Bloccarla significa che il modello dietro il tuo endpoint non cambia sotto i tuoi piedi tra un martedì e un giovedì.
GPT-6 Sol non ha equivalenti. È un singolo identificatore rolling — la stessa pagina del modello contiene uno snapshot predefinito e nessuna variante datata — il che significa che ciò che hai testato a settembre non è garantito essere ciò che stai chiamando a novembre. Per la maggior parte dei team va bene. Per una pipeline regolamentata che deve dimostrare che cosa ha prodotto un output, è una differenza reale, ed è una che Alibaba offre gratuitamente mentre OpenAI non la offre affatto.
La linea video è quella che decide
Tutto ciò che precede è un confronto. Questa parte no. Se il tuo input include video — registrazioni dello schermo, filmati di ispezione, catture di lezioni, qualsiasi cosa in cui l'informazione sia in movimento anziché in un fotogramma statico — Qwen3.8-Max lo accetta nativamente e GPT-6 Sol non ha alcun percorso per accedervi. Non puoi aggirare una modalità con i prompt. Non puoi pre-elaborare un video in immagini e ottenere la stessa cosa, perché l'informazione temporale è il punto, e nessuna quantità di punti indice su un benchmark testuale può sostituire l'input che il tuo compito richiede effettivamente.
Vale la pena menzionare anche il caso inverso, perché è lì che il confronto smette di essere sbilanciato. Se il tuo input è testo e immagini, {{1}}Sol{{/1}} è più economico per attività, {{2}}quattro punti{{/2}} avanti nella classifica neutrale, e più economico sulle letture in cache. La capacità video non è un fattore decisivo a tuo favore; è semplicemente inutilizzata.
Instradamento di una decisione che ha due risposte separate

Questo è un confronto in cui l'architettura giusta è davvero composta da due modelli, non da uno, e il motivo è che la suddivisione avviene per modalità di input anziché per difficoltà. Una pipeline che acquisisce video e ragiona sul testo necessita di entrambi, e la regola di instradamento è una proprietà della richiesta anziché una decisione soggettiva.
Qwen3.8-Max è nel catalogo di OrcaRouter — lo snapshot datato qwen/qwen3.8-max-0902 è instradabile al prezzo di listino di Alibaba secondo il modello pass-through, il che significa che una variazione delle tariffe di Alibaba è attiva dalla nostra parte lo stesso giorno anziché dopo che un rivenditore ha rinegoziato. GPT-6 Sol non è nel nostro catalogo al momento in cui scriviamo ed è raggiungibile tramite l'API di OpenAI stessa. Il DSL di routing è l'elemento che si adatta a questo caso specifico: una regola che instrada le richieste contenenti video da una parte e tutto il resto dall'altra è esattamente ciò per cui esiste, e il failover automatico fa sì che il ramo per modalità non diventi il singolo punto di guasto.
Dove ciascuno vince
• Video in ingresso, testo in uscita — Qwen3.8-Max, e non c'è alcuna competizione da descrivere.
• Testo e immagine in input, costo per attività completata come metrica — GPT-6 Sol, di circa cinque volte sull'harness indipendente.
• Lavoro con prefisso in cache — GPT-6 Sol. La sua lettura dalla cache è marginalmente più economica e il suo volume di token è meno della metà.
• Richieste superiori a 272.000 token di input — Qwen3.8-Max. La riprezzatura dell'intera richiesta di Sol è la singola differenza di costo più grande in questo confronto, ed è invisibile sulle tariffe principali.
• Pinning riproducibile — Qwen3.8-Max-0902, che non costa nulla in più ed è l'unica revisione bloccata delle due.
• Se ti è stato mostrato un grafico con Qwen in vantaggio su SWE-bench Pro, controlla di chi è l'harness che l'ha prodotto e con quale impostazione di effort. La classifica indipendente vede Qwen tre punti indietro sul composito, e le tabelle dei fornitori non sono sulla stessa scala tra loro.
Confrontati in questo articolo3
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
