Una hero title card per un articolo che confronta GPT-6 Sol con Qwen3.8-Max, che riporta 'GPT-6 Sol vs Qwen3.8-Max' con il sottotitolo 'L'unica riga in cui il modello chiuso non può competere', mostrando GPT-6 Sol come input testo e immagine e Qwen3.8-Max come input testo, immagine e video.
Guides & Insights

GPT-6 Sol vs Qwen3.8-Max: L'unica riga in cui il modello chiuso non può competere

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Quasi ogni confronto tra GPT-6 Sol e Qwen3.8-Max verrà deciso sul costo, e quasi tutti lo sbaglieranno nella stessa direzione. Qwen3.8-Max, il modello di punta ospitato dal fornitore, ha un prezzo di 2,00 $ per milione di token in input e 6,00 $ per milione in output dalla sua disponibilità generale del 3 agosto 2026, con lo snapshot datato Qwen3.8-Max-0902 reso disponibile il 2 settembre. GPT-6 Sol ha raggiunto la disponibilità generale il 22 settembre 2026 a 2,00 $ in input e 10,00 $ in output. Prezzo identico per l'input, e output più economico del 40% secondo il listino di Qwen3.8-Max — e, sull'harness indipendente, circa cinque volte il costo per completare un'attività.

Ma c'è una seconda differenza, più netta, che l'argomentazione sui costi continua a sotterrare, ed è quella che in realtà decide alcuni carichi di lavoro. Qwen3.8-Max accetta i video. GPT-6 Sol no. Non è una voce di prezzo né una riga di benchmark; è una capacità che uno di questi modelli ha e che l'altro non può approssimare, ed è l'unico aspetto di questo confronto che nessuna quantità di lavoro sull'efficienza dei token potrà risolvere.

A six-row scoreboard card titled 'GPT-6 Sol vs Qwen3.8-Max - the scoreboard', comparing the two models on output price, Intelligence Index, cost per task, input modality, maximum output and long-context handling. The left column lists GPT-6 Sol at $10.00 output, an Index of 48, $1.06 per task, text and image input, a 128,000-token maximum output and whole-request repricing above 272K; the right column lists Qwen3.8-Max at $6.00 output, an Index of 45, $5.41 per task, text, image and video input, a 131,072-token maximum output and a flat tier above 272K. A footer reads 'Vendor list rates; Index per Artificial Analysis.'

Due ammiraglie, due forme diverse

Qwen3.8-Max è un modello mixture-of-experts sparso da 2,4 trilioni di parametri con circa 95 miliardi di parametri attivi per query — il secondo modello ospitato più grande in produzione dopo Kimi K3. La sua finestra di contesto è di un milione di token con un limite di output di 131.072 token, le sue modalità di input sono testo, immagine e video, e supporta reasoning effort su basso, medio ed extra-alto con output strutturati e tool calling. Il flagship ospitato non è open weights; l'artefatto scaricabile della stessa generazione è una release separata con i suoi limiti.

GPT-6 Sol accetta testo e immagini in input e restituisce testo. La sua finestra di contesto è di 1.050.000 token, con un massimo di 922.000 token di input e un tetto di 128.000 token di output, al prezzo fisso di 2,00 $ e 10,00 $, con 0,20 $ per lettura dalla cache e 2,50 $ per scrittura nella cache, riprezzando l'intera richiesta oltre i 272.000 token di input a 4,00 $ e 15,00 $. È chiuso, con identificatore singolo, e OpenAI ha descritto le tariffe come permanenti anziché promozionali.

I valori della finestra sono entro circa il 7% l'uno dall'altro, e i limiti massimi di output sono nella stessa fascia. L'elenco delle modalità è l'unico divario strutturale — e va in una sola direzione.

Non vedo il testo da tradurre. Inviami il messaggio che vuoi farmi tradurre in italiano, includendo i relativi marcatori di span, e provvederò a restituirlo con i marcatori intatti.

• Input — GPT-6 Sol 2,00 $ per milione di token vs Qwen3.8-Max 2,00 $ per milione di token; il dato principale è identico

• Output — GPT-6 Sol 10,00 $ per milione di token contro Qwen3.8-Max 6,00 $ per milione di token; la tariffa di Alibaba è inferiore del 40%

• Input in cache — GPT-6 Sol 0,20 $ per milione di token contro Qwen3.8-Max 0,25 $ per milione di token per le letture implicite dalla cache, con una lettura esplicita dalla cache a 0,17 $ e una scrittura esplicita nella cache a 2,50 $

• Finestra di contesto — GPT-6 Sol 1.050.000 token vs Qwen3.8-Max 1.000.000 token

• Output massimo — GPT-6 Sol 128.000 token vs Qwen3.8-Max 131.072 token

• Modalità di input — testo e immagine di GPT-6 Sol vs testo, immagine e video di Qwen3.8-Max

• Gestione del contesto lungo — GPT-6 Sol rimodula il prezzo dell'intera richiesta al di sopra di 272.000 token di input, con tariffe di input e cache pari a 2× e output pari a 1,5×, rispetto a Qwen3.8-Max che applica una fascia fissa sull'intera finestra: è l'unico punto in cui il listino tariffario di Qwen è strutturalmente migliore anziché marginalmente più economico.

• Sforzo di ragionamento — GPT-6 Sol nessuno, basso, medio (predefinito), alto, xhigh, max vs Qwen3.8-Max basso, medio ed extra-alto

• Limite delle conoscenze — GPT-6 Sol 20 aprile 2026 vs Qwen3.8-Max non pubblicata come data unica

• Istantanea datata — GPT-6 Sol un unico identificatore in continuo aggiornamento vs Qwen3.8-Max-0902 disponibile come revisione fissata al 2 settembre 2026 allo stesso prezzo

La questione del contesto lungo merita più attenzione di quanta ne riceva di solito. Il sovrapprezzo di GPT-6 Sol è uno scaglione applicato all'intera richiesta, quindi un'esecuzione di un agente da 900.000 token viene fatturata a $4.00 e $15.00 su ogni token. Qwen3.8-Max applica un unico scaglione su tutta la finestra. Per un carico di lavoro che si mantiene oltre i 272.000 token, le due tabelle tariffarie smettono del tutto di essere confrontabili — il modello più economico in vetrina è quello più costoso, e di gran lunga, e la direzione del divario dipende interamente da dove si colloca il vostro contesto.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured 23 September 2026, showing an Intelligence Index score of 45, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a cost of $5.41 per Intelligence Index task, 190 million output tokens generated during the index run, a 984,000-token context window and 39.2 output tokens per second.

Il listino prezzi dice 40% in meno. L'harness dice cinque volte il conto.

Artificial Analysis ha misurato Qwen3.8-Max-0902 con un punteggio dell'Intelligence Index di 45, con un costo di 5,41 $ per ogni attività dell'indice completata, avendo generato 190 milioni di token di output durante l'esecuzione. Il suo riepilogo descrive il modello come "notevolmente lento e molto prolisso". GPT-6 Sol ha ottenuto 48 a 1,06 $ per attività su 77 milioni di token di output.

Leggi quelle tre coppie insieme e appare la forma del confronto. Qwen è tre punti indice indietro, ha generato due volte e mezzo i token ed è costato circa cinque volte tanto per attività completata — su un listino prezzi in cui il suo output è più economico del 40%. Il meccanismo non è sottile. A 6,00 $ per milione di token di output, 190 milioni di token costano 1,14 $ per esecuzione dell'indice solo in output, prima di contare l'input; a 10,00 $ per milione, i 77 milioni di Sol costano 0,77 $. La tariffa più economica sta comprando più token, non un conto più basso.

Questo è lo stesso schema che ricorre in tutto il panorama di settembre, e vale la pena enunciarlo come regola anziché come fatto riguardante questi due modelli: su una tariffa per token, uno sconto del 40% sull'output non vale nulla se il modello emette due volte e mezzo il numero di token. Il costo per attività completata è l'unico dato che regge.

Ciò che Alibaba ha pubblicato, e il problema della definizione dello sforzo

La tabella di benchmark propria di Alibaba è la più lunga in questo confronto e la meno comparabile. Le cifre riportate dai fornitori mettono Qwen3.8-Max in vantaggio su PaperBench e IFBench, ma in svantaggio su SWE-bench Pro e Humanity's Last Exam, con una scala di sforzo di ragionamento — basso, medio, extra-alto — che non ha una corrispondenza diretta con la scala a sei livelli di OpenAI. Un punteggio pubblicato a livello extra-alto non è lo stesso prodotto di un punteggio pubblicato a livello medio, e nessuno dei due fornitori indica quale livello ha prodotto un dato numero su un grafico di confronto.

Questa è la ragione onesta per non affidarsi alla tabella di nessuno dei due fornitori in questo caso. I numeri di Alibaba sono eseguiti sull'harness di Alibaba con l'impostazione di effort di Alibaba; quelli di OpenAI sono eseguiti su OpenAI. Le cifre di Artificial Analysis esistono proprio perché entrambi questi dati sono inutilizzabili come confronto diretto, e sono quelle usate sopra.

La riproducibilità è una vera funzionalità, e ha un prezzo pari a zero

Lo snapshot datato è la voce più sottovalutata di questo confronto. Qwen3.8-Max-0902 è una revisione bloccata del 2 settembre 2026 che, secondo Alibaba, offre le stesse capacità e lo stesso prezzo del modello base. Bloccarla significa che il modello dietro il tuo endpoint non cambia sotto i tuoi piedi tra un martedì e un giovedì.

GPT-6 Sol non ha equivalenti. È un singolo identificatore rolling — la stessa pagina del modello contiene uno snapshot predefinito e nessuna variante datata — il che significa che ciò che hai testato a settembre non è garantito essere ciò che stai chiamando a novembre. Per la maggior parte dei team va bene. Per una pipeline regolamentata che deve dimostrare che cosa ha prodotto un output, è una differenza reale, ed è una che Alibaba offre gratuitamente mentre OpenAI non la offre affatto.

La linea video è quella che decide

Tutto ciò che precede è un confronto. Questa parte no. Se il tuo input include video — registrazioni dello schermo, filmati di ispezione, catture di lezioni, qualsiasi cosa in cui l'informazione sia in movimento anziché in un fotogramma statico — Qwen3.8-Max lo accetta nativamente e GPT-6 Sol non ha alcun percorso per accedervi. Non puoi aggirare una modalità con i prompt. Non puoi pre-elaborare un video in immagini e ottenere la stessa cosa, perché l'informazione temporale è il punto, e nessuna quantità di punti indice su un benchmark testuale può sostituire l'input che il tuo compito richiede effettivamente.

Vale la pena menzionare anche il caso inverso, perché è lì che il confronto smette di essere sbilanciato. Se il tuo input è testo e immagini, {{1}}Sol{{/1}} è più economico per attività, {{2}}quattro punti{{/2}} avanti nella classifica neutrale, e più economico sulle letture in cache. La capacità video non è un fattore decisivo a tuo favore; è semplicemente inutilizzata.

Instradamento di una decisione che ha due risposte separate

Screenshot of OrcaRouter's model page for Qwen3.8 Max (0902), captured 23 September 2026, showing the model id qwen/qwen3.8-max-0902 from provider Qwen, a 1M-token context window with a 131k-token maximum output, text, image and video input with text output, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, and a p50 time to first token of 3.50 seconds.

Questo è un confronto in cui l'architettura giusta è davvero composta da due modelli, non da uno, e il motivo è che la suddivisione avviene per modalità di input anziché per difficoltà. Una pipeline che acquisisce video e ragiona sul testo necessita di entrambi, e la regola di instradamento è una proprietà della richiesta anziché una decisione soggettiva.

Qwen3.8-Max è nel catalogo di OrcaRouter — lo snapshot datato qwen/qwen3.8-max-0902 è instradabile al prezzo di listino di Alibaba secondo il modello pass-through, il che significa che una variazione delle tariffe di Alibaba è attiva dalla nostra parte lo stesso giorno anziché dopo che un rivenditore ha rinegoziato. GPT-6 Sol non è nel nostro catalogo al momento in cui scriviamo ed è raggiungibile tramite l'API di OpenAI stessa. Il DSL di routing è l'elemento che si adatta a questo caso specifico: una regola che instrada le richieste contenenti video da una parte e tutto il resto dall'altra è esattamente ciò per cui esiste, e il failover automatico fa sì che il ramo per modalità non diventi il singolo punto di guasto.

Dove ciascuno vince

• Video in ingresso, testo in uscita — Qwen3.8-Max, e non c'è alcuna competizione da descrivere.

• Testo e immagine in input, costo per attività completata come metrica — GPT-6 Sol, di circa cinque volte sull'harness indipendente.

• Lavoro con prefisso in cache — GPT-6 Sol. La sua lettura dalla cache è marginalmente più economica e il suo volume di token è meno della metà.

• Richieste superiori a 272.000 token di input — Qwen3.8-Max. La riprezzatura dell'intera richiesta di Sol è la singola differenza di costo più grande in questo confronto, ed è invisibile sulle tariffe principali.

• Pinning riproducibile — Qwen3.8-Max-0902, che non costa nulla in più ed è l'unica revisione bloccata delle due.

• Se ti è stato mostrato un grafico con Qwen in vantaggio su SWE-bench Pro, controlla di chi è l'harness che l'ha prodotto e con quale impostazione di effort. La classifica indipendente vede Qwen tre punti indietro sul composito, e le tabelle dei fornitori non sono sulla stessa scala tra loro.

Confrontati in questo articolo3

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno