
GPT-6.1 Sol vs Qwen3.8-Max: la fattura, non il listino prezzi
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Prendi un lavoro notturno di manutenzione del repository, eseguilo una volta a notte per un mese e metti GPT-6.1 Sol e Qwen3.8-Max a turno su di esso. Secondo i dati per attività di Artificial Analysis v4.3.2, GPT-6.1 Sol costa $21,72 per quelle trenta notti e Qwen3.8-Max costa $162,27 — un divario di $140,55 al mese, circa $1.690 all'anno, per un lavoro il cui listino prezzi per token riporta $2,00 in ingresso e $10,00 in uscita contro $2,00 in ingresso e $6,00 in uscita. Le tariffe per milione sono a meno di un errore di arrotondamento l'una dall'altra sull'input e il modello cinese è più economico del 40% sull'output, eppure la fattura differisce di un fattore di 7,5. Il fornitore ha rilasciato GPT-6.1 Sol il 29 settembre 2026; Qwen3.8-Max è disponibile dal 3 agosto 2026.
Quel divario non è un trucco di prezzo e non è un artefatto del benchmark — è tutto ciò che questo confronto ha da dire, e deriva da un numero che nessun listino prezzi ti mostra.
Cosa è ciascun modello
GPT-6.1 Sol è l'attuale flagship di OpenAI per reasoning e coding, rilasciato una settimana dopo il GPT-6 Sol che sostituisce, allo stesso prezzo di listino di $2,00 / $10,00, con una tariffa di $0,10 per l'input in cache e una finestra di contesto di 1.050.000 token. È venduto per il lavoro agentico: i suoi tag best-for sulla nostra scheda modello recitano reasoning, coding e agentico, e porta il punteggio di qualità di fascia più alta.
Qwen3.8-Max è il flagship agentico di Alibaba — un modello chiuso, disponibile solo via API, che accetta input testuali, immagini e video e gestisce un contesto da 1.000.000 di token. A differenza delle release Qwen più piccole, questo non ha pesi pubblicati. Su Artificial Analysis si colloca a 45,42 sull'Intelligence Index, 17º su 147 modelli, con un indice di coding di 76,2 che lo classifica 9º in quel campo. Non è un modello debole. È semplicemente costoso lasciarlo pensare.
Il numero che non è sul tariffario

Artificial Analysis registra 107.730 token di output per attività per Qwen3.8-Max, di cui 70.830 sono token di ragionamento. GPT-6.1 Sol produce 38.128 token di output, 25.190 dei quali di ragionamento. Il modello cinese scrive 2,8 volte tanti token per rispondere alla stessa domanda, e li scrive a un costo per token inferiore del 40%.
• Token di output per attività — 38.128 vs 107.730; Qwen ne scrive 2,8× di più
• Di cui ragionamento — 25.190 vs 70.830
• Costo per attività — 0,724 $ contro 5,29 $; Qwen costa 7,5 volte di più
• Tempo per attività — 640 s vs 2.152 s; circa 11 minuti vs circa 36
• Tempo al primo token di risposta — 332,0 s vs 55,1 s
• Indice di intelligenza — 51,83 vs 45,42
• Finestra di contesto — 1.050.000 vs 1.000.000 token
• Input accettati — testo, immagine e file vs testo, immagine e video
Fai la moltiplicazione e lo sconto svanisce. Un modello che genera quasi tre volte i token a una tariffa inferiore del 40% non costa meno — costa circa 1,7 volte tanto solo sull'output, e il dato misurato per attività porta il moltiplicatore reale a 7,5 una volta che input, letture dalla cache e lunghezza della risposta utile sono presi in considerazione.
Nota la quarta e la quinta riga, perché puntano in direzioni opposte e insieme spiegano cos'è Qwen3.8-Max. Restituisce il suo primo token in 55 secondi, mentre GPT-6.1 Sol impiega cinque minuti e mezzo, poi impiega trentasei minuti a completare l'attività, mentre il modello OpenAI ha finito in undici. È un modello che inizia subito a parlare e pensa molto a lungo. Per un'interfaccia di chat con una risposta in streaming, questo si legge come reattività. Per un processo notturno non presidiato, è tempo effettivo che stai pagando anche tu.
Tre ambiti in cui Qwen3.8-Max è davvero in vantaggio
Il divario dell'indice è di 6,4 punti in tutta la suite, ed è il tipo di numero che viene citato come se fosse uniforme. Non lo è, e il disaccordo è istruttivo:
• GPQA Diamond — Qwen3.8-Max 0.9283 contro GPT-6.1 Sol non pubblicato in questa esecuzione
• GDPval — 1.671,4 vs 1.575,09
• Terminal-Bench 2.1 — 0,8876 contro non pubblicato in questa esecuzione
• AutomationBench — 0,5619 vs 0,6487
• SciCode — non pubblicato in questa esecuzione vs 0.5417 per GPT-6.1 Sol
• CritPT — 0,1771 vs 0,3171
Qwen3.8-Max vince le domande scientifiche di livello universitario e il campione di compiti lavorativi, il che è un risultato concreto per un modello della sua generazione e il motivo per cui il suo indice di coding si colloca al 9° posto su 138. Perde le valutazioni più difficili e vicine alla ricerca — CritPT di 14 punti — e perde AutomationBench di 8,7, quella che più assomiglia al lavoro al computer senza supervisione. Quale delle due ritieni conti di più per il tuo carico di lavoro è la vera decisione; il dato principale di 6,4 punti è una media su un disaccordo, non un verdetto.
Cosa fanno ottenere i token extra, e cosa no
Le lunghe tracce di ragionamento non sono uno spreco per definizione. Un modello che spende 70.830 token di deliberazione su un compito difficile sta facendo qualcosa che il modello più breve potrebbe saltare, e nelle valutazioni in cui Qwen3.8-Max è in vantaggio, quella deliberazione è plausibilmente il motivo. La modalità di fallimento è che paghi per questo su ogni compito, non solo quelli difficili. I conteggi dei token di ragionamento sono una proprietà della calibrazione del modello, non della difficoltà della domanda, e un modello che pensa troppo a un'estrazione di una riga te lo fa pagare.
Il modo per scoprire quale dei tuoi task è quale è smettere di trattare la scelta del modello come globale. Il che ci porta alla parte che è una modifica di configurazione.
La nostra scheda modello per GPT-6.1 Sol riporta i numeri serviti del soggetto: la tariffa di $2,00 / $10,00, la finestra di contesto di 1.050.000 token, un p50 di 4,54 secondi al primo token e un blocco indice memorizzato di Artificial Analysis sulla stessa pagina del prezzo contro cui un'applicazione instraderebbe effettivamente il traffico.

Una chiave, un misuratore, due modelli
Entrambi i modelli sono raggiungibili tramite un unico endpoint OrcaRouter — una sola API per oltre 200 modelli, con il prezzo di listino del provider passato attraverso a un ricarico dello 0%. La scheda OrcaRouter per Qwen3.8-Max riporta la tariffa praticata accanto alla finestra di contesto da 1.000.000 di token, alle modalità di input testo/immagine/video e al volume di 101,4 milioni di token su sette giorni — i numeri sui quali un'applicazione instrada, accanto a quelli di cui discute l'articolo. Quel pass-through conta in modo specifico per Qwen3.8-Max, perché un modello la cui economia è dominata dal volume di token in output è un modello che il suo fornitore può riprezzare in qualsiasi momento, e un contatore pass-through significa che la modifica arriva sulla tua fattura il giorno in cui Alibaba la pubblica, anziché secondo i tempi di un rivenditore.

L'uso più interessante del livello di routing qui è il DSL di routing, che ti consente di comporre modelli in un'unica chiamata invece di sceglierne uno per l'intera applicazione. Suddividi il job notturno: un modello economico classifica ed estrae, GPT-6.1 Sol gestisce i passaggi di ragionamento e verifica, e Qwen3.8-Max è riservato ai compiti in cui la sua lunga deliberazione e la sua forza scientifica di livello GPQA cambiano davvero la risposta. Il failover automatico copre il resto — se un provider peggiora a metà esecuzione, la richiesta si sposta invece di far fallire il batch.
Nessuna di queste è una ragione per scegliere un modello. Sono la ragione per cui non devi fare la scelta una volta sola e conviverci.
La chiamata, e la cosa da tenere d'occhio
Vale la pena pagare 7,5 volte tanto solo dove la deliberazione lo giustifica. Su un job notturno generico, GPT-6.1 Sol a 0,724 $ per attività è il default difendibile e i 1.690 $ all'anno sono reali. Dove il compito è scienza dura o ragionamento professionale con una risposta verificabile, lo 0,9283 di Qwen3.8-Max su GPQA Diamond vale i token — è proprio la cosa che fa meglio.
La cosa da tenere d'occhio è se Alibaba riprezza. Un modello da 2,8× token a $2,00/$6,00 ha un prezzo come se i token fossero la cosa scarsa; il comportamento stesso del modello rende i token abbondanti. Se il tasso di output si muove in modo sostanziale, l'aritmetica in questo articolo si muove con esso, e il misuratore del pass-through te lo mostrerà lo stesso giorno in cui accade.
Confrontati in questo articolo3
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
