Una hero card generata intitolata "GPT-6.1 Sol vs Qwen3.8-Max" con due pannelli arrotondati: a sinistra "GPT-6.1 Sol" che elenca "OpenAI - rilasciato il 29 set 2026", "$2,00 in / $10,00 out per 1M", "$0,72 per attività" e "AA Index 51,8"; a destra "Qwen3.8-Max" che elenca "Alibaba - rilasciato il 3 ago 2026", "$2,00 in / $6,00 out per 1M", "$5,41 per attività" e "AA Index 45,4"; sotto di essi la striscia "Stesso prezzo di input. 7,5 volte la fattura."; piè di pagina "Dati: Artificial Analysis v4.3.2." e il logo OrcaRouter in basso a destra.
Guides & Insights

GPT-6.1 Sol vs Qwen3.8-Max: la fattura, non il listino prezzi

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Prendi un lavoro notturno di manutenzione del repository, eseguilo una volta a notte per un mese e metti GPT-6.1 Sol e Qwen3.8-Max a turno su di esso. Secondo i dati per attività di Artificial Analysis v4.3.2, GPT-6.1 Sol costa $21,72 per quelle trenta notti e Qwen3.8-Max costa $162,27 — un divario di $140,55 al mese, circa $1.690 all'anno, per un lavoro il cui listino prezzi per token riporta $2,00 in ingresso e $10,00 in uscita contro $2,00 in ingresso e $6,00 in uscita. Le tariffe per milione sono a meno di un errore di arrotondamento l'una dall'altra sull'input e il modello cinese è più economico del 40% sull'output, eppure la fattura differisce di un fattore di 7,5. Il fornitore ha rilasciato GPT-6.1 Sol il 29 settembre 2026; Qwen3.8-Max è disponibile dal 3 agosto 2026.

Quel divario non è un trucco di prezzo e non è un artefatto del benchmark — è tutto ciò che questo confronto ha da dire, e deriva da un numero che nessun listino prezzi ti mostra.

Cosa è ciascun modello

GPT-6.1 Sol è l'attuale flagship di OpenAI per reasoning e coding, rilasciato una settimana dopo il GPT-6 Sol che sostituisce, allo stesso prezzo di listino di $2,00 / $10,00, con una tariffa di $0,10 per l'input in cache e una finestra di contesto di 1.050.000 token. È venduto per il lavoro agentico: i suoi tag best-for sulla nostra scheda modello recitano reasoning, coding e agentico, e porta il punteggio di qualità di fascia più alta.

Qwen3.8-Max è il flagship agentico di Alibaba — un modello chiuso, disponibile solo via API, che accetta input testuali, immagini e video e gestisce un contesto da 1.000.000 di token. A differenza delle release Qwen più piccole, questo non ha pesi pubblicati. Su Artificial Analysis si colloca a 45,42 sull'Intelligence Index, 17º su 147 modelli, con un indice di coding di 76,2 che lo classifica 9º in quel campo. Non è un modello debole. È semplicemente costoso lasciarlo pensare.

Il numero che non è sul tariffario

A generated two-column scoreboard titled 'GPT-6.1 Sol vs Qwen3.8-Max - the scoreboard'. Left column 'GPT-6.1 Sol': Output tokens 38,128, Reasoning tokens 25,190, Cost per task $0.72, AA Index 51.8, Time per task 640 s, Context 1.05M. Right column 'Qwen3.8-Max': Output tokens 107,730, Reasoning tokens 70,830, Cost per task $5.41, AA Index 45.4, Time per task 2,152 s, Context 1M. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Artificial Analysis registra 107.730 token di output per attività per Qwen3.8-Max, di cui 70.830 sono token di ragionamento. GPT-6.1 Sol produce 38.128 token di output, 25.190 dei quali di ragionamento. Il modello cinese scrive 2,8 volte tanti token per rispondere alla stessa domanda, e li scrive a un costo per token inferiore del 40%.

• Token di output per attività — 38.128 vs 107.730; Qwen ne scrive 2,8× di più

• Di cui ragionamento — 25.190 vs 70.830

• Costo per attività — 0,724 $ contro 5,29 $; Qwen costa 7,5 volte di più

• Tempo per attività — 640 s vs 2.152 s; circa 11 minuti vs circa 36

• Tempo al primo token di risposta — 332,0 s vs 55,1 s

• Indice di intelligenza — 51,83 vs 45,42

• Finestra di contesto — 1.050.000 vs 1.000.000 token

• Input accettati — testo, immagine e file vs testo, immagine e video

Fai la moltiplicazione e lo sconto svanisce. Un modello che genera quasi tre volte i token a una tariffa inferiore del 40% non costa meno — costa circa 1,7 volte tanto solo sull'output, e il dato misurato per attività porta il moltiplicatore reale a 7,5 una volta che input, letture dalla cache e lunghezza della risposta utile sono presi in considerazione.

Nota la quarta e la quinta riga, perché puntano in direzioni opposte e insieme spiegano cos'è Qwen3.8-Max. Restituisce il suo primo token in 55 secondi, mentre GPT-6.1 Sol impiega cinque minuti e mezzo, poi impiega trentasei minuti a completare l'attività, mentre il modello OpenAI ha finito in undici. È un modello che inizia subito a parlare e pensa molto a lungo. Per un'interfaccia di chat con una risposta in streaming, questo si legge come reattività. Per un processo notturno non presidiato, è tempo effettivo che stai pagando anche tu.

Tre ambiti in cui Qwen3.8-Max è davvero in vantaggio

Il divario dell'indice è di 6,4 punti in tutta la suite, ed è il tipo di numero che viene citato come se fosse uniforme. Non lo è, e il disaccordo è istruttivo:

• GPQA Diamond — Qwen3.8-Max 0.9283 contro GPT-6.1 Sol non pubblicato in questa esecuzione

• GDPval — 1.671,4 vs 1.575,09

• Terminal-Bench 2.1 — 0,8876 contro non pubblicato in questa esecuzione

• AutomationBench — 0,5619 vs 0,6487

• SciCode — non pubblicato in questa esecuzione vs 0.5417 per GPT-6.1 Sol

• CritPT — 0,1771 vs 0,3171

Qwen3.8-Max vince le domande scientifiche di livello universitario e il campione di compiti lavorativi, il che è un risultato concreto per un modello della sua generazione e il motivo per cui il suo indice di coding si colloca al 9° posto su 138. Perde le valutazioni più difficili e vicine alla ricerca — CritPT di 14 punti — e perde AutomationBench di 8,7, quella che più assomiglia al lavoro al computer senza supervisione. Quale delle due ritieni conti di più per il tuo carico di lavoro è la vera decisione; il dato principale di 6,4 punti è una media su un disaccordo, non un verdetto.

Cosa fanno ottenere i token extra, e cosa no

Le lunghe tracce di ragionamento non sono uno spreco per definizione. Un modello che spende 70.830 token di deliberazione su un compito difficile sta facendo qualcosa che il modello più breve potrebbe saltare, e nelle valutazioni in cui Qwen3.8-Max è in vantaggio, quella deliberazione è plausibilmente il motivo. La modalità di fallimento è che paghi per questo su ogni compito, non solo quelli difficili. I conteggi dei token di ragionamento sono una proprietà della calibrazione del modello, non della difficoltà della domanda, e un modello che pensa troppo a un'estrazione di una riga te lo fa pagare.

Il modo per scoprire quale dei tuoi task è quale è smettere di trattare la scelta del modello come globale. Il che ci porta alla parte che è una modifica di configurazione.

La nostra scheda modello per GPT-6.1 Sol riporta i numeri serviti del soggetto: la tariffa di $2,00 / $10,00, la finestra di contesto di 1.050.000 token, un p50 di 4,54 secondi al primo token e un blocco indice memorizzato di Artificial Analysis sulla stessa pagina del prezzo contro cui un'applicazione instraderebbe effettivamente il traffico.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

Una chiave, un misuratore, due modelli

Entrambi i modelli sono raggiungibili tramite un unico endpoint OrcaRouter — una sola API per oltre 200 modelli, con il prezzo di listino del provider passato attraverso a un ricarico dello 0%. La scheda OrcaRouter per Qwen3.8-Max riporta la tariffa praticata accanto alla finestra di contesto da 1.000.000 di token, alle modalità di input testo/immagine/video e al volume di 101,4 milioni di token su sette giorni — i numeri sui quali un'applicazione instrada, accanto a quelli di cui discute l'articolo. Quel pass-through conta in modo specifico per Qwen3.8-Max, perché un modello la cui economia è dominata dal volume di token in output è un modello che il suo fornitore può riprezzare in qualsiasi momento, e un contatore pass-through significa che la modifica arriva sulla tua fattura il giorno in cui Alibaba la pubblica, anziché secondo i tempi di un rivenditore.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the $2.00 input and $6.00 output per-million prices, a 5.66 s p50 time to first token, 101.4M tokens over seven days, a 1,000,000-token context window and text/image/video input, above the OpenAI- and Anthropic-compatible code samples.

L'uso più interessante del livello di routing qui è il DSL di routing, che ti consente di comporre modelli in un'unica chiamata invece di sceglierne uno per l'intera applicazione. Suddividi il job notturno: un modello economico classifica ed estrae, GPT-6.1 Sol gestisce i passaggi di ragionamento e verifica, e Qwen3.8-Max è riservato ai compiti in cui la sua lunga deliberazione e la sua forza scientifica di livello GPQA cambiano davvero la risposta. Il failover automatico copre il resto — se un provider peggiora a metà esecuzione, la richiesta si sposta invece di far fallire il batch.

Nessuna di queste è una ragione per scegliere un modello. Sono la ragione per cui non devi fare la scelta una volta sola e conviverci.

La chiamata, e la cosa da tenere d'occhio

Vale la pena pagare 7,5 volte tanto solo dove la deliberazione lo giustifica. Su un job notturno generico, GPT-6.1 Sol a 0,724 $ per attività è il default difendibile e i 1.690 $ all'anno sono reali. Dove il compito è scienza dura o ragionamento professionale con una risposta verificabile, lo 0,9283 di Qwen3.8-Max su GPQA Diamond vale i token — è proprio la cosa che fa meglio.

La cosa da tenere d'occhio è se Alibaba riprezza. Un modello da 2,8× token a $2,00/$6,00 ha un prezzo come se i token fossero la cosa scarsa; il comportamento stesso del modello rende i token abbondanti. Se il tasso di output si muove in modo sostanziale, l'aritmetica in questo articolo si muove con esso, e il misuratore del pass-through te lo mostrerà lo stesso giorno in cui accade.

Confrontati in questo articolo3

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno