Card del titolo hero generata con il titolo 'GPT-6 Luna vs Qwen3.8-Max' e il sottotitolo 'Il modello più economico qui non è quello che guarda i video', un piè di pagina che recita 'Prezzi per OpenAI e Alibaba Cloud; cifre dell'indice per Artificial Analysis.', e il logo OrcaRouter compositato in basso a destra.
Guides & Insights

GPT-6 Luna vs Qwen3.8-Max: il modello più economico di questo confronto è anche l'unico che guarda i video

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

L'inquadramento più ovvio per questo abbinamento è quello sbagliato. Qwen3.8-Maxha un prezzo di listino di 2,00 $ per milione di token in input e 6,00 $ per milione in output, con le letture dalla cache a 0,25 $. GPT-6 Lunaha un prezzo di listino di 0,10 $ e 0,50 $, con le letture dalla cache a un centesimo. Venti volte sull'input, dodici volte sull'output, cinquanta volte sull'input in cache — un divario di prezzo così ampio che il confronto sembra già deciso prima ancora di cominciare.

Non è stabilito, perché i due modelli non competono per la stessa richiesta. Qwen3.8-Max accetta testo, immagini e video, e il suo limite massimo di output di 131.072 token è leggermente superiore ai 128.000 di GPT-6 Luna. GPT-6 Luna accetta solo testo e immagini. Il modello di Alibaba ottiene 58 sull'independent Intelligence Index — primo nella sua categoria nella classifica agentica — e GPT-6 Luna ottiene 37 al massimo sforzo, 29 con l'impostazione predefinita. Uno è un flagship con una discendenza open-weight e una modalità di input video. L'altro è una fascia di volume con un dato di velocità e una tariffa cache di un centesimo. Il divario di prezzo non è uno sconto sulla stessa cosa; è la descrizione di due cose diverse.

Che cos'è ciascuno di questi due

Qwen3.8-Max è il modello di punta di Alibaba della generazione 3.8, un checkpoint di classe Max il cui modello sottostante — Qwen3.8-2.4T-A95B — è stato rilasciato pubblicamente con una licenza personalizzata il 12 agosto 2026, rendendolo il primo Qwen di classe Max ad avere pesi aperti. Il modello di punta ospitato è ancora indicato dalla board indipendente come proprietario. Offre una finestra di contesto di 1.000.000 di token, un tetto di output di 131.072 token, input di testo, immagini e video, e uno sforzo di ragionamento selezionabile tra basso, medio ed extra-alto. Una revisione fissata Qwen3.8-Max-0902 è disponibile allo stesso prezzo: un piccolo dettaglio dal valore operativo concreto.

GPT-6 Luna è il livello di efficienza di OpenAI dal 22 settembre 2026, posizionato sotto GPT-6 Sol a $2,00/$10,00 e l'ammiraglia GPT-6 Astra a $10,00/$50,00. Input testo e immagini, output testo, una finestra di 1.050.000 token con un massimo di 922.000 token di input, un tetto di output di 128.000 token, e sforzo: nessuno, basso, medio, alto, xhigh e max, con medio come predefinito. Chiuso, con identificatore singolo, disponibile per chiunque abbia una chiave API.

Uno accetta video e può essere scaricato nella sua forma base. Uno accetta immagini ed è veloce. Entrambi hanno un prezzo pensato per un uso ad alto volume. La sovrapposizione tra queste due affermazioni è minore di quanto suggerisca il rapporto tra i prezzi.

Le carte, riga per riga

Una riga per dimensione, entrambi i lati su ciascuna:

Input per 1 mln — GPT-6 Luna $0,10 contro Qwen3.8-Max $2,00

• Output per 1M — GPT-6 Luna $0,50 vs Qwen3.8-Max $6,00

Input memorizzato nella cache per 1M — GPT-6 Luna $0.01 vs Qwen3.8-Max $0.25 per letture implicite dalla cache, con una lettura esplicita dalla cache a $0.17 e una scrittura esplicita nella cache a $2.50

• Clausola di contesto lungo — GPT-6 Luna raddoppia input e cache e aumenta l'output di 1,5× per input oltre 272.000 token, applicata all'intera richiesta, rispetto a Qwen3.8-Max, un livello fisso su tutta la finestra, che è l'unico punto in cui la scheda Qwen è strutturalmente migliore anziché marginalmente più economica

• Finestra di contesto — GPT-6 Luna 1.050.000 token vs Qwen3.8-Max 1.000.000 token

• Output massimo — GPT-6 Luna 128.000 token vs Qwen3.8-Max 131.072 token

• Modalità di input — GPT-6 Luna testo e immagini vs Qwen3.8-Max testo, immagini e video

• Sforzo di ragionamento — GPT-6 Luna: nessuno, basso, medio (predefinito), alto, xhigh, massimo vs Qwen3.8-Max: basso, medio ed extra-alto

• Intelligence Index, indipendente — GPT-6 Luna 37 al massimo sforzo vs Qwen3.8-Max 58

• Agentic Index, indipendente — Qwen3.8-Max 58, primo della sua categoria; nessun dato comparabile su GPT-6 Luna è stato pubblicato

• Punteggio con sforzo predefinito — GPT-6 Luna 29 con l'impostazione media predefinita vs Qwen3.8-Max misurato alla sua impostazione massima

• Costo per attività Index, indipendente — GPT-6 Luna circa $0,07 vs Qwen3.8-Max $5,41

• GDPval, indipendente — Qwen3.8-Max 1.739 Elo con 64 turni per attività, che corrisponde a circa 1,14 $ per attività completata in quella valutazione; non è pubblicata alcuna esecuzione comparabile di GPT-6 Luna

• Tasso di allucinazione su AA-Omniscience — Qwen3.8-Max 40%, una regressione rispetto al 23% della generazione precedente; GPT-6 Luna 77%, in calo dal 93%

• Snapshot datato — GPT-6 Luna un unico identificatore rolling rispetto a Qwen3.8-Max-0902 disponibile come revisione fissata al 2 settembre 2026 allo stesso prezzo

• Pesi — GPT-6 Luna chiusi, solo API vs Qwen3.8-Max, il checkpoint base Qwen3.8-2.4T-A95B pubblico con licenza personalizzata dal 12 agosto 2026, mentre il modello di punta ospitato è indicato come proprietario

• Su OrcaRouter — GPT-6 Luna non nel nostro catalogo rispetto a Qwen3.8-Max instradabile al prezzo di listino di Alibaba

Generated two-column scoreboard titled 'GPT-6 Luna vs Qwen3.8-Max - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index 37 at max effort, Context 1,050,000, Input text + image, Cost per index task $0.07. Right column Qwen3.8-Max rows: Price in/out $2.00 / $6.00, Cached input $0.25, AA Index 58, Context 1,000,000, Input text + image + video, Cost per index task $5.41. Footer: 'Prices per OpenAI and Alibaba Cloud; index figures per Artificial Analysis.'

Il video non è una linea di funzionalità, è un carico di lavoro diverso.

La riga della modalità è quella che determina più confronti reali rispetto alla riga del prezzo, e di solito viene letta come una casella di controllo.

Qwen3.8-Max accetta i video. GPT-6 Luna no. Se la tua pipeline deve ragionare su una registrazione dello schermo, una demo di prodotto, la registrazione di una lezione, un segmento di una telecamera di sicurezza o una guida passo passo dell'interfaccia utente, il confronto finisce su quella riga e la differenza di prezzo di venti volte diventa irrilevante: non stai scegliendo tra un'opzione costosa e una economica, stai scegliendo tra un'opzione e nessuna opzione. Estrarre fotogrammi e passarli come immagini è un espediente, non un equivalente, e chiunque ne abbia costruito uno ne conosce la differenza sia in termini di costo sia di qualità.

Se la tua pipeline è testo e immagini, la linea della modalità tace e la linea del prezzo parla. Questa è la divisione onesta, e vale la pena essere schietti su da che parte di essa ti trovi prima di leggere qualunque altra cosa in questa pagina.

Il divario agentico è reale ed è la metà costosa della differenza di prezzo

Qwen3.8-Max ottiene 58 sull'Intelligence Index indipendente. GPT-6 Luna ottiene 37 con sforzo massimo e 29 con la sua impostazione media predefinita. Ventuno punti a impostazioni equivalenti, ventinove con le impostazioni predefinite — su un composito in cui un singolo punto rientra nel rumore di una ripetizione, un divario di quella portata non è rumore.

Il posizionamento di Qwen3.8-Max è concentrato sul lavoro agentico. Ottiene 58 sull'Agentic Index indipendente, primo della sua categoria, e 1.739 Elo su GDPval a 64 turni per attività. Quest'ultimo dato è quello informativo, perché è la misura di un modello che tiene insieme un'attività attraverso sessantaquattro decisioni sequenziali, e porta con sé un prezzo: circa 1,14 $ per attività completata in quella valutazione. Confrontatelo con il costo per attività dell'indice di GPT-6 Luna, di circa 0,07 $, e l'affermazione onesta non è che Qwen sia costoso. È che a Qwen viene chiesto di fare una cosa molto più difficile, e la sta facendo.

Il corollario è che anche il deficit di ventun punti di GPT-6 Luna non è distribuito uniformemente sul tuo carico di lavoro. Su un compito breve, ben specificato e consumato da un programma — estrai questo campo, classifica questo ticket, instrada questa richiesta — entrambi i modelli produrranno quasi sempre la stessa risposta utilizzabile, e il divario nell'indice sarà invisibile nella tua valutazione. Su un compito che richiede sessantaquattro azioni sequenziali con un checkpoint alla fine, il divario è la differenza tra completare e fermarsi silenziosamente a metà, e questo è il compito per il quale Qwen3.8-Max è stato costruito e GPT-6 Luna no.

Un numero va nella direzione opposta e merita di essere dichiarato anziché sepolto. Il tasso di allucinazione di Qwen3.8-Max sulla classifica dell'omniscienza è del 40%, in aumento dal 23% della generazione precedente — una regressione sostanziale, e del tipo che si manifesta in produzione come risposte sbagliate dette con sicurezza anziché come una riga in un benchmark. Quello di GPT-6 Luna è del 77%, in calo dal 93%. Entrambi i valori sono alti in termini assoluti, e il modello più economico resta il peggiore dei due su questa misura. Nessuno dei due numeri è un motivo per preferire un modello; entrambi sono motivi per tenere un essere umano o un verificatore nel ciclo su qualsiasi cosa in cui un fatto inventato sia costoso.

La clausola del contesto lungo è l'unico punto in cui Qwen vince sulla struttura

GPT-6 Luna include una clausola che Qwen3.8-Max non ha: le richieste superiori a 272.000 token di input vengono fatturate al doppio delle tariffe di input e cache e a 1,5× la tariffa di output, applicate all'intera richiesta anziché alla sola porzione eccedente. Una chiamata da 300.000 token su GPT-6 Luna viene fatturata a $0,20 per milione di token di input per tutti i 300.000 token, perché ha superato la soglia di 28.000. Suddividi lo stesso documento in due chiamate e il costo si dimezza, senza alcuna modifica al prompt.

Qwen3.8-Max è a tariffa fissa lungo tutta la sua finestra completa di 1.000.000 di token. Per richieste singole davvero enormi, ciò rende il divario di dodici volte sul prezzo di output più piccolo di quanto sembri e può invertirlo: oltre 272.000 token di input, la tariffa effettiva di input di GPT-6 Luna raddoppia a 0,20 $, e la sua tariffa di output sale a 0,75 $, contro i 2,00 $ e 6,00 $ fissi di Qwen. Il divario si restringe da venti volte a dieci sull'input e da dodici a otto sull'output. Ancora ampio — ma i carichi di lavoro che più probabilmente hanno un contesto operativo di 300.000 token sono esattamente quelli agentici su cui entrambi i fornitori stanno vendendo, e i team che li gestiscono sono i team che se ne accorgeranno.

L'altra linea strutturale è la revisione bloccata. Qwen3.8-Max-0902 è disponibile allo stesso prezzo dell'identificatore rolling, il che significa che un team che necessita di un comportamento riproducibile attraverso un aggiornamento del modello può ottenerlo senza pagare un sovrapprezzo. GPT-6 Luna non offre nulla di equivalente. È una riga piccola su un listino prezzi e una riga grande in un post-mortem.

Eseguendone uno, o entrambi

Qwen3.8-Max è disponibile su OrcaRouter al prezzo di listino di Alibaba, con il pricing pass-through che significa che una variazione delle tariffe del fornitore è attiva dalla nostra parte lo stesso giorno. Due aspetti del nostro livello di routing si guadagnano il loro posto per questo modello in particolare: il failover automatico, perché un flagship ospitato con una base open-weight pubblicata ha più upstream rispetto a un modello chiuso di un singolo fornitore e più modi in cui uno di essi può degradarsi; e la gestione delle revisioni bloccate, che consente a una route di mantenere esplicitamente Qwen3.8-Max-0902 invece di ereditare qualunque cosa l'identificatore rolling risolva la settimana prossima.

GPT-6 Luna non è nel nostro catalogo al momento della stesura e vi si accede tramite l'API di OpenAI stessa, quindi un team che vuole entrambi utilizza una chiave per Qwen3.8-Max insieme a qualunque cosa già usi per OpenAI. Questa è anche l'abbinamento in cui il DSL di routing vale più di una suddivisione statica, perché il confine tra i due modelli è un controllo di modalità e un controllo di lunghezza anziché una preferenza: le richieste che contengono video vanno a Qwen3.8-Max perché nient'altro può servirle, le richieste oltre 272.000 token di input vanno a Qwen3.8-Max perché il salto dell'altro modello le rende più costose lì, e tutto il resto va al modello che costa un ventesimo. Questa è una regola, e appartiene alla configurazione anziché a un ramo dell'applicazione.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

Quale, e quando

Scegli Qwen3.8-Max se è vera una qualsiasi delle seguenti condizioni. La tua pipeline richiede video in input. Le tue richieste superano regolarmente 272.000 token di input, dove la sua fascia flat batte la nuova tariffazione di GPT-6 Luna. Il tuo output supera i 128.000 token. Il tuo lavoro è esecuzione agentica a lungo orizzonte con un endpoint verificabile, dove il suo 58 sulla classifica agentica e 1.739 Elo su GDPval a 64 turni per attività sono le prove che contano. Oppure hai bisogno di una revisione bloccata per la riproducibilità e sei disposto a pagarla — il che, allo stesso prezzo dell'identificatore rolling, significa che non lo sei.

Scegli GPT-6 Luna se nessuno di quelli si applica e il tuo carico di lavoro è ad alto volume, consumato da programmi, testo e immagini, e di breve durata. Classificazione, estrazione, routing, riepilogo in blocco, il ciclo interno di un agente che ha bisogno di una risposta veloce anziché accurata. A $0,10/$0,50 con una lettura in cache da un centesimo e un costo per attività completata pari a circa un quindicesimo di quello di Qwen3.8-Max, i numeri non sono neanche lontanamente vicini. Imposta esplicitamente il parametro effort — il valore predefinito è medium e il 37 in evidenza è un valore di massimo effort — e mantieni le chiamate lunghe al di sotto della soglia di 272.000 token.

L'errore che questo confronto invita a commettere è leggere il prezzo dell'input venti volte superiore come un verdetto. È un verdetto su una sola forma di carico di lavoro, e tace sulle tre righe che decidono l'altra: se la richiesta trasporta video, se supera i 272.000 token e se la risposta deve sopravvivere a sessantaquattro passaggi sequenziali.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) showing the breadcrumb Home > Models > Qwen > Qwen3.8 Max (0902), a NEW badge, the model id qwen/qwen3.8-max-0902, Vision, Tools, JSON and Reasoning chips, a Qwen attribution dated 2026-09-02, the description of a September 2, 2026 snapshot accepting text, image and video input with a 1M-token context, input pricing of $2.00 and output of $6.00 per 1M tokens, a p50 time to first token of 3.50s, a p95 of 9.38s, and traffic of 196.6M tokens over seven days.

Confrontati in questo articolo3

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno