
GPT-6 Luna vs DeepSeek V4 Pro: un punto di indice, cinque volte il prezzo e le ragioni per possedere i propri pesi
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ecco il numero che dovrebbe decidere questo confronto e non lo fa: GPT-6 Luna ottiene 37 sull'Artificial Analysis Intelligence Index al massimo sforzo. DeepSeek V4 Pro ottiene 36 sulla stessa revisione dell'indice, sempre al massimo sforzo. A un punto di distanza, su un composito in cui un singolo punto rientra nel rumore di una ri-esecuzione — e i due modelli sono separati da circa cinque volte sul prezzo. GPT-6 Luna è listato a $0,10 per milione di token in input e $0,50 per milione in output. DeepSeek V4 Pro 0813 è listato a $0,66 e $1,98 fuori punta, raddoppiando a $1,32 e $3,96 durante la sua finestra di picco.
Se questa fosse tutta la storia, questo articolo sarebbe lungo un paragrafo e si concluderebbe con "usate GPT-6 Luna". Non è tutta la storia, e il motivo è l'unica dimensione in cui il confronto si inverte completamente: i pesi di DeepSeek V4 Pro sono aperti e con licenza MIT. Il modello che costa cinque volte tanto per token è il modello che ti è consentito scaricare, modificare, mettere a punto e far girare sul tuo hardware per sempre. Non è una nota a margine dell'argomento sul prezzo: per una specifica categoria di acquirenti è l'argomento nella sua interezza, e il lancio di GPT-6 Luna del 22 settembre lo ha acuito anziché risolverlo.
Cosa è stato spedito, e quando
GPT-6 Luna è il modello di fascia piccola di OpenAI, rilasciato il 22 settembre 2026, insieme a GPT-6 Sol a $2,00/$10,00 e al di sotto dell'ammiraglia GPT-6 Astra a $10,00/$50,00. OpenAI lo descrive come il modello più efficiente dell'azienda per attività mirate e ad alto volume. Dispone di una finestra di contesto di 1.050.000 token, con un massimo di 922.000 token in input e un limite di output di 128.000 token, accetta testo e immagini ed espone lo sforzo di ragionamento da none a low, medium, high, xhigh e max — con medium come impostazione predefinita.
DeepSeek V4 Pro 0813 è la build GA del modello di punta di quarta generazione di DeepSeek, pubblicata il 13 agosto 2026, che sostituisce l'anteprima di aprile sotto lo stesso identificatore deepseek-v4-pro. È un modello mixture-of-experts solo testo con 1,6 trilioni di parametri totali e 49 miliardi attivi, una finestra di contesto da 1M token e un limite di output insolitamente generoso di 384.000 token, tre volte quello di GPT-6 Luna. I pesi sono stati pubblicati su Hugging Face come deepseek-ai/DeepSeek-V4-Pro-0813 circa mezza giornata dopo il lancio dell'API: 66 shard fp8, senza gate, MIT. La nostra pagina di catalogo per il modello riporta ancora la data dell'anteprima di aprile invece della data GA di agosto, cosa che vale la pena sapere se si leggono le date dalle pagine di prodotto anziché dalle note di rilascio.
Entrambi sono orientati al ragionamento e al contesto lungo. Solo uno dei due è un file che puoi tenere in mano.
I listini, sinceramente
Una riga per dimensione, entrambi i lati su ciascuna:
• Input per 1 mln — GPT-6 Luna $0,10 vs DeepSeek V4 Pro $0,66 fuori punta / $1,32 di punta
• Output per 1M — GPT-6 Luna $0.50 vs DeepSeek V4 Pro $1.98 fuori punta / $3.96 di punta
• Input in cache — GPT-6 Luna 0,01 $ per 1M, uno sconto del 90% sulla propria tariffa, contro DeepSeek V4 Pro con uno sconto cache del 97%: la percentuale più profonda applicata a una base più alta
• Finestra di picco — GPT-6 Luna nessuna, piatta tutto il giorno vs DeepSeek V4 Pro raddoppia tra le 01:00-04:00 e le 06:00-10:00 UTC
• Clausola sul contesto lungo — GPT-6 Luna raddoppia input e cache e aumenta l'output di 1,5x oltre i 272K di input, applicata all'intera richiesta rispetto a DeepSeek V4 Pro, nessun sovrapprezzo per contesto lungo pubblicato sulla sua scheda
• Contesto e output — GPT-6 Luna 1.050.000 in / 128.000 out vs DeepSeek V4 Pro 1.048.576 in / 384.000 out
• AA Intelligence Index — GPT-6 Luna 37 con impegno massimo vs DeepSeek V4 Pro 36 con impegno massimo, stessa revisione dell'indice
• Punteggio con sforzo predefinito — GPT-6 Luna 29 a medio vs DeepSeek V4 Pro 36 alla sua impostazione massima, lo sforzo misurato da Artificial Analysis
• Interruttore di disattivazione del ragionamento — GPT-6 Luna da none a max vs DeepSeek V4 Pro solo low, high e max
• Costo di esecuzione dell'indice — GPT-6 Luna $122,39 vs DeepSeek V4 Pro $1.122,27
• Pesi — GPT-6 Luna chiusi, solo API vs DeepSeek V4 Pro aperti, con licenza MIT, ospitabili autonomamente
• Su OrcaRouter — GPT-6 Luna non presente nel nostro catalogo, a differenza di DeepSeek V4 Pro, instradabile al prezzo di listino di DeepSeek

Leggi quelle righe insieme e la forma è insolita: il modello chiuso costa meno su ogni voce per token tranne l'input in cache, e il modello aperto vince sulla lunghezza dell'output, sul comportamento in contesto lungo e sull'unica cosa che non può essere prezzata per token.
Perché il divario di un punto non è la storia
Una differenza di un punto su un indice composito non è una differenza di capacità su cui si possa agire, e vale la pena dire chiaramente che questo è il numero meno interessante dell'articolo. Due cose al riguardo, però, contano davvero.
Il primo punto è che la revisione dell'indice cambia. Istantanee precedenti della stessa valutazione collocavano il punteggio con il massimo sforzo di DeepSeek V4 Pro sensibilmente più in alto del 36 che la nostra rilevazione mostra oggi, e i valori di GPT-6 Astra sono oscillati tra 52,8, 53 e 54,7 in materiale pubblicato nell'arco di un solo mese. Qualsiasi confronto che si basi sul divario preciso tra due modelli su un indice mobile si basa su qualcosa che non resterà fermo. La lettura onesta è che questi due modelli sono nella stessa fascia di capacità ai loro massimi, e l'indice non può dirti quale sia migliore per il tuo compito.
Il secondo è il default dell'effort, e qui il divario è reale. Il 37 di GPT-6 Luna è un valore di effort massimo. Il suo default è medium, dove segna 29. Il 36 di DeepSeek V4 Pro è anch'esso il suo valore di effort massimo, ed è anche l'impostazione con cui Artificial Analysis lo ha eseguito. Un team che mette in produzione GPT-6 Luna e non cambia nulla sta eseguendo un 29 contro un 36 — un deficit di sette punti nella direzione sbagliata, e il tipo di cosa che emerge come "il modello economico è peggiore" in un post-mortem di produzione quando il problema reale è un default.
Quanto valgono davvero i pesi aperti
È qui che il confronto dei prezzi smette di essere aritmetica e diventa una questione che riguarda la tua azienda. I pesi con licenza MIT ti offrono quattro cose, e ciascuna ha un prezzo che non compare mai su un tariffario.
Il primo è un limite minimo sui costi. Il prezzo per token è un affitto; i pesi sono un bene. Se il vostro volume è sufficientemente elevato da rendere un'infrastruttura GPU fissa più conveniente di una bolletta a consumo, DeepSeek V4 Pro è l'unico di questi due modelli in cui quell'opzione esista. Con le tariffe di GPT-6 Luna il punto di pareggio è molto lontano — un prezzo di input in cache di un centesimo è davvero difficile da battere con silicio a noleggio — ma "molto lontano" è un'affermazione diversa da "impossibile", e si tratta di una porta a senso unico: puoi passare dal self-hosting a un'API in qualsiasi momento, ma non puoi andare nella direzione opposta.
Il secondo è l'indipendenza dalla roadmap di un fornitore. Le tariffe promozionali di GPT-5.6 Luna avevano una scadenza dichiarata. Quelle di GPT-6 Luna sono permanenti, secondo OpenAI — ma la permanenza è una promessa che riguarda un modello che un fornitore può ritirare ogni volta che lancia un successore. Un modello che ospiti tu stesso non può essere deprecato alle tue spalle. Per chiunque abbia attraversato una migrazione forzata su un modello chiuso, vale più di un fattore cinque sui token.
Il terzo è il dato. Se il prompt contiene materiale che non può lasciare la vostra infrastruttura, il confronto finisce qui e non importa quanto costi GPT-6 Luna.
Il quarto è che puoi eseguire il fine-tuning. GPT-6 Luna non è affatto disponibile per il fine-tuning — è Chat Completions, Responses e Batch, e questo è l'elenco. I pesi di DeepSeek V4 Pro possono essere addestrati sulla tua distribuzione, il che per un compito ristretto ad alto volume è spesso un vantaggio maggiore rispetto a qualsiasi punto di riferimento generico.
Contro tutto ciò, la tesi di GPT-6 Luna è che è all'incirca cinque volte più economico su un mix combinato di input e output pari a 3:1 fuori dalle ore di punta e vicino a dieci volte più economico durante le ore di punta di DeepSeek, che la sua tariffa per l'input in cache è un decimo della sua già bassa tariffa per l'input, che gli si può ordinare di interrompere del tutto il ragionamento e che il suo prezzo di listino non raddoppia due volte al giorno. Per un carico di lavoro senza vincoli di residenza dei dati, senza requisiti di fine-tuning e senza alcuna propensione a gestire infrastrutture di inferenza, è una risposta diretta.
La migrazione è più piccola di quanto suggerisca il divario di prezzo.
Passare dall'uno all'altro è più vicino a una modifica di configurazione che a un port. Entrambi parlano il formato chat completions compatibile con OpenAI, entrambi hanno una finestra di contesto di classe 1M, e le modalità di errore sono quelle che ci si aspetterebbe piuttosto che di tipo strutturale.
Due di questi meritano una segnalazione prima di spostare il traffico. La clausola sul contesto lungo di GPT-6 Luna è quella costosa: se si superano i 272.000 token di input, l'intera richiesta viene ritariffata al doppio per input e cache e a 1,5x per l'output, quindi una chiamata da 300.000 token costa il doppio di quanto costerebbe la stessa chiamata suddivisa in due. DeepSeek V4 Pro non ha una clausola del genere, il che significa che per richieste singole davvero enormi il divario di prezzo di cinque volte è più piccolo di quanto sembri e può invertirsi in una chiamata nelle ore di punta. E il tetto di output è un vincolo rigido, non una preferenza: 128.000 token contro 384.000. Una pipeline che genera artefatti strutturati lunghi potrebbe non rientrare affatto in GPT-6 Luna, e nessun vantaggio di prezzo può risolvere la cosa.
DeepSeek V4 Pro è su OrcaRouter al prezzo di listino di DeepSeek, con il prezzo pass-through che mette un cambio di tariffa del fornitore dalla nostra parte lo stesso giorno — rilevante per un modello le cui tariffe già variano tra peak e off-peak. GPT-6 Luna non è nel nostro catalogo al momento in cui scriviamo e si raggiunge tramite l'API di OpenAI, quindi un team che li vuole entrambi usa una chiave per DeepSeek V4 Pro insieme a qualunque cosa già utilizzi per OpenAI. Il failover automatico è la parte che si guadagna il suo posto in questo particolare abbinamento: un endpoint DeepSeek self-hosted o di terze parti che si degrada è esattamente lo scenario in cui vuoi che il percorso cambi senza un deployment.

Chi dovrebbe scegliere cosa
Scegli DeepSeek V4 Pro se una delle seguenti condizioni è vera. Il prompt non può lasciare la tua infrastruttura. Devi eseguire il fine-tuning. Generi output più lunghi di 128.000 token. Le tue richieste superano regolarmente 272.000 token di input. Oppure il tuo volume è così elevato che preferiresti acquistare GPU invece di noleggiare token, e vuoi avere la possibilità di fare questo passaggio in seguito senza riscrivere l'applicazione.
Prendi GPT-6 Luna se nessuno di questi casi si applica e il tuo carico di lavoro è ad alto volume, consumato da programmi e di breve durata. Classificazione, estrazione, instradamento, sintesi in blocco, il ciclo interno di un agente. A 0,10 $/0,50 $ con una tariffa di input in cache di un centesimo e Batch a metà prezzo, il calcolo non è neanche lontanamente vicino, e la differenza di un punto nell'indice allo sforzo massimo non sarà visibile nella tua eval. Eseguilo in modalità media, verifica la regressione di due punti del Coding Agent Index con i tuoi test invece che con un grafico del fornitore, e mantieni le tue chiamate lunghe dalla parte giusta della linea delle 272.000 token.
L'errore da evitare è considerare il divario di prezzo di cinque volte come la risposta. Esso è la risposta a una domanda — quanto costa un token — e tace sulle quattro domande che decidono se potrai ancora eseguire questo carico di lavoro tra due anni.

Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
