
Grok 4.6 vs DeepSeek V4 Pro: Una guerra di prezzi di frontiera, combattuta a 24 ore di distanza
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaNUOVOMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
Due modelli di frontiera sono usciti a distanza di 24 ore l'uno dall'altro, e il divario tra i loro listini prezzi è il più ampio che questa generazione abbia prodotto. Grok 4.6 è stato lanciato il 12 agosto 2026 a 2 dollari per milione di token in input e 6 per milione in output. DeepSeek V4 Pro — la release di produzione ufficiale del modello di punta di DeepSeek, versione DeepSeek-V4-Pro-0813 — è arrivato il 13 agosto 2026 a 3 yuan per milione di token di input con cache miss e 6 yuan per milione in output, pari a circa 0,42 e 0,85 dollari. Stessa categoria, stesse ambizioni agentiche, un ordine di grandezza di differenza sul prezzo. Non è un confronto tra due specifiche; è un confronto tra due strategie su quanto dovrebbe costare un modello a forma di agente, ed entrambi sono usciti questa settimana.
Questo articolo mette i due listini prezzi uno accanto all'altro, esamina le dichiarazioni sui benchmark di ciascun fornitore con l'etichetta del venditore ben visibile, e calcola quanto costi realmente la differenza su un carico di lavoro reale — perché sulla carta questi modelli sono più vicini per capacità che per filosofia, ed è nella differenza di prezzo per attività che risiede la decisione.
Il tempismo è il punto.
Che entrambi i modelli siano arrivati nella stessa finestra di 48 ore non è un caso del calendario. Grok 4.6 è il rifacimento agentico di SpaceXAI della sua base da 1,5T — un aggiornamento post-addestramento fortemente incentrato sull'apprendimento per rinforzo nel coding, nel lavoro sul kernel e nella progettazione CAD, prezzato come carburante per i prodotti Cursor e Grok Bot di proprietà dell'azienda. DeepSeek V4 Pro è la formalizzazione di un'anteprima che ha silenziosamente ridefinito il significato di "agentico" a una frazione del prezzo, ora potenziata per l'economia degli agenti: le note di rilascio di DeepSeek per la build 0813 aprono con capacità agentiche significativamente migliorate, aggiungono il supporto per la Responses API e l'integrazione con Codex, e mantengono sia la modalità di pensiero (predefinita) sia quella non di pensiero, l'output JSON, le chiamate agli strumenti e il formato API Anthropic. Due aziende molto diverse sono giunte contemporaneamente alla conclusione che il mercato che conta a fine 2026 è quello degli agenti — e hanno prezzato le loro offerte per portafogli molto diversi.
I due listini prezzi, affiancati.
• Grok 4.6 — $2.00 / $6.00 / $0.50 (input in cache) per milione di token, contesto di 500K, un incremento di $4 / $12 / $1 oltre circa 200K token di input, e una variante più veloce al doppio della tariffa base.
• DeepSeek V4 Pro — ¥3,00 (≈$0,42) per milione di token di input cache-miss, ¥0,025 (≈$0,0035) per milione di token di input in cache, ¥6,00 (≈$0,85) per milione di token di output, con una finestra di contesto di 1 milione di token e fino a 384K token di output. La sua variante più economica, V4 Flash, costa ¥1 / ¥2.
Persino rispetto a Grok 4.6 — già l'API frontier più economica della sua generazione — DeepSeek V4 Pro è circa cinque volte più economico sull'input in cache-miss e sette volte più economico sull'output, e porta una finestra di contesto 2 volte più grande e un output massimo molto più ampio nella stessa fascia di prezzo. I due non competono sul prezzo; DeepSeek ha unilateralmente fissato un nuovo minimo e Grok è ora l'opzione premium nella stessa frase. Questo inquadramento conta, perché l'inquadramento precedente — "Grok 4.6 è il modello frontier economico" — è stato vero per esattamente un giorno.

Cosa ha effettivamente migliorato DeepSeek V4 Pro
I numeri di lancio di DeepSeek sono i più drammatici perché vengono misurati rispetto alla propria anteprima, e il salto da anteprima a rilascio è enorme. Secondo le valutazioni del vendor stesso:
• DeepSWE — 62,7% sulla build finale, in aumento rispetto al 12,8% della preview — un punteggio a lungo orizzonte nell'ingegneria del software che il produttore colloca tra il 58,0% di Opus 4.8 e il 70,0% di Claude Fable 5.
• Cybergym — 83,3%, in aumento dal 52,7%, superando di poco l'83,1% di Fable 5 e battendo il 78,3% di Opus 4.8.
• Terminal Bench 2.1 — 87.9%, entro un punto dall'88.0% di Fable 5 e davanti all'85.0% di Opus 4.8.
• AutomationBench (pubblico) — 31,8%, in aumento dal 12,8%, davanti sia a Fable 5 (29,1%) che a Opus 4.8 (27,2%).
• Toolathlon-Verified, NL2Repo, DSBench-FullStack e DSBench-Hard — 74,1%, 61,5%, 71,1% e 67,2% rispettivamente, raggruppati attorno o vicino alla fascia Opus 4.8 / Fable 5.
Ognuno di questi è riportato da DeepSeek sulla propria suite di valutazione. La direzione è inequivocabile — la preview non era pronta per i cicli agente di produzione e la build di rilascio afferma di esserlo — ma l'etichetta onesta è che nessun laboratorio indipendente ha ancora valutato DeepSeek V4 Pro, e i modelli con cui viene confrontato non sono nominati da una parte esterna.
Con cosa risponde Grok 4.6
Il rivale di Grok 4.6 è diverso per natura: è l'unico dei due ad avere una classifica indipendente. Artificial Analysis lo ha misurato a 61 sul suo Intelligence Index — alla pari con GPT-5.6 Sol, davanti a Kimi K3 (60) — prima ancora che DeepSeek V4 Pro venisse rilasciato. La sua tabella del fornitore dichiara un 65,9% leader su DeepSWE v1.1 e un 69,9% su CursorBench v3.2, con un punto debole apertamente ammesso al 26% su Terminal-Bench v3.0. Questi dati sono riportati da xAI, nessuno riprodotto in modo indipendente al 13 agosto.
Le discrepanze di versione contano quando si cerca di confrontare i due direttamente. L'87.9 di DeepSeek è su Terminal Bench 2.1; il 26% di Grok è sulla più difficile v3.0 — esami diversi, quindi "DeepSeek straccia Grok sui terminali" non è un'affermazione onesta, e nemmeno "Grok è in testa su DeepSWE" senza precisare che i due fornitori hanno usato versioni di valutazione diverse e nessuno dei due numeri è di terze parti. Ciò che è comparabile è la dimensione indipendente: Grok 4.6 ha una scheda di valutazione verificata, DeepSeek V4 Pro non ne ha ancora nessuna, e per una decisione di produzione questa asimmetria è di per sé un'informazione.

Il costo totale per una lunga esecuzione dell'agente
Prendi un lavoro agenziale realistico — leggere e ragionare su 500K token di contesto, scrivere 100K token di output, che equivale a un refactoring di medie dimensioni o a una pipeline di documenti lunghi, tutto all'interno delle finestre di entrambi i modelli:
• Grok 4.6 — 0.5M di input a $2 = $1.00, più 0.1M di output a $6 = $0.60. Totale: $1.60.
• DeepSeek V4 Pro — 0.5M di input con cache-miss a ¥3 = ¥1.50, più 0.1M di output a ¥6 = ¥0.60. Totale: ¥2.10, circa $0.29.
Questo è un divario di 5,5x sullo stesso compito nominale, prima di qualsiasi vantaggio di caching — e la finestra da 1M di DeepSeek, più l'output massimo di 384K, significa anche che il lavoro rientra in una singola passata, mentre la finestra da 500K di Grok 4.6 potrebbe richiederne due. Il problema che impedisce che tutto questo sia una risposta in una riga è il costo del ragionamento e il rischio: la modalità di pensiero di DeepSeek è attiva per impostazione predefinita, quindi ogni richiesta paga per una traccia di ragionamento completa anche quando non la si desidera, e la fiducia nei benchmark del fornitore stesso non è stata verificata da nessun soggetto indipendente. Economico per token con ragionamento sempre attivo è comunque economico per compito a queste tariffe, ma "economico" e "verificato" sono affermazioni diverse, e solo uno di questi modelli possiede la seconda.
Chi dovrebbe scegliere cosa
La decisione riguarda meno "quale sia migliore" che "quale profilo di rischio si adatti al carico di lavoro":
• Ad alto volume, vincolato dai costi e disposto ad accettare numeri non verificati — DeepSeek V4 Pro è l'opzione di prezzo minimo. Il contesto da 1M e l'output da 384K lo rendono il candidato più forte per contesti lunghi e lavori in batch, e la tariffa di input in cache di ¥0.025 rende quasi gratuite le pipeline con uso intensivo di retrieval. Fai le tue valutazioni, perché nessun indipendente le ha fatte.
• Profondità agentica con una scorecard indipendente, in un ecosistema compatibile con OpenAI — Il 61 di Grok 4.6 è verificato, la sua direzione nei benchmark di coding e agentici è coerente, e la debolezza terminale è nota in anticipo. Il tempo al primo token di 42 secondi è il prezzo che paghi per la qualità verificata.

• Traffico misto — questo è il caso del routing piuttosto che della scelta. Su OrcaRouter, entrambi i modelli stanno dietro una sola chiave con prezzi pass-through della lista dei provider — quindi i ¥3/¥6 di DeepSeek restano ¥3/¥6 in fattura, e Grok 4.6 resta a $2/$6, con zero ricarico su entrambi. Una regola di routing può inviare il lavoro a contesto lungo e vincolato dai costi a DeepSeek V4 Pro e il lavoro agentico verificato a Grok 4.6, suddividere il traffico per richiesta finché la tua valutazione non stabilisce la suddivisione, e fare affidamento sul failover automatico se il comportamento della prima settimana di uno dei due vendor contraddice i numeri di lancio. Per una coppia di modelli nati da un giorno ai lati opposti di una guerra dei prezzi, la capacità di confrontarli entrambi sul tuo carico di lavoro — e cambiare la suddivisione senza modificare il codice — non è una comodità. È l'unico modo difendibile per adottare l'uno o l'altro.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
