Scheda del titolo che recita “Grok 4.7 vs DeepSeek V4 Pro” con il sottotitolo “Uno è nuovo; l’altro viene sostituito sotto di te”, e tre schede: AA Index v4.3.2 46 vs 36, Prezzo fuori picco per 1M $2/$6 vs $0.66/$1.98, e Contesto 500k vs 1M.
Guides & Insights

Grok 4.7 vs DeepSeek V4 Pro: uno è nuovo, l'altro ti viene scambiato sotto i piedi

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Una nota pubblicata il 10 settembre 2026 cambia l'oggetto di questo confronto. «Stiamo dismettendo V4-Pro», si legge, e dalle 04:00 UTC del 14 settembre 2026 ogni richiesta alla stringa di modello deepseek-v4-pro viene indirizzata a DeepSeek-V4.1-Flash alle tariffe di V4.1-Flash — una situazione che, secondo il post, continua «fino al lancio di V4.1-Pro». La stringa di modello risponde ancora. Il modello che vi sta dietro non è quello su cui hai eseguito il benchmark. Ciò rende un confronto testa a testa con Grok 4.7 — rilasciato dal fornitore il 21 settembre 2026, un giorno prima che questo fosse scritto — un confronto con una data di scadenza da un lato. Sui numeri esistenti, Grok 4.7 è il modello più forte e DeepSeek V4 Pro è quello più economico. Sulla questione che decide davvero un'integrazione, solo uno dei due è ancora ciò che dice di essere.

Che cos'è ciascun modello, prima dei punteggi

DeepSeek V4 Pro ha raggiunto la disponibilità generale il 13 agosto 2026 come checkpoint DeepSeek-V4-Pro-0813, dopo un'anteprima del 24 aprile. È a pesi aperti con licenza MIT — la licenza consente uso commerciale, modifica e ridistribuzione senza soglia di ricavi o eccezioni regionali — con 1,7 trilioni di parametri totali sulla scheda del modello GA, una finestra di contesto da 1M token e un output massimo di 384K, il tetto di output più alto in questo confronto. È solo testo: la pagina dei prezzi di DeepSeek stessa afferma che la visione non è supportata su v4-pro, il che è una vera limitazione per chiunque gli fornisca screenshot o PDF. Espone un selettore dello sforzo di ragionamento su basso, alto e massimo, ed è limitato a 500 richieste simultanee per account, con espansione disponibile su richiesta.

Grok 4.7 è a pesi chiusi e ha un giorno di vita. Ha un contesto da 500k token — la metà di quello di DeepSeek — accetta in input testo e immagini e dispone di un proprio selettore dello sforzo. Il suo prezzo di listino è di 2,00 $ per milione di token di input e 6,00 $ per milione di token di output al di sotto dei 200k token di prompt, e raddoppia a 4,00 $ e 12,00 $ a partire da quella soglia, con letture in cache a 0,50 $ e 1,00 $. xAI elenca anche una variante più veloce, a circa il doppio della velocità di output e il doppio del prezzo. Nessuno dei due fornitori pubblica un valore massimo di output per Grok 4.7 nella documentazione consultata qui, quindi considera quella dimensione come sconosciuta anziché uguale.

Sull'indice condiviso, il divario è sbilanciato in una direzione.

Entrambi i modelli sono valutati sull'Artificial Analysis Intelligence Index v4.3.2, la revisione pubblicata il 19 settembre 2026. La colonna di Grok 4.7 è misurata con sforzo xhigh; quella di DeepSeek è il checkpoint 0813 con sforzo massimo. Leggendoli insieme, il divario composito sottostima quanto diversamente siano strutturati questi due modelli.

Composito — Grok 4.7: 46 sull'Artificial Analysis Intelligence Index v4.3.2. DeepSeek V4 Pro 0813: 36 sulla stessa revisione.

Agenti da terminale — Grok 4.7: Terminal-Bench 4.0 26. DeepSeek V4 Pro: 14. Quasi il doppio, sulla valutazione più vicina al lavoro software autonomo.

Automazione — Grok 4.7: AutomationBench-AA 66%. DeepSeek V4 Pro: 57%. Entrambi credibili; Grok è in vantaggio di nove.

Conoscenza e allucinazione — Grok 4.7: AA-Omniscience 32. DeepSeek V4 Pro: 1. Questo è l'outlier della classifica, e non è un artefatto di arrotondamento — l'indice valuta sia ciò che un modello sa sia quanto spesso inventa una risposta quando non la sa.

Contesto lungo — Grok 4.7: AA-LCR v1.1 77%, finestra 500k. DeepSeek V4 Pro: 80%, finestra 1M. L'unica chiara vittoria di DeepSeek, ed è l'asse per cui la sua finestra da 1M è stata costruita.

Ragionamento complesso — Grok 4.7: HLE 43, CritPt 18. DeepSeek V4 Pro: HLE 41, CritPt 18. Un pareggio sul benchmark di fisica e due punti di vantaggio per Grok su HLE.

Verbosità — Grok 4.7: 240M token di output per eseguire l'indice, segnalato come insolitamente verboso. DeepSeek V4 Pro: 163M. Entrambi sono loquaci; Grok lo è di più.

OrcaRouter model page for DeepSeek V4 Pro showing the deepseek/deepseek-v4-pro identifier, a 1M-token context window, 384K maximum output, text-only input, off-peak list rates of $0.66 per 1M input and $1.98 per 1M output, and 3818.2M tokens of traffic over seven days.

La storia dei prezzi non è un solo numero, è un calendario

Il prezzo di DeepSeek è l'aspetto più aggressivo che lo caratterizza, e quello meno stabile da preventivare. La tariffa di listino per deepseek-v4-pro è di $0,66 per milione di token di input in caso di cache miss e $1,98 per milione di token di output — durante le ore non di punta. Durante le ore di punta, queste raddoppiano a $1,32 e $3,96. Le ore di punta, secondo la documentazione di DeepSeek stessa, sono 01:00–04:00 e 06:00–10:00 UTC dal lunedì al venerdì, escluse le festività pubbliche cinesi; tutto il resto, compresi i fine settimana interi, è fuori dalle ore di punta, esattamente a metà prezzo. Le letture di input in cache sono il vero dato saliente: $0,022 fuori dalle ore di punta e $0,044 in quelle di punta, trenta volte più economiche di un cache miss, il che rende un carico di lavoro DeepSeek con una cache ben ottimizzata drasticamente più economico di quanto lasci intendere il suo listino.

Al confronto, i $2.00 e $6.00 di Grok 4.7 sembrano costosi — circa 3 volte l'input off-peak di DeepSeek e 3 volte il suo output off-peak. Il confronto si restringe in modi che vale la pena conoscere. Il prezzo di Grok 4.7 è fisso all'interno della sua fascia anziché dipendente dall'orario, quindi un picco di produzione alle 09:00 UTC costa quanto un batch della domenica sera; quello di DeepSeek no. E oltre i 200k token di prompt Grok 4.7 raddoppia, e a quel punto è da quattro a sei volte la tariffa off-peak di DeepSeek anziché tre. Il modo più chiaro per dirlo: DeepSeek V4 Pro è il modello più economico su ogni asse, e l'entità dello sconto dipende da quando lo esegui e da quanto bene usi la cache.

Cosa ha cambiato il 14 settembre

Questa è la parte che rende più difficile dare per certo l'argomento sul prezzo. Dal 14 settembre 2026, DeepSeek indirizza le richieste di deepseek-v4-pro a DeepSeek-V4.1-Flash e le fattura alle tariffe di Flash — che sono ancora più basse. Il registro delle modifiche di DeepSeek e la sua pagina dei prezzi raccontano una storia leggermente diversa rispetto al post di notizie del 10 settembre: la tabella dei prezzi elenca ancora deepseek-v4-pro come riga attiva con le proprie tariffe e senza tag di dismissione, e la voce del registro delle modifiche afferma che il servizio API per V4 Pro continua dopo il 14 settembre con fatturazione invariata. Ciò che non è in discussione è la direzione del cambiamento. V4.1-Pro è confermato in sviluppo senza una data annunciata, e V4.1-Flash — rilasciato il 10 settembre — è quello che, secondo l'annuncio di DeepSeek stesso, supera V4 Pro in "prestazioni, costo, velocità e tempo di esecuzione totale", un'affermazione del fornitore che non è stata riprodotta in modo indipendente su tale ampiezza.

Quindi la domanda pratica non è «Grok 4.7 o DeepSeek V4 Pro», ma «Grok 4.7 o qualunque modello DeepSeek in cui quella stringa si risolverà il prossimo trimestre». Se hai eseguito benchmark su V4 Pro ad agosto e hai dimensionato il budget di contesto su una finestra da 1M con un tetto di output di 384K, il modello che chiami a novembre potrebbe non essere quello che hai misurato — e i limiti di contesto e output del successore non sono quelli su cui hai progettato. Grok 4.7 ha il profilo di rischio opposto: un modello vecchio di un giorno, i cui numeri sono riportati dal fornitore e in gran parte non riprodotti, ma la cui identità non è in discussione.

Two-column scoreboard titled “Grok 4.7 vs DeepSeek V4 Pro - the scoreboard”: AA Index 46 vs 36, Terminal-Bench 4.0 26 vs 14, AutomationBench 66% vs 57%, context 500k vs 1M, price per 1M $2/$6 vs $0.66/$1.98 off-peak, and open weights “no” vs “MIT”.

Dove un router è adatto, e dove no

OrcaRouter include DeepSeek V4 Pro, e la pagina del modello lo riporta alla tariffa del provider stesso — 0,66 $ in input e 1,98 $ in output con una finestra di contesto da 1M e un output massimo di 384k — perché applichiamo il prezzo di listino del provider con markup allo 0%. Questo conta più del solito con un fornitore le cui tariffe si muovono secondo un calendario peak/off-peak e il cui annuncio del 10 settembre è arrivato con una riduzione di prezzo: una variazione di prezzo DeepSeek è attiva sulla stessa chiave lo stesso giorno, senza ritardi di riprezzamento e senza un secondo contratto. Quando un fornitore reindirizza una stringa di modello dalla sua parte, la modifica arriva attraverso lo stesso endpoint invece di richiedere una nuova integrazione dalla tua, e il failover automatico impedisce che un rate limit o un evento di capacità lato provider si trasformi in un'interruzione del servizio — utile quando un lato del tuo stack è limitato a 500 richieste simultanee. Grok 4.7 non è nel catalogo OrcaRouter al momento in cui scriviamo; per usarlo bisogna passare attraverso l'API di xAI stessa e le piattaforme di terze parti che lo offrono.

La divisione che questo suggerisce è poco glamour ma difendibile: mantenere DeepSeek V4 Pro sui carichi di lavoro in cui il prezzo con cache-hit e la finestra da 1M fanno il lavoro, e ancorare le proprie aspettative a V4.1-Flash anziché al checkpoint di agosto. Mettere Grok 4.7 sui compiti in cui il modello deve sapere ciò che non sa — un indice AA-Omniscience di 1 è un segnale forte della propensione di un modello a rispondere con sicurezza e in modo sbagliato, e nessun vantaggio di prezzo sopravvive a un consumatore a valle che si fida di una risposta inventata.

La chiamata

Grok 4.7 è il modello migliore qui e non c'è quasi partita: un vantaggio di dieci punti nel punteggio composito, il doppio del punteggio Terminal-Bench, un vantaggio sull'automazione e un divario di onestà epistemica abbastanza ampio da costituire una differenza di categoria. DeepSeek V4 Pro costa circa 3 volte meno off-peak e offre il doppio della finestra di contesto, il che è una ragione reale e difendibile per tenerlo — ma non stai comprando il modello che hai sottoposto a benchmark, stai comprando una stringa di modello che DeepSeek ha già annunciato di voler ripuntare, a tariffe che cambiano di ora in ora, su una licenza e un set di pesi che rendono il self-hosting una vera terza opzione. Se il carico di lavoro è a contesto lungo, ad alto volume e memorizzabile in cache, l'economia di DeepSeek è difficile da battere e dovresti progettare per il successore anziché per il checkpoint. Se si tratta di qualsiasi cosa in cui sbagliare è costoso, paga il triplo e scegli il modello che ammette l'incertezza.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno