Generata card del titolo hero per Claude Sonnet 5.5 vs DeepSeek V4 Pro, con sottotitolo 'Venti punti indice e una lettura della cache da $0,022', che mostra $2,00 e $10,00 per milione di token contro $0,66 e $1,98, con il logo OrcaRouter composto nell'angolo in basso a destra.
Guides & Insights

Claude Sonnet 5.5 vs DeepSeek V4 Pro: 20 punti indice e una lettura della cache a $0,022

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Metti le due schede tariffarie una accanto all'altra e il confronto sembra già chiuso prima di iniziare. Claude Sonnet 5.5, disponibile a livello generale dal 28 settembre 2026, costa 2,00 $ per milione di token in input e 10,00 $ per milione di token in output. DeepSeek V4 Pro, rilasciato il 24 aprile 2026, costa 0,66 $ e 1,98 $. L'output è la voce che conta nel lavoro con gli agenti, e 10,00 $ contro 1,98 $ è un divario di cinque a uno — un dollaro contro venti centesimi per centomila token. Poi guarda il lato delle capacità, dove Artificial Analysis colloca Claude Sonnet 5.5 a 56 sull'Intelligence Index v4.3 e DeepSeek V4 Pro a 36, un divario di venti punti sullo stesso sistema di valutazione. È tutta qui la tensione: il modello di DeepSeek si colloca a un quinto del prezzo di output e a circa due terzi della capacità misurata, e i due fatti non si risolvono in un'unica raccomandazione senza sapere che cosa fa realmente il tuo carico di lavoro con un token.

Che cosa è ciascun modello, precisamente

La denominazione è il primo punto in cui questo confronto va storto, quindi correggilo qui. DeepSeek V4 Pro come lo indichiamo è deepseek/deepseek-v4-pro, rilasciato il 24 aprile 2026, un modello con contesto da 1.048.576 token, output massimo di 384.000 token e input solo testo. Artificial Analysis tiene traccia di un'istantanea che etichetta DeepSeek V4 Pro 0813 — una build del 13 agosto — e le cifre citate di seguito provengono da quella riga. Il lato Sonnet è di Anthropic anthropic/claude-sonnet-5.5, input testo, immagini e file, contesto 1M, output massimo 128K. Se stai confrontando una pagina del fornitore con una pagina di valutazione e i numeri non coincidono, controlla il suffisso della build prima di concludere che uno dei due sia sbagliato.

DeepSeek V4 Pro supporta solo input di testo. Claude Sonnet 5.5 accetta anche immagini e file. Questa è la prima differenza strutturale e non è marginale: qualsiasi pipeline che acquisisce screenshot, PDF o diagrammi non può semplicemente scambiare l'uno con l'altro, perché uno dei due non può vedere.

Il listino prezzi, riga per riga

• Input — 0,66 $ per milione per DeepSeek V4 Pro rispetto a 2,00 $ per Claude Sonnet 5.5; DeepSeek costa il 67% in meno

• Output — $1,98 per milione contro $10,00; DeepSeek è l'80% più economico, il divario singolo più ampio in questo confronto

• Lettura cache — 0,022 $ per milione contro 0,20 $; DeepSeek è l'89% più economico sulla voce che domina i lunghi cicli degli agenti

• Scrittura cache — $2,50 per milione per la finestra di cinque minuti su Claude Sonnet 5.5; la riga di catalogo di DeepSeek V4 Pro non riporta una voce separata per la scrittura cache

• Contesto — 1.048.576 token contro 1.000.000; DeepSeek è marginalmente più lungo, una distinzione senza conseguenze pratiche

• Output massimo — 384.000 token contro 128.000; DeepSeek vince di un fattore tre sul tetto che vincola la generazione in blocco

• Modalità di input — solo testo rispetto a testo, immagine e file

• Ragionamento — entrambi usano uno sforzo di ragionamento configurabile anziché un budget di pensiero fisso, quindi la profondità è un parametro della richiesta su ciascuno.

C'è un dettaglio di pianificazione sul lato DeepSeek che un confronto tra tariffe nasconderà. La nostra riga di catalogo contiene una finestra di prezzo temporizzato: tra le 01:00 e le 04:00 UTC, e di nuovo tra le 06:00 e le 10:00 UTC, le tariffe indicate vengono moltiplicate per due. In quelle ore V4 Pro costa $1,32 in input e $3,96 in output — ancora meno di Claude Sonnet 5.5, rispettivamente del 34% e del 60%, ma non più con i margini che suggeriscono i numeri di copertina. Per i carichi di lavoro batch che possono essere pianificati, vale la pena pianificarli; per quelli che non possono esserlo, vale la pena applicare la tariffa di picco anziché quella media. Questo è anche il tipo di cosa che emerge solo se leggi il catalogo invece della pagina di marketing, il che è l'argomento a favore del mettere ogni modello candidato dietro un unico endpoint invece di tre account di fornitori.

Due numeri di capacità, uno dei quali non indipendente

Dal lato di terze parti la classifica è inequivocabile. Artificial Analysis assegna a Claude Sonnet 5.5 un punteggio di 56 e a DeepSeek V4 Pro 36 sull'Intelligence Index v4.3, entrambi in una configurazione di ragionamento a massimo sforzo. Lo stesso valutatore colloca Claude Opus 5 a 51 e Gemini 3.1 Pro Preview a 30, quindi il 36 di V4 Pro lo pone al di sotto del precedente flagship di Anthropic e al di sopra del livello Pro di Google — una posizione rispettabile per un modello che costa un quinto del prezzo, e molto lontano dalla vetta.

Anche qui compare l'inversione del costo per attività e, in questo confronto, va nella direzione opposta rispetto all'ultimo. DeepSeek V4 Pro costa $0,67 per la valutazione sulla suite dell'indice. Claude Sonnet 5.5 costa $7,60. Non è un refuso né un artefatto di arrotondamento: il modello Anthropic più recente emette 410 milioni di token sull'intera suite, contro una mediana di 88 milioni, e la verbosità del modello DeepSeek non riesce neanche lontanamente a colmare un divario di prezzo di quella portata. Su compiti aperti e senza vincoli, il modello più economico è più economico di un ordine di grandezza nella pratica, non solo sul listino prezzi.

I numeri dei fornitori vanno gestiti con maggiore attenzione. DeepSeek pubblica un valore τ²-Bench di 96,2 per V4 Pro, che è un numero forte, ma è dichiarato dal fornitore e τ²-Bench è stato nel frattempo rimosso dall'indice di Artificial Analysis nella sua revisione v4.3 — quindi è un valore che non può essere collocato in modo indipendente sulla stessa scala di qualsiasi cosa pubblichi Anthropic. La tabella di lancio di Anthropic per Claude Sonnet 5.5 porta con sé le proprie avvertenze, tra cui una nota a piè di pagina secondo cui l'impostazione di sforzo Max ottiene un punteggio inferiore a Xhigh su FrontierCode e una nota secondo cui due dei benchmark sono stati eseguiti su un deployment pre-release con un bug negli output strutturati. Mettete le tabelle dei due fornitori una accanto all'altra e avrete due documenti di marketing, non una classifica. Gli unici valori in questo articolo che appartengono a un unico asse sono i due punteggi dell'indice e i due costi per task, perché un solo valutatore ha prodotto tutti e quattro.

Perché il limite di output conta più del prezzo

Il numero in questo confronto che riceve meno attenzione è quello che cambia l'architettura: 384.000 token di output contro 128.000.

Il limite massimo di output non è una funzione di comfort. Decide se un'attività è una singola chiamata o una catena. Generare un grande file sorgente, emettere un documento completo, produrre un lungo report strutturato, tradurre il capitolo di un libro — qualsiasi cosa in cui l'artefatto sia più grande di 128.000 token — non può essere fatto in una singola chiamata a Claude Sonnet 5.5, e deve essere scomposto in una sequenza con lo stato trasportato tra le chiamate. La scomposizione significa più token di input reinviati a ogni passo, più letture di cache, più codice di orchestrazione, e una nuova classe di errore in cui le giunture tra i blocchi sono il punto in cui si annidano gli errori. Un modello a cinque volte il prezzo che elimina un intero strato di orchestrazione può essere più economico in ore di ingegneria prima di essere più economico in token, e nella direzione opposta un'attività che rientra in una singola chiamata è un'attività in cui il limite massimo non entra affatto nell'aritmetica.

Quindi la questione del tetto massimo viene prima della questione del prezzo. Se il tuo artefatto più lungo rientra sotto i 128.000 token, ignora questa sezione e confronta sul costo per attività completata. In caso contrario, valuta il costo della pipeline che dovresti costruire, non solo quello dei token.

Costo di commutazione e il problema del fallback

La migrazione in entrambe le direzioni riguarda principalmente il prompting più che il codice, con un’eccezione per cui vale la pena prevedere un budget.

Entrambi i modelli configurano il ragionamento tramite un parametro di effort, ma sono parametri di fornitori diversi, con livelli diversi e valori predefiniti diversi. Un prompt ottimizzato per un'impostazione Anthropic ad alto effort non si trasferisce a un'impostazione DeepSeek di effort come uno scambio equivalente; si trasferisce come una nuova misurazione. Aspettati di impiegare un giorno per ogni workload per ristabilire la qualità prima di fidarti di una proiezione dei costi, su entrambi i lati del passaggio.

L'eccezione è la visione. Claude Sonnet 5.5 legge immagini e file; DeepSeek V4 Pro legge solo testo. Qualsiasi parte della tua pipeline che passi a un modello uno screenshot, una pagina scansionata o un grafico renderizzato non ha un equivalente DeepSeek, quindi una migrazione completa è disponibile solo per il sottoinsieme del tuo traffico in forma testuale. È una linea di demarcazione da tracciare fin da subito, perché di solito significa che la risposta non è un solo modello, ma una suddivisione.

Entrambi sono instradabili su OrcaRouter oggi — deepseek/deepseek-v4-pro e anthropic/claude-sonnet-5 sono entrambi voci attive del catalogo, al prezzo di listino del provider con 0% di markup, su un'unica credenziale. Questo conta soprattutto in confronti esattamente di questo tipo, dove il fattore decisivo non è quale modello sia migliore in astratto, ma a quale modello debba andare una determinata richiesta. Una suddivisione che manda il lavoro in blocco solo testuale al modello economico e il lavoro di visione a quello costoso è una regola di instradamento, ed è molto più facile da esprimere quando entrambi gli endpoint rispondono alla stessa chiave e alla stessa policy di failover. Claude Sonnet 5.5 stesso non è ancora una route sulla nostra piattaforma, quindi la versione odierna di quella suddivisione abbina il modello Anthropic a DeepSeek V4 Pro anziché sostituirlo.

La decisione, enunciata come regola

Invialo a Claude Sonnet 5.5 quando il compito richiede di vedere — immagini, PDF, screenshot, output renderizzati — quando l'artefatto è più lungo di una pagina di prosa e vuoi che a scriverlo sia un modello di frontiera, oppure quando un divario di venti punti nell'indice è la differenza tra una bozza che una persona deve riscrivere e una che può pubblicare.

Invialo a DeepSeek V4 Pro quando il carico di lavoro è testo in input, testo in output, ad alto volume e tollerante a un tetto inferiore sulla qualità del ragionamento: classificazione, estrazione, riassunto, riscrittura di massa, trasformazione di codice con una specifica chiara, e qualsiasi cosa per cui altrimenti pagheresti dieci dollari per milione di token di output per spostare parole in giro. Lo sconto dell'89% sulla lettura della cache rende i loop di agenti a contesto lungo su questo modello strutturalmente economici in un modo in cui nient'altro nel confronto lo è.

Il verdetto onesto: questa non è una corsa alle capacità che DeepSeek sta perdendo, è una decisione di allocazione delle risorse che la maggior parte dei team sbaglia nella direzione di acquistare capacità che non usa. Se il tuo traffico è testuale e la tua asticella di qualità è “abbastanza buono da rivedere” invece che “abbastanza buono da rilasciare senza averlo letto”, V4 Pro al 20% del prezzo di output e $0,022 per le letture della cache è il default corretto, e i venti punti indice sono una tassa che stai attualmente scegliendo di pagare.

A two-column scoreboard for Claude Sonnet 5.5 and DeepSeek V4 Pro across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50 for the five-minute window, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column DeepSeek V4 Pro: input $0.66, output $1.98, cache read $0.022, no separate cache-write line, 1,048,576-token context with 384K max output, input modality text only, AA Intelligence Index v4.3 score 36, $0.67 per task on the index run. The card heading reads "Twenty index points against an 89% cache-read discount", and a footer line notes that a timed-pricing window multiplies the DeepSeek rates by two between 01:00-04:00 and 06:00-10:00 UTC.Screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro), showing the model header, the 1,048,576-token context window with 384,000 maximum output tokens, text-only input, the Tools, JSON and Reasoning capability tags with no Vision tag, a 1.86-second p50 time to first token, a "Public benchmarks by DeepSeek · 2026-04-24" line, and the $0.66 input and $1.98 output prices per million tokens.Screenshot of Artificial Analysis's model page for "DeepSeek V4 Pro 0813 (Reasoning, Max Effort)", marked an open-weights model and released August 2026, showing In $1.32 and Out $3.96 with a 97% cache discount, the Intelligence Index score of 36, an output rate of 96.6 tokens per second, the $0.67 average cost per task, and 160M output tokens described as somewhat verbose against a median of 140M.

Confrontati in questo articolo3

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno