Card hero del titolo per l'articolo 'DeepSeek V4 Pro Benchmarks': un tabellone segnapunti con un grande indicatore, titolo 'DeepSeek V4 Pro — la scheda dei benchmark', sottotitolo 'Punteggi ufficiali 0813, verifiche indipendenti e ciò che non è ancora stato riprodotto', e chip che riportano 'TERMINAL-BENCH 2.1: 87.9', 'DEEPSWE: 62.7', 'AA INDEX: 53', '1M CONTEXT'. Logo OrcaRouter in sovrimpressione in basso a destra.
Guides & Insights

DeepSeek V4 Pro Benchmarks: La scheda completa 0813, ogni verifica indipendente e ciò che nessuno ha ancora verificato

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

La risposta in una riga: DeepSeek V4 Pro presenta una scorecard agentica davvero solida secondo i numeri di Deep​Seek — Terminal-Bench 2.1 a 87,9, DeepSWE a 62,7, CyberGym a 83,3 — ma quasi ogni cifra di punta è riportata dal vendor, e il quadro indipendente è più freddo. Artificial Analysis colloca la build ufficiale 0813 a 53 nel suo Intelligence Index, alla pari con GLM 5.2, quattro punti dietro GPT-5.6 Terra e sette dietro Kimi K3; Vals AI la classifica al 12° posto, al di sotto della GPT-5.5 della generazione precedente. Questo articolo è l'aggregazione completa che nessun altro ha scritto: la scorecard completa della 0813, il set di coding esteso del report tecnico, ogni verifica indipendente esistente e un registro onesto di quali numeri sono stati riprodotti e quali sono ancora solo la parola di Deep​Seek. Una settimana dopo la scheda, anche il quadro del serving ha iniziato a prendere forma — il 19 agosto 2026, LMSYS e Ant Group hanno pubblicato uno stack di serving H20 che raggiunge 271 token di output al secondo con batch size 1, trattato nella sua sezione qui sotto e, al pari di tutto ciò che proviene dal lato vendor di questa pagina, archiviato come auto-dichiarato finché qualcuno non lo riproduce.

La scheda ufficiale 0813 — i numeri di Deep​Seek, tutti quanti

L'annuncio ufficiale di Deep​Seek (documentazione API, news260813, 13 agosto 2026) riferisce la build di produzione rispetto all'anteprima di aprile. Ogni dato in questa sezione è fornito dal fornitore — nessuno è stato riprodotto in modo indipendente al 16 agosto 2026:

• Terminal-Bench 2.1 — 87.9 (anteprima: 72.1).

• DeepSWE — 62.7 (anteprima: 12.8) — un balzo di circa 5x che è l'affermazione di gran lunga più sorprendente sulla scheda.

• CyberGym — 83.3 (anteprima: 52.7).

• Humanity's Last Exam — 42.7 senza strumenti, 60.0 con strumenti (anteprima: 37.7 / 48.2).

• Toolathlon-Verified — 74.1 (anteprima: 55.9).

• AutomationBench (pubblico) — 31.8 (anteprima: 12.8).

• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (anteprima: 41.8 / 31.1).

• NL2Repo — 61.5 (anteprima: 38.5).

• Agents' Last Exam — 25.7 (anteprima: 16.5).

Il pattern da notare è dove si concentrano i guadagni: i benchmark agentici e di cybersicurezza. È esattamente il tipo di scorecard che un laboratorio produce quando vuole pubblicizzare un modello per agenti — ed esattamente il tipo che richiede una riesecuzione neutrale prima di spendere denaro per la produzione.

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

Il set di codifica esteso dal rapporto tecnico di Deep​Seek

Oltre alla scheda agentica, il rapporto tecnico di Deep​Seek (come aggregato da BenchLM il 16 agosto 2026) aggiunge un set più ampio di coding e long-context. Anche riportato dal fornitore, ed etichettato "Provider exact" da BenchLM — nessun test indipendente:

• SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.

• LiveCodeBench Pass@1-CoT — 93.5% — il migliore verificato nel catalogo di BenchLM.

• Rating Codeforces — 3206 — anche il migliore verificato nel catalogo.

• BrowseComp — 83.4%; Terminal-Bench 2.0 — 67.9%.

• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — entrambi i migliori del catalogo nel recupero su 1M di token, un aspetto cruciale per un modello che pubblicizza una finestra di contesto da 1M di token.

• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (elencati sulla pagina del modello di OrcaRouter).

Cosa misurano realmente i valutatori indipendenti

Tre fonti indipendenti hanno eseguito DeepSeek V4 Pro e i loro verdetti si concentrano al di sotto della scheda del fornitore:

• Artificial Analysis Intelligence Index — 53(Resoconto di SCMP, agosto 2026; la pagina del modello di OrcaRouter mostra 53.2, classificato al 20° posto su 132). Alla pari con GLM 5.2, quattro punti dietro a GPT-5.6 Terra, sette dietro a Kimi K3.

• Artificial Analysis Coding — 68.8, classificato 24° su 130 (secondo la pagina del modello di OrcaRouter).

• Vals AI Index — 12°, dietro alla precedente generazione GPT-5.5 e molto indietro rispetto a Kimi K3 e Claude Opus 5 (SCMP). I test interni di Vals AI hanno evidenziato due punti deboli concreti: completare attività in un ambiente terminale in sandbox e creare modelli finanziari complessi in fogli di calcolo Excel.

• Vibe Code Bench v1.1 — 49.93 (Vals AI, l'unica esecuzione indipendente "Benchmark exact" nel set).

Il registro onesto — ciò che è stato riprodotto rispetto a ciò che è ancora solo la parola di Deep​Seek

Questa è la sezione che un articolo di benchmark serve a fornire, e il motivo per cui aggiungere questa pagina ai preferiti rispetto alla copertura del lancio. Dividi ogni punteggio in uno di due gruppi:

• Fonte indipendente: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI al 12º posto, Vibe Code Bench 49.93 — e un run di Terminal-Bench 2.1 da fonte separata di 78.7 che si affianca all'87.9 di Deep​Seek sulla pagina del modello di OrcaRouter. Questo divario di nove punti tra il numero del fornitore e un run indipendente è il dato più importante di questa pagina: è il gap di riproduzione, quantificato.

• Solo segnalato dal fornitore, non riprodotto in modo indipendente: ogni cifra nella scheda ufficiale 0813 qui sopra (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) e l'intero set di coding esteso (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). La documentazione di Deep​Seek stessa etichetta la cifra di Terminal-Bench 2.1 come "provider run."

Letta in questo modo, la storia è coerente: DeepSeek V4 Pro è un vero modello frontier di fascia media — AA 53, classificato tra il 13° e il 29° posto — con una scheda di valutazione del fornitore che rivendica prestazioni quasi ai vertici in ambito agentico e di coding. Entrambe le affermazioni sono vere e non sono in conflitto; una è misurata, l'altra è dichiarata.

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

Quanto costa la scorecard

DeepSeek V4 Pro è il modello di punta MoE da 1.6T totali / 49B attivi, con una finestra di contesto da 1M token e un output massimo di 384K. Su OrcaRouter è disponibile al prezzo di listino di Deep​Seek senza alcun ricarico: $0,435 per milione di token di input e $0,87 per milione di output (lettura cache $0,060 per milione), secondo la directory verificata il 15 agosto 2026 e confermata sulla pagina live del modello. A questa tariffa, il calcolo del prezzo per punto è l'argomento più forte a favore del modello: costa circa un decimo del prezzo di output dei modelli che nell'indice indipendente ottengono punteggi vicini al suo, quindi paghi prezzi di fascia media per una scheda che, se le dichiarazioni del fornitore reggono, è vicina alla vetta. Un'avvertenza: Deep​Seek ha annunciato un programma di prezzi con fasce di picco e fuori picco (fuori picco al 50% del picco) in vigore dal 17 agosto, ora di Pechino, quindi la tariffa potrebbe variare — i numeri qui riportati sono il prezzo di listino vigente alla data di questo articolo.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

Servizio DeepSeek V4 Pro: 271 token di output/s su H20

I benchmark valutano ciò che il modello sa; i numeri del serving valutano quanto poco ti costa farlo pensare. Il 19 agosto 2026, LMSYS — l'organizzazione dietro Chatbot Arena — e il team open-source di Ant Group hanno pubblicato il primo serio lavoro di serving sulla build 0813: uno "stack di serving specifico per scenario" costruito su SGLang, il motore open-source mantenuto da LMSYS. Il dato di punta è 271 token di output/s con batch size 1 su una NVIDIA H20, che il team stima essere 1,42× inferiore a una B300 — raggiunto su un chip con nessun Tensor Core FP4 nativo. Queste sono misurazioni di LMSYS e Ant Group, annunciate sul loro blog e su X; nessuna è stata riprodotta in modo indipendente.

I numeri del resto dello stack, tutti auto-riportati da LMSYS e Ant Group sul proprio stack:

• Latenza di decodifica — un componente "DSpark ottimizzato" riduce il tempo per token di output (TPOT) del 74,8–78,0% con una dimensione batch di 1.

• Prefill — un prefill da 1 milione di token viene completato in 43,7 secondi, con un guadagno medio geometrico del 36,5% del throughput del prefill.

• KV cache — uno schema che il team chiama "Humming MXFP4AFP8 + Online C128" espande di 10,14× la capacità della cache KV per tutti i token, la leva che rende pratici i carichi di lavoro agentici da 1 milione di token su questa classe di silicio.

• Decodifica per GPU — con un contesto a 4K, il throughput di decodifica per GPU passa da 319.9 a 703.2 token/s/GPU, un miglioramento di 2.20×.

Leggi le avvertenze prima di dimensionare una flotta basandoti su questo. Il batch size 1 è il regime a flusso singolo — ciò che un agente interattivo o una chat incontra, non un'API ad alta concorrenza — e il confronto 1,42× rispetto alla B300 è un rapporto che LMSYS dichiara senza pubblicare i token/s assoluti della B300, quindi il divario è affermato, non verificabile. Il risultato misura inoltre lo stack, non il chip: questi guadagni derivano da un'ottimizzazione a livello SGLang su hardware che altrimenti sembrerebbe sottodimensionato per un MoE da 1,6T totali. Per contesto, la pagina del modello live di OrcaRouter misura DeepSeek V4 Pro a 80,8 token/s in output attraverso un endpoint API condiviso — il dato della H20 è un benchmark a flusso singolo su uno stack dedicato, un numero diverso con un significato diverso.

If your workload is served through an API, none of this changes how you call the model: {{1}}DeepSeek V4 Pro is one OpenAI-compatible key on OrcaRouter at Deep​Seek's list price, with automatic failover if the provider stalls.{{/1}} The H20 numbers matter most if {{2}}you are the team weighing a self-hosted H20 fleet against paying for the API{{/2}} — {{3}}the gap the LMSYS and Ant Group work closes is a hardware-purchase decision, not a model-selection one.{{/3}}

Quando questa raccomandazione è sbagliata

I casi in cui, onestamente, DeepSeek V4 Pro non dovrebbe essere la tua scelta:

• Ti serve un ragionamento di frontiera con conferma indipendente. AA Index 53 è a metà classifica — Kimi K3 (60) e GPT-5.6 Terra (57) sono più avanti e verificati. Se la tua decisione dipende dal tetto misurato, la scheda del fornitore non lo cambia.

• Stai scommettendo la produzione su DeepSWE 62.7 prima che qualcuno lo riesegua. Un salto 12.8→62.7 in una singola release è un’affermazione, non un fatto. Aspetta una riproduzione neutrale: il divario 87.9-vs-78.7 in Terminal-Bench mostra ciò che si potrebbe scoprire.

• Il tuo carico di lavoro è automazione di terminale in sandbox o modellazione finanziaria in Excel. Vals AI afferma che questi sono esattamente i punti in cui il modello ha difficoltà, indipendentemente da qualsiasi punteggio del fornitore.

• Stai prendendo una decisione di cybersecurity su CyberGym 83.3. Questo è Deep​Seek che testa il proprio modello sul proprio benchmark — un fornitore di sicurezza che acquista sulla base di questo numero sta comprando dati non verificati.

• Stai comprando le H20 basandoti solo sul dato di 271 token/s. Quella cifra è un benchmark auto-dichiarato su un singolo stack, con batch size 1 — promettente, non riprodotto, e solo un punto su una curva di costo che include anche utilizzo, potenza e qualunque stack di serving che eseguiresti davvero.

Il risultato finale

DeepSeek V4 Pro 0813 è un vero modello di frontiera con una scorecard del vendor che supera il suo record indipendente. La release 0813 ha trasformato un'anteprima testuale in un serio contendente agentico — abbiamo coperto la release stessa separatamente — e se vuoi valutarlo oggi, è una chiave compatibile OpenAI su OrcaRouter al prezzo di listino di Deep​Seek, con failover automatico se il provider si blocca. Basta leggere la scorecard nel modo in cui questo articolo la suddivide: i controlli indipendenti (AA 53, Vals 12°, il run 78.7 su Terminal-Bench) sono ciò di cui puoi fidarti oggi; gli 87.9 e i 62.7 sono ciò che dovresti verificare prima di costruirci sopra. La stessa disciplina ora si estende al serving: i 271 token/s in output su H20 di LMSYS e Ant Group è il miglior quadro di throughput che abbiamo, ed è ancora una loro parola finché un run neutrale non lo conferma. Compralo per il rapporto prezzo-prestazioni e il contesto da 1 milione di token, non per i numeri in evidenza non riprodotti.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno