
DeepSeek V4 Pro Benchmarks: La scheda completa 0813, ogni verifica indipendente e ciò che nessuno ha ancora verificato
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaNUOVOMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 221 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
La risposta in una riga: DeepSeek V4 Pro pubblica una scheda agentica davvero solida sui numeri di DeepSeek — Terminal-Bench 2.1 a 87.9, DeepSWE a 62.7, CyberGym a 83.3 — ma quasi ogni cifra di punta è dichiarata dal fornitore, e il quadro indipendente è più freddo. Artificial Analysis colloca la build ufficiale 0813 a 53 nel suo Intelligence Index, alla pari di GLM-5.2, quattro punti dietro GPT-5.6 Terra e sette dietro Kimi K3; Vals AI la classifica al 12° posto, sotto la GPT-5.5 della generazione precedente. Questo articolo è l'aggregazione completa che nessun altro ha scritto: la scheda completa 0813, il set di codifica esteso dal rapporto tecnico, ogni verifica indipendente esistente e un registro onesto di quali numeri sono stati riprodotti e quali sono ancora solo parola di DeepSeek.
La scheda di valutazione ufficiale 0813 — i numeri di DeepSeek, tutti quanti
L'annuncio ufficiale di DeepSeek (documentazione API, news260813, 13 agosto 2026) riporta la build di produzione rispetto all'anteprima di aprile. Ogni dato in questa sezione è dichiarato dal fornitore — nessuno è stato verificato in modo indipendente al 16 agosto 2026:
• Terminal-Bench 2.1 — 87.9 (anteprima: 72.1).
• DeepSWE — 62.7 (anteprima: 12.8) — un balzo di circa 5x che è l'affermazione di gran lunga più sorprendente sulla scheda.
• CyberGym — 83.3 (anteprima: 52.7).
• Humanity's Last Exam — 42.7 senza strumenti, 60.0 con strumenti (anteprima: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (anteprima: 55.9).
• AutomationBench (pubblico) — 31.8 (anteprima: 12.8).
• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (anteprima: 41.8 / 31.1).
• NL2Repo — 61.5 (anteprima: 38.5).
• Agents' Last Exam — 25.7 (anteprima: 16.5).
Il pattern da notare è dove si concentrano i guadagni: i benchmark agentici e di cybersicurezza. È esattamente il tipo di scorecard che un laboratorio produce quando vuole pubblicizzare un modello per agenti — ed esattamente il tipo che richiede una riesecuzione neutrale prima di spendere denaro per la produzione.

Il set di codifica esteso del rapporto tecnico di DeepSeek
{{1}}Oltre alla scheda agentica, il rapporto tecnico di DeepSeek (aggregato da BenchLM il 16 agosto 2026) aggiunge un set più ampio per il coding e il contesto lungo.{{/1}} {{2}}Anche riportato dal fornitore, ed etichettato come "Provider exact" da BenchLM — nessun test indipendente:{{/2}}
• SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.
• LiveCodeBench Pass@1-CoT — 93.5% — il migliore verificato nel catalogo di BenchLM.
• Rating Codeforces — 3206 — anche il migliore verificato nel catalogo.
• BrowseComp — 83.4%; Terminal-Bench 2.0 — 67.9%.
• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — entrambi i migliori del catalogo nel recupero su 1M di token, un aspetto cruciale per un modello che pubblicizza una finestra di contesto da 1M di token.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (elencati sulla pagina del modello di OrcaRouter).
Cosa misurano realmente i valutatori indipendenti
Tre fonti indipendenti hanno eseguito DeepSeek V4 Pro e i loro verdetti si concentrano al di sotto della scheda del fornitore:
• Artificial Analysis Intelligence Index — 53 (report di SCMP, agosto 2026; la pagina del modello di OrcaRouter mostra 53.2, classificato 20° su 132). Alla pari con GLM-5.2, quattro punti dietro a GPT-5.6 Terra, sette dietro a Kimi K3.
• Artificial Analysis Coding — 68.8, classificato 24° su 130 (secondo la pagina del modello di OrcaRouter).
• Vals AI Index — 12°, dietro alla precedente generazione GPT-5.5 e molto indietro rispetto a Kimi K3 e Claude Opus 5 (SCMP). I test interni di Vals AI hanno evidenziato due punti deboli concreti: completare attività in un ambiente terminale in sandbox e creare modelli finanziari complessi in fogli di calcolo Excel.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, l'unica esecuzione indipendente "Benchmark exact" nel set).
Il registro onesto — ciò che è stato riprodotto vs ciò che è ancora solo la parola di DeepSeek
Questa è la sezione che un articolo di benchmark serve a fornire, e il motivo per cui aggiungere questa pagina ai preferiti rispetto alla copertura del lancio. Dividi ogni punteggio in uno di due gruppi:
• Fonte indipendente: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI rank 12th, Vibe Code Bench 49.93 — e un'esecuzione di Terminal-Bench 2.1 da fonte separata di 78.7 che si affianca all'87.9 di DeepSeek nella pagina del modello di OrcaRouter. Questo divario di nove punti tra il numero del fornitore e un'esecuzione indipendente è il dato più importante di questa pagina: è il gap di riproduzione, quantificato.
• Solo riportato dal fornitore, non riprodotto in modo indipendente: ogni cifra nella scheda ufficiale 0813 qui sopra (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) e l'intero set di codifica esteso (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). I documenti di DeepSeek etichettano la cifra di Terminal-Bench 2.1 come "provider run."
Letta in questo modo, la storia è coerente: DeepSeek V4 Pro è un vero modello frontier di fascia media — AA 53, classificato tra il 13° e il 29° posto — con una scheda di valutazione del fornitore che rivendica prestazioni quasi ai vertici in ambito agentico e di coding. Entrambe le affermazioni sono vere e non sono in conflitto; una è misurata, l'altra è dichiarata.

Quanto costa la scorecard
DeepSeek V4 Pro è il modello di punta MoE da 1,6T totali / 49B attivi, con una finestra di contesto di 1M token e un output massimo di 384K. Su OrcaRouter è prezzato al prezzo di listino di DeepSeek senza alcun ricarico: $0,435 per milione di token di input e $0,87 per milione di output (lettura cache $0,060 per milione), secondo la directory controllata il 15 agosto 2026 e confermata sulla pagina live del modello. A questa tariffa, il calcolo prezzo-per-punto è l'argomento più forte a favore del modello: è circa un decimo del prezzo di output dei modelli che ottengono punteggi simili nell'indice indipendente, quindi stai pagando prezzi di fascia media per una scheda che, se le affermazioni del fornitore reggono, è quasi ai vertici. Una nota: DeepSeek ha annunciato una tariffazione con picchi e fuori picco (fuori picco al 50% del picco) in vigore dal 17 agosto, ora di Pechino, quindi la tariffa potrebbe variare — i numeri qui sono il prezzo di listino vigente al momento dell'articolo.

Quando questa raccomandazione è sbagliata
I casi in cui, onestamente, DeepSeek V4 Pro non dovrebbe essere la tua scelta:
• Ti serve un ragionamento di frontiera con conferma indipendente. AA Index 53 è a metà classifica — Kimi K3 (60) e GPT-5.6 Terra (57) sono più avanti e verificati. Se la tua decisione dipende dal tetto misurato, la scheda del fornitore non lo cambia.
• Stai scommettendo la produzione su DeepSWE 62.7 prima che qualcuno lo riesegua. Un salto 12.8→62.7 in una singola release è un’affermazione, non un fatto. Aspetta una riproduzione neutrale: il divario 87.9-vs-78.7 in Terminal-Bench mostra ciò che si potrebbe scoprire.
• Il tuo carico di lavoro è automazione di terminale in sandbox o modellazione finanziaria in Excel. Vals AI afferma che questi sono esattamente i punti in cui il modello ha difficoltà, indipendentemente da qualsiasi punteggio del fornitore.
• Stai prendendo una decisione di cybersicurezza su CyberGym 83.3. Questo è DeepSeek che testa il proprio modello sul proprio benchmark — un vendor di sicurezza che acquista in base a questo numero sta comprando dati non verificati.
Il risultato finale
DeepSeek V4 Pro 0813 è un vero modello di frontiera con una scheda del fornitore che supera il suo record indipendente. La release 0813 ha trasformato un'anteprima testuale in un serio contendente agentico — abbiamo coperto la release stessa separatamente — e se vuoi valutarlo oggi, è una chiave compatibile con OpenAI su OrcaRouter al prezzo di listino di DeepSeek, con failover automatico se il provider si blocca. Basta leggere la scheda come la suddivide questo articolo: i controlli indipendenti (AA 53, 12° nei Vals, il run Terminal-Bench da 78.7) sono ciò di cui puoi fidarti oggi; gli 87.9 e 62.7 sono ciò che dovresti verificare prima di costruirci sopra. Compralo per il rapporto prezzo/prestazioni e il contesto da 1M di token, non per i numeri in evidenza non riprodotti.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
