Scheda del titolo hero: Benchmark di DeepSeek V4.1 Flash — cosa dimostra e cosa non dimostra 74,2, con data di rilascio 2026-09-10 e una nota che recita: sei giorni di risultati indipendenti.
Guides & Insights

Benchmark di DeepSeek V4.1 Flash: cosa dimostra e cosa non dimostra il 74,2

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

DeepSeek V4.1 Flash ha ottenuto 74,2 su DeepSWE v1.1, un decimo di punto sopra GPT-6 Astra, mezzo punto sopra Gemini 3.8 Flash e Claude Opus 5, e il numero è stato citato per tutta la settimana come un cambio della guardia. Vale la pena essere precisi su che cosa sia in realtà. Il modello in sé non è nuovo — DeepSeek V4.1 Flash è diventato disponibile a livello generale il 2026-09-10, sei giorni fa — quindi qui non c'è nessun lancio. Ciò che è caduto in quella finestra è il livello di misurazione: le prime voci indipendenti negli indici, il primo risultato indipendente in arena, il supporto di serving day-0 su tre stack e la decisione di un fornitore di ritirare il proprio flagship in favore di questo. Questa pagina è una rassegna di ciò che è stato effettivamente misurato, con la fonte indicata per ogni cifra, e una dichiarazione chiara di ciò che nessuno ha ancora stabilito.

Il numero DeepSWE, e i quattro modelli entro mezzo punto da esso

DeepSWE v1.1 è un benchmark di ingegneria del software a lungo orizzonte di Datacurve — 113 attività originali distribuite su 91 repository open source e cinque linguaggi di programmazione, costruito attorno a modifiche multi-file e correttezza comportamentale. Nella model card di DeepSeek stessa, la tabella riportata dal fornitore recita: DeepSeek V4.1 Flash 74,2, Claude Opus 5 74,0, GPT-5.6 Sol 73,0, Kimi K3 67,5, GLM-5.3 66,9, DeepSeek V4-Pro-0813 62,7, DeepSeek V4-Flash 54,4.

La classifica indipendente per lo stesso benchmark non riproduce quell'ordine, e le differenze contano più del dato principale. La classifica Pass@1 di DeepSWE v1.1 di Datacurve colloca Muse Spark 1.3 (FAIR) al primo posto a 75,40, davanti a DeepSeek V4.1 Flash a 74,20. Dietro: GPT-6 Astra a 74,12 (extra alto) e 74,10 (max), Gemini 3.8 Flash a 73,83 (alto), Claude Opus 5 a 73,65 (max).

Quindi il 74.2 è una voce reale su una vera classifica di terze parti, ed è secondo, non primo. L'affermazione che circolava il giorno del rilascio — che questo sia lo stato dell'arte su DeepSWE — non regge al confronto con la classifica che riporta quel punteggio. Muse Spark 1.3 è avanti di 1.2 punti.

Ora la parte che viene saltata. Quattro modelli di frontiera si collocano entro 0,55 punti l'uno dall'altro su questo benchmark: 74,20, 74,12, 73,83, 73,65. È una fascia più stretta del rumore di misura. La variazione pubblicata da esecuzione a esecuzione su DeepSWE è dell'ordine di 1,4-3,2 punti — da tre a sei volte l'ampiezza dell'intera forbice dei primi quattro. Un vantaggio di 0,2 punti su GPT-6 Astra non è un risultato; è l'aspetto che ha un pareggio quando lo si stampa con due decimali.

La sensibilità allo scaffold è il secondo motivo per considerare il numero con cautela, e qui è la documentazione stessa del fornitore a fornire le prove. DeepSeek riporta DeepSWE su otto scaffold negli stessi materiali di rilascio. Il 74,2 è stato ottenuto su mini-SWE. Lo stesso modello ha totalizzato 72,6 su DSH Minimal, 70,5 su DSH Standard, 69,8 su Claude Code, 67,6 su DSH PTC, 66,2 su Pi, 65,6 su Codex e 65,5 su OpenCode. Si tratta di una differenza di 8,7 punti su un solo modello e un solo benchmark, determinata esclusivamente dall'harness che lo avvolge. Chiunque confronti un numero di DeepSeek prodotto su mini-SWE con il numero di un concorrente prodotto su un diverso agent loop sta confrontando scaffold, non modelli.

Dove l'indice indipendente lo colloca effettivamente

Artificial Analysis esegue una suite fissa con impostazioni di effort dichiarate, il che rende il suo Intelligence Index la verifica esterna più pulita disponibile. Nella pagina del modello DeepSeek V4.1 Flash, con reasoning max effort, l'indice segna 40 — classificato #6 su 113 modelli in quella classe, rispetto a una mediana di classe di 18. I rivali closed si collocano sopra di esso: Claude Opus 5 (max) 51, GPT-5.6 Sol (max) 47, GLM-5.3 (max) 45, Kimi K3 (max) 44, Gemini 3.8 Flash (high) 41. Il precedente flagship di DeepSeek, V4-Pro-0813, si colloca sotto, a 36.

Leggi le due classifiche affiancate e il disaccordo è strutturale, non un errore. Sul benchmark scelto da DeepSeek, con lo scaffold giusto, il modello pareggia con la frontiera. Su una suite esterna fissa, calcolata come media tra ragionamento, coding, matematica e lavoro agentico, è indietro di undici punti rispetto a Claude Opus 5 e di un punto rispetto a Gemini 3.8 Flash. Entrambe le cose possono essere vere. Una tabella di fornitore è un argomento; un indice è una media.

La pagina dell'indice riporta anche due cifre che contano per una decisione di routing e raramente fanno notizia. DeepSeek V4.1 Flash funziona a 214,4 token di output al secondo con il massimo sforzo — veloce. Ha inoltre generato 250M token di output completando l'Intelligence Index, contro una mediana di 140M, che Artificial Analysis segnala come marcatamente prolisso. La verbosità non è un problema di qualità; è un conto da pagare. Un modello che pensa con il 79% di token in più rispetto ai suoi pari restituisce parte del suo vantaggio di prezzo a ogni chiamata di ragionamento lunga.

Single-column scoreboard for DeepSeek V4.1 Flash: DeepSWE v1.1 74.2, second behind Muse Spark 1.3; Artificial Analysis Intelligence Index 40 against Claude Opus 5 at 51; ProgramBench 20.3 single model; ProgramBench agent team 30.04% at 8 hours; output speed 214.4 tokens per second; off-peak price $0.15 in and $0.60 out per 1M.

ProgramBench: un punteggio relativo a un singolo modello e un punteggio multi-agente non sono la stessa misurazione

Questo è il numero più facilmente soggetto a errori di lettura, perciò vale la pena separarlo con attenzione.

• Modello singolo, configurazione standard — DeepSeek V4.1 Flash ottiene 20,3 su ProgramBench (Almost@1), secondo la scheda modello di DeepSeek stessa. Questo è inferiore a GPT-5.6 Sol con 23,0 e ben al di sotto di Claude Opus 5 con 37,0, e solo leggermente superiore a GLM-5.3 con 19,0 e Kimi K3 con 17,5. Dati dichiarati dal fornitore, e non favoriscono il modello.

• Configurazione di team multi-agente — il report tecnico di DeepSeek, DeepSeek-V4.1-Flash: spingere ai limiti la compressione della KV cache, descrive una ricetta preliminare di Agent Swarm RL in cui un agente lead coordina i compagni di squadra su una bacheca di attività condivisa. Su un sottoinsieme ad alta affidabilità di ProgramBench composto da 172 attività — attività in cui la soluzione di riferimento supera il 95% o più — la configurazione multi-agente sale dal 13,59% con una scadenza di un'ora a un picco del 30,04% a otto ore, mentre la baseline a singolo agente passa dal 12,79% al 20,39%.

Il 30,04% è la fonte dell'affermazione del «30%», e non è un punteggio di un singolo modello. È un team di agenti a cui sono state concesse otto ore, misurato su un sottoinsieme filtrato, nella valutazione preliminare dello stesso fornitore. Il confronto a cui invita — «ben al di sopra di Sol da solo, quasi il doppio di Kimi K3» — è aritmeticamente equo rispetto al 23,0 di Sol e al 17,5 di K3, ed è anche un confronto tra una configurazione multi-agente e baseline a modello singolo su un insieme di attività diverso. Lo stesso report mostra l'effetto su FrontierSWE v2: il multi-agente raggiunge il 32,90% a venti ore contro il 28,20% del singolo agente. Il divario è reale, si restringe man mano che la scadenza si estende, e il costo in token per ottenerlo non è piccolo — un resoconto sul campo riporta più di 10 volte i token e tempi di esecuzione che si avvicinano alle quattro ore.

Il numero di parametri non è stabilito, quindi considera ogni confronto tra dimensioni come provvisorio

Le note di rilascio di DeepSeek descrivono un "MoE da 552B parametri". Questa è la cifra del fornitore, ed è quella che la maggior parte della copertura ripete. Non è però l'intero artefatto.

La model card di DeepSeek documenta un secondo componente accanto al backbone transformer: "Engram conditional memory (196B parametri, accesso sparso tramite lookup basato su token)". Somma i due e ottieni 748B. Questa è l'aritmetica dietro la lettura della comunità che ha circolato su r/LocalLLaMA entro poche ore dal rilascio, e l'indice safetensors della model card stessa elenca 763B parametri tra i suoi tipi di tensore. La cifra di circa 510 GB in FP8 proviene dalla stessa linea di analisi: ciò che effettivamente scarichi e tieni in memoria.

La riconciliazione sta nel fatto che questi numeri contano cose diverse. 552B è la spina dorsale computazionale — i parametri attraverso cui scorre un token. 196B è una tabella di ricerca consultata a livelli specifici che restituisce informazioni memorizzate anziché calcolarle. 8B e 16B, le cifre di attivazione citate da DeepSeek, sono le porzioni per token attive rispettivamente durante il prefill e il decode. Tutti e quattro i numeri descrivono lo stesso modello.

Niente di tutto ciò rende sicuro il confronto. Ogni affermazione del tipo "questo modello eguaglia un modello di frontiera con una frazione della dimensione" si basa su un titolo di un fornitore che esclude un quinto dell'artefatto. Finché qualcuno non pubblica un conteggio riproducibile dei parametri, gli argomenti basati sulla dimensione dovrebbero includere l'avvertenza in linea.

ARC-AGI: nessun risultato per questo modello

Non esiste alcun punteggio ARC-AGI-2 o ARC-AGI-1 per DeepSeek V4.1 Flash. La pagina dei risultati verificati di ARC Prize non contiene alcuna voce per questo checkpoint, e la tabella di benchmark di DeepSeek non presenta alcuna riga ARC. L'unico risultato DeepSeek verificato da ARC Prize riguarda il più vecchio checkpoint V4 Flash 0731 — 61,4% su ARC-AGI-2 semi-private con massimo sforzo di ragionamento e 89,0% su ARC-AGI-1, a 0,04 $ e 0,02 $ per attività rispettivamente. Quelli sono i numeri del predecessore su un modello diverso, e citarli come risultati di V4.1 Flash sarebbe sbagliato. Se ARC-AGI è importante per la tua valutazione, al momento questo modello è privo di punteggio.

Cos'altro è finito dentro la finestra?

Tre cose sono cambiate per un lettore che decide se provare questo modello, e nessuna di esse è il rilascio del modello stesso.

• Risultato indipendente dell'arena. OpenDesign Arena ha messo alla prova tredici modelli su compiti di design identici — app web, dashboard, schermate mobile, landing page. DeepSeek V4.1 Flash ha ottenuto 81,2 su 100 contro gli 82,7 di GPT-6 Astra, a $0,023 per design finito contro $1,61, e ha terminato in 5,3 minuti contro 11,1. Il tasso di consegna — output utilizzabili senza revisioni — è stato del 57,7% contro il 60% di Astra. Questa è una delle prime misurazioni davvero indipendenti del modello, e misura nello specifico l'output di design, non il ragionamento generale o la programmazione.

• Supporto di serving Day-0 su tre stack. vLLM ha pubblicato un'immagine day-0 (2026-09-09) validata su hardware NVIDIA e AMD. SGLang e Miles hanno pubblicato il supporto day-0 per inferenza e RL il 2026-09-10, includendo un percorso Engram host-offload che ha aumentato la capacità della KV cache del 36% su 4x GB300 e un'ottimizzazione bounded-replay che ha incrementato il throughput di prefill di 1.56x su 8x H200. Cambricon ha annunciato l'adattamento Day-0 sullo stack vLLM lo stesso giorno. Per un modello il cui punto di forza è la compressione aggressiva della KV cache — un quarto dell'impronta HBM della generazione precedente, un ottavo della sua SSD — essere eseguibile su stack standard fin dal primo giorno è la differenza tra un risultato di laboratorio e qualcosa che puoi distribuire.

• Il fornitore ha ritirato la propria ammiraglia. DeepSeek sta dismettendo V4-Pro. A partire dalle 04:00 UTC del 2026-09-14, qualsiasi richiesta che nomini “deepseek-v4-pro” viene instradata a V4.1 Flash ed è fatturata alle tariffe di Flash, proseguendo finché non viene lanciato un V4.1 Pro. DeepSeek V4.1 Pro non è stato rilasciato — è un modello futuro, e il reindirizzamento è una soluzione tampone che impedisce alle integrazioni fissate di rompersi. Ritirati anche: “deepseek-v4-flash” e “deepseek-v4-flash-vision-exp”, entrambi temporaneamente indirizzati a V4.1 Flash per compatibilità. Se hai un ID modello fissato in produzione, quel reindirizzamento è l'unico fatto operativo di questa pagina che non puoi ignorare.

Che effetto ha il prezzo sulla decisione

Il prezzo è il punto in cui questo modello smette di essere un racconto da benchmark. Secondo le tariffe pubblicate da DeepSeek stessa, in vigore dalle 04:00 UTC del 2026-09-10, con le ore di punta definite come 01:00–04:00 e 06:00–10:00 UTC nei giorni feriali e tutto il resto in fascia non di punta.

• Fuori picco, per milione di token — 0,003 $ per cache hit, 0,15 $ per cache miss, 0,60 $ di output.

• Picco, per milione di token — $0,006 cache hit, $0,30 cache miss, $1,20 output.

• Input in cache, rispetto a un modello chiuso di frontiera — tre decimi di centesimo per milione contro circa cinquanta centesimi. Per un agente che reitera sullo stesso repository, quel livello assorbe la maggior parte dei token.

• Misurato sul nostro catalogo — $0.15 in input e $0.60 in output per milione, 784 ms di tempo mediano al primo token, 211 token al secondo negli ultimi sette giorni.

Artificial Analysis elenca lo stesso modello a 0,30 $ in input e 1,20 $ in output con uno sconto cache del 98% e un prezzo misto di 0,18 $ per milione — quello è il livello di picco, e le due cifre sono lo stesso prezzo in ore diverse della giornata. Vale la pena interiorizzare questa distinzione prima di confrontare i fornitori: un modello con un orologio a due livelli non può essere confrontato su una singola tariffa di riferimento.

È anche per questo che il prezzo pass-through conta più del solito, qui. OrcaRouter instrada DeepSeek V4.1 Flash insieme al resto del suo catalogo con 0% di markup — prezzo di listino del fornitore, invariato, così le fasce di picco e fuori picco di DeepSeek arrivano dalla nostra parte esattamente come DeepSeek le pubblica, e una variazione di prezzo del fornitore è attiva lo stesso giorno. Su un modello la cui tariffa raddoppia per quattro ore ogni mattina dei giorni feriali, una piattaforma che appiattisce le fasce sta nascondendo l'unico numero che ti serviva.

Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Reasoning, Max Effort), showing an Artificial Analysis Intelligence Index score of 40 at rank 6 of 113, output speed 214.4 tokens per second at rank 4 of 113, $0.30 per million input and $1.20 per million output tokens with a 98% cache discount and $0.27 cost per Intelligence Index task, verbosity of 250M output tokens at rank 37 of 113, a 1M token context window, 552B total and 16B active parameters, and an MIT license.Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model identifier, NEW and FEATURED badges, Vision, Tools, JSON and Reasoning capability tags, a release date of 2026-09-10, a 1M token context window, 384K maximum output, text and image input, $0.15 input and $0.60 output per million tokens, and a p50 time to first token of 784 ms.

Ciò che nessuno ha stabilito

La lacuna in questa storia non è un benchmark mancante. È che non esiste alcun confronto diretto credibile tra DeepSeek V4.1 Flash e i suoi rivali nominati su un harness condiviso, eseguito da qualcuno senza interessi in gioco sull'esito. Ogni numero in questa pagina è una di tre cose: riportato dal fornitore, prodotto da una terza parte su una configurazione diversa, o una media su una suite fissa che non è stata progettata per isolare questo confronto. Non esiste alcuna esecuzione in cui DeepSeek V4.1 Flash e GPT-6 Astra siano stati valutati sugli stessi task, con lo stesso scaffold, con la stessa impostazione di effort, pubblicata con la varianza.

Tre cose specifiche cambierebbero il quadro, e nessuna di esse esiste oggi.

• Un confronto DeepSWE controllato a livello di scaffold. La forbice di 8,7 punti tra gli scaffold di DeepSeek stesso è più ampia di qualsiasi divario tra i primi quattro modelli della classifica. Finché la frontiera non viene misurata su un unico harness, l'ordinamento in cima a quella tabella non è significativo.

• Una riproduzione indipendente del risultato dell'agent-team di ProgramBench. Il 30,04% proviene dal rapporto tecnico del fornitore su un sottoinsieme filtrato di 172 attività, in una configurazione preliminare, con un costo in token che non è stato caratterizzato per budget di produzione.

• ARC-AGI.Per questo checkpoint non esiste alcun punteggio.

La conseguenza pratica è un'affermazione più ristretta di quanto i titoli lascino intendere. DeepSeek V4.1 Flash è misurabilmente entro il margine di rumore rispetto alla frontiera su un benchmark di coding a lungo orizzonte, davvero competitivo su compiti di progettazione indipendenti a circa l'1,4% del costo, e circa dieci punti indietro su un indice aggregato. Questo basta a giustificare l'esecuzione sul proprio carico di lavoro e lasciare che sia la propria valutazione a dirimere la questione. Non basta a giustificare la riscrittura di una tabella di routing di produzione sulla base di 0,2 punti — e il fatto che entrambe queste affermazioni siano vere è il risultato complessivo.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno