
DeepSeek V4 Flash Vision (Exp) approda sull'API: stesso prezzo di V4-Flash, ora con gli occhi.
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
DeepSeek V4 Flash Vision (Exp) è andato live sulla piattaforma API di DeepSeek oggi, 21 agosto 2026, e il numero più importante nell'annuncio non è un benchmark — è il prezzo: questo modello di visione sperimentale viene fatturato esattamente alle stesse tariffe token di DeepSeek V4 Flash, il cavallo di battaglia solo testo di cui eguaglia apertamente le capacità testuali. Ciò rende questa la prima volta che l'API di DeepSeek accetta immagini, e significa che il modo più economico per eseguire un agente con contesto da 1M è appena diventato multimodale gratuitamente.
Cosa è stato effettivamente spedito
DeepSeek V4 Flash Vision (Exp) è un modello multimodale sperimentale, accessibile con l'ID modello deepseek-v4-flash-vision-exp. Accetta testo e immagini in input e produce testo in output, su una finestra di contesto da 1 milione di token con un massimo di 384K token di output, sia in modalità di pensiero che non. Supporta il formato Chat Completions, le Messages in stile Anthropic e il formato Responses, ovvero la triade di cui un framework per agenti ha bisogno per integrarlo senza un adattatore personalizzato.
Per l'input di immagini, DeepSeek accetta JPEG, PNG, GIF e WebP, che possono essere passati in tre modi: base64 inline, un URL esterno o un file caricato tramite la nuova Files API. Non c'è ancora input video o audio: la 'visione' qui è solo immagini fisse.

Il posizionamento di DeepSeek stesso, nella sua nota di rilascio: la capacità di testo puro — agenti, ragionamento, conoscenza del mondo — è alla pari con il rilascio ufficiale di DeepSeek V4 Flash, mentre la capacità di agente multimodale fa un grande balzo in avanti e si avvicina a Opus-4.8. Questa è un'affermazione del fornitore, non verificata, e vale la pena leggerla attentamente, perché il dettaglio dei benchmark dietro di essa è più interessante del titolo.
Perché il balzo del benchmark è più grande di quanto sembri
Tutte le seguenti cifre sono di DeepSeek, pubblicate oggi nella nota di lancio, non verificate in modo indipendente. Nei benchmark degli agenti che incorporano screenshot e immagini, il DeepSeek V4 Flash solo testo non li legge — ignora semplicemente le parti multimodali del compito. DeepSeek V4 Flash Vision (Exp) guarda davvero, ed è per questo che i delta sono così ampi:
• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2 (Opus-4.8 39.4)
• Agents' Last Exam — Vision-Exp 27.3 vs V4-Flash 25.2 (Opus-4.8 25.7)
• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7 (Opus-4.8 85.0)
• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2 (Opus-4.8 69.7)
• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4 (Opus-4.8 58.0)
• Chartography — Vision-Exp 64.3 (il V4-Flash solo testo non può provarci)
• ZeroBench Pass@5 — Vision-Exp 35.0 (il V4-Flash solo testo non può tentarlo)

Due di questi numeri meritano un secondo sguardo. In Agents' Last Exam, Vision-Exp (27.3) supera di poco Opus-4.8 (25.7), e anche su DeepSWE batte Opus-4.8 (59.3 vs 58.0). È su questo che si fonda realmente "vicino a Opus-4.8" — non un singolo risultato di punta, ma una fascia di benchmark agentici in cui vedere lo schermo colma gran parte del divario rispetto al modello multimodale di frontiera, pur costando circa un ordine di grandezza in meno.
Quanto costa un'immagine, fino al decimale.
Le immagini vengono tokenizzate per la fatturazione — fino a 384 token ciascuna — e poi addebitate alle stesse tariffe per token di DeepSeek V4 Flash. Poiché DeepSeek ha spostato tutti i suoi modelli alla tariffazione picco/off-peak il 16 agosto 2026, i numeri esatti dipendono da quando effettui la chiamata:
• Input, cache miss — $0.22 per 1M token fuori punta, $0.44 in punta.
• Input, cache hit — $0,007 per 1 milione di token fuori punta, $0,014 in punta
• Output — $0.66 per 1M token fuori punta, $1.32 di punta
• Ore di punta — 01:00–04:00 e 06:00–10:00 UTC (tutte le altre ore sono fuori punta)
Fate i conti e il costo della visione quasi svanisce. Un'immagine al suo massimo di 384 token costa circa 0,0085 centesimi fuori punta e 0,017 centesimi di punta, come input. Un agente che legge 50 screenshot in una singola esecuzione aggiunge circa mezzo centesimo di token di input, prima ancora che il modello scriva il suo primo token di output. DeepSeek limita inoltre la risoluzione prima dell'inferenza: il livello di dettaglio basso ridimensiona a 512×512, mentre quello alto/originale pre-scala l'immagine (quelle piccole fino a circa 384×384, quelle grandi fino a circa 800×800), quindi un originale ad alta risoluzione non viene mai passato al modello con la sua quantità nativa di pixel.
Il cast di supporto: una Files API gratuita e Harness 0.1.1
Due componenti infrastrutturali sono stati distribuiti insieme al modello. La Files API è attiva e gratuita: carica un'immagine una volta, fai riferimento ad essa tramite file_id e riutilizzala tra diverse richieste senza dover inviare nuovamente i byte — un aspetto rilevante per un agente di navigazione che mantiene una pagina nel contesto per più turni. E DeepSeek Harness 0.1.1, rilasciato lo stesso giorno, offre un supporto pronto all'uso per il nuovo modello, così l'harness che valuta e gestisce i carichi di lavoro agentici di DeepSeek può puntare su di esso immediatamente.
L'avvertenza sulla produzione, detta chiaramente
Questo è un modello sperimentale. DeepSeek lo etichetta esplicitamente come tale, non ha annunciato una data di GA e sconsiglia di eseguirlo direttamente in produzione; il piano dichiarato è di iterare sui feedback e rilasciare una versione stabile in seguito. La conseguenza pratica è che il cervello testuale è collaudato — è la stessa famiglia di pesi che alimenta V4-Flash — ma il percorso visivo è codice nuovo, e nessuno al di fuori di DeepSeek lo ha stress-testato su larga scala.
Questa è esattamente la situazione in cui un livello di routing dimostra il suo valore. Su OrcaRouter, sia deepseek/deepseek-v4-flash-vision-exp che deepseek/deepseek-v4-flash sono attivi dietro un'unica API, al prezzo di listino di DeepSeek, senza alcun ricarico. Puoi indirizzare il traffico contenente immagini verso il modello sperimentale e, nella stessa configurazione, impostare un failover automatico verso un fallback nel momento in cui va in errore o in timeout — il che rende meno rischioso l'intero problema del "nuovo codice". Il DSL di routing consente inoltre di inviare solo le chiamate che contengono effettivamente immagini al modello vision e di mantenere il traffico puramente testuale su DeepSeek V4 Flash, cogliendo i benefici nei benchmark dove esistono e senza pagare nulla in più dove non esistono.

Cosa guardare dopo
Le domande aperte sono quelle consuete per un lancio sperimentale. Quando DeepSeek V4 Flash Vision (Exp) raggiungerà la GA, e il prezzo reggerà? L'input video o audio arriverà in seguito — oggi il modello supporta solo immagini fisse, il che lascia i grandi modelli multimodali di frontiera senza opposizione sui media in movimento. E le valutazioni indipendenti (la prima esecuzione di terze parti su ApexBench o Terminal-Bench) riprodurranno i numeri pubblicati? La cosa interessante è che anche se ogni benchmark dovesse calare, l'unica affermazione che è già conveniente — visione ai prezzi del testo — è un fatto di prezzo, non un'affermazione di benchmark, e non ha bisogno di essere riprodotta.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
