Una hero card con il titolo DeepSeek-V4-Flash-Vision-Exp e il sottotitolo 'Stesso prezzo di V4-Flash, ora con gli occhi', un'icona lineare con un occhio e un'etichetta del prezzo, un piccolo badge arrotondato con la scritta 'SPERIMENTALE • API • 2026-08-21' e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) approda sull'API: stesso prezzo di V4-Flash, ora con gli occhi.

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

DeepSeek V4 Flash Vision (Exp) è andato live sulla piattaforma API di Deep​Seek oggi, 21 agosto 2026, e il numero più importante nell'annuncio non è un benchmark — è il prezzo: questo modello di visione sperimentale viene fatturato esattamente alle stesse tariffe token di DeepSeek V4 Flash, il cavallo di battaglia solo testo di cui eguaglia apertamente le capacità testuali. Ciò rende questa la prima volta che l'API di Deep​Seek accetta immagini, e significa che il modo più economico per eseguire un agente con contesto da 1M è appena diventato multimodale gratuitamente.

Cosa è stato effettivamente spedito

DeepSeek V4 Flash Vision (Exp) è un modello multimodale sperimentale, accessibile con l'ID modello deepseek-v4-flash-vision-exp. Accetta testo e immagini in input e produce testo in output, su una finestra di contesto da 1 milione di token con un massimo di 384K token di output, sia in modalità di pensiero che non. Supporta il formato Chat Completions, le Messages in stile Anthropic e il formato Responses, ovvero la triade di cui un framework per agenti ha bisogno per integrarlo senza un adattatore personalizzato.

Per l'input di immagini, Deep​Seek accetta JPEG, PNG, GIF e WebP, che possono essere passati in tre modi: base64 inline, un URL esterno o un file caricato tramite la nuova Files API. Non c'è ancora input video o audio: la 'visione' qui è solo immagini fisse.

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

Il posizionamento di Deep​Seek stesso, nella sua nota di rilascio: la capacità di testo puro — agenti, ragionamento, conoscenza del mondo — è alla pari con il rilascio ufficiale di DeepSeek V4 Flash, mentre la capacità di agente multimodale fa un grande balzo in avanti e si avvicina a Opus-4.8. Questa è un'affermazione del fornitore, non verificata, e vale la pena leggerla attentamente, perché il dettaglio dei benchmark dietro di essa è più interessante del titolo.

Perché il balzo del benchmark è più grande di quanto sembri

Tutte le seguenti cifre sono di Deep​Seek, pubblicate oggi nella nota di lancio, non verificate in modo indipendente. Nei benchmark degli agenti che incorporano screenshot e immagini, il DeepSeek V4 Flash solo testo non li legge — ignora semplicemente le parti multimodali del compito. DeepSeek V4 Flash Vision (Exp) guarda davvero, ed è per questo che i delta sono così ampi:

• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2 (Opus-4.8 39.4)

• Agents' Last Exam — Vision-Exp 27.3 vs V4-Flash 25.2 (Opus-4.8 25.7)

• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7 (Opus-4.8 85.0)

• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2 (Opus-4.8 69.7)

• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4 (Opus-4.8 58.0)

• Chartography — Vision-Exp 64.3 (il V4-Flash solo testo non può provarci)

• ZeroBench Pass@5 — Vision-Exp 35.0 (il V4-Flash solo testo non può tentarlo)

A single-column scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp — the scoreboard' listing Context 1M tokens, Max output 384K tokens, Input text + images, Image billing up to 384 tokens each, ApexBench Pass@1 36.5, Status experimental — no GA date, with a footer reading 'All benchmark figures vendor-reported; no independent scores yet.'

Due di questi numeri meritano un secondo sguardo. In Agents' Last Exam, Vision-Exp (27.3) supera di poco Opus-4.8 (25.7), e anche su DeepSWE batte Opus-4.8 (59.3 vs 58.0). È su questo che si fonda realmente "vicino a Opus-4.8" — non un singolo risultato di punta, ma una fascia di benchmark agentici in cui vedere lo schermo colma gran parte del divario rispetto al modello multimodale di frontiera, pur costando circa un ordine di grandezza in meno.

Quanto costa un'immagine, fino al decimale.

Le immagini vengono tokenizzate per la fatturazione — fino a 384 token ciascuna — e poi addebitate alle stesse tariffe per token di DeepSeek V4 Flash. Poiché Deep​Seek ha spostato tutti i suoi modelli alla tariffazione picco/off-peak il 16 agosto 2026, i numeri esatti dipendono da quando effettui la chiamata:

• Input, cache miss — $0.22 per 1M token fuori punta, $0.44 in punta.

• Input, cache hit — $0,007 per 1 milione di token fuori punta, $0,014 in punta

• Output — $0.66 per 1M token fuori punta, $1.32 di punta

• Ore di punta — 01:00–04:00 e 06:00–10:00 UTC (tutte le altre ore sono fuori punta)

Fate i conti e il costo della visione quasi svanisce. Un'immagine al suo massimo di 384 token costa circa 0,0085 centesimi fuori punta e 0,017 centesimi di punta, come input. Un agente che legge 50 screenshot in una singola esecuzione aggiunge circa mezzo centesimo di token di input, prima ancora che il modello scriva il suo primo token di output. Deep​Seek limita inoltre la risoluzione prima dell'inferenza: il livello di dettaglio basso ridimensiona a 512×512, mentre quello alto/originale pre-scala l'immagine (quelle piccole fino a circa 384×384, quelle grandi fino a circa 800×800), quindi un originale ad alta risoluzione non viene mai passato al modello con la sua quantità nativa di pixel.

Il cast di supporto: una Files API gratuita e Harness 0.1.1

Due componenti infrastrutturali sono stati distribuiti insieme al modello. La Files API è attiva e gratuita: carica un'immagine una volta, fai riferimento ad essa tramite file_id e riutilizzala tra diverse richieste senza dover inviare nuovamente i byte — un aspetto rilevante per un agente di navigazione che mantiene una pagina nel contesto per più turni. E Deep​Seek Harness 0.1.1, rilasciato lo stesso giorno, offre un supporto pronto all'uso per il nuovo modello, così l'harness che valuta e gestisce i carichi di lavoro agentici di Deep​Seek può puntare su di esso immediatamente.

L'avvertenza sulla produzione, detta chiaramente

Questo è un modello sperimentale. Deep​Seek lo etichetta esplicitamente come tale, non ha annunciato una data di GA e sconsiglia di eseguirlo direttamente in produzione; il piano dichiarato è di iterare sui feedback e rilasciare una versione stabile in seguito. La conseguenza pratica è che il cervello testuale è collaudato — è la stessa famiglia di pesi che alimenta V4-Flash — ma il percorso visivo è codice nuovo, e nessuno al di fuori di Deep​Seek lo ha stress-testato su larga scala.

Questa è esattamente la situazione in cui un livello di routing dimostra il suo valore. Su OrcaRouter, sia deepseek/deepseek-v4-flash-vision-exp che deepseek/deepseek-v4-flash sono attivi dietro un'unica API, al prezzo di listino di Deep​Seek, senza alcun ricarico. Puoi indirizzare il traffico contenente immagini verso il modello sperimentale e, nella stessa configurazione, impostare un failover automatico verso un fallback nel momento in cui va in errore o in timeout — il che rende meno rischioso l'intero problema del "nuovo codice". Il DSL di routing consente inoltre di inviare solo le chiamate che contengono effettivamente immagini al modello vision e di mantenere il traffico puramente testuale su DeepSeek V4 Flash, cogliendo i benefici nei benchmark dove esistono e senza pagare nulla in più dove non esistono.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash-vision-exp showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text + Image', 'Output: text', p50 TTFT 275 ms, and the model description 'Experimental vision-enabled variant of DeepSeek V4 Flash: text + image in, text out'.

Cosa guardare dopo

Le domande aperte sono quelle consuete per un lancio sperimentale. Quando DeepSeek V4 Flash Vision (Exp) raggiungerà la GA, e il prezzo reggerà? L'input video o audio arriverà in seguito — oggi il modello supporta solo immagini fisse, il che lascia i grandi modelli multimodali di frontiera senza opposizione sui media in movimento. E le valutazioni indipendenti (la prima esecuzione di terze parti su ApexBench o Terminal-Bench) riprodurranno i numeri pubblicati? La cosa interessante è che anche se ogni benchmark dovesse calare, l'unica affermazione che è già conveniente — visione ai prezzi del testo — è un fatto di prezzo, non un'affermazione di benchmark, e non ha bisogno di essere riprodotta.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube