Una card titolo hero per 'DeepSeek-V4-Flash-Vision-Exp vs DeepSeek-V4-Flash' con il sottotitolo 'Stesso prezzo, uno vede', un'icona lineare dell'occhio a sinistra e un'icona lineare di documento di testo a destra separate da un sottile divisore neutro, e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) vs DeepSeek V4 Flash: Stesso Prezzo, Uno Vede

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

DeepSeek V4 Flash Vision (Exp) e DeepSeek V4 Flash sono lo stesso modello con esattamente una differenza, e quella differenza è tutta la storia: il modello visione vede le immagini e il modello testuale no. Lanciato oggi, 21 agosto 2026, come release sperimentale, DeepSeek V4 Flash Vision (Exp) mantiene invariato il cervello testuale di DeepSeek V4 Flash — lo stesso contesto da 1M token, lo stesso output massimo di 384K, gli stessi prezzi per token — e aggiunge l'input di immagini che ridistribuisce i suoi punteggi nei benchmark degli agenti dove il modello testuale fallisce silenziosamente. L'unica vera domanda è se "sperimentale" ti costi più di quanto risparmi.

I due modelli

DeepSeek V4 Flash è il cavallo di battaglia economico ufficiale dell'azienda: un modello Mixture-of-Experts con circa 284 miliardi di parametri totali e 13 miliardi attivi, solo testo, ottimizzato per carichi di lavoro quotidiani ad alta concorrenza, con un budget di concorrenza di 2.500 token al secondo sull'API del fornitore. DeepSeek V4 Flash Vision (Exp) appartiene alla stessa famiglia di pesi con un encoder visivo davanti, fatturato in modo identico e contrassegnato come sperimentale. Tutto ciò che sta sotto gli occhi è condiviso.

• Parametri — Vision-Exp: 284B totali / 13B attivi MoE vs V4-Flash: 284B totali / 13B attivi MoE (stessa famiglia)

• Input — Vision-Exp: testo + immagini (JPEG, PNG, GIF, WebP) vs V4-Flash: solo testo

Contesto — Vision-Exp: 1M token vs V4-Flash: 1M token

• Output massimo — Vision-Exp: 384K token vs V4-Flash: 384K token

• Modalità di pensiero — entrambe supportano il pensiero e il non-pensiero

• Formati API — entrambi: Chat Completions, Messages, Responses

• Prezzo — identico (entrambi fatturano alle tariffe token di picco/fuori picco di V4-Flash)

• Stato — Vision-Exp: sperimentale, nessuna data GA vs V4-Flash: rilascio ufficiale (V4-Flash-0731)

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

Dove la visione cambia il punteggio.

In termini di testo puro, Deep​Seek afferma che i due sono alla pari, e non c'è motivo di dubitarne — il modello di visione è costruito sulla stessa capacità testuale. La divergenza emerge nei benchmark per agenti che contengono screenshot, grafici e immagini di interfacce utente, dove il modello solo-testo ignora letteralmente il contenuto multimodale. Tutte le cifre seguenti sono dichiarate dal fornitore nella nota di lancio di oggi, non riprodotte in modo indipendente:

• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2

• Agents' Last Exam — Vision-Exp 27.3 vs V4-Flash 25.2

• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7

• NL2Repo — Vision-Exp 57.7 contro V4-Flash 54.2

• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4

• Chartography — Vision-Exp 64.3 (V4-Flash non può tentare)

• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash non può tentare)

A two-column comparison scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp vs DeepSeek-V4-Flash — the scoreboard': left column DeepSeek-V4-Flash-Vision-Exp — Input text + image, Context 1M tokens, Max output 384K, ApexBench Pass@1 36.5, Price $0.22/M off-peak, Status experimental; right column DeepSeek-V4-Flash — Input text only, Context 1M tokens, Max output 384K, ApexBench Pass@1 26.2, Price $0.22/M off-peak, Status official release; footer 'Benchmark figures vendor-reported; pricing per DeepSeek API docs.'

Il balzo più grande in assoluto è ApexBench, dove l'aggiunta della visione porta il punteggio da 26,2 a 36,5 — un salto di dieci punti dovuto non a un ragionamento più profondo del modello, ma al fatto che finalmente legge il compito. Per un agente che opera attraverso uno schermo — un browser, un desktop, un terminale con output renderizzato — il modello testuale procedeva alla cieca proprio sulle parti del compito che contengono le informazioni.

La questione del prezzo ha una sola risposta.

Non c'è differenza di prezzo, ed è qui che il confronto diventa una scelta ovvia in una direzione. DeepSeek V4 Flash Vision (Exp) applica esattamente le stesse tariffe di DeepSeek V4 Flash, che dal 16 agosto 2026 sono picco/fuori picco:

• Input, cache miss — $0,22 per 1M token fuori punta, $0,44 di punta (entrambi i modelli)

• Input, cache hit — $0,007 per 1M token fuori punta, $0,014 di punta (entrambi i modelli)

• Output — $0.66 per 1M token fuori dalle ore di punta, $1.32 nelle ore di punta (entrambi i modelli)

• Ore di punta — 01:00–04:00 e 06:00–10:00 UTC, entrambi i modelli

L'unico costo aggiuntivo che la visione comporta è l'immagine stessa: ogni immagine viene tokenizzata fino a 384 token, quindi uno screenshot costa circa 0,0085 centesimi fuori punta. Anche un agente che fa ampio uso della visione e legge 50 immagini per esecuzione aggiunge meno di un centesimo di input. Scegliere il modello di testo per risparmiare denaro significa scegliere spiccioli invece della vista — il risparmio non è reale.

Quando scegliere quale

Scegli DeepSeek V4 Flash Vision (Exp) se la tua pipeline può mai ricevere un'immagine. Agenti di test dell'interfaccia utente e QA basati su screenshot, agenti di navigazione web che devono leggere la pagina in cui si trovano, estrazione di grafici e diagrammi, screenshot di documenti, catture di messaggi di errore dallo schermo di un utente — in ognuno di questi, il modello vision è il modello decisamente migliore allo stesso prezzo. Non c'è alcuna penalità sulla qualità del testo, secondo il fornitore, quindi l'unico motivo per non usarlo è la stabilità.

Scegli DeepSeek V4 Flash se il tuo traffico è solo testo e nulla di esso cambierà. Per il completamento del codice, il recupero e i loop di agenti solo testo, i due modelli ottengono lo stesso punteggio sul testo e la versione ufficiale è la scelta più sicura per definizione. Se sei già su V4-Flash e non invii mai immagini, non c'è motivo di cambiare — e non c'è nemmeno motivo di non avere l'opzione nella tua configurazione di routing.

L'unica vera differenza: stato sperimentale

Tutto ciò che sta sopra gli occhi è identico; il costo della visione è trascurabile; i benchmark favoriscono il modello di visione. L'unico fattore che può legittimamente farti restare su DeepSeek V4 Flash in produzione è che il modello di visione è sperimentale. Deep​Seek lo etichetta così, non fornisce una data di GA e afferma che non è consigliato per l'uso in produzione. Il cervello testuale sottostante è collaudato, ma il percorso di visione è nuovo, e una superficie API sperimentale è esattamente il posto dove non vuoi un guasto silenzioso alle 2 di notte.

Questo è l'unico punto in cui il confronto non è deciso dalle specifiche, ed è anche l'unico punto in cui un router cambia la risposta. Su OrcaRouter entrambi i modelli sono attivi — deepseek/deepseek-v4-flash-vision-exp e deepseek/deepseek-v4-flash — dietro un'unica chiave API al prezzo di listino del provider, trasmessa senza alcun ricarico. Poiché la stessa piattaforma instrada entrambi, puoi adottare il modello vision dove si guadagna il suo posto e mantenere il resto sulla release ufficiale, con failover automatico così un intoppo sperimentale non fa mai crollare l'intera pipeline. Ottieni il guadagno di dieci punti su ApexBench per le chiamate che ne hanno bisogno e la stabilità della release ufficiale per quelle che non lo richiedono, senza un secondo contratto o un secondo percorso di codice.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash showing the Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text', a price block of $0.15 input / $0.29 output per 1M tokens with p50 TTFT 602 ms, and the model description 'DeepSeek V4 Flash efficient MoE — 284B total / 13B active params, 1M context'.

Il risultato finale

Se il tuo carico di lavoro può ricevere immagini, DeepSeek V4 Flash Vision (Exp) supera DeepSeek V4 Flash su ogni asse che conta e perde solo sull'unico asse su cui puoi intervenire: lo stato sperimentale. Se il tuo carico di lavoro è puramente testuale, i modelli sono equivalenti in termini di output e la versione ufficiale vince in stabilità. I due non sono realmente concorrenti: il modello di visione è il modello testuale con un'abilità sbloccata, senza alcun costo aggiuntivo. L'unica decisione che vale la pena prendere è quanta parte del tuo traffico sei disposto a indirizzare verso un'API sperimentale, e questa è una decisione di routing, non una decisione sul modello.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube