
DeepSeek V4 Flash Vision (Exp) vs DeepSeek V4 Flash: Stesso Prezzo, Uno Vede
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
DeepSeek V4 Flash Vision (Exp) e DeepSeek V4 Flash sono lo stesso modello con esattamente una differenza, e quella differenza è tutta la storia: il modello visione vede le immagini e il modello testuale no. Lanciato oggi, 21 agosto 2026, come release sperimentale, DeepSeek V4 Flash Vision (Exp) mantiene invariato il cervello testuale di DeepSeek V4 Flash — lo stesso contesto da 1M token, lo stesso output massimo di 384K, gli stessi prezzi per token — e aggiunge l'input di immagini che ridistribuisce i suoi punteggi nei benchmark degli agenti dove il modello testuale fallisce silenziosamente. L'unica vera domanda è se "sperimentale" ti costi più di quanto risparmi.
I due modelli
DeepSeek V4 Flash è il cavallo di battaglia economico ufficiale dell'azienda: un modello Mixture-of-Experts con circa 284 miliardi di parametri totali e 13 miliardi attivi, solo testo, ottimizzato per carichi di lavoro quotidiani ad alta concorrenza, con un budget di concorrenza di 2.500 token al secondo sull'API del fornitore. DeepSeek V4 Flash Vision (Exp) appartiene alla stessa famiglia di pesi con un encoder visivo davanti, fatturato in modo identico e contrassegnato come sperimentale. Tutto ciò che sta sotto gli occhi è condiviso.
• Parametri — Vision-Exp: 284B totali / 13B attivi MoE vs V4-Flash: 284B totali / 13B attivi MoE (stessa famiglia)
• Input — Vision-Exp: testo + immagini (JPEG, PNG, GIF, WebP) vs V4-Flash: solo testo
Contesto — Vision-Exp: 1M token vs V4-Flash: 1M token
• Output massimo — Vision-Exp: 384K token vs V4-Flash: 384K token
• Modalità di pensiero — entrambe supportano il pensiero e il non-pensiero
• Formati API — entrambi: Chat Completions, Messages, Responses
• Prezzo — identico (entrambi fatturano alle tariffe token di picco/fuori picco di V4-Flash)
• Stato — Vision-Exp: sperimentale, nessuna data GA vs V4-Flash: rilascio ufficiale (V4-Flash-0731)

Dove la visione cambia il punteggio.
In termini di testo puro, DeepSeek afferma che i due sono alla pari, e non c'è motivo di dubitarne — il modello di visione è costruito sulla stessa capacità testuale. La divergenza emerge nei benchmark per agenti che contengono screenshot, grafici e immagini di interfacce utente, dove il modello solo-testo ignora letteralmente il contenuto multimodale. Tutte le cifre seguenti sono dichiarate dal fornitore nella nota di lancio di oggi, non riprodotte in modo indipendente:
• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2
• Agents' Last Exam — Vision-Exp 27.3 vs V4-Flash 25.2
• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7
• NL2Repo — Vision-Exp 57.7 contro V4-Flash 54.2
• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4
• Chartography — Vision-Exp 64.3 (V4-Flash non può tentare)
• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash non può tentare)

Il balzo più grande in assoluto è ApexBench, dove l'aggiunta della visione porta il punteggio da 26,2 a 36,5 — un salto di dieci punti dovuto non a un ragionamento più profondo del modello, ma al fatto che finalmente legge il compito. Per un agente che opera attraverso uno schermo — un browser, un desktop, un terminale con output renderizzato — il modello testuale procedeva alla cieca proprio sulle parti del compito che contengono le informazioni.
La questione del prezzo ha una sola risposta.
Non c'è differenza di prezzo, ed è qui che il confronto diventa una scelta ovvia in una direzione. DeepSeek V4 Flash Vision (Exp) applica esattamente le stesse tariffe di DeepSeek V4 Flash, che dal 16 agosto 2026 sono picco/fuori picco:
• Input, cache miss — $0,22 per 1M token fuori punta, $0,44 di punta (entrambi i modelli)
• Input, cache hit — $0,007 per 1M token fuori punta, $0,014 di punta (entrambi i modelli)
• Output — $0.66 per 1M token fuori dalle ore di punta, $1.32 nelle ore di punta (entrambi i modelli)
• Ore di punta — 01:00–04:00 e 06:00–10:00 UTC, entrambi i modelli
L'unico costo aggiuntivo che la visione comporta è l'immagine stessa: ogni immagine viene tokenizzata fino a 384 token, quindi uno screenshot costa circa 0,0085 centesimi fuori punta. Anche un agente che fa ampio uso della visione e legge 50 immagini per esecuzione aggiunge meno di un centesimo di input. Scegliere il modello di testo per risparmiare denaro significa scegliere spiccioli invece della vista — il risparmio non è reale.
Quando scegliere quale
Scegli DeepSeek V4 Flash Vision (Exp) se la tua pipeline può mai ricevere un'immagine. Agenti di test dell'interfaccia utente e QA basati su screenshot, agenti di navigazione web che devono leggere la pagina in cui si trovano, estrazione di grafici e diagrammi, screenshot di documenti, catture di messaggi di errore dallo schermo di un utente — in ognuno di questi, il modello vision è il modello decisamente migliore allo stesso prezzo. Non c'è alcuna penalità sulla qualità del testo, secondo il fornitore, quindi l'unico motivo per non usarlo è la stabilità.
Scegli DeepSeek V4 Flash se il tuo traffico è solo testo e nulla di esso cambierà. Per il completamento del codice, il recupero e i loop di agenti solo testo, i due modelli ottengono lo stesso punteggio sul testo e la versione ufficiale è la scelta più sicura per definizione. Se sei già su V4-Flash e non invii mai immagini, non c'è motivo di cambiare — e non c'è nemmeno motivo di non avere l'opzione nella tua configurazione di routing.
L'unica vera differenza: stato sperimentale
Tutto ciò che sta sopra gli occhi è identico; il costo della visione è trascurabile; i benchmark favoriscono il modello di visione. L'unico fattore che può legittimamente farti restare su DeepSeek V4 Flash in produzione è che il modello di visione è sperimentale. DeepSeek lo etichetta così, non fornisce una data di GA e afferma che non è consigliato per l'uso in produzione. Il cervello testuale sottostante è collaudato, ma il percorso di visione è nuovo, e una superficie API sperimentale è esattamente il posto dove non vuoi un guasto silenzioso alle 2 di notte.
Questo è l'unico punto in cui il confronto non è deciso dalle specifiche, ed è anche l'unico punto in cui un router cambia la risposta. Su OrcaRouter entrambi i modelli sono attivi — deepseek/deepseek-v4-flash-vision-exp e deepseek/deepseek-v4-flash — dietro un'unica chiave API al prezzo di listino del provider, trasmessa senza alcun ricarico. Poiché la stessa piattaforma instrada entrambi, puoi adottare il modello vision dove si guadagna il suo posto e mantenere il resto sulla release ufficiale, con failover automatico così un intoppo sperimentale non fa mai crollare l'intera pipeline. Ottieni il guadagno di dieci punti su ApexBench per le chiamate che ne hanno bisogno e la stabilità della release ufficiale per quelle che non lo richiedono, senza un secondo contratto o un secondo percorso di codice.

Il risultato finale
Se il tuo carico di lavoro può ricevere immagini, DeepSeek V4 Flash Vision (Exp) supera DeepSeek V4 Flash su ogni asse che conta e perde solo sull'unico asse su cui puoi intervenire: lo stato sperimentale. Se il tuo carico di lavoro è puramente testuale, i modelli sono equivalenti in termini di output e la versione ufficiale vince in stabilità. I due non sono realmente concorrenti: il modello di visione è il modello testuale con un'abilità sbloccata, senza alcun costo aggiuntivo. L'unica decisione che vale la pena prendere è quanta parte del tuo traffico sei disposto a indirizzare verso un'API sperimentale, e questa è una decisione di routing, non una decisione sul modello.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
