
Gemini 3.7 Flash vs DeepSeek V4 Flash: Due modelli "Flash", risposte opposte alla stessa domanda
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
I due modelli dal nome più fuorviante del 2026 si chiamano entrambi Flash, e non potrebbero rispondere alla stessa domanda in modo più diverso. Gemini 3.7 Flash, rilasciato il 13 agosto 2026, è il cavallo di battaglia closed-source di Google: circa 340 token di output al secondo, un Intelligence Index di 56 e un prezzo promozionale di $0.75 per milione di token in input e $3.75 per milione in output. DeepSeek V4 Flash è la metà open-weights della famiglia V4 di DeepSeek, uscito ad aprile e aggiornato a fine luglio: con licenza MIT, scaricabile, al prezzo di $0.14 per milione di token in input e $0.28 per milione in output sull'API di DeepSeek — circa un quinto del prezzo promozionale in input di Google e un tredicesimo del prezzo in output. Entrambi sono modelli "flash", costruiti per essere veloci ed economici per lavori ad alto volume. La parola è dove finisce la somiglianza.
La domanda a cui rispondono in modo diverso è quella che definisce questa generazione: affitti l'intelligenza o la possiedi? DeepSeek V4 Flash è un modello mixture-of-experts da 284 miliardi di parametri con circa 13B attivi per token, una finestra di contesto da 1M di token e un tetto di output di 384K, rilasciato sotto licenza MIT — il download dei pesi è di ~160GB, e l'aggiornamento del 31 luglio (V4-Flash-0731) ha aggiunto capacità agentiche decisamente più forti. Gemini 3.7 Flash è un modello proprietario costruito su Gemini 3.6 Flash con un contesto di 1M, un limite di output di 64K, input multimodale e nessuna possibilità di self-hosting. Uno di questi modelli può essere isolato dalla rete, ottimizzato ed eseguito sul tuo hardware. L'altro gira solo dove lo fa girare Google.

I due Flash, fianco a fianco
Entrambi i modelli puntano allo stesso acquirente — carichi di lavoro di produzione ad alto volume che non possono permettersi un modello di punta per token — ma ci arrivano attraverso architetture opposte. L'attenzione ibrida di DeepSeek V4 Flash (attenzione sparsa compressa più attenzione altamente compressa) è ciò che rende il suo contesto da 1M abbastanza economico da essere venduto a questi prezzi; è il modello a cui DeepSeek indirizza gli endpoint legacy `deepseek-chat` e `deepseek-reasoner`, ritirati a luglio. Gemini 3.7 Flash è il raffinamento algoritmico di Google della propria linea Flash, e il suo vantaggio è il throughput di servizio: misurazioni indipendenti lo collocano a circa 340 token/s contro i circa 113 di DeepSeek V4 Flash, e raggiunge questo risultato accettando input audio e video che DeepSeek V4 Flash non supporta.
• Intelligence Index — 56 per Gemini 3.7 Flash contro 50 per DeepSeek V4 Flash, secondo Artificial Analysis.
• Velocità di output — ~340 tokens/s contro ~113 tokens/s, entrambi secondo Artificial Analysis.
• Finestra di contesto — 1M token per entrambi; DeepSeek V4 Flash genera fino a 384K contro i 64K di Gemini 3.7 Flash.
• Prezzo di input — $0.75 (promozionale, fino al 2026) contro $0.14 sull'API di DeepSeek.
• Prezzo di output — $3,75 (promozionale) rispetto a $0,28.
• Pesi — proprietari rispetto a quelli con licenza MIT e scaricabili.

Cosa comprano effettivamente sei punti indice
Il divario di sei punti nell'Indice è significativo ma non abissale, e si concentra soprattutto in aree per cui DeepSeek V4 Flash non è stato ottimizzato. I numeri di codifica agentica dichiarati da Gemini 3.7 Flash (65.3 su DeepSWE v1.1, 43.6 su FrontierCode 1.1 Main, riportati dal fornitore) sono decisamente superiori, e il suo Elo di sviluppo web (1588, anch'esso riportato dal fornitore) riflette reali miglioramenti nella generazione di interfacce utente. Le cifre dichiarate da DeepSeek V4 Flash — 79.0 su SWE-bench Verified, 91.6 su LiveCodeBench, un punteggio τ²-Bench di 95.0 che tracker indipendenti corroborano — reggono bene su codifica limitata e uso di strumenti, e il suo recupero con contesto da 1M (78.7 su MRCR, 60.5 su CorpusQA) è competitivo con qualsiasi cosa nella sua fascia di prezzo. Il quadro: Gemini 3.7 Flash è in testa per profondità agentica e lavoro web; DeepSeek V4 Flash cede quei punti a favore di un'economia grezza dei token e di un tetto di contesto lungo che nessun cavallo di battaglia chiuso eguaglia.
I pesi aperti cambiano l'approvvigionamento, non solo il prezzo.
La licenza MIT è la parte di questo confronto che nessuna tabella di benchmark cattura. DeepSeek V4 Flash può essere scaricato ed eseguito sul vostro hardware, messo a punto sui vostri dati e utilizzato in ambienti in cui le chiamate API non sono consentite — e la licenza non ha restrizioni basate sulla scala, quindi nessun aspetto della vostra crescita cambia i termini. Il costo pratico è operativo: servire un modello MoE da 284B alla velocità che un team di produzione desidera richiede un vero parco GPU, e per la maggior parte dei team la scelta onesta è l'API hosted. È lì che il divario di prezzo fa il suo vero lavoro: anche la soluzione hosted, a $0,14 / $0,28, è abbastanza economica da essere l'opzione predefinita per la coda lunga del traffico. Gemini 3.7 Flash non offre alcun percorso di proprietà — ciò che si acquista è un servizio multimodale, veloce e gestito in modo affidabile, con un prezzo promozionale e un precipizio a gennaio.
La bolletta del volume
Esegui lo stesso giorno su entrambi: 20 milioni di token di input e 4 milioni di token di output. Sull'API di DeepSeek V4 Flash, ciò costa $2,80 + $1,12, circa $3,92. Su Gemini 3.7 Flash con la tariffa promozionale, costa $15 + $15, circa $30 — un divario di 7,6 volte anche mentre Google sta applicando il suo sconto. Dopo il 1° gennaio 2027, quando Gemini 3.7 Flash tornerà a $1,50 / $7,50, lo stesso giorno costa circa $58, quindici volte la cifra di DeepSeek. Il vantaggio in velocità compensa in parte questo sui carichi di lavoro interattivi — token più veloci significano meno richieste concorrenti — ma per il lavoro batch e in background, il modello aperto vince sulla fattura senza contestazione. I due modelli non puntano nemmeno alla stessa curva di costo, che è esattamente il punto.

Chi dovrebbe costruire su quale
Scegli DeepSeek V4 Flash quando il costo per token è il vincolo principale, quando desideri output lunghi fino a 384K, quando hai bisogno dell'opzione di self-hosting o di distribuzione air-gapped, o quando stai costruendo qualcosa i cui margini non sopravvivrebbero a token a prezzo di punta. Scegli Gemini 3.7 Flash quando ti serve velocità in un ciclo interattivo, input multimodale, l'affidabilità gestita di Google, o i migliori risultati di coding agentico riportati da Google — e quando ti sta bene che il prezzo promozionale sia temporaneo. Non sono rivali nello stesso modo in cui lo sono due modelli di punta; sono due diverse strategie di approvvigionamento con lo stesso nome. Il livello di routing è il punto in cui le strategie si incontrano: DeepSeek V4 Flash è disponibile su OrcaRouter al prezzo di listino di DeepSeek con ricarico 0%, e il pattern di failover si adatta naturalmente a questa coppia — una regola che instrada la maggior parte del traffico su V4 Flash e fa scalare il sottoinsieme difficile a un modello closed più forte, con Gemini 3.7 Flash raggiungibile tramite la Gemini API di Google sull'altro ramo dello stesso router.
La lettura onesta
Se puoi auto-ospitare o sei spinto esclusivamente dai costi, DeepSeek V4 Flash è il modello migliore su cui costruire, e la licenza rende questa una decisione che non dovrai mai rivalutare. Se hai bisogno della velocità di servizio di Google, dell'input multimodale, o del riportato vantaggio nella codifica agentica, Gemini 3.7 Flash è il servizio migliore finché dura la promozione — con il raddoppio del prezzo di gennaio già in calendario. Due modelli, un solo nome, e il mercato potrà vedere quale filosofia riceverà i voti del traffico nel prossimo anno.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
