Una scheda titolo per il confronto tra Gemini 3.7 Flash e DeepSeek V4 Flash, che mostra due fulmini: una cassetta chiusa etichettata Gemini 3.7 Flash con un'etichetta $0.75 / $3.75, e una scatola aperta con una freccia di download etichettata DeepSeek V4 Flash con un'etichetta $0.14 / $0.28.
Guides & Insights

Gemini 3.7 Flash vs DeepSeek V4 Flash: Due modelli "Flash", risposte opposte alla stessa domanda

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

I due modelli dal nome più fuorviante del 2026 si chiamano entrambi Flash, e non potrebbero rispondere alla stessa domanda in modo più diverso. Gemini 3.7 Flash, rilasciato il 13 agosto 2026, è il cavallo di battaglia closed-source di Go​ogle: circa 340 token di output al secondo, un Intelligence Index di 56 e un prezzo promozionale di $0.75 per milione di token in input e $3.75 per milione in output. DeepSeek V4 Flash è la metà open-weights della famiglia V4 di Deep​Seek, uscito ad aprile e aggiornato a fine luglio: con licenza MIT, scaricabile, al prezzo di $0.14 per milione di token in input e $0.28 per milione in output sull'API di Deep​Seek — circa un quinto del prezzo promozionale in input di Go​ogle e un tredicesimo del prezzo in output. Entrambi sono modelli "flash", costruiti per essere veloci ed economici per lavori ad alto volume. La parola è dove finisce la somiglianza.

La domanda a cui rispondono in modo diverso è quella che definisce questa generazione: affitti l'intelligenza o la possiedi? DeepSeek V4 Flash è un modello mixture-of-experts da 284 miliardi di parametri con circa 13B attivi per token, una finestra di contesto da 1M di token e un tetto di output di 384K, rilasciato sotto licenza MIT — il download dei pesi è di ~160GB, e l'aggiornamento del 31 luglio (V4-Flash-0731) ha aggiunto capacità agentiche decisamente più forti. Gemini 3.7 Flash è un modello proprietario costruito su Gemini 3.6 Flash con un contesto di 1M, un limite di output di 64K, input multimodale e nessuna possibilità di self-hosting. Uno di questi modelli può essere isolato dalla rete, ottimizzato ed eseguito sul tuo hardware. L'altro gira solo dove lo fa girare Go​ogle.

The Google DeepMind model card for Gemini 3.7 Flash, showing the model's headline description as Google's workhorse model for coding and agents, its 1M-token context window and 64K output cap, and benchmark tables of its gains over Gemini 3.6 Flash.

I due Flash, fianco a fianco

Entrambi i modelli puntano allo stesso acquirente — carichi di lavoro di produzione ad alto volume che non possono permettersi un modello di punta per token — ma ci arrivano attraverso architetture opposte. L'attenzione ibrida di DeepSeek V4 Flash (attenzione sparsa compressa più attenzione altamente compressa) è ciò che rende il suo contesto da 1M abbastanza economico da essere venduto a questi prezzi; è il modello a cui DeepSeek indirizza gli endpoint legacy `deepseek-chat` e `deepseek-reasoner`, ritirati a luglio. Gemini 3.7 Flash è il raffinamento algoritmico di Google della propria linea Flash, e il suo vantaggio è il throughput di servizio: misurazioni indipendenti lo collocano a circa 340 token/s contro i circa 113 di DeepSeek V4 Flash, e raggiunge questo risultato accettando input audio e video che DeepSeek V4 Flash non supporta.

Intelligence Index — 56 per Gemini 3.7 Flash contro 50 per DeepSeek V4 Flash, secondo Artificial Analysis.

Velocità di output — ~340 tokens/s contro ~113 tokens/s, entrambi secondo Artificial Analysis.

Finestra di contesto — 1M token per entrambi; DeepSeek V4 Flash genera fino a 384K contro i 64K di Gemini 3.7 Flash.

Prezzo di input — $0.75 (promozionale, fino al 2026) contro $0.14 sull'API di Deep​Seek.

Prezzo di output — $3,75 (promozionale) rispetto a $0,28.

Pesi — proprietari rispetto a quelli con licenza MIT e scaricabili.

A comparison scoreboard for Gemini 3.7 Flash and DeepSeek V4 Flash: Gemini 3.7 Flash leads 56 to 50 on the AA Index and ~340 to ~113 tokens per second, while DeepSeek V4 Flash leads 384K to 64K on max output, $0.14 to $0.75 on input and $0.28 to $3.75 on output, with both at 1M context and proprietary weights against MIT open weights.

Cosa comprano effettivamente sei punti indice

Il divario di sei punti nell'Indice è significativo ma non abissale, e si concentra soprattutto in aree per cui DeepSeek V4 Flash non è stato ottimizzato. I numeri di codifica agentica dichiarati da Gemini 3.7 Flash (65.3 su DeepSWE v1.1, 43.6 su FrontierCode 1.1 Main, riportati dal fornitore) sono decisamente superiori, e il suo Elo di sviluppo web (1588, anch'esso riportato dal fornitore) riflette reali miglioramenti nella generazione di interfacce utente. Le cifre dichiarate da DeepSeek V4 Flash — 79.0 su SWE-bench Verified, 91.6 su LiveCodeBench, un punteggio τ²-Bench di 95.0 che tracker indipendenti corroborano — reggono bene su codifica limitata e uso di strumenti, e il suo recupero con contesto da 1M (78.7 su MRCR, 60.5 su CorpusQA) è competitivo con qualsiasi cosa nella sua fascia di prezzo. Il quadro: Gemini 3.7 Flash è in testa per profondità agentica e lavoro web; DeepSeek V4 Flash cede quei punti a favore di un'economia grezza dei token e di un tetto di contesto lungo che nessun cavallo di battaglia chiuso eguaglia.

I pesi aperti cambiano l'approvvigionamento, non solo il prezzo.

La licenza MIT è la parte di questo confronto che nessuna tabella di benchmark cattura. DeepSeek V4 Flash può essere scaricato ed eseguito sul vostro hardware, messo a punto sui vostri dati e utilizzato in ambienti in cui le chiamate API non sono consentite — e la licenza non ha restrizioni basate sulla scala, quindi nessun aspetto della vostra crescita cambia i termini. Il costo pratico è operativo: servire un modello MoE da 284B alla velocità che un team di produzione desidera richiede un vero parco GPU, e per la maggior parte dei team la scelta onesta è l'API hosted. È lì che il divario di prezzo fa il suo vero lavoro: anche la soluzione hosted, a $0,14 / $0,28, è abbastanza economica da essere l'opzione predefinita per la coda lunga del traffico. Gemini 3.7 Flash non offre alcun percorso di proprietà — ciò che si acquista è un servizio multimodale, veloce e gestito in modo affidabile, con un prezzo promozionale e un precipizio a gennaio.

La bolletta del volume

Esegui lo stesso giorno su entrambi: 20 milioni di token di input e 4 milioni di token di output. Sull'API di DeepSeek V4 Flash, ciò costa $2,80 + $1,12, circa $3,92. Su Gemini 3.7 Flash con la tariffa promozionale, costa $15 + $15, circa $30 — un divario di 7,6 volte anche mentre Google sta applicando il suo sconto. Dopo il 1° gennaio 2027, quando Gemini 3.7 Flash tornerà a $1,50 / $7,50, lo stesso giorno costa circa $58, quindici volte la cifra di DeepSeek. Il vantaggio in velocità compensa in parte questo sui carichi di lavoro interattivi — token più veloci significano meno richieste concorrenti — ma per il lavoro batch e in background, il modello aperto vince sulla fattura senza contestazione. I due modelli non puntano nemmeno alla stessa curva di costo, che è esattamente il punto.

The OrcaRouter model page for DeepSeek V4 Flash, showing the ~$0.15 per million input and ~$0.29 per million output pass-through pricing, a 1M-token context window with 384K max output, and the text-only 284B-total / 13B-active mixture-of-experts description.

Chi dovrebbe costruire su quale

Scegli DeepSeek V4 Flash quando il costo per token è il vincolo principale, quando desideri output lunghi fino a 384K, quando hai bisogno dell'opzione di self-hosting o di distribuzione air-gapped, o quando stai costruendo qualcosa i cui margini non sopravvivrebbero a token a prezzo di punta. Scegli Gemini 3.7 Flash quando ti serve velocità in un ciclo interattivo, input multimodale, l'affidabilità gestita di Google, o i migliori risultati di coding agentico riportati da Google — e quando ti sta bene che il prezzo promozionale sia temporaneo. Non sono rivali nello stesso modo in cui lo sono due modelli di punta; sono due diverse strategie di approvvigionamento con lo stesso nome. Il livello di routing è il punto in cui le strategie si incontrano: DeepSeek V4 Flash è disponibile su OrcaRouter al prezzo di listino di DeepSeek con ricarico 0%, e il pattern di failover si adatta naturalmente a questa coppia — una regola che instrada la maggior parte del traffico su V4 Flash e fa scalare il sottoinsieme difficile a un modello closed più forte, con Gemini 3.7 Flash raggiungibile tramite la Gemini API di Google sull'altro ramo dello stesso router.

La lettura onesta

Se puoi auto-ospitare o sei spinto esclusivamente dai costi, DeepSeek V4 Flash è il modello migliore su cui costruire, e la licenza rende questa una decisione che non dovrai mai rivalutare. Se hai bisogno della velocità di servizio di Go​ogle, dell'input multimodale, o del riportato vantaggio nella codifica agentica, Gemini 3.7 Flash è il servizio migliore finché dura la promozione — con il raddoppio del prezzo di gennaio già in calendario. Due modelli, un solo nome, e il mercato potrà vedere quale filosofia riceverà i voti del traffico nel prossimo anno.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno