Un carton-titre pour la comparaison entre Gemini 3.7 Flash et DeepSeek V4 Flash, montrant deux éclairs : un coffre-fort fermé étiqueté Gemini 3.7 Flash avec une étiquette $0.75 / $3.75, et une boîte ouverte avec une flèche de téléchargement, étiquetée DeepSeek V4 Flash avec une étiquette $0.14 / $0.28.
Guides & Insights

Gemini 3.7 Flash vs DeepSeek V4 Flash : deux modèles « Flash », des réponses opposées à la même question

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Les deux modèles de 2026 aux noms les plus déroutants s'appellent tous deux Flash, et ils ne pourraient pas répondre à la même question de manière plus différente. Gemini 3.7 Flash, sorti le 13 août 2026, est le cheval de bataille fermé de {{1}}Go​ogle{{/1}} : environ 340 tokens de sortie par seconde, un indice d'intelligence de 56, et un prix promotionnel de 0,75 $ par million de tokens d'entrée et 3,75 $ par million de tokens de sortie. DeepSeek V4 Flash est la moitié à poids ouverts de la famille V4 de {{2}}Deep​Seek{{/2}}, sortie en avril et mise à jour fin juillet : sous licence MIT, téléchargeable, et au prix de 0,14 $ par million de tokens d'entrée et 0,28 $ par million de tokens de sortie sur l'API propre de {{3}}Deep​Seek{{/3}} — environ un cinquième du prix promotionnel des tokens d'entrée de {{4}}Go​ogle{{/4}} et un treizième du prix des tokens de sortie. Les deux sont des modèles « flash », conçus pour être rapides et économiques pour les travaux à grand volume. La similitude s'arrête au mot.

La question à laquelle ils répondent différemment est la question déterminante de cette génération : louez-vous l'intelligence ou la possédez-vous ? DeepSeek V4 Flash est un modèle de mélange d'experts à 284 milliards de paramètres, avec environ 13 milliards de paramètres actifs par jeton, une fenêtre de contexte d'un million de jetons et un plafond de sortie de 384 000 jetons, publié sous licence MIT — les poids représentent un téléchargement d'environ 160 Go, et la mise à jour du 31 juillet (V4-Flash-0731) a ajouté des capacités agentiques nettement plus solides. Gemini 3.7 Flash est un modèle propriétaire construit sur Gemini 3.6 Flash, avec un contexte d'un million de jetons, une limite de sortie de 64 000 jetons, une entrée multimodale et aucune possibilité d'auto-hébergement. L'un de ces modèles peut être déconnecté de tout réseau, affiné et exécuté sur votre propre matériel. L'autre ne s'exécute que là où Google l'exécute.

The Google DeepMind model card for Gemini 3.7 Flash, showing the model's headline description as Google's workhorse model for coding and agents, its 1M-token context window and 64K output cap, and benchmark tables of its gains over Gemini 3.6 Flash.

Les deux Flashes, côte à côte

Les deux modèles ciblent le même acheteur — des charges de production à grand volume qui ne peuvent pas s'offrir un modèle phare par token — mais ils y parviennent par des architectures opposées. L'attention hybride de DeepSeek V4 Flash (attention sparse compressée plus attention fortement compressée) est ce qui rend son contexte de 1M suffisamment économique pour être vendu à ces prix ; c'est le modèle vers lequel Deep​Seek pointe les endpoints legacy `deepseek-chat` et `deepseek-reasoner`, retirés en juillet. Gemini 3.7 Flash est le raffinement algorithmique par Go​ogle de sa propre gamme Flash, et son avantage réside dans le débit d'inférence : une mesure indépendante le situe à environ 340 tokens/s contre environ 113 pour DeepSeek V4 Flash, et il y parvient tout en acceptant des entrées audio et vidéo que DeepSeek V4 Flash ne prend pas en charge.

Indice d'intelligence — 56 pour Gemini 3.7 Flash contre 50 pour DeepSeek V4 Flash, selon Artificial Analysis.

Vitesse de sortie — ~340 tokens/s contre ~113 tokens/s, les deux selon Artificial Analysis.

Fenêtre de contexte — 1M de jetons pour les deux ; DeepSeek V4 Flash peut générer jusqu'à 384K, contre 64K pour Gemini 3.7 Flash.

Prix d'entrée — 0,75 $ (prix promotionnel, jusqu'en 2026) contre 0,14 $ sur l'API propre de Deep​Seek.

Prix de sortie — 3,75 $ (promotionnel) contre 0,28 $.

Poids — propriétaires par rapport à ceux sous licence MIT et téléchargeables.

A comparison scoreboard for Gemini 3.7 Flash and DeepSeek V4 Flash: Gemini 3.7 Flash leads 56 to 50 on the AA Index and ~340 to ~113 tokens per second, while DeepSeek V4 Flash leads 384K to 64K on max output, $0.14 to $0.75 on input and $0.28 to $3.75 on output, with both at 1M context and proprietary weights against MIT open weights.

Ce que six points d'indice achètent réellement

L'écart de six points sur l'Index est significatif mais pas abyssal, et il se situe principalement dans des domaines pour lesquels DeepSeek V4 Flash n'était pas optimisé. Les chiffres de codage agentique rapportés pour Gemini 3.7 Flash (65,3 sur DeepSWE v1.1, 43,6 sur FrontierCode 1.1 Main, rapportés par le fournisseur) sont nettement supérieurs, et son Elo en développement web (1588, également rapporté par le fournisseur) reflète de véritables progrès en génération d'UI. Les chiffres rapportés par DeepSeek V4 Flash lui-même — 79,0 sur SWE-bench Verified, 91,6 sur LiveCodeBench, un score τ²-Bench de 95,0 que des observateurs indépendants corroborent — tiennent bien la route en matière de codage borné et d'utilisation d'outils, et sa récupération en contexte de 1M (78,7 sur MRCR, 60,5 sur CorpusQA) est compétitive avec tout ce qui existe dans sa gamme de prix. Le constat est le suivant : Gemini 3.7 Flash est en tête sur la profondeur agentique et le travail web ; DeepSeek V4 Flash échange ces atouts contre une économie de tokens brute et un plafond de contexte long qu'aucun cheval de trait fermé n'égale.

Les poids ouverts modifient l’approvisionnement, pas seulement le prix.

La licence MIT est l'aspect de cette comparaison qu'aucun tableau de benchmarks ne capture. DeepSeek V4 Flash peut être téléchargé et exécuté sur votre propre matériel, affiné sur vos propres données, et utilisé dans des environnements où les appels API ne sont pas autorisés — et la licence n'impose aucune restriction liée à l'échelle, donc rien dans votre croissance ne modifie les conditions. Le coût pratique est opérationnel : servir un modèle MoE de 284B à la vitesse qu'une équipe de production souhaite exige un véritable parc de GPU, et pour la plupart des équipes, le choix honnête est l'API hébergée. C'est là que l'écart de prix fait son vrai travail : même la voie hébergée, à 0,14 $ / 0,28 $, est assez bon marché pour être l'option par défaut pour la longue traîne du trafic. Gemini 3.7 Flash n'offre aucune voie de propriété — ce que vous achetez, c'est un service multimodal rapide et géré de manière fiable, avec un prix promotionnel et une falaise tarifaire en janvier.

La facture de volume

Exécutez le même jour sur les deux : 20 millions de jetons d'entrée et 4 millions de jetons de sortie. Sur l'API de DeepSeek V4 Flash elle-même, cela fait 2,80 $ + 1,12 $, soit environ 3,92 $. Sur Gemini 3.7 Flash au tarif promotionnel, cela fait 15 $ + 15 $, soit environ 30 $ — un écart de 7,6x, même pendant que Go​ogle applique sa remise. Après le 1er janvier 2027, lorsque Gemini 3.7 Flash reviendra à 1,50 $ / 7,50 $, la même journée coûtera environ 58 $, soit quinze fois le chiffre de Deep​Seek. L'avantage de vitesse compense partiellement cela sur les charges de travail interactives — des jetons plus rapides signifient moins de requêtes simultanées — mais pour le travail par lots et en arrière-plan, le modèle ouvert gagne sans conteste la bataille de la facture. Les deux modèles ne visent même pas la même courbe de coûts, et c'est là tout l'intérêt.

The OrcaRouter model page for DeepSeek V4 Flash, showing the ~$0.15 per million input and ~$0.29 per million output pass-through pricing, a 1M-token context window with 384K max output, and the text-only 284B-total / 13B-active mixture-of-experts description.

Qui devrait construire sur quoi

Choisissez DeepSeek V4 Flash lorsque le coût par jeton est la contrainte déterminante, lorsque vous voulez des sorties longues jusqu'à 384K, lorsque vous avez besoin de l'option d'un auto-hébergement ou d'un déploiement en environnement déconnecté, ou lorsque vous construisez quelque chose dont les marges ne survivront pas à des jetons au prix des modèles phares. Choisissez Gemini 3.7 Flash lorsque vous avez besoin de rapidité dans une boucle interactive, d'une entrée multimodale, de la fiabilité gérée de Go​ogle, ou des résultats de codage agentique plus solides rapportés par Go​ogle — et lorsque vous acceptez que le prix promotionnel soit temporaire. Ils ne sont pas rivaux de la manière dont deux modèles phares sont rivaux; ce sont deux stratégies d'approvisionnement différentes portant le même nom. La couche de routage est le point de rencontre des stratégies : DeepSeek V4 Flash est disponible sur OrcaRouter au prix catalogue de Deep​Seek avec une marge de 0%, et le schéma de basculement s'accorde naturellement à cette paire — une règle qui achemine l'essentiel du trafic sur V4 Flash et fait remonter le sous-ensemble difficile vers un modèle fermé plus puissant, avec Gemini 3.7 Flash accessible via la propre API Gemini de Go​ogle sur l'autre branche du même routeur.

La lecture honnête

Si vous pouvez auto-héberger ou si vous êtes purement motivé par les coûts, DeepSeek V4 Flash est le meilleur modèle sur lequel construire, et la licence en fait une décision que vous n'aurez jamais à reconsidérer. Si vous avez besoin de la vitesse de service de Go​ogle, de l'entrée multimodale ou de l'avantage signalé en codage agentique, Gemini 3.7 Flash est le meilleur service tant que dure la promotion — avec le doublement des prix de janvier déjà inscrit au calendrier. Deux modèles, un nom, et le marché pourra voir quelle philosophie la prochaine année de trafic choisira.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement