
Gemini 3.7 Flash vs DeepSeek V4 Flash : deux modèles « Flash », des réponses opposées à la même question
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Les deux modèles de 2026 aux noms les plus déroutants s'appellent tous deux Flash, et ils ne pourraient pas répondre à la même question de manière plus différente. Gemini 3.7 Flash, sorti le 13 août 2026, est le cheval de bataille fermé de {{1}}Google{{/1}} : environ 340 tokens de sortie par seconde, un indice d'intelligence de 56, et un prix promotionnel de 0,75 $ par million de tokens d'entrée et 3,75 $ par million de tokens de sortie. DeepSeek V4 Flash est la moitié à poids ouverts de la famille V4 de {{2}}DeepSeek{{/2}}, sortie en avril et mise à jour fin juillet : sous licence MIT, téléchargeable, et au prix de 0,14 $ par million de tokens d'entrée et 0,28 $ par million de tokens de sortie sur l'API propre de {{3}}DeepSeek{{/3}} — environ un cinquième du prix promotionnel des tokens d'entrée de {{4}}Google{{/4}} et un treizième du prix des tokens de sortie. Les deux sont des modèles « flash », conçus pour être rapides et économiques pour les travaux à grand volume. La similitude s'arrête au mot.
La question à laquelle ils répondent différemment est la question déterminante de cette génération : louez-vous l'intelligence ou la possédez-vous ? DeepSeek V4 Flash est un modèle de mélange d'experts à 284 milliards de paramètres, avec environ 13 milliards de paramètres actifs par jeton, une fenêtre de contexte d'un million de jetons et un plafond de sortie de 384 000 jetons, publié sous licence MIT — les poids représentent un téléchargement d'environ 160 Go, et la mise à jour du 31 juillet (V4-Flash-0731) a ajouté des capacités agentiques nettement plus solides. Gemini 3.7 Flash est un modèle propriétaire construit sur Gemini 3.6 Flash, avec un contexte d'un million de jetons, une limite de sortie de 64 000 jetons, une entrée multimodale et aucune possibilité d'auto-hébergement. L'un de ces modèles peut être déconnecté de tout réseau, affiné et exécuté sur votre propre matériel. L'autre ne s'exécute que là où Google l'exécute.

Les deux Flashes, côte à côte
Les deux modèles ciblent le même acheteur — des charges de production à grand volume qui ne peuvent pas s'offrir un modèle phare par token — mais ils y parviennent par des architectures opposées. L'attention hybride de DeepSeek V4 Flash (attention sparse compressée plus attention fortement compressée) est ce qui rend son contexte de 1M suffisamment économique pour être vendu à ces prix ; c'est le modèle vers lequel DeepSeek pointe les endpoints legacy `deepseek-chat` et `deepseek-reasoner`, retirés en juillet. Gemini 3.7 Flash est le raffinement algorithmique par Google de sa propre gamme Flash, et son avantage réside dans le débit d'inférence : une mesure indépendante le situe à environ 340 tokens/s contre environ 113 pour DeepSeek V4 Flash, et il y parvient tout en acceptant des entrées audio et vidéo que DeepSeek V4 Flash ne prend pas en charge.
• Indice d'intelligence — 56 pour Gemini 3.7 Flash contre 50 pour DeepSeek V4 Flash, selon Artificial Analysis.
• Vitesse de sortie — ~340 tokens/s contre ~113 tokens/s, les deux selon Artificial Analysis.
• Fenêtre de contexte — 1M de jetons pour les deux ; DeepSeek V4 Flash peut générer jusqu'à 384K, contre 64K pour Gemini 3.7 Flash.
• Prix d'entrée — 0,75 $ (prix promotionnel, jusqu'en 2026) contre 0,14 $ sur l'API propre de DeepSeek.
• Prix de sortie — 3,75 $ (promotionnel) contre 0,28 $.
• Poids — propriétaires par rapport à ceux sous licence MIT et téléchargeables.

Ce que six points d'indice achètent réellement
L'écart de six points sur l'Index est significatif mais pas abyssal, et il se situe principalement dans des domaines pour lesquels DeepSeek V4 Flash n'était pas optimisé. Les chiffres de codage agentique rapportés pour Gemini 3.7 Flash (65,3 sur DeepSWE v1.1, 43,6 sur FrontierCode 1.1 Main, rapportés par le fournisseur) sont nettement supérieurs, et son Elo en développement web (1588, également rapporté par le fournisseur) reflète de véritables progrès en génération d'UI. Les chiffres rapportés par DeepSeek V4 Flash lui-même — 79,0 sur SWE-bench Verified, 91,6 sur LiveCodeBench, un score τ²-Bench de 95,0 que des observateurs indépendants corroborent — tiennent bien la route en matière de codage borné et d'utilisation d'outils, et sa récupération en contexte de 1M (78,7 sur MRCR, 60,5 sur CorpusQA) est compétitive avec tout ce qui existe dans sa gamme de prix. Le constat est le suivant : Gemini 3.7 Flash est en tête sur la profondeur agentique et le travail web ; DeepSeek V4 Flash échange ces atouts contre une économie de tokens brute et un plafond de contexte long qu'aucun cheval de trait fermé n'égale.
Les poids ouverts modifient l’approvisionnement, pas seulement le prix.
La licence MIT est l'aspect de cette comparaison qu'aucun tableau de benchmarks ne capture. DeepSeek V4 Flash peut être téléchargé et exécuté sur votre propre matériel, affiné sur vos propres données, et utilisé dans des environnements où les appels API ne sont pas autorisés — et la licence n'impose aucune restriction liée à l'échelle, donc rien dans votre croissance ne modifie les conditions. Le coût pratique est opérationnel : servir un modèle MoE de 284B à la vitesse qu'une équipe de production souhaite exige un véritable parc de GPU, et pour la plupart des équipes, le choix honnête est l'API hébergée. C'est là que l'écart de prix fait son vrai travail : même la voie hébergée, à 0,14 $ / 0,28 $, est assez bon marché pour être l'option par défaut pour la longue traîne du trafic. Gemini 3.7 Flash n'offre aucune voie de propriété — ce que vous achetez, c'est un service multimodal rapide et géré de manière fiable, avec un prix promotionnel et une falaise tarifaire en janvier.
La facture de volume
Exécutez le même jour sur les deux : 20 millions de jetons d'entrée et 4 millions de jetons de sortie. Sur l'API de DeepSeek V4 Flash elle-même, cela fait 2,80 $ + 1,12 $, soit environ 3,92 $. Sur Gemini 3.7 Flash au tarif promotionnel, cela fait 15 $ + 15 $, soit environ 30 $ — un écart de 7,6x, même pendant que Google applique sa remise. Après le 1er janvier 2027, lorsque Gemini 3.7 Flash reviendra à 1,50 $ / 7,50 $, la même journée coûtera environ 58 $, soit quinze fois le chiffre de DeepSeek. L'avantage de vitesse compense partiellement cela sur les charges de travail interactives — des jetons plus rapides signifient moins de requêtes simultanées — mais pour le travail par lots et en arrière-plan, le modèle ouvert gagne sans conteste la bataille de la facture. Les deux modèles ne visent même pas la même courbe de coûts, et c'est là tout l'intérêt.

Qui devrait construire sur quoi
Choisissez DeepSeek V4 Flash lorsque le coût par jeton est la contrainte déterminante, lorsque vous voulez des sorties longues jusqu'à 384K, lorsque vous avez besoin de l'option d'un auto-hébergement ou d'un déploiement en environnement déconnecté, ou lorsque vous construisez quelque chose dont les marges ne survivront pas à des jetons au prix des modèles phares. Choisissez Gemini 3.7 Flash lorsque vous avez besoin de rapidité dans une boucle interactive, d'une entrée multimodale, de la fiabilité gérée de Google, ou des résultats de codage agentique plus solides rapportés par Google — et lorsque vous acceptez que le prix promotionnel soit temporaire. Ils ne sont pas rivaux de la manière dont deux modèles phares sont rivaux; ce sont deux stratégies d'approvisionnement différentes portant le même nom. La couche de routage est le point de rencontre des stratégies : DeepSeek V4 Flash est disponible sur OrcaRouter au prix catalogue de DeepSeek avec une marge de 0%, et le schéma de basculement s'accorde naturellement à cette paire — une règle qui achemine l'essentiel du trafic sur V4 Flash et fait remonter le sous-ensemble difficile vers un modèle fermé plus puissant, avec Gemini 3.7 Flash accessible via la propre API Gemini de Google sur l'autre branche du même routeur.
La lecture honnête
Si vous pouvez auto-héberger ou si vous êtes purement motivé par les coûts, DeepSeek V4 Flash est le meilleur modèle sur lequel construire, et la licence en fait une décision que vous n'aurez jamais à reconsidérer. Si vous avez besoin de la vitesse de service de Google, de l'entrée multimodale ou de l'avantage signalé en codage agentique, Gemini 3.7 Flash est le meilleur service tant que dure la promotion — avec le doublement des prix de janvier déjà inscrit au calendrier. Deux modèles, un nom, et le marché pourra voir quelle philosophie la prochaine année de trafic choisira.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
