Carte de titre principale : DeepSeek V4.1 Flash vs Gemini 3.1 Pro — l'un des deux n'est encore qu'un aperçu
Guides & Insights

DeepSeek V4.1 Flash vs Gemini 3.1 Pro : l'un d'eux n'est encore qu'un aperçu

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

L'information la plus utile à connaître au sujet de DeepSeek V4.1 Flash face à Gemini 3.1 Pro ne figure sur aucune des deux fiches techniques. DeepSeek V4.1 Flash est un modèle en disponibilité générale, publié le 10 septembre 2026 avec des poids sous licence MIT que vous pouvez télécharger. Gemini 3.1 Pro est en préversion depuis le 19 février 2026 et est encore servi sous un nom de build de préversion environ sept mois plus tard. Cette asymétrie ne détermine pas quel modèle est meilleur, mais elle détermine le type d'engagement que vous prenez lorsque vous construisez sur l'un d'eux, et c'est le cadre de tout ce qui suit.

Les deux prennent en charge un million de tokens de contexte. Tous deux acceptent les images. Les différences qui les séparent réellement sont la courbe tarifaire au-delà de 200 000 tokens d'entrée, les modalités d'entrée, le plafond de sortie, et le fait que l'un de ces deux soit un fichier que vous pouvez posséder et l'autre une API.

Où en sont réellement les deux

• Prix par million de tokens, jusqu’à 200 K de contexte — DeepSeek V4.1 Flash 0,15 $ en entrée / 0,60 $ en sortie, contre Gemini 3.1 Pro 2,00 $ en entrée / 12,00 $ en sortie. Soit 13 fois le prix d’entrée et 20 fois le prix de sortie.

• Prix par million de tokens, au-delà de 200 K de contexte — V4.1 Flash inchangé à 0,15 $ / 0,60 $ contre Gemini 3.1 Pro à 4,00 $ en entrée / 18,00 $ en sortie. Le facteur multiplicateur pour l’entrée s’élargit à 27× précisément là où se situe le travail sur les contextes longs.

• Entrée mise en cache — V4.1 Flash 0,003 $ par million en heures creuses, contre Gemini 3.1 Pro 0,40 $ par million. Deux ordres de grandeur, sur le poste de coût qui détermine si la relecture d'un contexte reste abordable.

• Fenêtre de contexte — 1 M de jetons vs 1 M de jetons. Niveau.

• Sortie maximale — V4.1 Flash 384K jetons contre Gemini 3.1 Pro 65K jetons. Six fois le plafond.

Modalités d'entrée — V4.1 Flash prend en charge le texte et les images, tandis que Gemini 3.1 Pro prend en charge le texte, les images, l'audio, la vidéo et les téléversements de fichiers.

• Poids — V4.1 Flash MIT, téléchargeable vs Gemini 3.1 Pro fermé, API uniquement.

• État de la version — V4.1 Flash en disponibilité générale depuis le 10 septembre 2026 contre Gemini 3.1 Pro en préversion depuis le 19 février 2026.

• Latence observée jusqu’au premier token — V4.1 Flash : 2,63 s au p50 et 9,05 s au p95, contre Gemini 3.1 Pro : 10,00 s au p50 et 10,00 s au p95, d’après la télémétrie sur 7 jours propre à OrcaRouter. Le temps d’attente médian du modèle coûteux se situe au plafond de la télémétrie, et sa queue ne s’en écarte pas.

Lisez la liste sans les prix, et la configuration est familière à chaque comparaison entre poids ouverts et modèles de frontière : le modèle téléchargeable gagne sur le plafond de sortie, fait jeu égal sur le contexte et devance sur la latence observée. Le modèle fermé gagne sur les modalités, et sur celles-ci, il l’emporte haut la main. Rien ici n’explique à lui seul un facteur 13× en entrée.

Two-column scoreboard: DeepSeek V4.1 Flash vs Gemini 3.1 Pro — price per 1M tokens $0.15 input and $0.60 output vs $2.00 and $12.00 up to 200K and $4.00 and $18.00 above, cached input $0.003 vs $0.40, context window 1M tokens on both, max output 384K tokens vs 65K tokens, input modalities text and images vs audio, file, image, text and video, weights MIT vs closed, release state generally available since 2026-09-10 vs in preview since 2026-02-19, and a time to first token of 2.63 s at p50 and 9.05 s at p95 vs 10.00 s at p50 and p95

La falaise des 200K est l’enjeu tarifaire.

Le tarif affiché de Gemini 3.1 Pro n'est pas un tarif unique. Les requêtes jusqu'à 200 000 tokens d'entrée sont facturées 2,00 $ en entrée et 12,00 $ en sortie par million ; une requête qui franchit ce seuil est facturée 4,00 $ et 18,00 $. DeepSeek V4.1 Flash n'a pas de palier — il facture 0,15 $ et 0,60 $, que la requête fasse 2 000 tokens ou 900 000, avec la seule réserve que DeepSeek double son tarif pendant les heures de pointe et fonctionne entièrement en heures creuses le week-end.

Cette frontière de palier tombe au pire endroit possible pour le travail sur de longs contextes, car le travail sur de longs contextes est par définition celui qui la franchit. Une comparaison chiffrée le rend concret. Prenons un pipeline effectuant 20 000 appels par mois, avec en moyenne 250 000 jetons d’entrée et 4 000 jetons de sortie — une tâche d’analyse de documents sur de gros fichiers.

• DeepSeek V4.1 Flash aux tarifs heures creuses : 20 000 × 250 000 = 5 000 M de tokens d’entrée à 0,15 $ le million, soit 750,00 $. La sortie est de 20 000 × 4 000, soit 80 M de tokens à 0,60 $ le million, soit 48,00 $. Total : 798,00 $.

• Gemini 3.1 Pro à son palier supérieur à 200 K : les mêmes 5 000 M de jetons d’entrée à 4,00 $ par million représentent 20 000,00 $, et 80 M de jetons de sortie à 18,00 $ par million représentent 1 440,00 $. Total : 21 440,00 $.

C'est une différence de 27× sur les dépenses mensuelles pour un trafic identique, et ce n'est pas le facteur que vous auriez deviné à partir des chiffres mis en avant. Le facteur mis en avant est de 13×. Le facteur que vous payez réellement pour du travail à contexte long est de 27×, car la limite de palier se situe exactement là où se trouvent vos prompts.

Ce que le libellé d’aperçu vous coûte réellement

Une version d’aperçu reste une version d’aperçu dans toute l’industrie : elle ne comporte aucune garantie de stabilité publiée. Le fournisseur ne s’est pas engagé à maintenir le point de terminaison à ce comportement, à ce prix ou sous ce nom. Ce n’est pas une critique de Gemini 3.1 Pro — c’est ce que signifie ce libellé, et c’est pourquoi le suffixe preview a survécu sept mois plutôt que d’être une formalité de deux semaines.

Pour un prototype, ce n’est rien. Pour un chemin de production, c’est un risque précis et quantifiable : vous pariez que la version sur laquelle vous avez réglé vos paramètres ne bougera pas. Le contraste avec l’autre côté de cette comparaison est structurel plutôt que rhétorique. DeepSeek V4.1 Flash est en disponibilité générale, et ses poids sont sous licence MIT et téléchargeables, ce qui signifie que même si l’API hébergée changeait ses conditions demain, le modèle lui-même resterait entre vos mains. Un modèle de prévisualisation fermé ne vous offre ni l’engagement de disponibilité générale ni la porte de sortie. Si votre charge de travail peut tourner sur l’un ou l’autre, cette différence vaut plus qu’un point de benchmark.

Là où Gemini 3.1 Pro est le meilleur instrument

L’écart de modalité n’est pas une erreur d’arrondi, et c’est la seule dimension de cette liste où le modèle bon marché ne peut être substitué à aucun prix. Gemini 3.1 Pro accepte l’audio et la vidéo comme entrées à part entière, ainsi que les téléversements de fichiers. DeepSeek V4.1 Flash accepte le texte et les images. Si votre pipeline ingère un enregistrement d’appel, une capture d’écran ou une revue vidéo, DeepSeek V4.1 Flash n’est pas une option moins chère — ce n’est pas une option. Le facteur 13× est sans pertinence pour une tâche qu’un modèle peut accomplir et que l’autre ne peut pas.

Il y a un second cas, plus discret. Gemini 3.1 Pro est publiquement disponible, sous une forme ou une autre, depuis février, et c'est le modèle qui a l'historique de production le plus long — plus de personnes ont atteint ses limites, et son comportement sur du trafic réel est mieux documenté que celui d'une version vieille de douze jours. Pour un travail interactif à forte charge de sortie, où une attente médiane de dix secondes est acceptable parce que la tâche s'exécute en arrière-plan, cet historique est l'argument, et c'est un véritable argument. Ce n'est pas un argument de latence : sur la télémétrie ci-dessus, le modèle le moins cher est le plus rapide des deux, tant à la médiane que dans la queue.

Et il y a la question de ce que signifie l'étiquette preview pour cet historique. Sept mois de disponibilité sous un nom de build preview, c'est plus long que ce que la plupart des modèles obtiennent, et c'est aussi sept mois sans engagement de GA. DeepSeek V4.1 Flash a douze jours au moment de la rédaction et son historique indépendant est mince : la seule évaluation tierce récente dans laquelle il apparaît, le tableau de codage agentique Agents on Rails publié le 21 septembre 2026, l'a placé à 17 % en effort maximal, en milieu de tableau. Douze jours ne suffisent pas pour que la réputation d'un modèle signifie quoi que ce soit, dans un sens ou dans l'autre — c'est la raison honnête pour laquelle un acheteur pourrait préférer le modèle plus ancien ici, et cela n'a rien à voir avec la vitesse.

Routage sur la longueur du contexte, parce que c'est ça la vraie décision

La décision que cette comparaison implique n’est pas « d’en choisir une seule ». C’est une règle à deux clauses : le travail à long contexte et à fort volume revient à DeepSeek V4.1 Flash, et tout ce qui contient de l’audio ou de la vidéo revient à Gemini 3.1 Pro. Le plus embarrassant, c’est que cette règle est facile à énoncer et pénible à mettre en œuvre, car les deux clauses relèvent généralement de fournisseurs différents, avec des clés différentes, des SDK différents et des limites de débit différentes.

Les deux modèles sont accessibles à partir d'une seule clé OrcaRouter, ce qui transforme la règle en une règle de routage plutôt qu'en code de branchement dans votre application — vous pouvez fonder la décision directement sur la longueur du contexte de la requête, qui est la dimension qui détermine réellement la différence de coût ici. OrcaRouter répercute les tarifs catalogue des fournisseurs avec 0 % de marge, de sorte que les tarifs par paliers ci-dessus sont ceux de Google et que le calendrier de pointe de DeepSeek est celui de DeepSeek, toute modification tarifaire d'un fournisseur étant effective de notre côté le jour même. Et comme l'un des deux membres de ce duo est une version préliminaire, il vaut la peine de lui adjoindre un basculement automatique : si la version est révisée sous vos pieds, la requête aboutit sur l'autre modèle plutôt que sur une page d'erreur.

Ce dernier point est la version pratique de tout ce qui précède. Le multiple de 27× sur le travail à long contexte est la raison de router plutôt que de choisir, et l’étiquette d’aperçu sur l’un des deux modèles est la raison d’avoir un endroit où envoyer la requête lorsque la version change.

Screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the model id, 1M-token context, 65K max output, audio, file, image, text and video input, $2.00 input and $12.00 output per 1M tokens, and observed time to first token of 10.00 s at both p50 and p95

Que regarder

• Que Gemini 3.1 Pro quitte ou non l’aperçu. Une sortie GA supprimerait la réserve sur la stabilité et modifierait la physionomie de cette comparaison plus que ne le ferait n’importe quel changement de prix.

• Que le palier au-delà de 200K change ou non. Dans l'arithmétique des coûts, la frontière de palier joue un rôle plus important que le taux affiché.

• Savoir si DeepSeek V4.1 Flash accumule un palmarès indépendant. Un modèle avec des poids sous licence MIT, un plafond de sortie de 384K et un contexte de 1M à 0,15 $ par million de tokens d'entrée constitue un ensemble inhabituel ; la question de savoir si la capacité est au rendez-vous n'a encore été tranchée par aucun benchmark public.

En attendant que le premier de ces éléments arrive, le résumé exact est le suivant : DeepSeek V4.1 Flash est environ treize fois moins cher en entrée et vingt-sept fois moins cher sur les entrées à contexte long que Gemini 3.1 Pro, c'est le seul des deux que vous pouvez télécharger, et c'est le seul des deux à bénéficier d'un engagement de disponibilité générale (GA). Gemini 3.1 Pro est le modèle dont l'historique de production est le plus long et c'est le seul des deux qui peut lire l'audio et la vidéo. Routez en conséquence.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart