
Ling-3.1-flash vs DeepSeek V4.1 Flash : Deux points d'indice, trois fois la facture
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Ling-3.1-flash et DeepSeek V4.1 Flash (Max) ne sont séparés que de deux points sur l'Artificial Analysis Intelligence Index — 41 contre 39 — et sont à des années-lumière l'un de l'autre côté prix. Si l'on fait passer les dix évaluations qui composent cet index à chaque modèle, Ling-3.1-flash coûte environ 0,99 $ par tâche, contre 0,27 $ pour DeepSeek. Tous deux sont des modèles à mélange d'experts d'environ 550 milliards de paramètres, avec un contexte revendiqué de 1 M de tokens. L'un est un modèle fermé, textuel uniquement, du laboratoire InclusionAI d'Ant Group, publié le 01/10/2026 et toujours sans poids publiés ni licence. L'autre est ouvert sous licence MIT depuis le 10/09/2026, prend en charge les images comme le texte, est proposé chez 23 fournisseurs et est le modèle que la plupart des équipes auraient déjà dans un fichier de configuration. La comparaison n'est pas serrée sur la plupart des axes. La question intéressante est de savoir pourquoi ces deux points existent tout court.
Là où Ling-3.1-flash est véritablement en avance
Il est en tête sur les évaluations qui mesurent la conduite d'un terminal et l'écriture de code devant s'exécuter, et l'écart mérite d'être énoncé précisément parce que l'agrégat le masque.
• Terminal-Bench 4.0 — Ling-3.1-flash 0,333 contre DeepSeek V4.1 Flash (Max) 0,268. Ce sont tous deux des chiffres modestes en valeur absolue ; l’écart représente un quart du score de DeepSeek.
• SciCode — 0,541 vs 0,519.
• Raisonnement physique CritPt — 0,180 contre 0,143.
• GDPval-AA — travail agentique dans le monde réel — 1 621,75 Elo contre 1 600 Elo.
Deux de ces quatre lignes sont des quasi-égalités, une est une victoire étroite, et Terminal-Bench 4.0 est la seule ligne où la différence survivrait à un changement de graine. Mettez cela en regard des domaines où DeepSeek l'emporte : AA-Briefcase v1.1, travail intellectuel agentique, à 1 420,47 Elo contre 1 400,35 ; AutomationBench-AA à 0,689 contre 0,617 ; AA-LCR, raisonnement à long contexte, à 0,84 contre 0,83 ; et — la ligne qui compte le plus pour la production — AA-Omniscience à −5,30 contre les +2,22 de Ling-3.1-flash, sur une mesure où une hallucination est pire qu'un refus. L'exactitude de DeepSeek y est de 46,4 %, avec un taux d'hallucination de 96,5 % parmi les questions auxquelles il répond ; Ling-3.1-flash répond correctement à 29,1 % des questions, avec un taux d'hallucination de 37,9 %. Ni l'un ni l'autre n'est un modèle que l'on pointe vers une base de connaissances sans retrieval en amont.
L’écart de prix est plus important que l’écart d’indice, et ce n’est pas seulement une question de grille tarifaire.
Les tarifs affichés semblent presque identiques. Artificial Analysis les relève tous deux à 0,30 $ par million de tokens d’entrée. Ils divergent nettement sur les deux autres chiffres :
• Sortie — Ling-3.1-flash 0,90 $ par million contre DeepSeek V4.1 Flash (Max) 1,20 $ par million. Ici, Ling-3.1-flash est tout simplement le modèle le moins cher, de 25 %.
• Lecture du cache — Ling-3.1-flash à 0,06 $ par million contre DeepSeek V4.1 Flash (Max) à 0,006 $ par million, soit une réduction de 98 % contre 80 %. C’est là que les deux modèles cessent d’être comparables.
Le taux mixte pour une répartition 7:2:1 entre succès de cache, entrées et sorties ressort à 0,192 $ pour Ling-3.1-flash et à 0,184 $ pour DeepSeek V4.1 Flash (Max) — quasiment à égalité. Mais ce mélange repose sur une hypothèse quant à votre façon d'utiliser un modèle, et cette hypothèse joue un rôle considérable. Toute charge de travail à forte réutilisation de prompt — un long prompt système, un préambule de récupération, une boucle d'agent qui renvoie le contexte accumulé à chaque tour — pousse la répartition effective vers les lectures de cache, et là, la différence de 10× dans le prix du cache prend le dessus. Le volume de tokens amplifie le phénomène de la même manière : Ling-3.1-flash est un raisonneur bavard, qui génère 220 millions de tokens de sortie sur l'ensemble des évaluations de l'index, contre 250 millions pour DeepSeek, et une moyenne d'environ 357 secondes par tâche d'évaluation, contre 285 pour DeepSeek. Il réfléchit davantage par réponse et met plus de temps à le faire.

Un exemple concret : la même boucle d’agent sur les deux
Prenons un agent qui pilote des outils et consomme 1 M de tokens d’entrée par tâche, dont 90 % sont servis depuis le cache, et produit 200 000 tokens de sortie. Avec Ling-3.1-flash, d’après les chiffres ci-dessus : 900 000 tokens d’entrée mis en cache à 0,06 $ plus 100 000 tokens d’entrée frais à 0,30 $ plus 200 000 tokens de sortie à 0,90 $ reviennent à environ 0,26 $ par tâche. La même boucle sur DeepSeek V4.1 Flash (Max) revient à environ 0,14 $ — soit à peu près la moitié.
Appliquez maintenant le calendrier de DeepSeek, car c’est la partie que la plupart des comparaisons ignorent. Le tarif hors pointe de DeepSeek est celui ci-dessus, et les heures creuses couvrent les week-ends et la majeure partie de la journée ; mais pendant deux créneaux en semaine, 01:00–04:00 et 06:00–10:00 UTC, la tarification des entrées et du cache double. Déplacez la même boucle dans un créneau de pointe et le coût de DeepSeek avoisine les 0,28 $ — à ce moment-là, la grille tarifaire fixe et plus élevée de Ling-3.1-flash devient l’option la moins chère pour cette heure, et la remise de 10× sur le cache a été neutralisée par l’horloge.
Toute la décision tient dans une paire de chiffres. Si votre trafic d’agent est fortement dépendant du cache et que vous pouvez le planifier, DeepSeek V4.1 Flash (Max) coûte environ deux fois moins cher que Ling-3.1-flash pour un écart d’indice de deux points. Si votre trafic est fortement dépendant du cache et tombe dans les fenêtres de pointe de DeepSeek, les deux modèles coûtent à peu près la même chose, et la ligne terminal-agent légèrement meilleure de Ling-3.1-flash devient le critère décisif.
Les axes pour lesquels il n’y a aucune comparaison à faire
Trois dimensions ne sont pas proches, et ce sont elles qui ont tendance à décider d’une architecture avant que le prix ne soit abordé.
• Poids et licence — Ling-3.1-flash n’a pas publié de poids, n’a aucun texte de licence, et Artificial Analysis le classe comme propriétaire. DeepSeek V4.1 Flash (Max) est à poids ouverts sous MIT, téléchargeable depuis Hugging Face, avec utilisation commerciale autorisée. L’un peut être auto-hébergé, affiné et isolé en air-gapped ; l’autre non.
• Modalité — Ling-3.1-flash, c’est du texte en entrée, du texte en sortie. DeepSeek V4.1 Flash (Max) accepte des images en plus du texte et est évalué sur des benchmarks multimodaux. Si une partie de votre pipeline transmet au modèle une capture d’écran, un graphique ou un scan, la comparaison s’arrête là.
• Surface de service — DeepSeek V4.1 Flash (Max) est disponible via 23 fournisseurs, dont OrcaRouter ; Ling-3.1-flash fonctionne via l’API propre du fournisseur et les plateformes tierces qui assurent sa distribution. Pour un déploiement en production, le nombre de fournisseurs est une propriété de résilience, pas un concours de popularité.
Une asymétrie supplémentaire qui n'apparaît dans aucune de ces listes : DeepSeek V4.1 Flash (Max) expose 384 000 jetons de sortie dans une seule réponse. Ant n'a pas publié de longueur de sortie maximale pour Ling-3.1-flash, de sorte qu'une charge de travail de génération longue ne peut pas encore être dimensionnée par rapport à ce modèle. L'absence de plafond publié n'équivaut pas à un plafond faible, mais ce n'est pas non plus un chiffre sur lequel on peut concevoir.
Exécuter les deux, et à quoi cela ressemble concrètement
Ling-3.1-flash n'est pas au catalogue d'OrcaRouter aujourd'hui — une recherche dans notre API publique de modèles renvoie « not-found » pour le modèle sous InclusionAI, et cet article ne prétendra pas le contraire. DeepSeek V4.1 Flash est routable dès maintenant au tarif du fournisseur, à savoir le prix catalogue sans marge, donc un changement de prix du fournisseur est répercuté de notre côté le jour même où il survient, et il se trouve derrière la même clé API unique que le reste du catalogue, avec basculement automatique entre les fournisseurs en amont.
Cette asymétrie a une forme concrète. La façon raisonnable d’aborder une comparaison où un modèle est fermé, coûte environ quatre fois le prix de son prédécesseur et n’est accessible que par un seul fournisseur, consiste à garder le modèle ouvert, largement servi, comme voie par défaut et à traiter le challenger comme quelque chose que l’on teste plutôt que comme quelque chose sur lequel on s’engage. DeepSeek V4.1 Flash (Max) peut porter la boucle de production dès aujourd’hui — poids ouverts, entrée d’images, sortie de 384K, une remise de 98 % sur le cache — tandis que Ling-3.1-flash se voit confier le travail propre aux agents, là où ses marges sur Terminal-Bench et SciCode s’appliquent réellement. Comme les deux parlent le format chat-completions compatible OpenAI, cette répartition relève d’une décision de routage plutôt que d’un projet d’intégration : un point de terminaison, une clé, et une règle qui envoie les tâches pour lesquelles chaque modèle est mesurablement meilleur.
Le verdict
D'après les éléments disponibles, DeepSeek V4.1 Flash (Max) remporte cette confrontation, et il l'emporte surtout sur des choses qui n'ont rien à voir avec deux points d'Index : des poids ouverts sous licence MIT, l'entrée d'images, 384 000 jetons de sortie, une remise de 98 % sur le cache, et 23 fournisseurs entre lesquels basculer en cas de défaillance. Le dossier de Ling-3.1-flash est plus étroit et bien réel — c'est le meilleur agent de terminal et d'outils des deux, et c'est le seul de la paire à ne pas avoir publié de grille tarifaire avec un multiplicateur d'heures de pointe intégré.
Deux choses changeraient cette évaluation. Si Ant publie les poids sous une licence permissive, l’écart d’ouverture se comble et la comparaison devient une simple discussion sur les capacités et le coût. Et si la fenêtre de contexte long servie par Ant est validée à 1 M de tokens, ce que les deux modèles déclarent, l’affirmation de parité de contexte cesse d’être une simple affirmation. D’ici là, le résumé honnête est qu’un modèle peut gagner sur une ligne de benchmark agentique et pourtant perdre l’évaluation — et que l’écart de deux points sur l’indice entre ces modèles vaut environ 3,6 × le coût par tâche, un compromis que seule une charge de travail spécifique devrait accepter.


