
Ling-3.0-flash-VL vs DeepSeek V4 Flash Vision Exp : deux paris sur la vision ouverte
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Ling-3.0-flash-VL et DeepSeek V4 Flash Vision Exp sont les deux modèles de vision à poids ouverts de cette catégorie qu'une équipe peut réalistement télécharger et servir aujourd'hui, et ils ont été conçus par des personnes qui ne sont pas d'accord sur la finalité de la vision. Ling-3.0-flash-VL, du laboratoire inclusionAI d'Ant Group, active environ 5,5 milliards de ses 124 milliards de paramètres par token et considère la vision comme quelque chose à appliquer dans une boucle de rétroaction — générer, rendre, regarder, corriger — au coût d'inférence le plus faible possible. DeepSeek V4 Flash Vision Exp, premier modèle multimodal de DeepSeek, associe une fenêtre de contexte de 1 M de tokens à une sortie maximale de 384 K tokens et considère la vision comme une entrée de plus qu'un agent lit sur le chemin de l'achèvement d'une longue tâche. L'un est optimisé pour le peu qu'il en coûte de penser. L'autre est optimisé pour la quantité qu'il peut contenir pendant qu'il pense.
Cette différence, et non un écart de benchmark, est ce qui devrait guider le choix. Les deux modèles n’ont aucun protocole d’évaluation commun auquel se comparer, et un seul d’entre eux dispose réellement d’un score indépendant. Ce qui suit est la forme honnête de la confrontation : les paris architecturaux, les spécifications qui divergent réellement, la situation des benchmarks, y compris pourquoi elle est limitée, ce que chacun coûte, et lequel l’emporte pour quel type de tâche — ainsi que la partie où nous disons clairement lequel des deux figure dans notre catalogue.
Les deux paris, énoncés précisément
Le côté Ling de cette affaire est un pari sur la parcimonie d’activation comme principal levier de coût. Ling-3.0-flash-VL est un mélange d’experts creux (sparse mixture-of-experts) avec 124B de paramètres au total — la fiche modèle indique environ 124,8B, et le cookbook SGLang décrit 5,1B actifs là où la fiche indique environ 5,5B — mettant en œuvre un tronc hybride à 42 couches qui alterne Kimi Delta Attention et des blocs MLA à portes selon un ratio de 5:1. Un encodeur visuel à résolution arbitraire et un projecteur MLP à deux couches alimentent ce tronc, VideoRoPE gérant la position spatiale et temporelle afin que les images vidéo arrivent dans un ordre cohérent. La conséquence architecturale est un modèle dont le coût d’exécution par token ne représente qu’une petite fraction de celui d’un modèle dense de 124B, ce qui est la raison même pour laquelle il apparaît sur la frontière intelligence/paramètres actifs.
Le côté DeepSeek est un pari sur le contexte et l’endurance agentique. DeepSeek V4 Flash Vision Exp reprend l’architecture textuelle DeepSeek-V4-Flash, y ajoute un encodeur visuel et un aligneur, puis poursuit l’entraînement — une source situe le résultat autour de 305 milliards de paramètres, ce que DeepSeek n’a pas confirmé en détail. Il embarque une fenêtre de contexte de 1 048 576 tokens et une sortie maximale de 384 000 tokens, prend en charge la sortie JSON, les appels d’outils, l’API Responses, l’API Anthropic et la continuation par préfixe de conversation, et DeepSeek a été explicite : il ne s’agit pas d’un modèle de réponse aux questions visuelles. C’est de la perception pour les agents : lire des captures d’écran web, des interfaces logicielles et des graphiques, puis enchaîner sur des appels d’outils. Les images sont converties en tokens et facturées comme telles, avec un plafond de 384 tokens par image.
Lisez ces deux paragraphes ensemble et la forme de la décision apparaît. Si votre charge de travail consiste à « regarder ceci, décider quelque chose, agir, regarder de nouveau », c’est le nombre de paramètres actifs de Ling qui rend la boucle abordable, et sa conception de rétroaction visuelle vise exactement cela. Si votre charge de travail consiste à « lire ce document de 400 pages avec des figures et continuer », la fenêtre de contexte de DeepSeek est la caractéristique clé et rien du côté de Ling ne rivalise avec elle.
Pourquoi la comparaison de benchmarks est plus mince qu'elle n'en a l'air
C'est la section que la plupart des comparaisons sautent, et la sauter produit un tableau de chiffres qui ne signifie rien. Voici l'état réel des preuves.
Ling-3.0-flash-VL dispose d'une mesure indépendante : 25 sur l'Artificial Analysis Intelligence Index v4.3, classé n° 2 sur 64 dans sa catégorie de taille, contre une médiane de catégorie de 8. La fiche du fournisseur revendique séparément 42 sur le protocole Intelligence Index v4.1.1, qui est une échelle abandonnée et non comparable — considérez le 42 comme non reproduit.
DeepSeek V4 Flash Vision Exp ne dispose d'aucune page Artificial Analysis du tout. Chaque chiffre publié à son sujet est celui de DeepSeek, issu de l'annonce de sortie, et plusieurs d'entre eux sont explicitement relatifs à Opus-4.8 plutôt qu'à un protocole fixe. Ce n'est pas une critique des chiffres ; c'est un constat sur ce que l'on peut en faire. Vous ne pouvez pas mettre un modèle évalué indépendamment et un modèle évalué uniquement par son fournisseur dans la même colonne et déclarer un vainqueur, et toute page qui le fait fabrique un résultat.
Ce qui est légitime, c'est de comparer chaque modèle à son propre bilan déclaré, avec la provenance attachée :
• Ling-3.0-flash-VL, indépendant — Intelligence Index 25 sur v4.3, n°2 sur 64 dans sa catégorie, médiane de catégorie 8, selon Artificial Analysisbr /> • Ling-3.0-flash-VL, fournisseur — 42 sur le protocole v4.1.1 retiré, et 1 441 contre 1 440 pour GPT-5.4 dans l'Image-to-WebDev Arena en tant que « linthium » ; les deux sont déclarés par le fournisseur et la marge de l'arène se situe dans le bruit Elobr /> • DeepSeek V4 Flash Vision Exp, fournisseur — Terminal Bench 2.1 83,9 ; DeepSWE 59,3 contre 58,0 pour Opus-4.8 ; Agents' Last Exam 27,3 contre 25,7 pour Opus-4.8 ; Toolathlon-Verified 75,9 ; Cybergym 75,3 ; Chartography 64,3 ; NL2Repo 57,7 ; DSBench-Hard 63,6 ; ZeroBench Pass@5 35,0 ; ApexBench Pass@1 36,5 ; AutomationBench 25,7br /> • DeepSeek V4 Flash Vision Exp, indépendant — aucune publication
Remarquez de quoi la liste DeepSeek est principalement composée : des évaluations d'agents et d'ingénierie logicielle, et non des évaluations de vision. La présentation qu'en fait DeepSeek elle-même est que, sur les tâches purement textuelles, le modèle de vision égale le DeepSeek-V4-Flash officiel sans aucune régression, et que les gains se situent sur les benchmarks d'agents multimodaux — où DeepSeek décrit le résultat comme approchant Opus-4.8 plutôt que comme le surpassant, et concède un écart d'environ dix points sur les tâches structurées de science des données et de code NL2Repo et DSBench-Hard. C'est un ensemble de revendications inhabituellement prudent, et cela vous indique que le modèle est vendu comme une amélioration de la perception destinée à une pile d'agents existante, plutôt que comme un nouveau plafond.

Les specs qui divergent réellement
Les deux fiches techniques concordent sur la plupart des points : toutes deux sont à poids ouverts sous licence MIT, prennent en entrée du texte et des images et renvoient du texte, fournissent des poids BF16 avec des versions quantifiées, ont des recettes de service publiées et gèrent la vidéo d’une manière ou d’une autre. Les divergences se concentrent en quatre points.
• Paramètres — Ling-3.0-flash-VL totalise 124 B, avec environ 5,5 B actifs par token ; DeepSeek V4 Flash Vision Exp est annoncé à environ 305 B, sans chiffre publié de paramètres actifsbr /> • Fenêtre de contexte — Ling-3.0-flash-VL mesure 262 K tokens selon Artificial Analysis, contre les 256 K indiqués sur sa propre fiche modèle ; DeepSeek V4 Flash Vision Exp fonctionne nativement avec 1 048 576 tokensbr /> • Sortie maximale — Ling-3.0-flash-VL est nettement plus courte, de l’ordre de quelques dizaines de milliers de tokens ; DeepSeek V4 Flash Vision Exp atteint 384 000br /> • Gestion des images — Ling-3.0-flash-VL accepte jusqu’à 40 images par requête, chacune jusqu’à 16 384 × 784 pixels, en base64 uniquement ; DeepSeek V4 Flash Vision Exp accepte le base64, les URL externes ou une référence à l’API Files, et plafonne le coût par image à 384 tokensbr /> • Paramètres actifs — Ling-3.0-flash-VL active environ 5,5 B par token ; DeepSeek V4 Flash Vision Exp n’a publié aucun chiffre de paramètres actifs
La ligne consacrée au traitement des images est celle que l’on sous-estime. Un plafond strict de 384 tokens par image signifie qu’un graphique dense ou une capture d’écran pleine page est compressé dans un budget à peu près équivalent à celui d’une vignette — économique, mais avec des pertes qui comptent pour les tâches de lecture fine. L’approche de Ling va dans l’autre sens : un budget de pixels par image très important, un transport en base64 uniquement, et donc une charge utile de requête beaucoup plus lourde. Lequel des deux est meilleur dépend entièrement de si vos images sont des photographies de documents que vous devez lire avec précision, ou des captures d’écran d’interface que vous devez comprendre approximativement.
La deuxième ligne sous-estimée est la sortie maximale. Le plafond de plusieurs dizaines de milliers de tokens de Ling-3.0-flash-VL convient à une boucle décrire-puis-corriger et devient contraignant pour tout ce qui veut émettre un artefact volumineux — un long fichier généré, une réécriture complète de document, un diff de plusieurs milliers de lignes. La sortie de 384K de DeepSeek existe précisément parce que sa charge de travail prévue aboutit à un résultat d'appel d'outil volumineux ou à un artefact généré. Si votre pipeline s'attend à ce que le modèle renvoie quelque chose de long, cette seule ligne décide de la confrontation avant même qu'un benchmark ne le fasse.
Prix, et la différence entre gratuit et sans prix
DeepSeek V4 Flash Vision Exp affiche un vrai tarif dans notre catalogue : 0,24 $ par million de jetons d'entrée et 0,73 $ par million de jetons de sortie, avec une fenêtre de contexte de 1 048 576 jetons et une sortie maximale de 384 000 jetons, accessible via deepseek/deepseek-v4-flash-vision-exp. Il s'agit d'un tarif publié, facturé de la même manière que la version texte du V4-Flash, avec des images converties en jetons, jusqu'à 384 par image. C'est un tarif que vous pouvez mettre dans un tableur.
Ling-3.0-flash-VL n'en a pas. La page d'Artificial Analysis l'affiche à 0,00 $ pour 1 M de tokens en entrée et 0,00 $ pour 1 M de tokens en sortie face aux médianes de 0,14 $ et 0,40 $ des modèles comparables — mais cela reflète l'essai gratuit en cours sur Ling Studio d'Ant, et non un tarif. La documentation multimodale d'Ant ne publie aucun prix par token pour le modèle de vision, il n'y a donc rien à quoi comparer ce zéro. Le modèle frère textuel Ling-3.0-flash a été répertorié autour de 0,075 $ pour 1 M de tokens en entrée et 0,22 $ pour 1 M de tokens en sortie, et les déclinaisons Ling spécifiques à un domaine d'Ant ont été lancées en tant qu'API gratuites, ce qui suggère une configuration finale similaire — mais une suggestion n'est pas un prix.
Mettez-les côte à côte honnêtement, et la comparaison des coûts est la suivante : un modèle a un tarif, l'autre a une fenêtre promotionnelle et une estimation plausible. Quiconque affirme que Ling-3.0-flash-VL est moins cher que DeepSeek V4 Flash Vision Exp compare un essai gratuit à un prix catalogue. L'affirmation défendable est que Ling-3.0-flash-VL est très probablement moins cher par token une fois tarifé, parce que 5,5 milliards de paramètres actifs constituent un avantage structurel qu'aucun changement de tarif n'efface — avec la réserve que la verbosité de Ling-3.0-flash-VL rogne cet avantage. Artificial Analysis relève qu'il consomme 160 M de tokens de sortie sur l'Intelligence Index, classé 8e sur 64 contre une médiane de 84 M et qualifié de « très verbeux ». Vous payez par token émis, donc un modèle qui en dit presque deux fois plus pour arriver à la même réponse rend une partie de ce que son activation éparse lui fait gagner.
Lequel, pour quoi
L'arbre de décision honnête se divise d'abord en fonction du contexte et de la longueur de sortie, avant toute autre chose, car ce sont les dimensions où les deux modèles ne sont pas des substituts.
Choisissez DeepSeek V4 Flash Vision Exp lorsque votre tâche est longue et se termine par un artefact : des documents de plusieurs centaines de pages avec des figures, des bases de code lues de bout en bout, des boucles d’agents qui doivent produire un résultat volumineux, des charges de travail pour lesquelles vous préférez transmettre une image par URL ou une référence à la Files API plutôt qu’en base64, et des pipelines où vous avez besoin de la Responses API, de la continuation par préfixe ou d’un tarif par token publié sur lequel vous pouvez établir un budget. C’est aussi le seul des deux dont le fournisseur revendique la parité avec son propre modèle texte sur les tâches textuelles, ce qui compte si un seul modèle en remplace deux dans votre stack.
Choisissez Ling-3.0-flash-VL lorsque votre contrainte principale est le coût par appel et que votre boucle est courte : automatisation d’interface graphique, inspection répétée de captures d’écran, génération front-end avec un cycle rendu-correction, contrôles ponctuels de documents médicaux ou financiers lorsque vous avez besoin d’une résolution élevée par image et pouvez accepter une sortie réduite. Le nombre de 5,5 B de paramètres actifs est la raison de le choisir, la licence MIT est la raison pour laquelle il est sûr de l’auto-héberger, et la conception de boucle de rétroaction visuelle vise exactement le schéma observer-agir-vérifier-corriger. Sachez que vous choisissez un modèle non tarifé avec une voie d’accès gratuite et aucun engagement quant à la suite.
Et si ce dont vous avez réellement besoin est un seul modèle qui lit les images correctement sans aucun de ces deux extrêmes — pas d'astuce de sparsité 5.5B, pas de fenêtre d'un million de tokens — alors ni l'un ni l'autre de ces modèles n'est la réponse intéressante, et les modèles de vision de gamme moyenne ordinaires vous serviront mieux et à moindre coût que l'un ou l'autre de ces spécialistes.
Les gérer, et où nous nous situons honnêtement
DeepSeek V4 Flash Vision Exp figure dans notre catalogue. Vous pouvez l'appeler via le point de terminaison compatible OpenAI d'OrcaRouter avec la chaîne de modèle deepseek/deepseek-v4-flash-vision-exp, avec la même clé que vous utilisez pour tout le reste, au tarif publié de 0,24 $/0,73 $ sans aucun supplément — le prix catalogue du fournisseur est répercuté directement, donc si DeepSeek réduit le tarif, vous en bénéficiez le jour même plutôt qu'au prochain renouvellement de contrat. Si vous intégrez un modèle de vision dans un chemin de production pour la première fois, c'est le plus sûr des deux pour démarrer sur une couche de routage, car vous pouvez configurer une chaîne de repli afin qu'une erreur de fournisseur soit réessayée via un autre itinéraire avant que votre réponse ne commence. Personne ne veut que son premier appel de vision en production soit celui qui lui apprenne la défaillance d'un fournisseur unique.

Ling-3.0-flash-VL ne figure pas dans notre catalogue, et nous n'allons pas laisser entendre le contraire. Il est accessible via la plateforme d'Ant elle-même, qui publie un point de terminaison compatible OpenAI et un autre compatible Anthropic, via un accès d'essai gratuit sur Ling Studio, et via les poids ouverts sur Hugging Face, que vous pouvez servir vous-même avec la recette SGLang publiée ou le fork vLLM d'Ant. Une chose à vérifier avant d'investir dans cette voie : les exemples d'API d'Ant utilisent l'identifiant Ling-3.0-flash-VL-rc1, un marqueur de version candidate, et la question de savoir si le checkpoint servi correspond aux poids ouverts n'a pas été tranchée publiquement. Si vous évaluez par rapport à l'API hébergée en vous attendant à ce que les chiffres se transposent à un déploiement BF16 auto-hébergé, testez d'abord cette hypothèse.

Le résumé qui résiste à l’examen : ce ne sont pas des réponses rivales à une même question. DeepSeek V4 Flash Vision Exp est une couche de perception à long contexte pour agents, avec un prix publié et une fiche de benchmarks rapportée par le fournisseur qui s’appuie sur des évaluations agentiques. Ling-3.0-flash-VL est un modèle de vision peu coûteux à servir, avec un véritable score indépendant unique, un palier gratuit non tarifé et une conception visant des boucles correctives courtes. Faites correspondre la forme de votre charge de travail à la forme du modèle, et le fait que seul l’un des deux ait un score indépendant au tableau devrait guider le poids que vous accordez au marketing de l’autre.
La même clé donne accès au reste du catalogue, et vous pouvez parcourir le catalogue complet des modèles pour voir ce qui d'autre se trouve derrière un point de terminaison compatible OpenAI.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
