
Ling-3.0-flash-VL vs Ling 3.0 Flash : un cerveau de 124B, désormais avec des yeux
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
Ling-3.0-flash-VL et Ling 3.0 Flash ne sont pas des rivaux, et lire ce duo comme un face-à-face de modèles vous mènerait à la mauvaise conclusion. Ling-3.0-flash-VL est le point de contrôle vision-langage que le laboratoire inclusionAI d'Ant Group a publié cette semaine — les poids sont disponibles sur Hugging Face sous licence MIT depuis le 4 septembre 2026 — et il est construit directement sur Ling 3.0 Flash, le modèle de texte à poids ouverts de 124 milliards de paramètres du laboratoire, qui ancre son échelon rapide depuis fin juillet. Les deux partagent la même conception MoE hybride-linéaire, les mêmes économies d’activation éparse, la même recette de déploiement en contexte de 256K et la même licence MIT. Ce que le point de contrôle VL ajoute, c'est l'unique chose que le modèle de texte n'a jamais eue : l'entrée native d'images et de vidéos, acheminée via un encodeur ViT, un projecteur MLP à deux couches et un encodage temporel VideoRoPE. La comparaison se réduit donc à une seule question pratique — si votre charge de travail ne regarde jamais d'image, le modèle avec des yeux mérite-t-il le changement ?
La raison pour laquelle cette question vaut la peine d’être posée est qu’inclusionAI ne présente pas Ling-3.0-flash-VL comme une gamme de produits distincte. Sa fiche modèle le qualifie de « notre modèle multimodal natif de nouvelle génération », construit sur Ling-3.0-flash, héritant des capacités de langage, de raisonnement et de contexte long de ce modèle, et les étendant avec une vision qui participe à la boucle complète de compréhension, de raisonnement, d’action et de vérification — et non une vision greffée en entrée. Pour une famille de modèles dont la version phare précédente était explicitement limitée au texte, c’est un véritable changement, et cela modifie le checkpoint qu’une équipe textes-et-outils devrait adopter comme norme.
Deux checkpoints, un backbone
Ling 3.0 Flash, l’adversaire dans cette comparaison, est le plus mature des deux. Annoncé fin juillet 2026 et publié en open source sous licence MIT le 7 août, ce modèle est un mélange d’experts hybride-linéaire avec 124 milliards de paramètres au total et environ 5,1 milliards de paramètres actifs par jeton — 35 couches KDA et 7 couches Gated MLA empilées selon un rapport de 5:1, 512 experts routés dont 8 activés, un contexte natif de 256K servi à 262 144 jetons. Il est exclusivement textuel, avec prise en charge de l’appel d’outils, une réflexion activée par défaut via le template de chat, et un profil de coût inhabituellement faible pour sa taille. C’est également le membre documenté de la paire : Artificial Analysis le référence sur son leaderboard en direct, où il est classé premier parmi les 63 modèles de sa catégorie, et a mesuré un débit d’environ 313 jetons par seconde sur l’API du fournisseur.
Ling-3.0-flash-VL conserve cette architecture et y ajoute une pile visuelle par-dessus. La fiche décrit un encodeur visuel ViT dont les caractéristiques sont alignées sur l'espace textuel via un projecteur MLP à deux couches, avec VideoRoPE encodant à la fois la position spatiale et l'ordre temporel, afin que le modèle puisse faire de la localisation d'événements et du raisonnement sur de longues vidéos. Le backbone est le même hybride KDA-to-MLA en ratio 5:1, cette fois à 124B au total / 5,5B actifs par jeton, avec un tronc de 42 couches. Les entrées sont le texte, l'image et la vidéo ; la sortie est du texte. Le contexte est annoncé jusqu'à 1M de jetons, la recette SGLang recommandée servant 256K via la mise à l'échelle YaRN. Comme son homologue textuel, il est livré avec le mode réflexion activé par défaut (désactivable par requête avec chat_template_kwargs), et il fonctionne sous SGLang ou sous un fork vLLM personnalisé d'inclusionAI. La version BF16 occupe environ 250 Go sur disque répartis sur 64 shards safetensor — la même classe de quart de téraoctet que les poids du modèle textuel.
À quel point est-ce récent ? Au moment de la rédaction, le dépôt VL compte quelques dizaines de téléchargements, sa fiche de modèle est encore en cours de mise à jour et Artificial Analysis ne l'a pas encore répertorié. Tout ce qui n'est pas explicitement attribué à Artificial Analysis dans ce qui suit provient des propres rapports d'inclusionAI.

Le tableau d'affichage
L'asymétrie ici n'est pas une question de qualité — c'est une question de modalité. Six dimensions résument la décision :
• Intelligence (carte du fournisseur, AA Index v4.1.1) — Ling-3.0-flash-VL : 42, rapporté par le fournisseur. Ling 3.0 Flash : 38, le chiffre d’indice antérieur cité par la carte.
• Classement AA en direct aujourd’hui (v4.3) — Ling-3.0-flash-VL : pas encore répertorié. Ling 3.0 Flash : estimé à 25, classé n°1 sur 63 dans sa catégorie.
• Entrées — Ling-3.0-flash-VL : texte, image et vidéo. Ling 3.0 Flash : texte uniquement.
• Contexte — les deux revendiquent jusqu’à 1M de jetons ; les deux sont en pratique servis à 256K (262 144) aujourd’hui.
• Prix — Ling-3.0-flash-VL : pas encore de prix catalogue ; poids ouverts MIT uniquement. Ling 3.0 Flash : environ 0,07 $ par million de jetons en entrée et 0,22 $ par million de jetons en sortie sur l’API propriétaire du fournisseur.
• Choisissez-le pour — Ling-3.0-flash-VL : documents, captures d’écran, graphiques, vidéo et agents agissant sur interface graphique. Ling 3.0 Flash : appels d’outils à forte composante textuelle et pipelines agentiques à long horizon.

Le tableau de bord dans lequel le modèle de texte ne peut pas entrer.
C'est là que les deux divergent réellement, et la divergence est structurelle plutôt que concurrentielle : sur les benchmarks d'image et de vidéo, le Ling 3.0 Flash uniquement texte n'a aucune entrée du tout, car il ne peut pas accepter l'entrée. Le propre graphique de Ling-3.0-flash-VL — l'évaluation d'inclusionAI, non reproduite, exécutée en partie en interne et en partie contre les API des concurrents dans des conditions de test officielles — affiche des chiffres dans les trois catégories que la fiche met en avant. En compréhension d'images complexes, il montre un MMMU-Pro de 79,0 et un MathVision de 84,87, avec un score bien inférieur de 19,88 sur Humanity's Last Exam-Multimodal, ce qui reflète à quel point cet ensemble est difficile pour tout le monde. Sur le travail documentaire et graphique, il est solide : OmniDocBench1.5 à 91,35 et CharXiv_RQ à 81,30. Et sur les suites multimodales agentiques qui rendent cette version intéressante — ClawEval-MM à 59,9, WebVoyager à 90,83, Vision2Web à 57,69 — il lui est demandé de lire une interface et d'agir dessus, ce qui est précisément la tâche d'agent GUI que le modèle texte ne peut pas assumer.
Lisez ces données en contexte et un tableau cohérent se dessine : il ne s'agit pas d'un modèle calibré pour gagner des quiz sur les images, mais d'un modèle calibré pour transformer des pixels en actions — lire la mise en page, suivre le graphique, agir sur la page. Sur le propre graphique du fournisseur, il mène le comparatif à trois (Qwen3.8-27B avec un effort de raisonnement élevé, Gemini 3.5 Flash-Lite et Kimi-K2.6) sur OmniDocBench, WebVoyager et ClawEval-MM, et marque le pas sur les batteries difficiles de connaissances et de raisonnement comme MathVision et HLE-MM. Considérez chacun de ces chiffres comme une affirmation d'inclusionAI jusqu'à ce qu'un laboratoire neutre les confirme — mais la direction du réglage, elle, est claire et cohérente.
Le seul nombre qui vaille la peine qu'on se dispute : 42 contre 38
La revendication la plus susceptible de faire basculer une équipe 100 % texte est celle du titre : inclusionAI rapporte que Ling-3.0-flash-VL obtient 42 sur l’indice Artificial Analysis Intelligence (v4.1.1), soit quatre points de plus que les 38 qu’elle attribue à Ling 3.0 Flash sur la même version de l’indice. Remarquez ce que mesure cet indice : sa note composite v4.1.1 repose sur des suites textuelles et agentiques — GDPval, Terminal-Bench, SciCode, GPQA Diamond, Humanity’s Last Exam et autres — dont aucune n’est une tâche d’image. Le fournisseur prétend donc que l’ajout d’un entraînement visuel au tronc commun a fait gagner quatre points d’intelligence textuelle au modèle, et pas simplement qu’il peut désormais décrire des images. C’est une affirmation frappante et tout à fait plausible : l’ajustement par instructions multimodales améliore généralement les capacités textuelles.
Deux réserves sur les sources permettent de relativiser ce chiffre. Premièrement, le 38 provient d'une génération d'indice antérieure : Artificial Analysis a depuis fait migrer son classement en direct vers une version plus récente de l'indice (v4.3), dans laquelle Ling 3.0 Flash obtient désormais un score estimé à 25, tout en conservant la première place parmi les 63 modèles de sa catégorie. Le couple 42/38 du fournisseur repose sur l'ancienne échelle ; il ne doit donc pas être interprété comme « quatre points au-dessus du score qu'AA attribue aujourd'hui au modèle textuel ». Deuxièmement, le 42 est un chiffre propre à inclusionAI pour un modèle qu'Artificial Analysis n'a pas encore répertorié, et inclusionAI n'a pas publié les résultats du checkpoint VL sur les batteries de tests textuelles individuelles (SWE-Bench, Terminal-Bench) que son propre tableau des modèles textuels détaille. Quatre points correspondent exactement à l'ampleur du gain qu'il faudrait reproduire avant de migrer un pipeline exclusivement textuel sur la foi de ce chiffre.

Prix : l'un a un prix catalogue, l'autre non.
La comparaison des coûts ne contient actuellement qu'un seul prix. Ling 3.0 Flash peut être appelé dès aujourd'hui sur l'API first-party du fournisseur à environ 0,07 $ par million de tokens d'entrée et 0,22 $ par million de tokens de sortie (tarification fixée par le fournisseur, comme l'indique sa fiche sur Artificial Analysis). L'entrée en cache est moins chère et ses remises de lancement ont pris fin. Aucun prix d'API n'est publié pour Ling-3.0-flash-VL ; vous ne pouvez pas encore payer par token pour l'utiliser. Si vous voulez l'utiliser cette semaine, vous devez l'auto-héberger avec des poids MIT d'environ 250 Go en BF16, sur la même catégorie de matériel que celle déjà requise par le modèle de texte — soit 4 GPU de 141 Go (H20-3e ou H200), soit un nœud Blackwell à 4 GPU en tensor-parallel 4, soit 8 GPU H100/H800 de 80 Go en TP8.
Cela change la donne économique pour une équipe qui ne traite que du texte. Si vous achetez des tokens, le modèle texte à 0,07 $/0,22 $ est peu coûteux et éprouvé. Si vous auto-hébergez déjà le modèle texte 124B, le point de contrôle VL ne représente pas un second achat d’infrastructure — c’est simplement environ 250 Go de poids supplémentaires sur la même classe de machines, justifié uniquement par des charges de travail qui consomment réellement des pixels. Le modèle avec des yeux ne gagne sa place que lorsque des yeux sont dans la boucle.
Qui devrait choisir quoi
• Texte uniquement et volume élevé — restez sur Ling 3.0 Flash. Vous bénéficiez d'un modèle éprouvé, classé AA, d'un vrai prix par jeton et d'un appel d'outils mature. Le gain de quatre points à l'indice du modèle VL n'est pas reproduit et son débit côté texte n'est pas mesuré ; il n'existe encore aucune preuve qu'il soit le meilleur modèle texte, seulement une affirmation en ce sens.
• La vision entre dans la boucle — documents, captures d’écran, graphiques, photos, images vidéo, ou une interface utilisateur que votre agent doit lire et sur laquelle il doit cliquer — Ling-3.0-flash-VL est le choix évident, car c’est le même socle de raisonnement que vous connaissez déjà, avec la pile de vision ajoutée, plutôt qu’un modèle multimodal distinct que vous devez réévaluer de zéro.
• Trafic mixte, non tranché — l’option à faible risque consiste à garder les deux accessibles et à router selon la requête plutôt que de réarchitecturer autour d’un seul. C’est la propriété qu’une passerelle de modèles a précisément pour vocation de vous offrir : une API unique pour plus de 200 modèles, les prix catalogue des fournisseurs répercutés sans aucune marge et un basculement automatique en cas de dégradation d’un fournisseur. Aucun des deux checkpoints Ling n’est encore derrière un endpoint OrcaRouter — le prix du modèle texte est celui du fournisseur lui-même, et le modèle VL n’a aucun prix d’hébergement — mais dès que le VL en aura un, déplacer une partie du trafic vers lui et mesurer l’impact relèvera d’un changement de configuration, et non d’un projet d’intégration.
Qu'est-ce qui manque encore ?
• Une exécution indépendante de Ling-3.0-flash-VL sur un Artificial Analysis Intelligence Index actuel — le 42 est la valeur qu'inclusionAI annonce pour une version antérieure de l'index.
• Tout prix d’API hébergée pour le modèle VL, qui est le plus grand frein à l’adoption occasionnelle.
• Publication de splits text-only (SWE-Bench Pro, Terminal-Bench 2.1) pour le checkpoint VL, afin qu'une équipe orientée texte puisse vérifier que la pile vision ne lui a rien coûté.
• Une mesure de latence ou de débit de bout en bout pour VL sous charge d'images — la vitesse du modèle de texte est mesurée ; celle du modèle de vision ne l'est pas.
Confirmation neutre du graphique de référence vision-benchmark, dont certaines parties ont été exécutées sur le propre harnais d'inclusionAI, au moins un benchmark interne étant prévu pour une publication ultérieure.
Le verdict
Ce n’est pas un concours de qualité de modèles ; c’est une décision de modalité accompagnée d’une affirmation en quatre points. Si vos entrées sont du texte, gardez Ling 3.0 Flash — c’est moins cher, inscrit sur la liste AA, et ses performances sont mesurées, et l’avantage du modèle VL sur lui est actuellement un chiffre de fournisseur sur une ancienne échelle d’indice. Si votre charge de travail part d’un écran — une page de document, une capture d’écran, un graphique, une image vidéo, une interface graphique que votre agent doit manipuler — Ling-3.0-flash-VL est le même cerveau 124B que vous connaissez déjà, désormais capable de voir, et c’est une option véritablement nouvelle qui n’existait pas dans le niveau rapide de Ling il y a une semaine. Adoptez-le là où la vision est réelle, validez le 42 avant de migrer quoi que ce soit sur la foi de ce résultat, et gardez le choix réversible au niveau du routage jusqu’à ce qu’un score indépendant et un prix catalogue arrivent.
