Une carte de titre pour Ling-3.0-flash-VL résumant le modèle comme un mélange d’experts multimodal natif de 124 milliards de paramètres dont 5,5 milliards actifs, issu du laboratoire inclusionAI d’Ant Group, publié en septembre 2026 sous licence MIT, obtenant un score de 25 à l’Artificial Analysis Intelligence Index v4.3 et offrant un débit de 142,9 tokens de sortie par seconde.
Guides & Insights

Ling-3.0-flash-VL : le modèle de vision à 5,5B de paramètres actifs d'Ant se hisse à la 25e place de l'Intelligence Index

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Ling-3.0-flash-VL dispose désormais d'un chiffre de benchmark que personne chez Ant Group n'a saisi, et c'est là la nouvelle. Le premier modèle nativement multimodal du laboratoire inclusionAI d'Ant obtient 25 à l'Artificial Analysis Intelligence Index — une évaluation indépendante, sur l'échelle v4.3 actuelle, publiée aux côtés d'une page de modèle listant sa vitesse, sa latence et son prix. Ce chiffre arrive trois semaines après que la propre fiche modèle du fournisseur annonçait 42 sur le même index, et la chose la plus utile qu'un lecteur puisse faire avec ces deux nombres est de comprendre pourquoi ils ne sont pas contradictoires : Ant a mesuré selon le protocole Intelligence Index v4.1.1, Artificial Analysis a mesuré selon la v4.3, et ce sont des instruments de mesure différents, construits à partir d'ensembles d'évaluation différents. Le chiffre du fournisseur n'a pas tant survécu au contact d'un tiers qu'il a été repris sur une échelle qui n'existait pas au moment où il a été écrit.

Le modèle qui sous-tend le score est un mélange d'experts clairsemé avec 124 milliards de paramètres au total et environ 5,5 milliards de paramètres actifs par token, publié sous licence MIT avec des poids BF16 et FP8, acceptant du texte, des images et de la vidéo et renvoyant du texte. Ce chiffre de paramètres actifs est tout l'argument de la chose. À 5,5 milliards de paramètres actifs, Ling-3.0-flash-VL se situe sur ce qui est devenu la courbe la plus intéressante des modèles ouverts — la frontière de l'intelligence tracée en fonction des paramètres activés plutôt que de la taille totale — et il y est parce qu'il fournit une quantité décente de travail par unité de calcul d'inférence, non parce qu'il est énorme.

Cet article couvre ce qui a réellement été livré et quand, ce que dit l'exécution indépendante, pourquoi l'affirmation de Pareto tient mieux que la plupart, combien coûte le modèle et où vous pouvez réellement l'appeler. La version courte, pour ceux qui ne veulent que cela : Ling-3.0-flash-VL est réel, à poids ouverts, exceptionnellement peu coûteux à servir, mesurablement au-dessus de la moyenne pour sa catégorie de taille, et nettement plus verbeux et plus lent à livrer que ne le suggère le score brut. Son 42 revendiqué par le fournisseur n'a jamais été reproduit indépendamment et n'est pas comparable au 25 désormais au tableau.

Ce qui a réellement été livré, et la chronologie qui ne cesse d’être aplatie

La couverture de cette sortie tend à fusionner plusieurs événements distincts en une seule date de lancement, et les dates importent parce qu'elles expliquent pourquoi les premiers articles décrivaient un modèle que personne en dehors d'Ant ne pouvait évaluer. Le dépôt Hugging Face inclusionAI/Ling-3.0-flash-VL a été créé le 4 septembre 2026 — 64 shards de poids BF16, une licence MIT, une pile de code personnalisée pour l'architecture bailing_moe_v3_vl, et, pendant quelques jours, presque personne ne le téléchargeait. La quantification FP8 a suivi le 8 septembre, soit environ 126 Go répartis sur 64 shards, avec la tour de vision conservée à une précision supérieure à celle des poids des experts. Artificial Analysis répertorie la sortie au 10 septembre 2026, qui est la date sur laquelle sa propre page se base, et la page du modèle portant le score a été mise en ligne vers ce moment-là.

Ainsi, « sorti en septembre 2026 » est exact, mais inutile. La séquence pratique était la suivante : les poids le 4, un second format de précision le 8, et une mesure indépendante le 10. Cela importe parce qu’un modèle dont les poids sont sur disque, mais sans point de terminaison hébergé ni score tiers, n’est, pour la plupart des équipes, pas encore une chose que l’on peut évaluer — c’est un téléchargement contre lequel il faut provisionner. Ling-3.0-flash-VL a franchi cette ligne lorsque l’API et le score indépendant ont tous deux existé.

Le support de serving est arrivé en même temps que les poids, et non après. Ant a publié un cookbook de déploiement SGLang et maintient un fork de vLLM ajusté pour Ling pour l’architecture, qui est la partie d’une sortie ouverte qui accuse généralement des semaines de retard. Ici, il n’y a pas eu de retard.

Le numéro sur le tableau, et celui sur la carte.

Voici le panorama indépendant d’Artificial Analysis, la seule mesure par un tiers de ce modèle qui existe actuellement :

• Indice d'intelligence — 25 sur v4.3, classé n°2 sur 64 dans sa catégorie de taille, contre une médiane de catégorie de 8br /> • Paramètres totaux — 124Bbr /> • Paramètres actifs — 5.5B par tokenbr /> • Vitesse de sortie — 142.9 tokens/seconde, n°10 sur 64, contre une médiane des pairs de 105.1br /> • Temps jusqu'au premier token — 2.21 secondes, contre une médiane des pairs de 2.29br /> • Fenêtre de contexte — 262K tokens selon les mesures d'Artificial Analysis, contre les 256K que la fiche du modèle elle-même indiquebr /> • Licence — MIT, poids ouverts

Et voici le chiffre du fournisseur à côté duquel il est si souvent imprimé : 42 sur le protocole Artificial Analysis Intelligence Index v4.1.1, soit quatre points de plus que ce que le Ling-3.0-flashtexte-only a obtenu sur le même protocole. Cette affirmation figure dans la fiche du modèle, ne s'accompagne d'aucune trace d'évaluation publiée et ne correspond pas au chiffre qu'Artificial Analysis rapporte. Deux choses sont vraies à la fois : le 42 n'est pas reproduit, et il ne prouve rien de malhonnête, car v4.1.1 et v4.3 ne mesurent pas la même chose. Artificial Analysis a reformulé son indice en septembre 2026 et re-noté l'ensemble de son tableau ; v4.3 intègre dix évaluations, dont AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0 et Humanity's Last Exam. Tout article qui cite encore un 42 à côté d'un 25 sans nommer la version compare deux tests différents et appelle cela un recul.

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class ranking of #2 of 64, 124B total and 5.5B active parameters, a 262K-token context window, 142.9 output tokens per second, a 2.21 second time to first token, 160M output tokens from the Intelligence Index ranked #8 of 64, and a listed price of $0.00 per 1M tokens in and out.

Le détail qui mérite d’être signalé au-delà du score principal, c’est la verbosité. Artificial Analysis indique que Ling-3.0-flash-VL a dépensé 160 M de tokens de sortie pour compléter l’Intelligence Index, se classant n° 8 sur 64 contre une médiane de 84 M, et le qualifie de « très verbeux ». Pour un modèle dont l’argument de vente est une inférence bon marché grâce à un faible nombre de paramètres actifs, cela va directement à l’encontre de cet argument. On paie au token, pas au paramètre. Un modèle qui active 5,5 B mais émet près du double du nombre médian de tokens pour répondre aux mêmes questions rend une partie de cet avantage structurel à la caisse — exactement le type d’interaction qu’un tableau de prix par token masque et qu’une mesure du coût par tâche met en évidence.

L’affirmation de Pareto, un peu mise à l’épreuve

L’affirmation selon laquelle Ling-3.0-flash-VL se situe sur la frontière de Pareto entre l’intelligence et les paramètres actifs est, fait inhabituel, étayée par les données indépendantes plutôt que simplement permise par elles. La médiane de la classe sur cet indice est de 8 ; Ling-3.0-flash-VL obtient 25 ; et il y parvient tout en activant 5,5 milliards de paramètres par token. Pour les équipes dont la contrainte déterminante est le débit exploitable — un seul accélérateur, un budget de requêtes fixe, un déploiement en périphérie —, ce ratio est toute la décision, et c’est une performance véritablement solide.

Deux réserves empêchent qu'il s'agisse d'une victoire nette. La première est l'écart sur le nombre de paramètres : la fiche du modèle indique environ 5,5 B actifs, tandis que le cookbook SGLang décrit un modèle à 5,1 B actifs. Les deux sont des documents Ant, la différence est faible, et elle modifie légèrement la forme de la courbe plutôt que sa direction. La seconde est que « frontière » est une affirmation relative à un domaine qui évolue chaque semaine. Être la meilleure intelligence par paramètre actif pour une taille donnée est une position que l'on occupe jusqu'à la sortie du prochain modèle de ce segment, et ce segment est encombré.

La démonstration phare du fournisseur lui-même — à savoir que Ling-3.0-flash-VL, engagé dans l'Image-to-WebDev Arena sous le pseudonyme « linthium », a obtenu 1,441 contre GPT-5.4et son 1,440 — doit se lire comme un argument d'accroche plutôt que comme un résultat. Un écart d'un point se situe dans le bruit d'un Elo d'arène, il est rapporté par le fournisseur, et ce n'est pas le genre d'écart qui décide quoi que ce soit. L'affirmation de capacité qui la sous-tend est plus intéressante que le chiffre : le modèle est conçu pour une boucle de rétroaction visuelle dans laquelle il génère du code front-end à partir d'une mise en page, effectue le rendu de sa propre sortie, examine ce rendu et corrige — observer, agir, vérifier, corriger, plutôt que de légender une fois et de s'arrêter.

A single-column scoreboard card for Ling-3.0-flash-VL listing six rows: Intelligence Index 25 on v4.3, active parameters 5.5B, total parameters 124B, context window 262K tokens, output speed 142.9 tokens per second, and license MIT open weights, with a footer noting the index figure is per Artificial Analysis and the vendor card claims 42 on the retired v4.1.1 protocol.

Ce que cela coûte, ce qui est moins clair qu’il n’y paraît

La page Artificial Analysis répertorie Ling-3.0-flash-VL à 0,00 $ pour 1 M de jetons d'entrée et 0,00 $ pour 1 M de jetons de sortie, contre des médianes comparables de 0,14 $ et 0,40 $. Ce n'est pas un prix. C'est l'apparence d'un prix. Artificial Analysis tarifie le point de terminaison qu'elle peut voir, et le point de terminaison qu'elle peut voir est gratuit — le modèle tourne sur Ant's Ling Studio en essai gratuit, et l'accès promotionnel gratuit est ce que reflète l'inscription. La propre documentation multimodale d'Ant ne publie pas du tout de tarification par jeton pour le modèle de vision, il n'y a donc aucune grille tarifaire du fournisseur pour vérifier le zéro. Pour donner un ordre de grandeur, le frère texte uniquement Ling-3.0-flash a été répertorié autour de 0,075 $ pour 1 M d'entrée et 0,22 $ pour 1 M de sortie, et les variantes Ling spécifiques à un domaine d'Ant ont également été lancées en tant qu'API gratuites.

Considérez le zéro comme une fenêtre de test plutôt que comme un tarif. Les niveaux gratuits sur des modèles fraîchement publiés sont un instrument d'acquisition de clients, et l'hypothèse de planification honnête est que Ling-3.0-flash-VL finira par avoir un prix aux alentours de celui de son homologue textuel. Il existe aussi une ambiguïté persistante que l'arrivée d'un point de terminaison payant ne résoudra pas : les propres exemples d'API d'Ant utilisent l'identifiant de modèle Ling-3.0-flash-VL-rc1, un marqueur de version candidate, et il reste difficile de savoir si le point de contrôle servi est identique octet pour octet aux poids ouverts du 4 septembre. Si vous évaluez vos propres prompts par rapport à l'API hébergée et que vous vous attendez à ce que les résultats se transposent à une version BF16 auto-hébergée, c'est une hypothèse que vous devriez tester avant de vous appuyer dessus.

L’image des coûts s’inverse selon le camp dans lequel on se trouve. Pour une équipe disposant déjà d’accélérateurs, la version FP8 d’environ 126 Go tient dans un nœud à huit accélérateurs de classe 80 Go, et le nombre de paramètres actifs de 5,5 milliards signifie que vous payez le coût amorti de ce nœud pour une empreinte de calcul par token très faible : la version la moins chère possible de ce modèle est celle que vous servez vous-même. Pour une équipe sans accélérateurs, la question est de savoir si un point de terminaison payant arrive avant la fermeture de l’offre gratuite.

Où vous pouvez réellement l'appeler, y compris la partie où nous disons non

Ling-3.0-flash-VL est accessible via la plateforme d'Ant elle-même — un point de terminaison compatible OpenAI à api.ant-ling.com/v1/chat/completions, et un autre compatible Anthropic à ses côtés — plus un accès d'essai gratuit sur Ling Studio, plus des poids ouverts que vous pouvez héberger vous-même. Des passerelles indépendantes ont aussi commencé à le référencer, et c'est véritablement le moyen le plus rapide de l'essayer sans rien provisionner.

The thing worth stating plainly is that OrcaRouter does not route Ling-3.0-flash-VL today. It is not on our model catalogue, so anything you read here about calling it through us would be fiction, and we would rather you knew that up front. What we do route is the vision model most directly comparable to it: DeepSeek V4 Flash Vision Exp, Deep​Seek's experimental multimodal build, which is live on our catalogue with a 1M-token context window and a published rate. If your actual requirement is a capable vision model behind one OpenAI-compatible endpoint — with a fallback chain configured so a provider hiccup retries before your response starts, and provider list pricing passed through with nothing added on top, so a vendor price change reaches you the same day it lands — that is the model to try first while Ling-3.0-flash-VL remains off-catalogue.

A release-timeline card for Ling-3.0-flash-VL covering four dated events: the Hugging Face repository created September 4 2026 with MIT-licensed BF16 weights, FP8 weights published September 8 at roughly 126 GB, the release anchored to September 10 by Artificial Analysis, and an independent Intelligence Index score of 25 published the same week, with a footer noting the model is not carried on the OrcaRouter catalogue.

Ce qu'il faut surveiller à partir d'ici

Trois choses détermineront si cette version paraîtra importante dans six mois. La première est une seconde exécution indépendante : un score provenant d’un seul évaluateur n’est qu’un point de données, et la question intéressante est de savoir si le positionnement de Ling-3.0-flash-VL sur la courbe intelligence-paramètres actifs résiste à un autre harnais d’évaluation. La deuxième est un vrai prix. Tant qu’Ant ne publie pas de grille tarifaire pour le modèle de vision, toute comparaison de coûts l’impliquant est une estimation déguisée en chiffre, et l’offre gratuite fait le travail qu’un prix ferait autrement. La troisième est l’écart de qualité FP8 — la tour de vision a été délibérément maintenue à une précision supérieure à celle des poids d’experts dans cette build, et savoir si la version quantifiée égale BF16 sur des tâches visuelles fines est exactement le genre de question qui n’apparaît qu’une fois que les gens l’exécutent en production plutôt que de l’évaluer en benchmark.

Le verdict dont on dispose aujourd’hui est plus étroit que ne le laissait entendre la couverture du lancement, et plus utile que le score seul. Ling-3.0-flash-VL est un véritable modèle de vision sous licence MIT, auto-hébergeable, qui active une petite fraction de ses 124 milliards de paramètres, obtient 25 sur un indice indépendant actuel contre une médiane de catégorie de 8, et en abandonne une partie de cet avantage à cause de sa verbosité. C’est un bon modèle, au profil honnête. Le 42 sur la fiche est un nombre issu d’une règle qui n’existe plus.