Une carte de titre générée pour Ling-3.0-flash-VL, sous-titrée « Ant ouvre un modèle multimodal sur la ligne Ling rapide », montrant trois icônes d’entrée étiquetées Texte, Image et Vidéo courte, qui passent par une puce affichant « 124B sparse MoE · 5,5B actifs » pour déboucher sur une icône de sortie de texte. On y trouve en pied de carte les puces « Poids MIT », « API en direct » et « FP8 », avec la mention « poids publiés le 4 septembre 2026 », et le logo OrcaRouter en bas à droite.
Guides & Insights

Ling-3.0-flash-VL : Ant lance un modèle multimodal sur la ligne rapide Ling.

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le 4 septembre 2026, le laboratoire inclusionAI d'Ant Group a publié des poids sous licence MIT pour Ling-3.0-flash-VL sur Hugging Face et, le même jour, a mis à jour la documentation développeur de la plateforme Ant Ling pour correspondre. Ling-3.0-flash-VL est le premier checkpoint doté de capacités visuelles de la famille Ling-3.0-flash : le même backbone de mélange d'experts sparse d'environ 124 milliards de paramètres qui a fait du Ling-3.0-flash, limité au texte, l'un des modèles de raisonnement à faible coût les plus commentés de la fin de l'été, désormais capable de lire des images et de courts clips vidéo en plus du texte. La quantification FP8 a suivi le 8 septembre, le matin même où ces lignes sont écrites. Ainsi, en quatre jours, la sortie a acquis trois surfaces d'action pour le lecteur : des poids ouverts, une API officielle sur la plateforme Ling d'Ant, et un score de 42 rapporté par le fournisseur sur le protocole Artificial Analysis Intelligence Index version 4.1.1, soit quatre points de plus que les 38 mesurés indépendamment pour le modèle textuel frère. Ce qu'elle n'a pas encore acquis, c'est une annonce formelle : la fiche Hugging Face et le tutoriel développeur constituent l'intégralité du lancement, c'est pourquoi cet article distingue ce que le fournisseur déclare de ce qu'un observateur extérieur peut vérifier.

Cette sortie compte à cause de ce qu'elle fait à la carte produit d'Ant. Jusqu'à la mi-2026, le travail multimodal du portefeuille de modèles d'Ant résidait dans la gamme Ming, distincte, tandis que Ling-3.0-flash était positionné — y compris dans l'explication de ce blog pour le modèle de texte — comme le niveau rapide, texte et outils, destiné aux agents, au codage et à la recherche approfondie. Ling-3.0-flash-VL abolit cette frontière : il amène l'information visuelle dans un modèle de raisonnement construit autour d'une empreinte de paramètres activés inhabituellement réduite et de longues exécutions agentiques, et il remet le résultat aux développeurs de trois manières à la fois. Cela en fait une décision véritablement différente des variantes antérieures ajustées par domaine (Ling-3.0-flash-Fin, Ling-3.0-flash-Sante), qui étaient fournies sous forme d'API gratuites, sans les poids du modèle. Celui-ci est ouvert, fonctionne sur la plateforme payante d'Ant, et il est assez récent pour que personne en dehors du fournisseur n'ait encore publié d'exécution indépendante. Ce dernier fait est le plus important de cet article.

Qu'est-ce qui a été livré, et quand ?

Chaque date ci-dessous est vérifiable à partir des référentiels et de la documentation ; rien de tout cela ne repose sur un communiqué de presse qui n'existe pas.

• 4 septembre — le dépôt Hugging Face inclusionAI/Ling-3.0-flash-VL a été créé à 15:24 UTC avec 64 shards de poids bf16, une pile de code personnalisée complète pour le bailing_moe_v3_vl (une architecture), un modèle de chat avec réflexion activée par défaut, et une licence MIT. Le nombre de téléchargements se compte en dizaines au moment d'écrire ces lignes : c'est une publication que seul un veilleur de dépôts aurait remarquée dès le premier jour.

• 4 septembre — Le portail développeur de la plateforme Ling d’Ant a ajouté le didacticiel de compréhension multimodale documentant le modèle sur l’API officielle (le tampon « dernière mise à jour » de la page indique le 4 septembre 2026). Les médias chinois pour développeurs ont rapporté cette capacité le lendemain, la présentant comme une compréhension d’images et de courtes vidéos pour le question-réponse visuel et l’analyse de contenu.

• À partir du 5 septembre — la prise en charge du service et du déploiement est apparue rapidement : un guide de déploiement SGLang pour le modèle, un fork vLLM personnalisé maintenu par l’organisation inclusionAI, et une entrée de bibliothèque de déploiement « apportez vos propres poids » avec un endpoint chat-completions prêt à l’emploi. Ce sont des environnements d’exécution et des infrastructures, pas des annonces, mais ils montrent que le modèle a été conçu pour être servi, pas seulement publié.

• 8 septembre — la quantification FP8 du modèle inclusionAI/Ling-3.0-flash-VL-fp8 est arrivée (64 shards, ~126 Go), avec la tour de vision délibérément laissée en précision supérieure tandis que les poids du MoE sont compressés en FP8 E4M3. Pour un auto-hébergement sur moins de GPU ou des GPU plus petits, c'est le point de contrôle que la plupart des gens téléchargeront réellement.

An English screenshot of the Hugging Face model page for inclusionAI/Ling-3.0-flash-VL (captured September 8, 2026), showing the model tags text-generation, safetensors, bailing_moe_v3_vl, conversational and custom_code, a 'License: mit' badge, 'Downloads last month 42', model size 125B params, and an Inference Providers note that the model is not deployed by any provider. The card text introduces Ling-3.0-flash-VL as a 'next-generation native multimodal model' built on Ling-3.0-flash with 124B total parameters, only 5.5B activated per token, image and video inputs, and a context window of up to 1M tokens.

La carte ci-dessus est ce que cette version a de plus proche d’un post de lancement — description du modèle, architecture, liens vers les recettes SGLang et vLLM, et aucune annonce ailleurs que nous puissions trouver. Remarquez l’écart qui mérite d’être signalé d’emblée : la fiche modèle indique « seulement 5,5B de paramètres activés par jeton », tandis que le cookbook SGLang rédigé autour de la même version décrit un modèle « 5,1B actif ». Sur un tout nouveau checkpoint, la différence relève probablement de la comptabilisation de la tour de vision plutôt que de deux modèles distincts, mais c’est exactement le genre de détail qui devrait être étiqueté comme non résolu plutôt que lissé.

Un modèle 124B qui active 5.5B — désormais avec des yeux

Ling-3.0-flash-VL conserve la recette hybride sparse-MoE qui a défini le jumeau texte. La fiche décrit un backbone de 42 couches alternant des couches Kimi-Delta-Attention et Gated-MLA dans un rapport de 5:1 — le même rythme structurel que Ling-3.0-flash — avec un total d'environ 124,8 milliards de paramètres et seule une petite fraction activée par jeton. La nouveauté réside dans la pile de perception : un encodeur visuel ViT alimentant un projecteur MLP à deux couches dans le backbone linguistique, plus VideoRoPE pour encoder à la fois la position spatiale et temporelle afin que les frames vidéo arrivent dans un ordre sur lequel le modèle peut raisonner. L'entrée est du texte, de l'image et de la vidéo ; la sortie est du texte.

• Paramètres — 124B au total, ~5,5B activés par token selon la fiche du fournisseur (voir la note de comptabilisation ci-dessus).

• Contexte — annoncé comme « jusqu'à 1M de tokens » ; les recettes de déploiement qui existent aujourd'hui exercent 256K via le scaling RoPE de YaRN, ce qui est le chiffre pratique honnête à prendre en compte jusqu'à ce que quelqu'un publie une exécution plus longue vérifiée.

• Réflexion — le raisonnement est activé par défaut via le template de chat ; les exemples de l'API officielle et les recettes de déploiement montrent tous deux un commutateur enable_thinking: false par requête pour les appels sensibles à la latence.

• Licence — MIT, les deux formats de précision, sans condition additionnelle. C'est la même licence propre qui a rendu notable l'open-sourcing du modèle de texte en août, et c'est précisément la raison pour laquelle l'auto-hébergement est une option réaliste plutôt qu'une zone grise.

L'intention de conception compte autant que la fiche technique. Ant positionne Ling-3.0-flash-VL comme un modèle qui « intègre l'information visuelle dans le processus complet de compréhension, de raisonnement, d'action et de vérification » — ce qui relève du langage des charges de travail agentiques, et non de la légende d'images. Un modèle capable de regarder un enregistrement d'écran de 30 secondes, de maintenir une longue session d'appel d'outils en contexte et de conserver un coût activé proche de 5 milliards de paramètres vise directement les agents d'utilisation d'ordinateur et les agents fondés sur des vidéos courtes. C'est un produit différent des modèles vision-langage optimisés pour le question-réponse sur image unique, et c'est le cadre dans lequel chaque référence ci-dessous doit être interprétée.

Ce que l'API officielle accepte réellement

Le tutoriel de la plateforme Ant Ling documente Ling-3.0-flash-VL selon deux formes d'API : un endpoint compatible OpenAI à api.ant-ling.com/v1/chat/completions et un endpoint compatible Anthropic à api.ant-ling.com/anthropic/v1/messages. Les contraintes valent la peine d'être connues avant de développer dessus :

• Images — JPEG et PNG, base64 uniquement, jusqu'à 40 images par requête, chaque image jusqu'à 16 384 × 784 pixels et chaque chaîne base64 jusqu'à 32 Mo. Le paramètre compatible OpenAI image_url.detail est ignoré ; le moteur décide de la résolution en interne.

• Vidéo — MP4, MOV ou WMV, un clip par requête, limité à 30 secondes, échantillonné à une fréquence fixe de 2 images par seconde jusqu’à 32 images, base64 jusqu’à 32 Mo. La vidéo fonctionne uniquement sur le point de terminaison compatible OpenAI ; le point de terminaison compatible Anthropic accepte le texte et les images mais pas la vidéo.

• Identifiant du modèle — les exemples curl du tutoriel appellent le modèle Ling-3.0-flash-VL-rc1 plutôt que Ling-3.0-flash-VL. Ce -rc1 est un suffixe marqueur de version candidate et une véritable question ouverte : rien dans la documentation n'indique quels poids la plateforme sert, ni si le point de contrôle de l'API correspond à la version des poids ouverts du 4 septembre. Si vous évaluez l'API par rapport aux poids ouverts, c'est la première chose à tester, pas une hypothèse à faire.

An English screenshot of Ant's Ling-platform developer tutorial 'Multimodal Understanding' (captured September 8, 2026, cropped to the article column), which opens 'Ling-3.0-flash-VL is a vision-language model that supports multimodal inputs and understands text, images, and video', then lists the image-understanding limits: JPEG and PNG formats, each image up to 16,384 × 784 pixels, each base64 string up to 32 MB, up to 40 images per request and a 32 MB maximum request body, with OpenAI Chat Completions and Anthropic Messages API columns.

La page ci-dessus est l'endroit où se trouvent les contraintes d'entrée — les formats d'image et de vidéo, les plafonds par requête, et les deux formes de points de terminaison. C'est également là que le modèle est confirmé comme une offre d'API commerciale opérationnelle plutôt qu'une simple ébauche documentaire.

Les chiffres — et qui les a rapportés

A generated single-column scoreboard titled 'Ling-3.0-flash-VL — the scoreboard', with rows 'Released: Sep 4 2026 — MIT weights plus live API', 'Architecture: 124B sparse MoE, ~5.5B active per token', 'Inputs: text, images, short video', 'Context: up to 1M tokens', 'AA Intelligence Index: 42 (vendor-reported)' and 'Text sibling Ling-3.0-flash: 38 (AA-measured)', with the footer 'VL figure per Ant model card; 38 measured by Artificial Analysis.' and the OrcaRouter logo bottom-right.

Le chiffre principal en tête de la carte est de 42 sur le protocole version 4.1.1 de l’indice d’intelligence d’Artificial Analysis, ce qui, selon Ant, place ce modèle quatre points devant le score de 38 du Ling-3.0-flash, limité au texte. La distinction dans cette phrase est essentielle. Le 38 est une mesure d’Artificial Analysis — réalisée indépendamment, publiée sur leur classement, et citée avec approbation dans la couverture médiatique du modèle texte. Le 42 est une affirmation sur la fiche du modèle d’Ant, faite selon un protocole de l’indice AA mais non encore répertoriée par Artificial Analysis, qui ne propose d’ailleurs aucune page pour Ling-3.0-flash-VL à l’heure où nous écrivons ces lignes. Personne en dehors d’Ant n’a encore exécuté ce point de contrôle. Considérez le 42 comme un chiffre fournisseur provenant de la même famille qui a produit le véritable 38 du modèle texte — une raison d’y regarder de plus près, pas un nombre à citer comme acquis.

Tout le reste de la publication est qualitatif ou méthodologique. La fiche décrit le modèle à l'aide d'un tableau de capacités « comprendre, raisonner, agir » et évoque une évaluation agentique sur Terminal-Bench menée selon un protocole de type AA, mais ne publie aucun résultat numérique textuel que nous puissions reproduire ici ; le guide de déploiement liste des cases de précision (MMMU-Pro, GSM8K) liées à des configurations de service spécifiques qui valent la peine d'être lues, mais ce sont des mesures adjacentes à l'infrastructure, et non des évaluations indépendantes. Le résumé honnête est court : un modèle de raisonnement plausible, peu coûteux à servir, doté de capacités de vision, sans tableau de scores public indépendant pour l'instant.

Ce que cela coûte, et ce que suggère l'histoire familiale.

Le tutoriel multimodal d'Ant ne répertorie pas de prix par jeton pour Ling-3.0-flash-VL, donc tout ce qui est présenté ici est une inférence, clairement signalée comme telle. Le point d'ancrage utile est le modèle texte équivalent sur la même plateforme : le prix catalogue de première partie de Ling-3.0-flash est d'environ 0,075 $ pour 1 M de jetons en entrée et 0,22 $ pour 1 M en sortie, avec des lectures en cache environ 80 % moins chères, et la console chinoise le facture en renminbi (0,40 ¥ en entrée / 1,20 ¥ en sortie pour 1 M de jetons) après une promotion initiale de 75 % de réduction qui s'est terminée le 31 août. Un modèle multimodal 124B-A5.5B est plus coûteux à servir qu'un modèle texte 124B-A5.1B — la tour de vision est dense et s'exécute pour chaque jeton d'image — donc un prix dans cette fourchette ou légèrement au-dessus constitue l'a priori raisonnable. L'historique de la famille va aussi dans l'autre sens : les variantes de domaine Fin et Sante ont été lancées sous forme d'API gratuites, ce qui montre qu'Ant utilisera une tarification nulle pour amorcer l'adoption d'une variante de Ling qu'il souhaite voir sur le marché. Que la VL suive la fourchette tarifaire payante du modèle texte ou le schéma de la variante gratuite n'est tout simplement pas encore public.

Pour l'auto-hébergement, les chiffres sont concrets car les fichiers sont publics. La version bf16 représente environ 250 Go de téléchargement répartis sur 64 shards — un défi multi-GPU sauf sur les plus grands nœuds monolithiques — tandis que la version FP8 (~126 Go, avec la tour de vision conservée en bf16) tient aisément sur un nœud équipé de 8 accélérateurs de classe 80 Go et constitue la version que la plupart des équipes exécuteront réellement. Les chiffres de débit du cookbook de service existent, mais ils émanent des fournisseurs ; attendez-vous à la mise en garde habituelle : le nombre réel de token/s dépend de votre matériel et de votre batch.

Où une couche de routage s'intègre — honnêtement.

Au lancement, aucune passerelle majeure de modèles tiers que nous avons vérifiée ne répertorie Ling-3.0-flash-VL, et OrcaRouter — la plateforme de routage à laquelle appartient ce blog — ne le sert pas non plus. Rien dans cet article ne devrait laisser entendre le contraire. C'est l'état honnête d'un modèle vieux de quatre jours, et il vaut la peine de le dire clairement car les options qui s'offrent réellement à un lecteur aujourd'hui sont exactement deux : appeler l'API officielle d'Ant, ou auto-héberger les poids MIT. L'angle du routage, c'est ce qui vient ensuite. Une fois qu'un modèle comme celui-ci est servi par des tiers, l'économie d'un routeur en transparence est la raison de le préférer pour l'évaluation : prix catalogue du fournisseur répercuté avec une marge de 0 %, de sorte qu'une baisse de prix du vendeur (ou une expérimentation de niveau gratuit comme les lancements Fin et Sante) prend effet le jour même de son annonce, et le basculement automatique permet de diriger une charge de travail réelle vers un modèle ouvert vieux de quelques jours sans engager toute votre pile sur la disponibilité d'un seul fournisseur ou le comportement d'un seul point de contrôle. Pour une famille qui a réajusté ses prix une fois et s'est fragmentée en quatre variantes en six semaines, ce n'est pas une hypothèse — c'est la différence entre re-tester à la main à chaque évolution d'Ant et re-tester une seule fois via une API.

Que regarder

Cette version est assez récente pour que les signaux utiles soient surtout des vérifications que tout le monde peut effectuer. Premièrement, de savoir si Artificial Analysis (ou un autre laboratoire indépendant) référence Ling-3.0-flash-VL et confirme ou corrige le 42 — cette seule donnée sépare « le meilleur modèle de la famille » d'« un autre numéro de fournisseur ». Deuxièmement, de savoir si l'identifiant -rc1 sur l'API officielle correspond aux poids ouverts du 4 septembre ; si ce n'est pas le cas, l'API et le chemin d'auto-hébergement sont des modèles différents et chaque comparaison que vous lirez doit préciser lequel a été utilisé. Troisièmement, la tarification : un taux VL publié sur la plateforme Ling, et de savoir s'il suit la bande payante du modèle texte ou la logique d'API gratuite de Fin/Sante. Quatrièmement, de savoir si le point de contrôle FP8 conserve la précision de la carte en service réel — le fait de garder la tour de vision en bf16 est un bon signe, mais les affirmations sur la vision quantifiée nécessitent une exécution, pas une configuration. Et cinquièmement, la question de la cartographie des produits : avec la vision désormais intégrée à la gamme Ling rapide, il faut observer si Ant maintient Ming comme marque multimodale distincte ou laisse les deux converger.

Pour un développeur, la réponse à court terme est courte. Si vous voulez construire sur cette base aujourd'hui, l'API officielle est la voie sans infrastructure, et les poids FP8 sont la voie de l'auto-hébergement, et les deux sont réelles depuis cette semaine. Si vous voulez vous appuyer sur le nombre 42, attendez que quelqu'un en dehors d'Ant le reproduise. Tout ce qui est véritablement utile dans Ling-3.0-flash-VL — des poids MIT, une architecture plausible, une conception au rapport prix/activation agressif et un score de fournisseur à prendre au sérieux — est en place ; tout ce qui en ferait une valeur par défaut sûre reste en suspens.