Carte éditoriale principale générée, intitulée « Ling-3.1-flash : annoncé, pas ouvert », avec le sous-titre « ~560 Md de paramètres au total · ~25 Md actifs par token · jusqu'à 1M de contexte ». Trois cartes étiquetées indiquent « Poids : pas encore publiés », « Benchmarks : déclarés par le fournisseur uniquement » et « Aucune licence · aucune fiche modèle · aucun téléchargement ».
Guides & Insights

Ling-3.1-flash est annoncé, mais pas ouvert : ~560 milliards de paramètres, un contexte de 1 M de tokens, et un graphique exécuté uniquement par Ant

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

L'équipe Ling d'Ant Group a publié les chiffres de son prochain modèle de gamme rapide le 30 septembre 2026, et dans la foulée a déclaré que vous ne pouvez pas encore l'avoir. Ling-3.1-flash est un mélange d'experts d'environ 560 milliards de paramètres qui active environ 25 milliards de paramètres par token et dispose d'une fenêtre de contexte allant jusqu'à 1 million de tokens, selon l'annonce du modèle publiée par Ant depuis son propre compte @AntLingAGI. La phrase qui définit cette sortie est celle qui suit les spécifications : « Nous prévoyons de rendre le modèle open source prochainement. » À ce jour, il n'existe aucun dépôt Ling-3.1-flash sur Hugging Face, aucune licence, aucun fichier de poids téléchargeable et aucune évaluation provenant de qui que ce soit en dehors d'Ant Group. Ce qui existe, c'est un graphique de benchmarks, une interface produit en ligne et une promesse.

Cette distinction est toute l’histoire, et il vaut la peine d’être direct à ce sujet, car le cadrage qui parvient en premier à la plupart des gens — une publication à poids ouverts de classe 500B venue de Chine qui se situe près de la frontière — décrit quelque chose qui n’a pas eu lieu. Ling-3.1-flash n’est pas une sortie ouverte. C’est une sortie annoncée. Les deux sont loin d’être équivalentes, et l’écart entre elles est exactement l’endroit où un lecteur peut se faire avoir : si vous planifiez des capacités, budgétisez un pilote ou rédigez une note d’approvisionnement autour de poids ouverts qui n’existent pas encore, vous planifiez contre un communiqué de presse.

Ce que contient réellement l’annonce

Le billet est court et les chiffres qu'il contient sont précis. Ant annonce un nombre total de paramètres d'environ 560 milliards, contre environ 25 milliards d'actifs par token, soit un rapport proche de 1 pour 22, à peine plus dense que la génération Ling-3.0-flash à laquelle il succède — ce modèle tourne à 124 Md au total contre 5,1 Md d'actifs, soit environ 1 pour 24, sur une enveloppe représentant moins du quart de la taille. Le contexte est annoncé comme allant « jusqu'à 1 M de tokens », soit quatre fois la fenêtre de 262 144 tokens que sert aujourd'hui la famille Ling-3.0-flash. Trois scores phares sont mis en avant : 1 673 points Elo sur GDPVal-AA v2.1, 75,16 sur FrontierSWE et 65,35 sur HealthBench Professional.

Chacun de ces chiffres est rapporté par le fournisseur, de première main, et non publié sous une forme qu’un tiers peut réexécuter. Il n’existe aucun harnais d’évaluation, aucun jeu de prompts, aucune configuration d’exécution et aucune graine — et, plus fondamentalement, aucun poids pour les exécuter. Si les chiffres d’Ant sont exacts, le modèle se situe au premier rang des publications chinoises de modèles ouverts ; il n’existe actuellement aucun moyen de savoir s’ils sont exacts.

Le graphique, et la mise en garde qu’il comporte

Ant Group's own Ling-3.1-flash benchmark card, published from the @AntLingAGI account on 30 September 2026. Multi-panel bar charts compare Ling-3.1-flash against GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3 and GLM 5.3 Flash, and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states that HealthBench Professional was evaluated in the AQ environment.

Ant a publié Ling-3.1-flash en même temps qu'une fiche de benchmarks à plusieurs panneaux qui le place dans un ensemble de modèles frontières et quasi-frontières : GPT-5.6 Sol, Claude Opus 5, Kimi K3, deux entrées de la famille GLM, et DeepSeek-V4.1-Flash. D'un panneau à l'autre, la barre de Ling se situe au sommet ou tout près du sommet pour les mesures agentiques et de codage, et en milieu de tableau pour celles portant sur le multi-tour et les domaines spécifiques. À lire pour ce que c'est — la sélection de tâches propre au fournisseur, issue d'une suite qui comprend le travail d'agent généraliste, le codage, des tâches du secteur bancaire et la santé — et la fiche paraît crédible.

Regardez toutefois qui figure sur cette carte : une chose saute aux yeux. Les pairs de frontière qu'Ant a choisis sont GPT-5.6 Sol et Claude Opus 5. Or ces deux modèles accusent désormais une génération de retard. Opus 5.5 et GPT-6 Sol sont tous deux entrés en service le 22 septembre 2026, le même jour, et tous deux sont aujourd'hui routables. Les modèles les plus récents qu'Ant n'a pas inscrits sur la carte sont précisément ceux contre lesquels un lecteur voudrait le voir mesuré, ce qui correspond exactement à la critique apparue dans la première vague de commentaires sur la sortie — le souhait qu'un modèle arrivant en octobre ait été évalué par rapport à la frontière d'octobre plutôt qu'à celle de juillet. Ce n'est pas un reproche adressé au modèle, qui pourrait bien tenir la distance. C'est une raison de considérer la carte comme une affirmation indicative plutôt qu'un verdict, et de noter que la comparaison choisie par Ant flatte moins le résultat qu'elle ne le date.

Là où vous pouvez y toucher, et une note de bas de page inexpliquée

Il existe aujourd’hui exactement un endroit où Ling-3.1-flash tourne pour un utilisateur : le produit d’Ant lui-même. L’interface Ling Studio sur ling.tbox.cn répertorie Ling-3.1-flash dans son sélecteur de modèles, et la description que l’application fait elle-même du modèle est plus large que la fiche de benchmark — elle le présente comme destiné aux « agents polyvalents, à la recherche, au travail de bureau courant et au développement logiciel/code », ce qui correspond au positionnement habituel de cette gamme : non pas le raisonneur le plus profond de la famille, mais celui censé être appelé constamment et à moindre coût.

Cette surface porte aussi le détail le plus embarrassant de cette sortie. La note de bas de page de la fiche de benchmark elle-même indique que HealthBench Professional — le chiffre de 65,35, l’un des trois nombres du texte d’annonce — a été « évalué dans l’environnement AQ », et ajoute que les capacités de Ling-3.1-flash en matière de santé « ne peuvent actuellement être expérimentées que dans AQ ». Rien sur la fiche n’explique ce qu’est AQ, et aucune documentation publique que nous ayons pu trouver ne le définit. Un score phare assorti d’un qualificatif d’environnement, où l’environnement n’est pas nommé, n’est pas un résultat reproductible ; c’est une démo produit avec un chiffre à côté.

Ce qui est connaissable, et ce qui ne l’est pas

Classer cette publication dans ces deux catégories est la chose la plus utile qu’un lecteur puisse en faire aujourd’hui.

Ce qu'il est possible de savoir maintenant : les paramètres, le nombre de paramètres actifs et la fenêtre de contexte tels qu'indiqués par le fournisseur ; les trois benchmarks du fournisseur ; l'existence du modèle au sein même d'un produit d'Ant ; l'ensemble de comparaison qu'Ant a sélectionné ; le fait qu'aucun poids, aucune licence ni fiche de modèle n'ait été publié ; et le fait qu'Artificial Analysis, qui a évalué indépendamment la génération précédente, ne dispose d'aucune page Ling-3.1-flash. À l'heure où nous écrivons, le pipeline d'évaluation indépendant qui a rendu lisible le score de 20 points à l'Intelligence Index de Ling-3.0-flash n'a rien publié du tout sur 3.1.

Impossible de savoir pour l’instant : si les poids seront réellement ouverts, et sous quelle licence ; si l’architecture est une version mise à l’échelle de la pile hybride Ling-3.0 ou quelque chose de nouveau ; combien le modèle coûte via l’API d’Ant, s’il a même un prix d’API ; comment il se comporte en contexte long en pratique, par opposition à la manière dont la fenêtre est spécifiée ; et si les écarts de benchmark tiennent lorsque quelqu’un qui n’est pas Ant exécute les mêmes tâches. Chacune de ces questions est une question à laquelle un modèle publié répond dès le premier jour et à laquelle un modèle annoncé répond un jour ultérieur qui n’a pas été planifié.

Generated two-column information card. Left column headed "Knowable today" lists five cards: "~560B total / ~25B active (vendor)", "up to 1M-token context (vendor)", "1,673 Elo GDPval-AA v2.1 (vendor)", "available in Ant's Ling Studio only" and "no independent score exists". Right column headed "Not knowable" lists five cards: "whether the weights will open", "the licence terms", "API price per million tokens", "long-context behaviour in practice" and "whether the benchmark gaps hold".

Comment lire une journée comme celle-ci

Le schéma est désormais assez courant pour qu'on le nomme. Un laboratoire chinois au solide palmarès publie une fiche de modèle et un graphique de benchmark, les chiffres frôlent la frontière, la communauté réagit aux chiffres, et les poids arrivent — ou pas — des semaines plus tard. Ling-3.0-flash a joué exactement cette partition cet été, et il vaut la peine de se rappeler comment cela s'est terminé : Ant l'a annoncé le 24 juillet 2026 comme un modèle uniquement disponible via API, sans mention de licence ni benchmark indépendant, et les poids sous MIT ne sont apparus sur Hugging Face que le 7 août, deux semaines après l'annonce. Ling-3.1-flash se trouve au point équivalent de cet arc dès le premier jour, avec la différence supplémentaire que cette fois, la promesse d'ouvrir le code source est explicite dans l'annonce plutôt qu'implicite.

Aucun des modèles qu’Ant a choisis comme points de comparaison ne figure dans notre catalogue en tant que sujet de l’article — Ling-3.1-flash, Ling-3.0-flash et Ling-3.0-flash-VL renvoient tous une réponse « introuvable » sur le catalogue OrcaRouter aujourd’hui, et nous ne prétendrons pas le contraire. Mais trois des pairs de ce graphique sont routables dès maintenant : Claude Opus 5, GPT-5.6 Sol et DeepSeek-V4.1-Flash se trouvent tous derrière une seule clé, au prix catalogue du fournisseur sans marge, avec basculement automatique entre eux. Cela compte plus que cela n’en a l’air dans une semaine comme celle-ci, car la manière honnête d’évaluer un modèle annoncé est de mener la comparaison qu’Ant propose — face aux modèles que vous pouvez réellement appeler — tant que le sujet de la comparaison n’est encore qu’un graphique.

Quand les poids arriveront, la question utile ne sera pas de savoir si Ling-3.1-flash a battu Opus 5 sur une seule note Elo. Elle sera de savoir si un MoE de ~560B avec ~25B de paramètres actifs peut tenir un contexte de 1M de tokens à un prix qui rende la parcimonie rentable, et si la licence est suffisamment permissive pour permettre l'auto-hébergement. Ce sont les deux questions auxquelles l'annonce ne répond pas, et ce sont les seules qui décideront si cela devient un modèle sur lequel les gens construisent ou une diapositive dans la prochaine présentation de quelqu'un. Pour l'instant : le nom est réel, les chiffres n'appartiennent qu'à Ant, et les poids ne sont encore qu'une phrase.

Generated horizontal timeline with four milestone nodes. "Jul 24, 2026 — Ling-3.0-flash announced, API-only, no weights, no licence"; "Aug 7, 2026 — MIT weights land on Hugging Face, 14 days later"; "Sep 30, 2026 — Ling-3.1-flash announced: ~560B, ~25B active, 1M context"; and a dashed open node reading "Weights: not yet — 'we plan to open-source soon'", captioned "the same point in the same arc, on day one".