
Ling-3.1-flash atteint 41 sur l'Artificial Analysis Intelligence Index : le MoE de 560B double son prédécesseur
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Ling-3.1-flash, le mélange d'experts de 560 milliards de paramètres d'Ant Group, porte désormais un nombre que son propre laboratoire n'a pas écrit : 41 sur l'Artificial Analysis Intelligence Index. L'indice est géré par l'évaluateur indépendant, sur du matériel que l'évaluateur contrôle, contre une suite fixe — et il place le modèle 21 points au-dessus de son propre prédécesseur direct, Ling-3.0-flash, qui reste à 20 sur le même indice. Ant a annoncé Ling-3.1-flash fin septembre 2026, Artificial Analysis date la sortie au 1er octobre, et il est trois mois plus jeune que le modèle qu'il double.
Cet écart, c’est toute l’histoire. Un mouvement de 21 points sur un composite que dix évaluations différentes alimentent n’est pas le genre de chose qu’un graphique de fournisseur peut truquer, et ce n’est pas le genre de chose dont ce blog aurait pu parler il y a quinze jours, lorsque la seule mesure existante de Ling-3.1-flash était la propre fiche de benchmark d’Ant : 1 673 Elo sur GDPval-AA v2.1, 75,16 sur FrontierSWE, 65,35 sur HealthBench Professional. Ces chiffres étaient de véritables affirmations d’un véritable laboratoire, mais non reproduites. Le 41 est d’une autre nature. C’est le premier chiffre de cette publication auquel un tiers peut être tenu.
Ce que le 41 mesure réellement
L'Artificial Analysis Intelligence Index v4.3.2 est un composite pondéré de dix évaluations : AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience et AA-LCR v1.1. Lire un composite isolément est une erreur, donc les lignes par évaluation comptent davantage que le score global :
• GDPval-AA — 1 621,75 pour Ling-3.1-flash contre 948,35 pour Ling-3.0-flash. Il s'agit du plus grand bond isolé de l'ensemble, et c'est sur lui que repose l'essentiel de la variation de l'indice.
• GDP.pdf — 0,100 all-pass, contre 0,054 auparavant. Toujours faible en termes absolus, mais presque un doublement.
• AA-LCR v1.1 raisonnement à long contexte — 0,83 contre 0,73 pour le prédécesseur, et au niveau de DeepSeek V4.1 Flash (Max) à 0,84.
• SciCode — 0,541 contre 0,420. Un gain en science du codage, pas un gain de qualité de chat.
• Raisonnement physique CritPt — 0,180, contre 0,017 auparavant. Dix fois le prédécesseur sur une petite base.
• AA-Omniscience — +2,22, contre −17,88 pour Ling-3.0-flash. Celui-ci est examiné ci-dessous, car il va à l'encontre du résultat principal.
Ling-3.0-flash n'a pas simplement perdu face à Ling-3.1-flash sur ces lignes ; il s'est effondré sur deux d'entre elles. Il a obtenu un score de 0,032 sur AutomationBench-AA et exactement 0,000 sur Terminal-Bench 4.0. C'est dans ce contexte que le 41 doit être lu — le prédécesseur était un modèle à poids ouverts, efficace et économique qui n'avait pratiquement aucune capacité d'agent sur terminal.

D'où venait le gain : le travail agentique, et non la conversation
Comparez les contributions à l’indice de Ling-3.1-flash à celles des deux modèles de la gamme Flash auxquels on le compare le plus souvent, et un schéma apparaît, que l’agrégat masque. DeepSeek V4.1 Flash (Max) affiche 39 sur le même indice et GLM 5.3 Flash affiche 42, de sorte que tous les trois se situent dans une fourchette de trois points. Mais ils y parviennent par des chemins différents.
• Travail en terminal agentique — Ling-3.1-flash 0,333 sur Terminal-Bench 4.0, DeepSeek V4.1 Flash (Max) 0,268, GLM 5.3 Flash 0,328.
• Travail agentique dans le monde réel — Ling-3.1-flash 1 621,75 Elo sur GDPval-AA, DeepSeek V4.1 Flash (Max) 1 600, GLM 5.3 Flash 1 646,86.
• AutomationBench-AA — Ling-3.1-flash 0,617, DeepSeek V4.1 Flash (Max) 0,689, GLM 5.3 Flash 0,604.
• Science du codage — Ling-3.1-flash 0,541 sur SciCode, DeepSeek V4.1 Flash (Max) 0,519, GLM 5.3 Flash 0,516.
L'interprétation étroite est que Ling-3.1-flash est compétitif sur les benchmarks agentiques et légèrement en avance sur SciCode. L'interprétation utile est qu'il est le plus fort des trois sur les deux mesures agentiques en terminal que la plupart des gens visent quand ils disent « peut-il piloter une boucle d'outils » — et qu'il est derrière les deux autres sur la mesure de fiabilité des connaissances. C'est une forme spécifique, pas une victoire générale, et cela vaut la peine d'être nommé avant que quiconque n'achète une charge de travail sur le seul chiffre de l'indice.
La facture qui arrive avec un modèle plus grand
Ling-3.0-flash était proposé au prix de 0,07 $ par million de tokens d’entrée et de 0,22 $ par million de tokens de sortie sur l’API d’Ant elle-même, et il était à poids ouverts sous licence MIT. Ling-3.1-flash n’est encore ni l’un ni l’autre. Artificial Analysis enregistre son coût d’utilisation à 0,30 $ par million d’entrées et 0,90 $ par million de sorties — avec un prix de 0,06 $ pour les hits de cache, soit une remise de 80 % sur l’entrée — mesuré par rapport à l’API d’InclusionAI elle-même en tant que fournisseur de service. Cela représente environ une multiplication par quatre du prix des entrées par rapport au modèle qu’il remplace, pour un gain de 21 points d’indice.
La pertinence de cet échange dépend entièrement de la charge de travail, et l'indice lui-même peut la chiffrer : exécuter les dix évaluations de l'Intelligence Index sur Ling-3.1-flash coûte environ 960 $ à ces tarifs, contre environ 477 $ pour DeepSeek V4.1 Flash (Max) et 280 $ pour GLM 5.3 Flash. La raison ne tient pas seulement à la grille tarifaire. Ling-3.1-flash est un raisonneur très bavard — il a brûlé 220 millions de tokens de sortie en parcourant l'indice, bien au-dessus de la médiane de sa catégorie de prix, et ses exécutions d'évaluation durent en moyenne environ 357 secondes par tâche, contre 285 secondes pour DeepSeek V4.1 Flash (Max) et 979 secondes pour GLM 5.3 Flash. Par tâche, Ling-3.1-flash coûte environ 0,99 $, contre 0,27 $ pour DeepSeek et 0,25 $ pour GLM 5.3 Flash.
Rien de tout cela n'est visible depuis le 41, et tout cela finit sur la facture. Un modèle peut gagner un indice et perdre un budget.
Les deux chiffres qui contredisent le titre
Le premier est la fiabilité des connaissances. Ling-3.1-flash obtient +2,22 sur AA-Omniscience, qui mesure si un modèle sait ce qu’il sait : les réponses correctes rapportent des points, les hallucinations en coûtent, et les refus ne coûtent rien. Son taux d’exactitude est de 29,1 % et son taux d’hallucination de 37,9 %. Comparé à ses pairs, c’est le profil le plus faible du groupe — GLM 5.3 Flash obtient +7,47 avec un taux d’hallucination de 27,6 %, et DeepSeek V4.1 Flash (Max) obtient −5,30 avec un taux d’hallucination stupéfiant de 96,5 % parmi les questions ayant reçu une réponse. Le score composite récompense Ling-3.1-flash pour la capacité qu’il démontre, non pour la fiabilité avec laquelle il la démontre, et un modèle qui invente un tiers de ce qu’il affirme a besoin d’un mécanisme de récupération autour de lui en production.
Artificial Analysis répertorie Ling-3.1-flash avec une fenêtre de contexte de 1 000 000 de jetons. Les propres supports de communication d'Ant citent eux aussi 1 M comme objectif. Mais la documentation destinée aux développeurs d'Ant, qui énumère les fenêtres de la famille modèle par modèle, attribue à Ling-3.0-flash une fenêtre native de 256 K extensible à 1 M, et ne comporte encore aucune entrée pour Ling-3.1-flash. La ligne distinctive de contexte long qui a effectivement été mesurée — AA-LCR à 0,83 — est un score de raisonnement sur contexte long, et non une mesure de la fenêtre réellement servie. Considérez 1 M comme le plafond déclaré et validez la fenêtre réellement fournie à l'aide de votre propre requête à contexte long avant de concevoir quoi que ce soit en fonction de celle-ci.
Comment il se compare sur la fiche technique
Le tableau dimension par dimension, sujet en premier, sur chaque ligne :
• Paramètres totaux — Ling-3.1-flash 560B vs DeepSeek V4.1 Flash (Max) 552B vs GLM 5.3 Flash 320B.
• Paramètres actifs par token — Ling-3.1-flash 25B vs DeepSeek V4.1 Flash (Max) 16B vs GLM 5.3 Flash 18B. Ling-3.1-flash active le plus de paramètres, ce qui explique en partie le niveau de son coût de service.
• Poids et licence — Ling-3.1-flash non publié (propriétaire, aucun texte de licence) vs DeepSeek V4.1 Flash (Max) ouvert sous MIT vs GLM 5.3 Flash ouvert sous MIT.
• Contexte déclaré — Ling-3.1-flash 1M vs DeepSeek V4.1 Flash (Max) 1M vs GLM 5.3 Flash 1M. Tous les trois revendiquent le même plafond ; seuls deux d'entre eux disposent d'un checkpoint téléchargeable pour le vérifier.
• Modalité — Ling-3.1-flash : texte en entrée, texte en sortie vs DeepSeek V4.1 Flash (Max) : texte et image en entrée vs GLM 5.3 Flash : texte, image et vidéo en entrée. C’est le seul axe sur lequel Ling-3.1-flash est tout simplement en retrait, et aucune ligne de benchmark ne compense cela.
• Prix sur l'API du fournisseur — Ling-3.1-flash 0,30 $ / 0,90 $ par million de tokens d'entrée / de sortie, contre DeepSeek V4.1 Flash (Max) 0,30 $ / 1,20 $, contre GLM 5.3 Flash 0,15 $ / 0,50 $.
• Score de l’indice — 41 vs 39 vs 42. Trois points d’écart dans une comparaison à trois ne constituent pas un classement ; c’est une égalité départagée par l’évaluation à laquelle la charge de travail du lecteur ressemble le plus.
Où vous pouvez l'appeler
Ling-3.1-flash n'est pas au catalogue d'OrcaRouter aujourd'hui — une vérification auprès de notre API publique de modèles pour le modèle sous InclusionAI renvoie « introuvable », et nous ne laisserons pas entendre le contraire. Il tourne actuellement sur l'API propre d'Ant et sur des plateformes tierces qui diffusent cette version, ce qui constitue l'étendue honnête de sa disponibilité. Ce qu'il vaut la peine de noter pour quiconque compare les trois modèles ci-dessus, c'est que les deux autres sont routables dès maintenant : DeepSeek V4.1 Flash et GLM 5.3 Flash figurent tous deux au catalogue d'OrcaRouter aux prix catalogue de leurs fournisseurs, avec zéro marge, derrière une seule clé API, avec bascule automatique entre eux. Si la comparaison ci-dessus indique que votre charge de travail se soucie davantage de la fiabilité des connaissances que du travail en terminal agentique, GLM 5.3 Flash est celui qu'il faut essayer — et vous pouvez l'essayer face à DeepSeek V4.1 Flash avec la même clé, sans second contrat ni une ligne de nouveau code client.
Ce que le 41 change, et ce qu'il ne change pas
Ce que cela change, c’est le statut de cette version. Ling-3.1-flash n’est plus une spécification accompagnée d’un graphique de fournisseur ; c’est un modèle dont la position est mesurée de manière indépendante, et cette position constitue un véritable bond générationnel en capacités agentiques par rapport à Ling-3.0-flash — le genre de saut qui découle d’un changement de conception plutôt que d’une augmentation de la puissance de calcul selon la même recette. Ce que cela ne change pas, c’est tout ce qui touche à l’approvisionnement. Les poids restent fermés, la licence reste non rédigée, la modalité reste uniquement textuelle, et le prix est environ quatre fois celui de son prédécesseur pour un gain qui se concentre sur les tâches d’agent et de terminal.
Si votre travail consiste en boucles d'agents, en pilotage d'outils et en longues chaînes d'outils, le 41 est le chiffre le plus significatif publié à ce jour au sujet de ce modèle, et il mérite un examen sérieux tant que la disponibilité s'élargit encore. Si votre travail est multimodal, ou s'il s'agit de répondre à des questions où la connaissance est critique, ou d'inférence à grand volume sensible au budget, le 41 n'atteint pas votre problème — et GLM 5.3 Flash, déjà routable et déjà ouvert sous MIT à la moitié du prix de sortie, est le modèle le mieux positionné des trois. L'indice vous dit où se situe Ling-3.1-flash. Il ne vous dit pas si cela doit vous importer, et cette question trouve sa réponse dans ce que vous construisez.


Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
