Carte vedette éditoriale générée, intitulée « Ling-3.1-flash vs Ling-3.0-flash », avec le sous-titre « L'un est téléchargeable dès aujourd'hui. L'autre n'est qu'une phrase dans un article de presse. » Deux colonnes de comparaison : « Ling-3.1-flash (annoncé) » liste « ~560B au total / ~25B actifs », « contexte jusqu'à 1M de tokens » et « pas de poids, pas de licence » ; « Ling-3.0-flash (livré) » liste « 124B au total / 5.1B actifs », « contexte servi de 262 144 tokens » et « poids MIT sur Hugging Face ».
Guides & Insights

Ling-3.1-flash vs Ling-3.0-flash : ce que changent réellement une fenêtre de 1 M de tokens et 4,5 fois plus de paramètres

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La famille Ling d'Ant Group accueille un nouveau niveau rapide, et cette fois, son âge se compte en une seule phrase. Ling-3.1-flash a été annoncé le 30 septembre 2026 — environ 560 milliards de paramètres au total, près de 25 milliards actifs par token, une fenêtre de contexte annoncée jusqu'à 1 million de tokens, et une formule toute faite accolée à l'annonce : « Nous prévoyons d'ouvrir le modèle en open source prochainement. » Le modèle qu'il remplace au sommet de la gamme rapide, Ling-3.0-flash, est un tout autre animal à tous égards : 124 milliards de paramètres au total, 5,1 milliards actifs par token, un contexte servi de 262 144 tokens, des poids sous licence MIT sur Hugging Face depuis le 7 août, et un indice d'intelligence indépendant Artificial Analysis de 20. L'un de ces modèles, vous pouvez le télécharger dès aujourd'hui. L'autre, vous ne pouvez qu'en lire la description. Les comparer est réellement utile, mais à condition que la comparaison commence par là.

L’arithmétique des gros titres est simple et légèrement trompeuse. Ling-3.1-flash représente environ 4,5× le nombre total de paramètres de Ling-3.0-flash et environ 4,9× le nombre de paramètres actifs — 25B contre 5,1B par token. Une lecture naïve dit « modèle beaucoup plus grand, donc modèle beaucoup plus intelligent ». La lecture plus attentive est qu’Ant a à peu près préservé le taux de parcimonie tout en augmentant la taille du corps, et ce que cela vous apporte, c’est de la capacité, pas nécessairement une profondeur de raisonnement par token : un modèle qui achemine 25B de ses 560B à travers chaque token fournit plus de travail par token qu’un modèle qui en achemine 5,1B, mais il paie aussi environ cinq fois plus de calcul par token pour ce faire. Le résultat de cet arbitrage dépend entièrement de la capacité de l’architecture d’Ant à gérer efficacement les paramètres supplémentaires — et c’est une question à laquelle l’annonce ne répond pas.

Les deux modèles, côte à côte

Placez les faits publiés côte à côte, et les générations se séparent nettement. Chaque ligne ci-dessous indique ce qu’Ant ou un évaluateur indépendant a réellement publié ; lorsqu’un nombre manque, c’est que personne ne l’a publié.

• Paramètres totaux — Ling-3.1-flash : ~560B (fournisseur). Ling-3.0-flash : 124B (fiche du modèle).

• Paramètres actifs par token — Ling-3.1-flash : ~25 B (fournisseur). Ling-3.0-flash : 5,1 B (fiche du modèle).

• Fenêtre de contexte — Ling-3.1-flash : jusqu’à 1M de tokens (fournisseur). Ling-3.0-flash : 256K natif, servi à 262 144 (fiche modèle et recettes d’inférence).

• Poids et licence — Ling-3.1-flash : non publiés ; aucun dépôt, aucune licence (vérifié le 30 septembre et à nouveau le 1er octobre 2026). Ling-3.0-flash : MIT, sur Hugging Face sous inclusionAI/Ling-3.0-flash et sur ModelScope depuis le 7 août 2026.

• Formats de poids — Ling-3.1-flash : aucun disponible. Ling-3.0-flash : BF16 (~255GB) et FP8 (~128GB) du labo, plus les quants de la communauté.

• Provenance des benchmarks — Ling-3.1-flash : entièrement déclarée par le fournisseur, aucun harnais public, aucun poids pour relancer les évaluations. Ling-3.0-flash : évalué indépendamment par Artificial Analysis avec un indice d’intelligence de 20, accompagné de la vitesse de sortie mesurée et du volume de génération de tokens publiés.

• Disponibilité — Ling-3.1-flash : uniquement le produit Ling Studio d'Ant. Ling-3.0-flash : auto-hébergeable, et appelable via l'API développeur d'Ant.

Headless capture of the Artificial Analysis model page for Ling 3.0 Flash. The page shows the model's stat strip with text input and text output, a 262k-token context window, 5.1B active parameters, and a written summary stating that Ling 3.0 Flash scores 20 on the Artificial Analysis Intelligence Index against a median of 8, generated 260M tokens during evaluation, is priced at $0.07 per 1M input tokens and $0.22 per 1M output tokens, and runs at 325 tokens per second.

À quoi sert probablement la capacité supplémentaire

La propre description en une ligne de Ling-3.1-flash par Ant est l’élément le plus instructif de cette sortie. L’application Ling Studio le positionne pour les « agents polyvalents, la recherche, le travail de bureau courant et le développement logiciel/de code » — un cadrage orienté travail de bureau et agents, et non un cadrage axé sur les benchmarks de raisonnement. Cela est cohérent avec l’organisation de la famille : Ling est la gamme polyvalente de texte et d’outils, Ring est la gamme de raisonnement, et Ming prend en charge le multimodal. Ling-3.0-flash occupait le même créneau une génération plus tôt, et il constituait explicitement le niveau rapide et économique plutôt que le modèle phare.

Interprétez cette montée en puissance sous cet angle, et tout devient logique. Les charges de travail agentiques et d’appel d’outils sont longues, répétitives et gourmandes en contexte : une seule boucle d’agent peut consommer des dizaines de milliers de tokens de sorties d’outils accumulées avant d’entreprendre une action, si bien qu’une fenêtre de 1 M de tokens est une exigence fonctionnelle plutôt qu’une fioriture de fiche technique. Augmenter le nombre total de paramètres tout en conservant une grande fraction active, c’est ainsi que l’on ajoute des connaissances du monde et de la profondeur de suivi des instructions à un modèle qui doit encore être assez rapide pour tenir dans une boucle. Ant ne construit pas ici un modèle phare plus lent et plus intelligent ; il construit un palier rapide plus grand.

Le contre-argument, c’est le coût, et c’est le même calcul qui arrive par l’autre bout. La capacité supplémentaire n’est pas gratuite au moment de l’inférence — elle se paie sur chaque token, et Ant n’a publié absolument aucun prix pour Ling-3.1-flash : aucune grille tarifaire d’API, aucune remise sur le cache, rien de comparable aux 0,075 $/0,22 $ par million de tokens que la génération précédente indique. C’est le chiffre manquant qui déciderait de cette comparaison, et il manque.

Benchmarks, et qui les a exécutés

Ling-3.1-flash arrive avec trois scores qui semblent solides pris isolément : 1 673 Elo sur GDPVal-AA v2.1, 75,16 sur FrontierSWE et 65,35 sur HealthBench Professional. Tous trois sont propres à Ant, tirés de l’annonce, et aucun n’a été reproduit par un laboratoire externe. La conséquence pratique est qu’ils peuvent être comparés aux chiffres d’autres fournisseurs, mais pas à des chiffres indépendants — et l’Intelligence Index de 20 points d’Artificial Analysis pour Ling-3.0-flash est un chiffre indépendant sur une échelle différente, donc les mettre côte à côte reviendrait à comparer une mesure à une affirmation. Il n’existe pas de page Ling-3.1-flash sur Artificial Analysis au moment de la rédaction.

Une note de bas de page sur le propre graphique d'Ant mérite d'être signalée en soi. La fiche indique que le résultat HealthBench Professional a été évalué dans « l'environnement AQ » et que les capacités de Ling-3.1-flash en matière de santé ne peuvent actuellement être expérimentées que dans AQ. Aucune documentation publique n'explique ce qu'est AQ. Un score phare assorti d'un qualificatif d'environnement non nommé n'est pas quelque chose qu'une équipe externe peut reproduire, même une fois les poids disponibles.

Lequel utiliser vraiment cette semaine

La question générationnelle se résout différemment selon ce dont vous avez besoin aujourd’hui, et pour presque tout le monde, la réponse à l’instant présent n’est pas le modèle plus récent.

Si vous avez besoin de quelque chose cette semaine, Ling-3.0-flash est le seul des trois qui existe sous une forme utilisable : des poids que vous pouvez auto-héberger, FP8 si vous voulez l'empreinte plus réduite, une tarification de l'API first-party publiée, et un score indépendant qui vous dit ce que vous obtenez. C'est un modèle vraiment bon dans sa catégorie — l'évaluation indépendante l'a placé sur la frontière de Pareto des poids ouverts pour l'intelligence par rapport au nombre total de paramètres, et a attribué une note élevée à sa vitesse, avec la réserve qu'il est inhabituellement verbeux et a généré environ 260 M de tokens au cours de son évaluation, contre une médiane proche de 100 M.

Si vous planifiez pour les six prochains mois, Ling-3.1-flash indique la direction à suivre et n’est pas encore un composant. Les points précis à surveiller avant qu’il n’en devienne un : si les poids sont réellement ouverts et sous quelle licence, si la fenêtre servie est réellement de 1M ou une extension d’un contexte natif plus court, combien il coûte par million de tokens, et si un laboratoire indépendant reproduit le 75.16 sur FrontierSWE. Que l’un de ces éléments se concrétise serait une raison de relancer la comparaison. Aucun ne s’est concrétisé.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Bar-chart panels cover GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge, with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment.

Où cela s'inscrit dans une pile de routage

Aucun modèle Ling n'est dans notre catalogue aujourd'hui — Ling-3.0-flash, Ling-3.0-flash-VL et Ling-3.1-flash renvoient tous not-found auprès de l'API de modèles OrcaRouter, donc la réponse honnête à « puis-je l'appeler via vous » est non, pour l'instant. Ce à quoi une couche de routage est réellement utile dans une semaine comme celle-ci, c'est l'autre moitié du problème : les modèles par rapport auxquels vous évalueriez un candidat. Claude Opus 5, GPT-5.6 Sol et DeepSeek-V4.1-Flash sont tous des routes actives au prix catalogue du fournisseur, sans aucune majoration, et un routeur qui les tient derrière une seule clé avec basculement automatique est la façon de garder un banc d'évaluation pointé sur une cible mouvante sans maintenir quatre intégrations. Quand les poids de Ling-3.1-flash arriveront et que la licence sera lisible, cela donne aussi la forme de la décision : ajouter un point de terminaison, pas reconstruire la pile.

Le résumé générationnel est court. Ling-3.0-flash est un modèle livré, évalué indépendamment et sous licence permissive, qui peut être auto-hébergé dès aujourd'hui. Ling-3.1-flash est une promesse plus grande, à contexte plus long et plus coûteuse à exécuter, qu'Ant n'a pas encore livrée sous une forme utilisable par un développeur. Considérer le second comme une mise à niveau du premier est l'erreur que cette version invite à commettre, et les chiffres ne l'étayent pas encore.

Generated two-lane information card. Top lane headed "Independently measured" holds "Ling-3.0-flash — AA Intelligence Index 20 (v4.3)" and "Ling-3.0-flash — 325 tokens/sec, 260M tokens generated". Bottom lane headed "Vendor-reported only" holds "Ling-3.1-flash — 1,673 Elo GDPval-AA v2.1", "Ling-3.1-flash — 75.16 FrontierSWE" and "Ling-3.1-flash — 65.35 HealthBench Professional (AQ environment, undefined)".