
Ling-3.0-flash : Ce que nous savons désormais sur le MoE à poids ouverts de niveau rapide d'Ant Group
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Le laboratoire InclusionAI d’Ant Group a officiellement publié Ling-3.0-flash — annoncé le 24 juillet 2026 et open-sourcé sous licence MIT le 7 août — et la donne a bien changé depuis l’aperçu que nous avions publié ici en juillet. Il s’agit d’un modèle natif hybride de raisonnement à mélange d’experts, avec 124B de paramètres au total et seulement 5,1B actifs par jeton, conçu comme le niveau rapide et économique de la famille Ling. Les deux chiffres qui ont tout changé : Artificial Analysis lui attribue désormais un score de 38 à l’indice d’intelligence (soit 24 points de plus que la génération précédente du niveau rapide, Ling-2.6-flash) et le place sur la frontière de Pareto des poids ouverts pour l’intelligence par rapport au nombre total de paramètres. Les poids sont disponibles sur Hugging Face et ModelScope.
Quand nous avons couvert ce modèle pour la première fois le 24 juillet, le résumé honnête était : API uniquement, pas de poids, pas de déclaration de licence, pas de benchmark indépendant. Ces quatre affirmations sont désormais obsolètes. Ant a open-sourcé les poids sous licence MIT le 7 août, et Artificial Analysis a depuis publié une évaluation indépendante complète. Cette mise à jour révise le brief original en conséquence — les étiquettes « non vérifié » qui dominaient l’article de juillet s’appliquent désormais à un ensemble beaucoup plus restreint de déclarations, principalement les chiffres de vitesse de pointe d’Ant, plutôt qu’au modèle dans son ensemble.
En bref.Ling-3.0-flash est le MoE open-weight de la gamme rapide d’Ant Group : 124B au total / 5.1B actifs, licence MIT, contexte natif de 256K (262K tel que servi). Artificial Analysis lui attribue un indice d’intelligence de 38 — en hausse de 24 points par rapport à la génération précédente Ling-2.6-flash et situé sur la frontière de Pareto des poids ouverts pour l’intelligence par rapport aux paramètres totaux — avec un débit de sortie mesuré d’environ 368 tokens/seconde. Les poids sont disponibles sur Hugging Face et ModelScope sous licence MIT. Toujours annoncés uniquement par le fournisseur : l’affirmation d’un débit maximal de 1 100+ tokens/seconde, la valeur d’un temps avant le premier token inférieur à 100 ms, et le tableau des benchmarks de la fiche modèle. Les prix de l’API first-party sont de $0.075 en entrée / $0.22 en sortie par million de tokens (80 % de réduction en cas de succès de cache) ; l’offre gratuite de lancement s’est terminée le 3 août.
Points clés
• C'est l'option rapide/économique, pas le modèle phare. Le modèle phare de la génération précédente, avec 1 000 milliards de paramètres, reste le plus grand modèle d'InclusionAI ; Ling-3.0-flash est son petit frère, plus rapide, destiné au texte à grand volume et à l'appel d'outils.
• Les poids sont désormais ouverts sous licence MIT. Les poids ont été publiés sur Hugging Face (inclusionAI/Ling-3.0-flash) et ModelScope le 7 août sous licence MIT — un revirement par rapport à la situation « API uniquement » de juillet.
• Il a enfin un score indépendant. Artificial Analysis mesure un indice d'intelligence de 38, en hausse de 24 par rapport à Ling-2.6-flash, et place le modèle sur la frontière de Pareto des poids ouverts pour l'intelligence par rapport au nombre total de paramètres.
• La vitesse est en partie mesurée maintenant. AA atteint environ 368 tokens/sec en sortie et un délai avant le premier token d'environ 1,98 s ; le chiffre phare d'Ant de plus de 1 100 tokens/sec en pic reste encore une simple annonce du fournisseur.
• Les prix sont fixés, et le lancement gratuit est terminé. L'API de première partie affiche 0,075 $ en entrée / 0,22 $ en sortie par million de jetons, avec une remise de 80 % en cas de cache hit ; le palier gratuit de lancement a pris fin le 3 août.
• C'est un élément d'une famille de trois modèles. InclusionAI divise sa gamme en Ling (MoE de texte et d'outils à usage général, ce modèle), Ring (raisonnement) et Ming (multimodal).
Une note sur la façon de lire cette mise à jour : il s'agit d'une révision de l'aperçu du 24 juillet, rédigée après l'ouverture des poids et l'apparition des premiers scores indépendants. Chaque spécification, benchmark et prix ci-dessous est étiqueté selon sa source. Là où Ant Group est la seule source — les affirmations sur la vitesse de pointe et le tableau des benchmarks de la fiche modèle — nous le disons clairement. Là où Artificial Analysis a mesuré quelque chose indépendamment, nous le citons.
Ce que nous savons réellement
L'architecture est désormais entièrement documentée sur la fiche du modèle. Ling-3.0-flash utilise une pile d'attention hybride-linéaire native — attention Kimi Delta (KDA) et couches MLA gated en alternance selon un ratio 5:1 (35 KDA + 7 MLA), avec un gating diagonal à grain fin pour KDA — par-dessus un MoE sparse 1/64 (512 experts routés, 8 activés par jeton). C'est ainsi qu'il atteint 124B de paramètres totaux avec seulement 5,1B actifs. La fenêtre de contexte est de 256K nativement, servie à 262 144 jetons dans les recettes d'inférence, et Ant affirme que l'architecture passe à l'échelle jusqu'à 1M. La longueur de sortie maximale n'est pas divulguée. Le modèle est textuel uniquement, avec prise en charge de l'appel d'outils ; l'entrée multimodale réside dans la ligne Ming distincte.
Deux formats de poids sont publiés par le laboratoire — BF16 (environ 255 Go) et FP8 (environ 128 Go) — et des variantes quantifiées par la communauté sont déjà liées depuis la fiche du modèle. Les recettes de déploiement du laboratoire ciblent SGLang et vLLM.
Disponibilité : open weights sous licence MIT
Le 7 août, l’équipe InclusionAI d’Ant Group a publié les poids en open source sous licence MIT sur Hugging Face (inclusionAI/Ling-3.0-flash) et ModelScope. Il s’agit d’une licence permissive, utilisable commercialement — la même que celle sous laquelle Ling 2.0 et Ling 2.6 ont été distribués — et cela signifie que vous pouvez auto-héberger, affiner et déployer Ling-3.0-flash vous-même plutôt que de le louer via une API. Le modèle est également appelable via l’API développeur d’Ant et plusieurs plateformes tierces. Pour un modèle de niveau rapide à ce prix, la question la plus intéressante est de savoir s’il faut l’auto-héberger (FP8 tourne dans environ 128 Go) ou rester sur une API.

Scores indépendants : un indice d'intelligence AA de 38.
Le changement le plus important par rapport au post de juillet est que des chiffres indépendants existent désormais. Artificial Analysis a une page pour Ling-3.0-flash et le mesure à 38 sur l’Intelligence Index — 24 points au-dessus de la génération précédente du niveau rapide, Ling-2.6-flash (14), et au même niveau que MiMo-V2.5 et Qwen 3.6 27B tout en activant une fraction de leurs paramètres. Artificial Analysis place également le modèle sur la frontière de Pareto des poids ouverts pour l’intelligence par rapport aux paramètres totaux : aucun modèle à poids ouverts avec moins de paramètres totaux n’obtient un score plus élevé. Le leader du niveau rapide à poids ouverts sur AA, DeepSeek V4 Flash, obtient toujours un score plus élevé (Index 52 à l’effort de raisonnement maximal).
Les résultats agentiques et en contexte long sont également solides en tendance. Sur la suite Banking τ3-Bench d'AA, Ling-3.0-flash obtient 27 %, deuxième parmi les modèles open-weights de niveau flash, derrière DeepSeek V4 Flash (39 %). Sur GDPval-AA v2, il atteint un Elo de 1108, contre 545 pour Ling-2.6-flash. Ant a entraîné le modèle sur plus de 10 000 environnements interactifs (selon les données du fournisseur) et le présente comme un nœud d'exécution pour les workflows d'agents — rapide, économique et jetable, le raisonnement lourd étant laissé à un modèle phare plus grand.
Une réserve concernant les sources : le tableau de référence sur la fiche modèle d’Ant — SWE-Bench Pro 56.6, SWE-bench Multilingual 72.4, MathArena AIME 2026 93.2, HLE 22.7 — est rapporté par le fournisseur et n’a pas encore été reproduit de manière indépendante. Traitez-le comme les propres affirmations du laboratoire, dans la même catégorie que les chiffres de vitesse maximale ci-dessous.
Vitesse : mesurée, puis annoncée.
L'histoire de la vitesse est désormais deux histoires distinctes. De manière indépendante, Artificial Analysis mesure environ 368 tokens/sec en sortie et un délai avant premier token d'environ 1,98 s sur l'API propriétaire — véritablement rapide pour un MoE à 5,1B de paramètres actifs, et suffisant pour placer le modèle près du sommet de sa catégorie en vitesse. Parallèlement, Ant Group revendique un débit de sortie moyen supérieur à 1 100 tokens/sec sur des configurations GPU spécifiées et un délai avant premier token inférieur à 100 ms, avec une couche de cache hiérarchique au niveau du cluster construite sur SGLang HiCache et Mooncake. Ce deuxième ensemble de chiffres provient uniquement du fournisseur — mesuré sur du matériel et des configurations de lots contrôlés par Ant, sans ré-exécution indépendante publiée. Pour la planification, utilisez le chiffre d'AA ; considérez les 1 100+ tokens/s comme un plafond marketing à vérifier sur votre propre charge de travail.

Prix : pas cher, et la promo est terminée.
Artificial Analysis répertorie l'API propriétaire à 0,075 $ par million de jetons d'entrée et 0,22 $ par million de sortie, avec des hits de cache à 0,015 $ (−80 %) — tous les prix fixés par le fournisseur. Le niveau gratuit de lancement (500 000 jetons gratuits par jour, accès API gratuit) s'est terminé le 3 août, et Ant a proposé une remise temporaire de 75 % sur son Ling Studio jusqu'au 31 août 2026, après quoi les prix catalogue s'appliquent. Même au prix catalogue complet, 0,075 $/0,22 $ place Ling-3.0-flash fermement dans la catégorie bon marché pour un modèle avec un indice de 38.
À des prix aussi bas, le coût de changement importe plus que le prix par jeton. OrcaRouter existe pour rendre ce changement peu coûteux : une API pour plus de 200 modèles, les prix catalogue des fournisseurs transmis tels quels avec 0 % de marge, et une bascule automatique entre fournisseurs — ainsi, lorsqu'un modèle nouvellement ouvert comme celui-ci semble bon sur le papier, vous pouvez le tester sur votre charge de travail réelle sans second contrat, et revenir à un autre modèle derrière la même clé s'il ne répond pas aux attentes sur une tâche spécifique.
La famille Ling / Ring / Ming
Ling-3.0-flash n'existe pas isolément — InclusionAI organise ses versions en trois familles nommées, chacune destinée à un usage différent. Ling est la gamme MoE à usage général pour la génération de texte et l'appel d'outils au quotidien, et Ling-3.0-flash se situe à son extrémité rapide/économique, un cran en dessous du fleuron à 1 000 milliards de paramètres de la génération précédente. Ring est la gamme axée sur le raisonnement, conçue pour le raisonnement en chaîne multi-étapes. Ming est la gamme multimodale. Si votre tâche nécessite un raisonnement plus poussé ou une entrée d'images, le bon modèle InclusionAI n'est probablement pas Ling-3.0-flash — il est conçu pour le volume et la vitesse dans le domaine du texte et des outils.
À qui cela s’adresse : trois scénarios
1. Pipelines de texte ou d'appel d'outils à haut volume et sensibles à la latence
C’est le terrain de jeu du modèle. Avec un Index indépendant de 38, une licence MIT et environ 368 tok/s mesurés, le pari sur la catégorie rapide est désormais testable plutôt qu’hypothétique — vous pouvez exécuter votre propre jeu d’évaluation dessus, ou récupérer les poids et les auto-héberger. Ne construisez simplement pas autour du plafond de 1 100+ tok/s du fournisseur avant de l’avoir mesuré sur votre charge de travail.
2. Équipes qui veulent un long contexte à petit budget
Un contexte natif de 256K (262K servis), avec un chemin annoncé vers 1M, à 0,075 $/0,22 $, est une combinaison attrayante pour les travaux à forte composante de récupération ou de traitement de documents. Les chiffres de contexte long de la fiche du modèle sont rapportés par le fournisseur ; il convient donc de le présélectionner par rapport aux options de contexte long éprouvées et de vérifier sur votre propre corpus avant de vous engager.
3. Observateurs suivant le paysage MoE de la Chine et la feuille de route d'InclusionAI
La question de juillet — InclusionAI resterait-elle ouverte ? — a maintenant une réponse : oui, MIT, et rapide. Le positionnement de Ling-3.0-flash sur la frontière de Pareto AA à 5,1B actifs constitue un point de référence pour quiconque suit comment les laboratoires chinois rivalisent en matière d’efficacité plutôt que sur le nombre brut de paramètres.
Qu’est-ce qui reste encore non vérifié ?
Une liste courte, maintenant que les grandes lacunes sont comblées. Les affirmations de vitesse de pointe du fournisseur (1 100+ tok/s, TTFT inférieur à 100 ms) n'ont fait l'objet d'aucune nouvelle mesure indépendante. Le tableau de référence de la fiche modèle est fourni par le fournisseur. Les variantes FP4/INT4 et le chemin de déploiement sur un seul DGX-Spark sont indiqués par le fournisseur. Et en matière de connaissances, l'indice Omniscience d'AA montre que l'amélioration par rapport à la génération précédente est due en grande partie à l'abstention — les hallucinations ont chuté (97 % → 44 %) tandis que la précision n'a que légèrement augmenté (16 % → 18 %) — ne confondez donc pas le bond de l'indice en titre avec une avancée généralisée des connaissances.
Quand ne pas l'utiliser
Évitez Ling-3.0-flash pour les travaux multimodaux — c’est la gamme Ming. Évitez-le si vous avez besoin d’un modèle de raisonnement lourd plutôt que d’un exécuteur rapide — c’est le domaine de Ring. Si vous prévoyez de vous auto-héberger, prévoyez le vrai matériel : BF16 nécessite environ 255 Go, FP8 environ 128 Go. Et si une affirmation compte pour vous, vérifiez-la — les chiffres de vitesse maximale et de long contexte sont ceux d’Ant jusqu’à ce qu’un laboratoire indépendant les re-teste.
FAQ
Est-ce que Ling-3.0-flash a des poids ouverts ?
Oui. Les poids ont été publiés en open source le 7 août sous licence MIT, sur Hugging Face (inclusionAI/Ling-3.0-flash) et ModelScope. Il s'agit d'une licence permissive, utilisable commercialement — la même que celle sous laquelle Ling 2.0 et Ling 2.6 ont été distribués.
Comment se comporte Ling-3.0-flash sur les benchmarks ?
Artificial Analysis mesure un indice d'intelligence de 38, en hausse de 24 points par rapport à Ling-2.6-flash, et place le modèle sur la frontière de Pareto des poids ouverts pour l'intelligence par rapport au nombre total de paramètres. Le tableau de référence sur la fiche modèle d'Ant (par exemple SWE-Bench Pro 56.6) est fourni par le vendeur et n'a pas été reproduit de manière indépendante.
À quelle vitesse est-ce vraiment ?
Artificial Analysis mesure un débit d'environ 368 tokens/sec en sortie, avec un temps jusqu'au premier jeton d'environ 1,98 s sur l'API propriétaire. Ant revendique un débit de pointe supérieur à 1 100 tokens/sec et un TTFT inférieur à 100 ms sur des configurations GPU spécifiées — il s'agit de chiffres du fournisseur, sans nouvelle mesure indépendante.
Combien coûte Ling-3.0-flash ?
AA indique l'API first-party à 0,075 $ pour 1 million de jetons d'entrée et 0,22 $ pour 1 million de sortie, avec une remise de 80 % en cas de cache hit. Le niveau gratuit de lancement a pris fin le 3 août, et une période de réduction temporaire de 75 % sur Ling Studio court jusqu'au 31 août 2026.
Quelle est la taille de la fenêtre de contexte ?
256K nativement, servi à 262 144 jetons ; Ant affirme que l'architecture peut évoluer jusqu'à 1M. La longueur maximale de sortie n'est pas divulguée.
Quelle est la différence entre Ling, Ring et Ming ?
Ling est la gamme MoE polyvalente d’InclusionAI pour le texte et l’appel d’outils, et Ling-3.0-flash se situe à son extrémité rapide/économique. Ring est la gamme axée sur le raisonnement. Ming gère les tâches multimodales. Ce sont des familles distinctes pour différents usages, et non des niveaux d’un même modèle.
Ling-3.0-flash est-il le même que le précédent fleuron 1T ?
Non. Ling-3.0-flash est la version rapide plus récente et plus petite (124B au total / 5,1B actifs). Le modèle phare de la génération précédente, doté de 1T de paramètres, reste le plus grand modèle.
Devrais-je utiliser Ling-3.0-flash en production aujourd'hui ?
Plus défendable qu'en juillet, maintenant qu'il existe un score indépendant et une licence MIT. Exécutez d'abord votre propre ensemble d'évaluation, vérifiez les déclarations de vitesse du fournisseur par rapport à votre charge de travail, puis choisissez entre l'API et l'auto-hébergement (FP8 fonctionne dans environ 128 Go). Les chiffres restants, fournis uniquement par le vendeur, sont assez restreints pour qu'on puisse planifier en conséquence.
En résumé
Ling-3.0-flash est passé des « fiches techniques et déclarations du fournisseur » aux « poids ouverts et évaluations indépendantes » en deux semaines. Avec un AA Intelligence Index de 38 pour 5,1 milliards de paramètres actifs — à la frontière de Pareto des poids ouverts, sous licence MIT, à 0,075 $/0,22 $ — c'est l'un des modèles à poids ouverts les plus efficaces que vous puissiez viser en ce moment, et l'un de ceux que vous pouvez réellement exécuter vous-même. Les réserves sont plus étroites qu'auparavant : les chiffres de vitesse de pointe et de fiche technique restent ceux d'Ant jusqu'à ce qu'un laboratoire indépendant les reproduise. Pour les textes à grand volume et l'appel d'outils à ce prix, il a mérité une véritable évaluation.

