
Ling-3.0-flash : Ce que nous savons vraiment sur le nouveau Fast-Tier MoE d'Ant Group (et ce que nous ne savons pas)
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 par million de tokens · 56 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligence69Code
- qwenNOUVEAUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 199 tok/s
- orcaNOUVEAUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNOUVEAUAnthropic: Claude Opus 52026-07-2461Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2150Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1651Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1557Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligence77Code
- grokxAI: Grok 4.52026-07-0854Intelligence72Code
- tencentTencent: Hy32026-07-0641Intelligence59Code
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligence42Code
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligence39Code
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligence72Code
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligence52Code57Maths
- z-aiZ.ai: GLM 5.22026-06-1651Intelligence69Code60Maths
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligence61Code61Maths
Le laboratoire InclusionAI d'Ant Group a publié Ling-3.0-flash aux alentours du 23 juillet 2026 — ce qui signifie qu'il n'a que quelques jours au moment de ce résumé. Il s'agit d'un modèle de langage à mélange d'experts (MoE) avec 124B de paramètres totaux et environ 5,1B actifs par token (soit un ratio de parcimonie d'environ 24:1), conçu pour la génération de texte et l'appel d'outils. Il est positionné comme le niveau rapide et économique de la famille Ling ; la place phare revient toujours au modèle beaucoup plus grand Ling-2.6-1T (1T total / 63B actifs). L'accès aujourd'hui se fait uniquement via API — via le portail développeur d'Ant, via OpenRouter sous le nom inclusionai/ling-3.0-flash, et via ZenMux.
Voilà l'image complète confirmée, et il vaut la peine d'être honnête sur la raison pour laquelle ce rapport est plus prudent qu'un article de modèle typique. Il n'y a pas de poids Hugging Face, pas de dépôt GitHub pour Ling-V3, et aucune mention de licence claire — un véritable changement par rapport à Ling 2.0 et Ling 2.6, qui étaient tous deux fournis sous forme de poids ouverts sous licence MIT. Il n'y a également aucune donnée de référence indépendante : Artificial Analysis, l'évaluateur tiers le plus souvent cité pour cette classe de modèles, n'a pas encore de page pour celui-ci. Chaque chiffre de performance et de vitesse en circulation en ce moment provient d'Ant Group lui-même.
En résumé. Ling-3.0-flash est un modèle MoE 124B/5.1B actifs de InclusionAI d'Ant Group, publié ces derniers jours, uniquement via API, sans poids sur Hugging Face et avec une licence non confirmée. Les affirmations du fournisseur — débit de pointe de 1000 tokens/s, temps jusqu'au premier token inférieur à 100 ms — n'ont encore fait l'objet d'aucune vérification indépendante, et il n'y a pas de score Artificial Analysis pour ce modèle spécifique. La génération précédente, Ling-2.6-flash, a obtenu un indice d'intelligence Artificial Analysis de seulement 14 (Ling-2.6-1T a obtenu 26), ce qui constitue un contexte utile mais ne remplace pas la capacité réelle du 3.0-flash. La tarification (¥0,40 en entrée / ¥1,20 en sortie par million de tokens, actuellement gratuite pendant la semaine de lancement avec 500 000 tokens gratuits par jour) est explicitement promotionnelle et susceptible d'évoluer. Considérez tout ceci comme un aperçu, pas un verdict.
Points clés
• C'est le niveau rapide/peu coûteux, pas le modèle phare.Ling-2.6-1T reste le plus grand modèle d'InclusionAI ; Ling-3.0-flash est un modèle frère plus petit, moins cher et plus rapide, destiné aux utilisations à grand volume.
• Aucun benchmark indépendant n'existe encore.Artificial Analysis n'a pas de page pour Ling-3.0-flash. Les seuls chiffres publics sont ceux d'Ant Group, et les documents d'Ant ne montrent actuellement aucun tableau de benchmark pour ce modèle.
• Les revendications de vitesse sont propres au fournisseur. Un pic de 1000 jetons/s et un délai inférieur à 100 ms pour le premier jeton proviennent d'Ant Group, sans test de débit tiers pour confirmer l'un ou l'autre chiffre.
• Pas de poids ouverts, licence non confirmée. Il n'y a pas de dépôt Hugging Face ni de projet GitHub Ling-V3. Les générations précédentes de Ling étaient sous licence MIT ; on ne sait pas si la version 3.0-flash suivra.
• Le prix est une promotion de lancement. ¥0.40/¥1.20 pour 1M de tokens sur la plateforme d'Ant est actuellement exonéré, avec 500k tokens gratuits par jour et une inscription gratuite sur OpenRouter — rien de tout cela ne doit être considéré comme permanent une fois la promotion terminée.
• C'est un élément d'une famille de trois modèles.InclusionAI divise sa gamme en Ling (MoE à usage général, ce modèle), Ring (axé sur le raisonnement) et Ming (multimodal).
Note sur la façon de lire ce document :chaque spécification, benchmark et prix ci-dessous est étiqueté par source. Lorsque Ant Group est la seule source, nous le disons clairement et nous nuançons en conséquence. Lorsque les modèles Ling de génération précédente ont des scores indépendants, nous les citons pour le contexte — pas comme un substitut aux données sur Ling-3.0-flash lui-même, qui n’existent pas encore. Il faudra probablement faire un suivi une fois que les tests indépendants auront rattrapé leur retard.
Ce que nous savons réellement
Architecturalement, Ling-3.0-flash est un modèle MoE creux : 124B paramètres au total, avec environ 5,1B actifs sur un token donné, ce qui le rend économique et rapide à exécuter par rapport à sa taille totale. La fenêtre de contexte est de 256K tokens selon la documentation d'Ant, avec une affirmation du fournisseur selon laquelle elle peut être étendue à 1M ; la fiche d'OpenRouter indique 262 144 tokens, ce qui correspond aux 256K. La longueur maximale de sortie n'est divulguée nulle part où nous avons pu chercher. Le modèle prend en charge la génération de texte standard et l'appel d'outils, mais aucune entrée ou sortie multimodale n'a été mentionnée — cette capacité appartient à la gamme Ming distincte.
En termes de disponibilité, l'image est exclusivement accessible via l'API et cohérente sur les trois routes que nous avons trouvées : la plateforme développeur d'Ant Group elle-même, OpenRouter (répertorié sous le nom inclusionai/ling-3.0-flash) et ZenMux. Aucune de ces sources n'expose de poids téléchargeables. Il n'existe pas de page d'organisation GitHub pour un projet « Ling-V3 », et la documentation d'Ant ne mentionne pas de licence pour ce modèle spécifique — une lacune significative, étant donné que Ling 2.0 et Ling 2.6 ont toutes deux été publiées sous licence MIT avec des poids ouverts. Tant qu'InclusionAI n'aura pas clarifié ce point, ne présumez pas que Ling-3.0-flash finira par être ouvert, et ne présumez pas non plus le contraire.

Les lacunes : ce qui n'est pas vérifié
Le plus grand écart concerne les benchmarks. Au moment où nous écrivons ces lignes, Artificial Analysis — l'évaluateur indépendant le plus souvent cité pour exactement cette classe de modèles — n'a pas de page pour Ling-3.0-flash ; le modèle d'URL qui l'hébergerait normalement renvoie une erreur 404. Cela signifie qu'il n'existe actuellement aucun score de raisonnement, de codage ou de mathématiques tiers pour ce modèle, provenant d'Artificial Analysis ou de tout autre évaluateur indépendant que nous avons pu trouver. La propre documentation d'Ant aggrave la situation : elle ne publie aucun tableau de benchmarks pour 3.0-flash, ni du fournisseur ni d'autres sources, ce qui est inhabituel pour une sortie de modèle et mérite d'être signalé en soi.
Pour donner un contexte approximatif : les modèles Ling de la génération précédente ont bien des scores indépendants. Ling-2.6-flash a obtenu un indice Artificial Analysis Intelligence de 14, et le plus grand Ling-2.6-1T a obtenu 26 — tous deux bien derrière les principaux modèles open-weight suivis par Artificial Analysis à l'époque. Les propres chiffres du fournisseur d'Ant pour Ling-2.6-flash revendiquaient 61,2 % sur SWE-bench Verified et 73,85 % sur AIME2026. Aucun de ces chiffres ne doit être directement reporté sur Ling-3.0-flash ; une nouvelle génération avec une nouvelle architecture peut évoluer dans les deux sens, et tant qu'un évaluateur indépendant ne l'aura pas effectivement testé, toute affirmation de capacité pour 3.0-flash n'est qu'une conjecture déguisée en fait.
Allégations de vitesse du fournisseur : rapides sur le papier, non vérifiées en pratique.
La performance phare d'Ant Group pour Ling-3.0-flash n'est pas la qualité de raisonnement, mais la vitesse brute. Le fournisseur revendique un débit de pointe de 1 000 tokens par seconde et un temps avant le premier token inférieur à 100 millisecondes, deux chiffres qui seraient véritablement rapides s'ils étaient confirmés. Mais « s'ils étaient confirmés » pèse lourd dans cette phrase : ces chiffres proviennent exclusivement des propres documents d'Ant Group, mesurés dans des conditions qu'Ant contrôle et n'a pas entièrement divulguées (matériel, taille de lot, longueur de prompt, et charge modifient considérablement les débits). Aucun laboratoire indépendant n'a publié de nouvelle mesure. Jusqu'à ce qu'une personne extérieure à Ant mène un test comparable, considérez les 1 000 tok/s et le TTFT inférieur à 100 ms comme des chiffres marketing à vérifier avec votre propre charge de travail, et non comme des faits établis.

Tarification, et pourquoi c'est une cible mouvante
Sur la propre plateforme d'Ant Group, le prix catalogue de Ling-3.0-flash est de 0,40 ¥ pour 1M de tokens d'entrée et 1,20 ¥ pour 1M de tokens de sortie — peu coûteux par conception, cohérent avec son positionnement en tant que catégorie rapide/peu coûteuse. Mais ce prix catalogue n'est pas ce que paie réellement quiconque pour le moment : Ant mène une promotion de la semaine de lancement gratuite, et propose séparément 500k tokens gratuits par jour sur sa plateforme. La liste d'OpenRouter affiche une variante ling-3.0-flash:free à 0$/0$. Rien de tout cela ne doit être confondu avec un prix stable. Les promotions de lancement expirent, les niveaux gratuits sont plafonnés, et les chiffres de 0,40 ¥/1,20 ¥ eux-mêmes pourraient changer une fois que les données d'utilisation réelles arriveront. Si vous planifiez des dépenses de production autour de ce modèle, budgétisez en fonction du prix catalogue, pas du prix promotionnel, et vérifiez à nouveau avant de vous engager.
La famille Ling / Ring / Ming
Ling-3.0-flash n'existe pas en isolation — InclusionAI organise ses versions en trois familles nommées, chacune destinée à un usage différent. Ling est la gamme MoE polyvalente, couvrant la génération de texte courante et l'appel d'outils ; Ling-3.0-flash se situe à l'extrémité rapide/économique de cette gamme, tandis que Ling-2.6-1T reste le modèle phare plus imposant. Ring est la gamme d'InclusionAI axée sur le raisonnement, conçue pour les tâches qui reposent sur un raisonnement multi-étapes plutôt que sur un débit brut. Ming est la gamme multimodale, prenant en charge les images et d'autres modalités non textuelles que Ling ne traite pas. Si votre tâche nécessite un raisonnement plus poussé ou une entrée multimodale, le bon modèle InclusionAI n'est probablement pas Ling-3.0-flash — il est conçu pour le volume et la rapidité dans le domaine du texte et des outils, et non pour s'étendre sur le territoire des deux autres familles.
À qui cela s'adresse : trois scénarios
1. Pipelines de texte ou d'appels d'outils à volume élevé et sensibles à la latence — à titre pilote, pas un engagement
Si votre charge de travail est dominée par la génération de texte sensible au débit ou l'appel d'outils — chat, agents légers, appels API à haute fréquence — le positionnement de Ling-3.0-flash (nombre de paramètres actifs réduit, TTFT revendiqué inférieur à 100 ms, tarification de lancement quasi gratuite) en fait un candidat intéressant pour un pilote. Le hic, c'est que « intéressant pour un pilote » est différent de « intéressant pour basculer le trafic de production ». Sans données de référence indépendantes, c'est vous qui êtes la référence maintenant : exécutez votre propre ensemble d'évaluation avant de lui faire confiance pour quoi que ce soit orienté client, et ne construisez pas de modèles de coûts autour de la tarification promotionnelle actuelle.
2. Équipes qui ont besoin d'un long contexte avec un budget limité
Une fenêtre de contexte de 256K (avec une revendication du fournisseur d'extensibilité à 1M) à un prix catalogue véritablement bas est une combinaison attrayante pour les cas d'utilisation axés sur la récupération ou le traitement de documents, à condition que la qualité réelle du raisonnement du modèle tienne sur cette longueur de contexte — ce qui, encore une fois, n'a été testé par aucune source indépendante. C'est un candidat raisonnable à présélectionner aux côtés des options établies à contexte long et bon marché, mais il devrait être évalué côte à côte avec elles plutôt qu'adopté uniquement sur la base de la fiche technique d'Ant.
3. Les observateurs surveillant le paysage du MoE en Chine et la feuille de route d'InclusionAI.
Pour les équipes qui suivent le paysage concurrentiel des laboratoires de modèles chinois ouverts et semi-ouverts plutôt que de déployer un modèle unique en production, Ling-3.0-flash est un point de données utile : il signale qu'InclusionAI itère rapidement sur son niveau rapide, recule potentiellement par rapport aux poids ouverts (du moins pour l'instant), et continue de miser sur une structure à trois familles (Ling/Ring/Ming) plutôt que sur un seul modèle général. À garder en favori et à revoir une fois que les références et la clarté des licences seront disponibles.
Quand ne pas l'utiliser
Évitez Ling-3.0-flash pour tout ce qui nécessite de citer une affirmation de capacité vérifiée — il n'existe aucun benchmark indépendant auquel se référer, donc toute déclaration sur ses capacités de raisonnement, de codage ou de mathématiques est actuellement non falsifiable. Évitez-le si vous avez besoin de poids ouverts pour l'auto-hébergement, le fine-tuning ou des raisons de conformité ; il n'y en a pas de disponibles, et la licence pour ce modèle spécifique n'a même pas été annoncée, et encore moins confirmée comme permissive. Évitez-le pour les tâches multimodales — c'est le travail de la gamme Ming, pas de Ling. Et soyez prudent lorsque vous construisez un modèle de coût basé sur les prix actuels : la semaine de lancement gratuite, les 500 000 jetons gratuits par jour et le niveau gratuit d'OpenRouter sont tous promotionnels, et le prix catalogue de ¥0.40/¥1.20 auquel il est susceptible de revenir n'a lui-même pas été testé par rapport à des modèles d'utilisation réels.
FAQ
Est-ce que Ling-3.0-flash a des poids ouverts ?
Pas actuellement. Il n'y a pas de dépôt Hugging Face ni de projet GitHub Ling-V3 à l'heure où j'écris ces lignes. Les générations précédentes de Ling (2.0 et 2.6) ont été publiées sous licence MIT en tant que open weights, mais rien ne confirme que Ling-3.0-flash suivra ce schéma — ou qu'il ne le fera pas.
Comment se comporte Ling-3.0-flash sur les benchmarks ?
Il n'existe pas encore de benchmark indépendant pour cela — Artificial Analysis n'a pas de page pour ce modèle. La propre documentation d'Ant Group ne publie pas non plus de tableau de référence. Pour un contexte historique approximatif, la génération précédente Ling-2.6-flash a obtenu un score de 14 sur l'Artificial Analysis Intelligence Index, et Ling-2.6-1T a obtenu 26, mais aucun de ces chiffres ne doit être supposé s'appliquer à cette nouvelle génération.
À quelle vitesse est-ce vraiment ?
Ant Group revendique un débit de pointe de 1000 tokens/seconde et un temps de premier token inférieur à 100ms. Ces deux chiffres proviennent uniquement du fournisseur, sans aucune remesure indépendante publiée à ce jour. Considérez-les comme des affirmations à vérifier sur votre propre charge de travail, et non comme des performances confirmées.
Combien coûte Ling-3.0-flash ?
Le prix catalogue sur la plateforme d'Ant est de ¥0,40 pour 1M de tokens d'entrée et ¥1,20 pour 1M de tokens de sortie, mais il est actuellement gratuit pendant une promotion de lancement d'une semaine, avec également 500k tokens gratuits par jour. OpenRouter répertorie également une variante gratuite. Attendez-vous à ce que ces conditions promotionnelles changent.
Quelle est la taille de la fenêtre de contexte ?
256K tokens selon la documentation d'Ant, avec une affirmation du fournisseur qu'il est extensible à 1M. La fiche d'OpenRouter affiche 262 144 tokens, ce qui correspond au chiffre de 256K. La longueur maximale de sortie n'est pas divulguée.
Quelle est la différence entre Ling, Ring et Ming ?
Ling est la ligne MoE polyvalente de texte et d'appel d'outils d'InclusionAI, et Ling-3.0-flash se situe à son extrémité rapide/peu coûteuse. Ring est la ligne axée sur le raisonnement. Ming gère les tâches multimodales. Ce sont des familles de modèles distinctes conçues pour différentes tâches, et non des niveaux du même modèle.
Est-ce que Ling-3.0-flash est identique à Ling-2.6-1T ?
N° Le Ling-2.6-1T est le plus grand modèle phare d'InclusionAI (1T total / 63B paramètres actifs) et reste un modèle distinct et plus imposant. Le Ling-3.0-flash (124B total / ~5.1B actifs) est la version plus récente, plus petite et plus rapide.
Devrais-je utiliser Ling-3.0-flash en production aujourd'hui ?
Seulement après avoir effectué votre propre évaluation. Sans benchmark indépendant, une licence non confirmée et un tarif actuellement promotionnel, il est raisonnable de l’expérimenter mais prématuré de lui confier des charges de travail critiques pour la production ou sensibles à la conformité sans vos propres tests et un plan pour ce qui se passe lorsque les conditions promotionnelles prennent fin.
En résumé
Ling-3.0-flash est une véritable nouvelle version qui mérite d'être suivie — un modèle MoE de 124B/5.1B-actif, conçu pour du texte rapide, bon marché et en grand volume ainsi que des appels d'outils, provenant d'un laboratoire qui a déjà publié des modèles crédibles. Mais pour l'instant, ce n'est qu'une fiche technique et un ensemble d'affirmations du fournisseur, pas un produit vérifié : pas de benchmark indépendant, pas de poids ouverts, pas de licence confirmée, et un prix explicitement promotionnel. Ce n'est pas une raison pour le rejeter — c'est une raison pour le piloter prudemment, vérifier les affirmations qui vous importent directement, et revenir sur ce bref une fois qu'Artificial Analysis ou un autre évaluateur indépendant publiera des chiffres réels.

