
Ling-3.1-flash vs Qwen3.8-Flash : deux façons de construire un palier rapide, et une seule d'entre elles voit le jour
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 262 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- xAISpaceXAI: Grok 4.62026-08-1244Intelligence77Code
Deux laboratoires chinois se sont penchés sur le même problème cet automne — comment construire un modèle bon marché et rapide, suffisamment bon pour fonctionner dans une boucle d'agent — et sont arrivés à des réponses opposées. Ling-3.1-flash, annoncé par Ant Group le 30 septembre 2026, est un mixture-of-experts d'environ 560 milliards de paramètres activant environ 25 milliards de paramètres par token, avec une fenêtre de contexte annoncée allant jusqu'à 1 million de tokens et une intention déclarée de passer en open source « bientôt ». Qwen3.8-Flash, publié par l'équipe Alibas Qwen le 26 août 2026, est un mixture-of-experts multimodal de 125 milliards de paramètres activant environ 6 milliards de paramètres par token, avec des poids déjà disponibles sur Hugging Face sous le nom Qwen3.8-Flash-Next, un modèle de production en ligne sur l'API QwenCloud à 0,15 $ par million de tokens en entrée et 0,47 $ par million en sortie, et une prise en charge dès le jour 0 dans SGLang. Un laboratoire a augmenté l'échelle et a annoncé. L'autre a réduit l'échelle et a livré. Cette différence est plus instructive que n'importe quel benchmark publié par l'un ou l'autre de ces laboratoires.
C'est aussi la raison pour laquelle cette comparaison doit être lue avec attention. Ling-3.1-flash n'a pas de poids, pas de licence, pas de fiche modèle, pas de prix d'API et pas d'évaluation indépendante ; tout ce qui a été publié se résume à un billet d'annonce, à un tableau comparatif de benchmarks fourni par l'éditeur et à une place dans le produit Ling Studio d'Ant lui-même. Qwen3.8-Flash possède tous ces éléments, et bénéficie de quatre semaines d'avance pour ce qui est d'être utilisé par des personnes qui ne travaillent pas pour Alibaba. Comparer un choix d'architecture est légitime. Comparer les capacités ne l'est pas encore.
Les deux décisions de conception, et pourquoi elles divergent
Le pari de Qwen est que la gamme rapide devrait être structurellement différente du modèle phare, et pas simplement plus petite que lui. Qwen3.8-Flash active 6 milliards de ses 125 milliards de paramètres — environ 95 % de sparsité — et tire sa capacité de l'endroit où le calcul est acheminé plutôt que d'une ampleur brute. Alibaba a clairement indiqué que l'architecture sous-jacente, qui associe Gated DeltaNet à Qwen Sparse Attention et à une table d'embeddings N-gram, est un aperçu précoce de la génération Qwen4, publié volontairement en avance afin que les moteurs d'inférence, les outils de quantification et les schémas de déploiement puissent mûrir autour d'elle avant que les modèles coûteux ne soient construits par-dessus. Le résultat est un modèle peu coûteux par token par construction : environ 6 milliards de paramètres de travail à chaque token, à un prix qu'Alibaba a fixé à 0,15 $ en entrée et 0,47 $ en sortie par million.
Le pari d'Ant, pour autant que l'annonce le révèle, se rapproche d'une mise à l'échelle conventionnelle avec un contexte très long. Ling-3.1-flash conserve une large fraction active — environ 25 milliards de paramètres par token sur 560 milliards, soit à peu près un sur vingt-deux — et annonce une fenêtre allant jusqu'à 1 million de tokens, quatre fois ce que sert la génération précédente de Ling. L'application Ling Studio le présente comme conçu pour « les agents polyvalents, la recherche, le travail de bureau courant et le développement logiciel/de code », ce qui relève d'un positionnement de gamme rapide, mais l'économie des paramètres est celle d'un modèle bien plus lourd. À entrée identique, un token traversant 25B de paramètres actifs coûte environ quatre fois le calcul d'un token traversant 6B, avant même qu'une quelconque décision tarifaire n'entre en jeu.
Aucune des deux approches n'est fausse, et toutes deux sont des réponses défendables à « qu'est-ce qui limite un modèle bon marché ». Qwen parie que la parcimonie et une nouvelle pile d'attention constituent le plafond. Ant parie que le plafond, c'est le contexte et la connaissance du monde, et qu'elle peut se permettre la puissance de calcul. Ce qui les distingue pour un lecteur, ce n'est pas la philosophie de conception mais la livraison : une conception que vous pouvez télécharger et mesurer, par opposition à une conception dont vous ne pouvez que lire la description.

Ce que chacun vous coûte, et ce que cela signifie en pratique
L’écart de prix n’est pas subtil et il n’est pas mince. Qwen3.8-Flash est publié à 0,15 $ par million de jetons d’entrée, 0,47 $ par million de jetons de sortie et 0,018 $ par million pour les lectures de cache — les mêmes chiffres dans l’annonce d’Alibaba, sur la fiche modèle de production du fournisseur et sur la page de modèle routé que nous servons, ce à quoi ressemble une répercussion à 0 % de marge lorsqu’on la confronte à trois sources. Ant n’a publié aucun tarif du tout pour Ling-3.1-flash — aucun prix d’API, aucune remise sur le cache, rien de comparable. Le seul chiffre publié pour la gamme Ling est celui de la génération précédente, qui affiche 0,075 $ en entrée et 0,22 $ en sortie par million, soit environ la moitié du tarif d’entrée de Qwen et moins de la moitié de son tarif de sortie. Si le nouveau palier Ling est tarifé près de là où se situait l’ancien, il sous-coterait Qwen3.8-Flash sur le papier ; s’il est tarifé tant soit peu près de la puissance de calcul qu’impliquent ses 25B de paramètres actifs, ce ne sera pas le cas. Cela reste une supposition dans les deux cas, car le chiffre n’existe pas.
Le contexte est le domaine où l’affirmation de Ling est véritablement plus large. Ant annonce jusqu’à 1 million de tokens pour Ling-3.1-flash ; Qwen3.8-Flash est livré avec un contexte par défaut de 1 M de tokens sur l’API de production et une fenêtre native de 262 144 tokens sur les poids ouverts, extensible. Deux réserves pèsent sur le chiffre de Ling, et aucune n’est levée. Premièrement, « jusqu’à 1 M » est une spécification, pas une mesure — personne n’a publié de comportement de récupération en contexte long pour un modèle que personne en dehors d’Ant ne peut appeler. Deuxièmement, la génération précédente de Ling présentait exactement le même écart entre la fenêtre annoncée et l’architecture qui la sous-tendait, et la réponse n’est venue que lorsque les poids, le format et les limites de contexte ont finalement été publiés. Le 1 M mis en avant est une promesse. Le 1 M de Qwen3.8-Flash est une valeur par défaut servie à laquelle vous pouvez confronter l’affirmation d’Ant.
Pourquoi « preview » est le mot honnête d'un côté de ceci
La présentation qu'Alibaba fait elle-même de Qwen3.8-Flash est celle d'un aperçu d'architecture livré sous un nom de production — les poids ouverts portent le suffixe « Next » précisément pour que personne ne confonde le prototype avec le modèle de service affiné. Ce cadrage a été validé par les faits plutôt que par le marketing : SGLang a livré un support dès le jour 0 pour Qwen3.8-Flash-Next, le jour même de sa sortie, le modèle étant également configuré pour Transformers, vLLM et TokenSpeed, et les poids ont depuis été repris par les communautés de quantification. Les versions sont rapidement devenues ordinaires, ce à quoi ressemble un modèle livré.
L'annonce d'Ant présente la même configuration, un cran plus tôt : une divulgation de spécifications avant la sortie, avec l'affirmation explicite que le modèle sera bientôt publié en open source. C'est une manière légitime de lancer — Ling-3.0-flash a suivi exactement ce chemin en juillet, et les poids ont été publiés sous licence MIT le 7 août, environ deux semaines plus tard. Mais l'état des deux projets aujourd'hui n'est pas comparable, et aucune lecture de graphiques ne comble l'écart. Il vaut la peine d'être précis sur ce qu'un acteur extérieur peut apporter à chacun.
Ce qui est vérifiable de manière indépendante pour Ling-3.1-flash aujourd'hui : que l'annonce existe et est datée du 30 septembre ; que les chiffres de paramètres, de paramètres actifs et de contexte sont ceux d'Ant ; que le modèle figure dans le produit Ling Studio d'Ant ; et qu'aucun poids, aucune licence ni fiche de modèle n'a été publié. Ce qui est vérifiable de manière indépendante pour Qwen3.8-Flash : que les poids sont téléchargeables en BF16 et FP8 ; que les termes de la licence sont lisibles ; que le prix de l'API est publié ; et que les affirmations d'Alibaba en matière de benchmarks sont ouvertes à la reproduction depuis fin août. La seconde liste est plus longue, et c'est toute la comparaison en miniature.

Comment les deux seraient réellement évalués
Ant a publié une fiche de benchmark pour Ling-3.1-flash, qui le place face à GPT-5.6 Sol, Claude Opus 5, Kimi K3, deux variantes de GLM et DeepSeek-V4.1-Flash, avec des chiffres phares de 1 673 Elo sur GDPVal-AA v2.1, 75,16 sur FrontierSWE et 65,35 sur HealthBench Professional. Deux problèmes figurent sur cette fiche avant même que quiconque ne débatte des chiffres. Le premier est le panel de comparaison : les deux modèles de pointe qu’Ant a choisis ont une génération de retard, puisque Claude Opus 5.5 et GPT-6 Sol sont entrés en service le 22 septembre 2026 et sont désormais routables, ce qui signifie que la fiche évalue un modèle d’octobre face à la frontière de juillet plutôt que face à celle d’aujourd’hui. Le second est une note de bas de page sur la fiche elle-même, indiquant que le résultat HealthBench Professional provient de l’« environnement AQ » et que les capacités du modèle en matière de santé ne peuvent actuellement être expérimentées que dans AQ — un environnement qu’aucune documentation publique ne définit. Un score phare dont l’environnement d’évaluation n’est pas nommé n’est pas reproductible, même en principe.
Les affirmations comparables de Qwen3.8-Flash, en revanche, ont été faites alors que les poids étaient déjà disponibles, et Alibaba a misé son positionnement sur une affirmation que quiconque peut tester : que c'est le taux de parcimonie, et non le nombre de paramètres, qui est à l'origine de la capacité. Quatre semaines d'utilisation ne constituent pas un verdict, mais c'est suffisamment long pour que les affirmations aient cessé d'être incontestées — ce qui est l'état utile pour un modèle.
Que faire réellement de ceci, aujourd'hui
Pour les développeurs, la distinction pratique est simple. Ling-3.1-flash n’est pas un composant que vous pouvez adopter cette semaine : il n’y a aucun endpoint à appeler, aucun poids à héberger, aucune licence à vérifier et aucun prix sur lequel bâtir un budget. Quelle que soit la forme finale du modèle, la démarche utile pour l’instant consiste à définir un déclencheur — poids publiés, licence permissive, un score indépendant sur FrontierSWE proche de 75,16 — puis à y revenir. L’histoire de la génération précédente montre que les poids peuvent arriver deux semaines après l’annonce, ce déclencheur pourrait donc se déclencher rapidement.
Qwen3.8-Flash est déjà un composant. Il est en ligne dans notre catalogue en tant que modèle routé au prix catalogue du fournisseur, sans aucune marge — la fiche du modèle routé indique 0,15 $ en entrée, 0,47 $ en sortie et 0,018 $ par million de lectures de cache, les mêmes chiffres qu'Alibaba publie, ce qui montre concrètement ce que signifie une politique de 0 % de marge, plutôt que sur une diapositive. Derrière une seule clé il côtoie Claude Opus 5, GPT-5.6 Sol et DeepSeek-V4.1-Flash, si bien que la comparaison que Ant vous invite à faire — un candidat face à la frontière actuelle — peut être lancée en pointant une configuration vers deux routes au lieu de maintenir deux intégrations, avec un basculement automatique qui gère le week-end où un fournisseur vacille. C'est la différence entre une discussion d'architecture et une expérience.
Le verdict, dans la mesure où l’on peut en donner un : Qwen a fait le pari architectural le plus audacieux et a eu la confiance de le publier tôt et de laisser les gens le décortiquer. Ant a fait le pari le plus lourd — plus de paramètres, plus de calcul actif par token, plus de contexte — et n’a jusqu’ici publié qu’un graphique au lieu d’un modèle. Le graphique est beau. Le graphique est aussi la seule chose dont quiconque dispose.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
