
Claude Haiku 5.5 vs Ling 3.0 Flash : L'un de ces modèles a déjà un successeur
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Commencez par le fait étrange, car c’est lui qui devrait orienter la décision. Ling 3.0 Flash — le modèle à poids ouverts de 124 milliards de paramètres d’Ant Group, publié en août 2026 sous licence MIT — est désormais signalé comme déprécié, Ling 3.1 Flash étant désigné comme son remplaçant. Claude Haiku 5.5 est arrivé le 7 octobre 2026, deux jours avant la rédaction de ces lignes, et Anthropic s’est engagée à ne pas le retirer avant octobre 2027. Deux modèles dans la même gamme de prix, et l’un d’eux est déjà orienté vers son propre successeur.
Cette asymétrie n’est pas un verdict sur la qualité. Ling 3.0 Flash est un modèle véritablement rapide, à poids ouverts et à l’architecture inhabituelle, et sur plusieurs axes, il surclasse purement et simplement le niveau d’Anthropic. Mais cela signifie que cette comparaison a une durée de vie limitée, et tout article qui présente les deux comme également durables vous vend la partie qui expire.
Deux versions, deux âges très différents
Les chiffres indépendants ici proviennent d’Artificial Analysis ; les affirmations propres aux fournisseurs proviennent des fiches de modèle et de la documentation, et sont étiquetées.
• Sortie — Ling 3.0 Flash le 4 août 2026, avec le dépôt Hugging Face daté du 2 août. Claude Haiku 5.5 le 7 octobre 2026.
• Licence — MIT pour Ling 3.0 Flash, ce qui est à peu près le plus permissif que l’on puisse trouver pour des poids ouverts. Claude Haiku 5.5 est propriétaire, uniquement accessible via API.
• Statut — Ling 3.0 Flash porte un indicateur d’obsolescence pointant vers Ling 3.1 Flash. Claude Haiku 5.5 est actuel, avec un engagement de non-retrait jusqu’en octobre 2027.
• Adoption — le dépôt Ling 3.0 Flash a cumulé 11 797 téléchargements et 427 mentions J’aime. C’est une empreinte réelle mais modeste, et c’est un indicateur raisonnable de l’ampleur du développement de l’outillage tiers autour du modèle.
L’écart d’âge compte plus que ne le suggèrent les six semaines. Ling 3.0 Flash a été lancé à une période où sa propre famille évoluait déjà ; Claude Haiku 5.5 a été lancé comme le membre le plus récent d’une lignée dont aucun successeur n’a été annoncé.
L’architecture est la partie qui vaut la peine d’être lue deux fois.

Ling 3.0 Flash est un modèle à mélange d’experts comptant 124 milliards de paramètres au total et 5,1 milliards actifs par token. Ce rapport constitue tout l’argument économique : on dispose de l’empreinte mémoire d’un grand modèle tout en payant le coût de calcul d’un petit. La configuration publiée est précise, et il ne s’agit pas d’un simple habillage d’un transformeur standard :
• Empilement — 35 couches KDA avec 7 couches MLA à portes dans un ratio de 5:1, plus 2 couches denses. La recette d’entraînement publiée fait passer la fenêtre de contexte de 8K à 32K puis à 256K par étapes, plutôt que d’entraîner la fenêtre longue à partir de zéro.
• Experts — 512 experts routés avec un expert partagé, 8 activés par token, sur une taille cachée de 2 560, une taille intermédiaire d’expert de 768 et une taille intermédiaire dense de 6 144. Le vocabulaire compte 157 184 tokens.
• Serving — le déploiement de référence de la carte utilise SGLang avec --context-length 262144, et indique que HiCache avec la mise en cache Mooncake réduit le temps jusqu'au premier token de 60 à 80 % ou plus sur les entrées longues. Il s'agit d'un chiffre rapporté par le fournisseur, et il est présenté comme tel.
Rien de tout cela n’est un gadget. Une empreinte active de 5,1 B est ce qui permet à Ling 3.0 Flash d’être servi au débit qu’il atteint, et le travail sur la mise en cache est ce qui permet à sa latence du premier token sur les longs prompts de rester exploitable. L’approche de Claude Haiku 5.5 est l’opposé : un seul modèle dense propriétaire derrière une API, avec une fenêtre de 1 000 000 de tokens et une réflexion adaptative qui décide, pour chaque requête, la quantité de travail à effectuer. Deux réponses cohérentes à la même question de coût.
Les chiffres, côte à côte

• Score indépendant — Claude Haiku 5.5 à 43 sur l’Intelligence Index, deuxième sur 182. Ling 3.0 Flash à 20, troisième sur 65 dans sa propre catégorie.
• Prix des tokens d’entrée par million de tokens — Claude Haiku 5.5 : 0,10 $ jusqu’à 100 000 tokens, 0,50 $ au-delà. Ling 3.0 Flash : 0,075 $, avec une remise de 80 % sur le cache.
• Prix de sortie par million de jetons — Claude Haiku 5.5 0,50 $ jusqu’à 100 000 jetons, 2,50 $ au-delà. Ling 3.0 Flash 0,22 $.
• Coût mixte — 0,05 $ par million de tokens pour Ling 3.0 Flash, contre 0,08 $ pour Claude Haiku 5.5 selon le propre mélange du conseil.
• Vitesse — 333,6 jetons de sortie par seconde pour Ling 3.0 Flash, premier sur 65 dans sa catégorie, contre 240,4 pour Claude Haiku 5.5. Le temps jusqu’au premier jeton est quasiment à égalité : 2,50 secondes contre la mesure du classement pour le modèle Anthropic.
• Contexte — 262 000 jetons pour Ling 3.0 Flash ; 1 000 000 pour Claude Haiku 5.5.
• Modalité d'entrée — texte uniquement pour Ling 3.0 Flash. Texte et images pour Claude Haiku 5.5.
• Poids — MIT et téléchargeables pour Ling 3.0 Flash. Propriétaires pour Claude Haiku 5.5.
L'atout de Ling, c'est la vitesse et le prix, pas la profondeur.
L’écart de 23 points à l’Index entre 43 et 20 est le gros titre, et il va dans le même sens que dans toutes les comparaisons de ce type : Claude Haiku 5.5 est le modèle le plus performant, et l’écart n’est pas mince. Mais la colonne Ling l’emporte nettement sur deux lignes, et toutes deux sont du genre qui apparaissent sur une facture ou dans un budget de latence.
D'abord, le débit. 333,6 tokens par seconde, c'est le plus rapide de sa catégorie sur le marché, environ 39 % de plus que Claude Haiku 5.5, et combiné à un coût mixte plus faible, cela signifie que la génération en masse — balayages de classification, étiquetage de données, extraction structurée à gros volume — coûte sensiblement moins cher à exécuter sur Ling 3.0 Flash. Lorsque la tâche est bien spécifiée et que le mode de défaillance est évident, un modèle à 23 points d'Index de retard peut encore être le bon choix.
Deuxièmement, la remise de 80 % sur le cache. Pour une charge de travail dotée d’un grand préfixe stable et d’une petite queue variable, le tarif effectif des entrées sur Ling 3.0 Flash descend bien en dessous du tarif affiché, et la conception de la mise en cache décrite dans la fiche du modèle cible exactement ce profil. Le tarif de lecture du cache de Claude Haiku 5.5, à 0,01 $, est moins cher en valeur absolue, mais l’écriture dans son cache coûte 0,125 $ et le modèle est facturé avec un palier à 100 000 jetons d’entrée que Ling n’a pas.
Le contrepoids, c'est la verbosité, et c'est le même que celui qui s'applique au modèle Anthropic. Artificial Analysis a enregistré 260 millions de tokens de sortie en exécutant l'Index sur Ling 3.0 Flash, contre une médiane de 100 millions, et le qualifie de verbeux. Sur un modèle facturé au token, cela érode l'avantage de tarif — un tarif de sortie 2,3 fois moins cher, en partie consommé par un modèle qui écrit plus de tokens, est un avantage plus faible que ne le suggère la fiche.
Ce que les benchmarks des fournisseurs prétendent, et ce qu’ils ne disent pas
La propre fiche de Ling 3.0 Flash annonce un ensemble de résultats solides : MathArena AIME 2026 à 93,2, HMMT February 2026 à 87, SWE-Bench Pro à 56,6, SWE-Bench Multilingual Resolved à 72,4, et Humanity's Last Exam à 22,7. Chacun de ces chiffres est rapporté par le fournisseur et aucun n'a été reproduit de manière indépendante ici. Ils ne sont pas non plus mesurés face à Claude Haiku 5.5 sur le même banc d'essai — Anthropic publie son propre ensemble (GDPval-AA v2.1 à 1620, OSWorld 2.1 à 72,4 %, Terminal-Bench 4.0 à 39,2 %) et les deux fournisseurs ont utilisé des batteries de tests différentes. La seule mesure commune est le classement indépendant, et là, la réponse est sans ambiguïté.
À noter, parallèlement aux scores de mathématiques : ce chiffre HLE de 22,7 est bien inférieur au 45,9 sans outils qu’Anthropic rapporte pour Claude Haiku 5.5. Des harnais différents, donc pas une comparaison directe, mais pas non plus un écart que le choix du harnais suffit à écarter.

Le problème du successeur
C’est la partie qui détermine la comparaison pour quiconque planifie au-delà du trimestre en cours, et elle n’a rien à voir avec les benchmarks.
Ling 3.0 Flash est déprécié au profit de Ling 3.1 Flash. Cela ne signifie pas pour autant qu'il cesse de fonctionner — les poids ouverts n'expirent pas, et une licence MIT ne peut pas être révoquée. Mais cela signifie que l'écosystème qui l'entoure va dériver : la prise en charge dans les frameworks d'inférence, les versions quantifiées, les corrections de bugs et l'outillage communautaire suivent tous le modèle actuel, et un modèle déprécié ne reçoit que les restes de cette attention. Si vous construisez aujourd'hui sur Ling 3.0 Flash, vous construisez sur des poids figés et définitifs, ce qui convient à une charge de travail stable mais s'avère délicat pour tout ce que vous espérez voir s'améliorer.
Claude Haiku 5.5 offre l’ensemble de garanties en miroir : vous n’obtenez pas les poids, mais vous obtenez un fournisseur dont l’intérêt commercial est de maintenir le modèle rapide, corrigé et en service, ainsi qu’un engagement de non-retrait jusqu’en octobre 2027 et un parcours de migration publié pour le moment où cela prendra fin.
Les deux côtés de cet itinéraire, avec une seule clé
Le constat honnête de disponibilité : OrcaRouter ne propose pas Ling 3.0 Flash, et il ne propose pas non plus Claude Haiku 5.5. Ling 3.0 Flash est diffusé via la distribution propre du fournisseur et plusieurs plateformes tierces ; Claude Haiku 5.5 est disponible sur l’API d’Anthropic et les principales plateformes cloud.
Ce qui reste, c'est la question du routage que soulèvent les deux modèles. Claude Haiku 5.5, à 43, avec une fenêtre de 1M, est une cible d'escalade naturelle ; Ling 3.0 Flash, à 333 tokens par seconde, est un segment de gros volume tout indiqué. Une route qui envoie le travail volumineux et bien spécifié vers un palier rapide et fait escalader vers un palier plus puissant tout ce qui échoue à un contrôle de longueur ou de qualité est exactement l'agencement que compose un routeur — sur OrcaRouter, les Claude Haiku 4.5, Claude Sonnet 5.5 et Claude Opus 5.5 d'Anthropic figurent au catalogue aujourd'hui, aux côtés de grandes options à poids ouverts telles que DeepSeek V4.1 Flash et GLM 5.3 Flash, de sorte que les segments d'escalade et de gros volume peuvent tous deux être construits et testés en charge dès maintenant. Une seule clé, un basculement automatique sous le capot, les prix catalogue des fournisseurs répercutés avec 0 % de marge, de sorte qu'un changement de prix est effectif le jour même.
Lequel des deux, et pour combien de temps ?
Choisissez Claude Haiku 5.5 si le travail est à périmètre ouvert, si vous avez besoin d'images ou d'une fenêtre d'un million de tokens, si vous voulez un fournisseur tenu responsable de la disponibilité, ou si vous planifiez au-delà du prochain trimestre. Il est en avance de 23 points d'Index, il est actuel plutôt que déprécié, et la différence de prix est suffisamment faible pour que l'écart de score domine.
Prenez Ling 3.0 Flash si la charge de travail est volumineuse, bien spécifiée et sensible à la latence, si la licence MIT ou les poids ouverts sont l’essentiel, ou si une remise de 80 % sur le cache pour un préfixe stable est ce qui pèse réellement dans votre facture. C’est le modèle le plus rapide et le moins cher par token, et il est vraiment bon pour les tâches qu’un modèle 20-Index peut gérer. Sachez simplement qu’en l’adoptant, vous adoptez un modèle finalisé plutôt qu’un modèle maintenu, et que le successeur qu’il désigne existe déjà.
