
Claude Haiku 5.5 vs Ling 3.1 Flash : un modèle de 560 milliards de paramètres qui coûte quatre fois plus cher par réponse
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Six jours les séparent. InclusionAI a livré Ling 3.1 Flash le 1er octobre 2026 ; l'éditeur a livré Claude Haiku 5.5 le 7 octobre. Tous deux sont vendus comme des modèles de gamme flash, tous deux embarquent une fenêtre de contexte d'un million de tokens, et sur les lignes de raisonnement du seul tableau indépendant qui a évalué les deux, ils sont si proches que l'écart tient dans le bruit. Puis on arrive à la ligne qui mesure si un agent termine réellement la tâche, et ils sont séparés de 26 points — et à la ligne qui mesure ce que coûte une tâche terminée, où le modèle à 560 milliards de paramètres coûte quatre fois et demie le prix de celui dont personne n'a publié le nombre de paramètres.
Aucune des deux grilles tarifaires ne le prédit. Ling 3.1 Flash s'affiche à 0,30 $ par million de tokens d'entrée et 0,90 $ par million de tokens de sortie. Claude Haiku 5.5 s'affiche à 0,10 $ et 0,50 $ pour les prompts jusqu'à 100 000 tokens, puis à 0,50 $ et 2,50 $ au-delà. Si l'on raisonne en prix par token, Ling coûte trois fois plus cher en entrée et un peu moins de deux fois plus en sortie, soit le genre d'écart qui clôt une comparaison en une ligne.
Cela ne met pas fin à celui-ci, car la grille tarifaire est facturée au token et la décision est facturée à la tâche. Ces deux nombres ressortent de cette confrontation avec des signes opposés, et la raison n’est pas la verbosité.
Ce que coûte une tâche terminée, pas ce que coûte un token
Sur l'Artificial Analysis Intelligence Index v4.3.2, le coût mesuré pour accomplir une tâche complète de l'indice est de 0,21 $ pour Claude Haiku 5.5 et de 0,99 $ pour Ling 3.1 Flash. Cela représente un écart de 4,6× — plus large que le ratio d'entrée de 3×, et dans la même direction.
L'explication évidente — que le modèle coûteux parle plus — est la mauvaise. Ling 3.1 Flash a généré 100 671 jetons de sortie par tâche d'index ; Claude Haiku 5.5 en a généré 162 164. Le modèle le moins cher est le plus bavard, de plus de 60 %. Donc l'argent ne va pas non plus là où la grille tarifaire le suggère.
Décomposez le coût par tâche et il atterrit là où la méthodologie de l'indice le dépense réellement. Sur les 0,21 $ de Claude Haiku 5.5, environ 62 % sont du côté des entrées ; sur les 0,99 $ de Ling 3.1 Flash, environ 91 % le sont. Ce sont des exécutions de raisonnement très gourmandes en cache, et les deux fournisseurs facturent un token d'entrée mis en cache de façon très différente : 0,01 $ par million pour Claude Haiku 5.5 contre 0,06 $ par million pour Ling 3.1 Flash — un écart de 6× sur la seule ligne qui domine la facture. La grille tarifaire publiée compare 0,10 $ à 0,30 $. La ligne qui décide de la facture compare 0,01 $ à 0,06 $.
Notre propre catalogue répercute les prix catalogue des fournisseurs avec une marge de 0 %, ce qui vous permet de distinguer les deux situations sur une facture réelle plutôt que sur une facture modélisée. Ling 3.1 Flash ne figure pas au catalogue, quelle que soit l'orthographe de son chemin fournisseur que nous ayons pu résoudre — ni sous InclusionAI, ni sous Ling, ni sous aucune des huit formes que nous avons essayées — les 0,30 $ et 0,90 $ ci-dessus sont donc les tarifs publiés par le fournisseur lui-même, et rien que nous puissions router pour vous aujourd'hui. Claude Haiku 5.5 ne figure pas non plus au catalogue ; il passe par l'API propre à Anthropic.Ce que le catalogue propose bel et bien, dans les environs de cette comparaison, c'est GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen3.8 Flash et Gemini 3.8 Flash, chacun au prix catalogue du fournisseur avec 0 % de marge, de sorte qu'une modification tarifaire du fournisseur nous parvient le jour même où elle leur parvient. Si la conclusion ci-dessous est que le profil agentique de Ling 3.1 Flash est ce dont votre charge de travail a besoin, la prochaine étape concrète est une confrontation directe avec les modèles capables d'agentique que nous routons, sur une seule clé avec basculement automatique en dessous, et le DSL de routage lorsque le plafond de coût doit figurer dans la route plutôt que dans le code de l'application.

Sept lignes où les deux ont été mesurés
Artificial Analysis est le seul classement qui a exécuté les deux modèles, et le chevauchement est étroit mais instructif. Les lignes ne concordent pas entre elles, et la direction du désaccord n’est pas aléatoire.
• Indice d’intelligence v4.3.2 — 43,40 pour Claude Haiku 5.5 (Max) contre 41,09 pour Ling 3.1 Flash. Une avance de 2,31 points pour Anthropic.
• Coût par tâche Index terminée — 0,21 $ contre 0,99 $ sur le même tableau.
• Temps par tâche de l’Index — 424,6 secondes pour Claude Haiku 5.5 contre 360,4 secondes pour Ling 3.1 Flash. C’est la ligne où l’attente est démentie : le modèle à 560 milliards de paramètres est le plus rapide des deux sur l’ensemble de l’index, d’environ 15 %.
• Terminal Bench 4.0 — 0,3283 contre 0,3333. Ling 3.1 Flash est en avance d’un demi-point, ce qui, sur un benchmark que les deux fournisseurs citent, équivaut à une égalité.
• SciCode — 0,5498 contre 0,5405. Claude Haiku 5.5 de 0,9 point. Également une égalité.
• Humanity's Last Exam, sans outils — 0,4439 contre 0,3943. Claude Haiku 5.5 de 5 points, la première véritable séparation.
• AutomationBench, score partiel — 0,3541 contre 0,6174. Ling 3.1 Flash l’emporte de 26 points, et avec une marge plus large que tous les autres écarts de cette liste réunis.
Deux autres lignes existent en dehors de cet ensemble partagé et méritent d’être incluses, car ce sont celles que les acheteurs remarquent le plus. Sur GDPval-AA, qu’Artificial Analysis mène sur 44 métiers, les deux sont à 1620,05 et 1621,75 — une égalité statistique parfaite. Sur AA-Briefcase v1.1, une évaluation Elo de travail professionnel de longue haleine, Claude Haiku 5.5 obtient 1577,72 contre 1400,35 pour Ling 3.1 Flash, soit un écart de 177 points en faveur d’Anthropic. C’est l’écart non agentique le plus large entre eux dans tout le tableau.
La seule ligne qui devrait décider de la plupart de ces conversations
Les moyennes au niveau de l’indice masquent où le temps et l’argent sont réellement passés, et cette paire en est le cas le plus évident du lot. Les chiffres par évaluation sur Terminal Bench 4.0 ne sont proches dans aucune dimension, sauf le score.
• Terminal Bench 4.0, Ling 3.1 Flash — 0,3333 à 5,49 $ par tâche et 1 283 secondes par tâche.
• Terminal Bench 4.0, Claude Haiku 5.5 — 0,283 à 0,65 $ par tâche et 908 par tâche.
Cinq millièmes de point de score les séparent. Le coût est de 8,4× et le temps réel est de 1,4×. Une équipe qui lit le tableau de référence et choisit le modèle qui obtient 0,3333 a, selon les propres calculs d’Artificial Analysis, choisi de payer huit fois plus pour arriver un tiers de minute plus tard avec la même réponse.
Il ne s’agit pas d’un argument selon lequel le score serait dénué de sens ; il s’agit d’un argument selon lequel un score est un ratio entre le travail accompli et le travail tenté, et il ne dit rien des ressources consommées pour y parvenir. Les benchmarks de complétion agentique sont exactement le cadre où cette distinction fait le plus mal, car un agent qui réessaie est un agent qui paie le prix plein à chaque réessai, et un modèle qui coûte huit fois plus cher par tentative transforme une boucle de réessai en poste budgétaire.

Les 560 milliards de paramètres sans rien à télécharger
Voici la partie de la fiche technique de Ling 3.1 Flash qui est véritablement inhabituelle, et ce n'est pas la taille.
Ling 3.1 Flash est un modèle à mélange d'experts creux — 560 milliards de paramètres au total, 25 milliards actifs par token — et Artificial Analysis le classe comme propriétaire. Il n'y a ni poids, ni fichier de licence, ni dépôt. Un grand modèle creux de cette forme serait normalement publié en accès ouvert, car c'est ce que fait le reste de cette catégorie : GLM 5.3 Flash distribue des poids sous licence MIT avec 320 milliards de paramètres au total et 18 milliards actifs, et DeepSeek V4.1 Flash distribue des poids sous licence MIT avec 552 milliards au total et 16 milliards actifs. Ling 3.1 Flash appartient à la même classe d'architecture, au même ordre d'échelle, et n'est publié que sous forme d'API.
Ce choix a une conséquence que les lignes du benchmark ne montrent pas. Un modèle à 25 milliards de paramètres actifs doit être servi quelque part, et si vous ne pouvez pas héberger le checkpoint, vous ne pouvez pas choisir où ni à quelle marge — vous louez le service d'inférence du fournisseur pour ce modèle. Le prix de 5,49 $ de la tâche Terminal Bench ci-dessus n'est pas principalement un artefact lié au tarif par token ; c'est ce que coûte la location d'un grand modèle sparse auprès du seul acteur capable de l'exécuter. Les modèles à poids ouverts homologues de cette catégorie vous offrent la possibilité de faire varier ce chiffre vous-même.
Ça joue aussi dans l'autre sens, et la même honnêteté s'applique. Une publication ouverte n'est pas automatiquement le meilleur produit : vous héritez de la charge de service, des choix de quantification et du tapis roulant des mises à niveau en même temps que des poids, et un fichier de licence n'est pas un contrat de support. Anthropic publie un engagement de retrait pour Claude Haiku 5.5, pas avant le 7 octobre 2027, sur une API propriétaire avec une fiche système. Lequel de ces deux arrangements vous voulez est une question qui concerne votre équipe, pas l'un ou l'autre des modèles.
À quoi sert Ling 3.1 Flash
Lisez le profil dans son intégralité : il décrit un produit cohérent plutôt qu’un produit compromis : un grand modèle sparse à contexte long qui mène à bien des workflows autonomes à plusieurs étapes mieux que tout ce qui a été mesuré dans cette gamme de prix, qui ne se distingue pas en raisonnement difficile en une seule passe, et qui le fait à tarif forfaitaire, sans falaise liée à la longueur du prompt. Sur AutomationBench, il a 26 points d’avance sur Claude Haiku 5.5, et son score AA-Briefcase est le seul point de cette comparaison où il se classe derrière le milieu du peloton plutôt qu’en tête.
C’est une description défendable d’un worker agentique par lots : dirigez-le vers une file de tâches structurées qui doivent chacune être menées à bien, acceptez que la tâche se mesure en minutes, gardez le prompt assez long pour qu’une étape de seuil soit punitive, et accordez à la fiabilité à la ligne d’arrivée plus de valeur qu’au coût d’un token individuel. Ce pour quoi il n’est pas bon, c’est ce pour quoi les modèles de gamme flash sont généralement achetés. Il n’accepte que du texte — aucune entrée d’image, alors que Claude Haiku 5.5 accepte le texte et les images. Son temps de tâche d’index est plus court, mais son temps de tâche Terminal Bench est plus long, et à 0,99 $ par tâche d’index terminée contre 0,21 $, il dépense quatre fois et demie autant pour aboutir à un score composite presque identique.

Lequel des deux, d’après les preuves qui existent
Si votre travail consiste en du texte en entrée, du texte en sortie, facturé au token en volume, Claude Haiku 5.5 remporte cette comparaison sur chaque ligne qui arrive sur une facture : coût de tâche indiciel inférieur, coût de tâche réel inférieur sur le benchmark qui compte le plus pour les agents, score composite plus élevé, meilleurs scores sur les travaux professionnels de format long, meilleure fidélité, et une entrée d’images que l’autre modèle n’offre pas du tout.
Si votre travail est un agent non supervisé qui doit accomplir un flux de travail à plusieurs étapes, Ling 3.1 Flash obtient 26 points de plus que Claude Haiku 5.5 sur le seul benchmark partagé qui mesure exactement cela, et cela vaut la peine d’être testé plutôt que d’être écarté pour des raisons de prix. Testez-le sur votre propre trace, pas sur ce tableau — et évaluez le coût du test par tâche complétée, car c’est le chiffre qui change lorsqu’un agent réessaie.
Si vous avez besoin de détenir les poids, aucun de ces deux modèles n’est fait pour vous. Ling 3.1 Flash est propriétaire avec 560 milliards de paramètres ; Claude Haiku 5.5 est propriétaire, sans nombre de paramètres publié. Les versions ouvertes de ce niveau se trouvent ailleurs dans le tableau, et cette comparaison part d’un ensemble de lignes entièrement différent.
Le composite indique 2,31 points. Le benchmark agentique indique 26 dans l’autre sens. La grille tarifaire indique 3× en entrée ; le coût par tâche terminée indique 4,6× dans le même sens que la grille. Quatre chiffres, deux directions — c’est pourquoi le seul moyen fiable de trancher est d’exécuter les deux sur une trace de votre propre travail et de lire le coût sur les tâches terminées plutôt que sur les tokens.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
