
Claude Haiku 5.5 vs Qwen3.8-Flash-Next : trois centimes d'écart par token, soixante-dix-huit d'écart par tâche terminée
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Put the two rate cards next to each other and they look like they came out of the same meeting. Claude Haiku 5.5 is $0.10 in and $0.50 out. Qwen3.8-Flash-Next is $0.15 in and $0.47 out. The vendor's model is a third cheaper on input and six percent dearer on output. Neither vendor built that shape by accident, and neither published a comparison note explaining what they were aiming at — but the arithmetic of a mixed 3:1 workload makes the intent legible, and it makes the pair the closest pricing match in this whole tier.
C’est là que la ressemblance s’arrête. Claude Haiku 5.5 est un modèle d’API fermé lancé le 2026-10-07 avec une fenêtre d’un million de tokens et une sortie maximale de 128 000 tokens. Qwen3.8-Flash-Next est un modèle à poids ouverts de 180 milliards de paramètres, avec 6 milliards de paramètres actifs, des poids sur Hugging Face sous la Qwen Community License 1.0, et une fenêtre de contexte publiée sur laquelle sa propre configuration de checkpoint et l’organisme indépendant ne s’accordent pas pleinement. Publié le 2026-08-26, il n’a rien de nouveau ni d’exotique pour quiconque développe dans ce segment.
Les deux sont tarifés ensemble à dessein. Ce que les grilles tarifaires ne peuvent pas vous dire, c’est qu’ils sont conçus pour des tâches différentes, et que celui qui a l’air moins cher sur un tableur est celui qui coûte le plus cher à exploiter.
L'arithmétique qui trahit le prix
Combinez les deux tarifs selon un ratio entrée/sortie courant de 3:1 — le ratio autour duquel se stabilisent la plupart des trafics de chat et d'assistance au code — et vous obtenez 0,20 $ par million de tokens pour Claude Haiku 5.5 et 0,23 $ par million pour Qwen3.8-Flash-Next. Celui d'Anthropic est environ 13 % moins cher sur ce mélange, soit un écart plus faible que ne le laisse entendre la colonne des entrées et plus important que ne le laisse entendre celle des sorties.
Inversez le ratio, et la position change. À 1:1, les deux sont à 0,30 $ et 0,31 $ par million — une égalité à une erreur d'arrondi près. À 1:3, à dominante de sortie, Claude Haiku 5.5 s'établit à 0,40 $ et Qwen3.8-Flash-Next à 0,39 $ — une victoire d'un cent pour Qwen et le seul ratio auquel le modèle d'Anthropic n'est pas le moins cher des deux.
Ainsi, il n'existe pas de réponse unique et honnête à la question « lequel est le moins cher », et toute comparaison qui prétend en donner une choisit un ratio à la place du lecteur. Ce qui est défendable, c'est ceci : la fiche de Claude Haiku 5.5 est pondérée pour un trafic à forte composante d'entrée, celle de Qwen3.8-Flash-Next est pondérée pour un trafic à forte composante de sortie, et les trois cents par million de tokens qui les séparent à un ratio de 3:1 constituent ce qui s'est le plus rapproché du chiffre d'Anthropic dans cette gamme. Il s'agit d'un positionnement délibéré, quoi qu'en disent les documents de lancement.
Notre catalogue indique Qwen3.8-Flash-Next à 0,15 $ en entrée et 0,47 $ en sortie par million de jetons, avec un tarif de 0,0184 $ pour l'entrée mise en cache. Les 0,15 $ et 0,47 $ correspondent aux mêmes chiffres qu'Artificial Analysis enregistre comme prix catalogue du fournisseur, ce que l'accord de répercussion est censé produire.
Ce que coûte réellement une journée de volume réel
Prenons un pipeline qui traite 10 millions de jetons d'entrée et 2 millions de jetons de sortie par jour. Il s'agit d'une petite charge de production, qui reste confortablement dans le premier palier tarifaire aux longueurs de prompt habituelles.
• Coût d'entrée — 1,00 $ par jour avec Claude Haiku 5.5, 1,50 $ par jour avec Qwen3.8-Flash-Next.
• Coût de sortie — 1,00 $ par jour sur Claude Haiku 5.5, 0,94 $ par jour sur Qwen3.8-Flash-Next.
• Total quotidien — 2,00 $ contre 2,44 $. Environ 160 $ par an d’écart à cette échelle, soit environ 3,7 cents par million de jetons.
Maintenant, appliquez les deux ajustements que la grille tarifaire omet, et la direction s’inverse.
Premièrement, Claude Haiku 5.5 utilise le tokeniseur plus récent partagé avec Claude 4.7 et les versions ultérieures, qui, selon la documentation d’Anthropic elle-même, comptabilise le même texte avec environ 30 % de tokens en plus que le modèle qu’il remplace. Si votre entrée est de la prose anglaise du type sur lequel ces décomptes de tokens ont été mesurés, le tarif d’entrée effectif n’est pas de 0,10 $ — il est plus proche de 0,13 $ par million de mots de texte, ce qui le place à deux cents près de Qwen3.8-Flash-Next plutôt qu’à un tiers en dessous.
Deuxièmement, et plus important : Claude Haiku 5.5 est verbeux. Artificial Analysis a enregistré 162 164 jetons de sortie pour lui lors de l’exécution de l’Intelligence Index, contre 107 884 pour Qwen3.8-Flash-Next. Si ce ratio tient sur votre charge de travail plutôt que dans l’hypothèse abstraite de 3:1, la ligne de sortie ci-dessus cesse d’être de 1,00 $ contre 0,94 $ et se rapproche de 1,50 $ contre 0,94 $ — et le total quotidien bascule en faveur de Qwen.
Aucun des deux ajustements n’est décisif à lui seul. Ensemble, ils font la différence entre deux modèles séparés par une erreur d’arrondi et Qwen3.8-Flash-Next nettement moins cher à exploiter, et le seul moyen de savoir lequel de ces cas s’applique est de compter les tokens sur votre propre trafic plutôt que de raisonner à partir de la grille tarifaire.

Où le tarif unique cesse de paraître unique
Le prix de Claude Haiku 5.5 comporte un palier, alors que celui de Qwen3.8-Flash-Next n'en comporte pas.
• Prix — Claude Haiku 5.5 0,10 $ en entrée / 0,50 $ en sortie par million de tokens jusqu’à 100 000 tokens de prompt, puis 0,50 $ / 2,50 $ au-delà ; Qwen3.8-Flash-Next 0,15 $ / 0,47 $ forfaitaire.
• Entrée mise en cache — 0,01 $ en lecture et 0,125 $ en écriture pour Claude Haiku 5.5 ; 0,016 $ en lecture et 0,23 $ en écriture pour Qwen3.8-Flash-Next.
• Contexte — un million de tokens pour Claude Haiku 5.5. Pour Qwen3.8-Flash-Next, le nombre dépend de qui vous posez la question : Qwen publie une fenêtre d’un million de tokens, la configuration propre du checkpoint plafonne les embeddings de position à 262 144, et Artificial Analysis enregistre la configuration évaluée à 256 000.
• Sortie maximale — 128 000 tokens pour Claude Haiku 5.5 ; 131 072 sur notre fiche catalogue pour Qwen3.8-Flash-Next.
• Modalité d’entrée — texte et images pour Claude Haiku 5.5 ; texte pour Qwen3.8-Flash-Next.
• Sortie — 2026-10-07 pour Claude Haiku 5.5, 2026-08-26 pour Qwen3.8-Flash-Next.
• Poids — propriétaires, accessibles uniquement via API pour Claude Haiku 5.5 ; poids ouverts sous licence Qwen Community License 1.0 pour Qwen3.8-Flash-Next.
Trois de ces lignes vont à l'opposé du titre sur le prix, et le palier lié à la longueur du prompt est le plus marqué. En dessous de 100 000 tokens de prompt, Claude Haiku 5.5 est le modèle le moins cher sur les deux lignes tarifaires. Au-dessus, le tarif d'entrée d'Anthropic est multiplié par cinq et Qwen3.8-Flash-Next conserve un avantage de 3,3× en entrée et de 5,3× en sortie. Le seuil coïncide à peu près avec l'endroit où les fenêtres de contexte divergent de toute façon — un million de tokens pour un modèle, 262 144 pour l'autre —, si bien qu'un pipeline qui a besoin de la fenêtre longue est aussi celui qui paie le tarif de second niveau pour l'obtenir.
Ce n'est pas une critique de la tarification ; des tarifs par paliers en fonction de la longueur du prompt sont une façon normale de facturer un modèle à long contexte. C'est un avertissement concernant la comparaison. Une comparaison directe réalisée avec des prompts de 8 000 jetons décrit une paire de prix. Les deux mêmes modèles avec des prompts de 400 000 jetons forment une paire entièrement différente, et le moins cher dans le second cas était le plus cher dans le premier.
Ce que disent les tableaux des fournisseurs en dessous
Aucun des deux fournisseurs n'a exécuté la suite d'évaluation de l'autre, de sorte que le tableau partagé se limite aux lignes qu'Artificial Analysis a mesurées sur les deux.
• Intelligence Index v4.3.2 — 43,40 pour Claude Haiku 5.5 (Max) contre 39,82 pour Qwen3.8-Flash-Next. Une avance de 3,57 points pour Anthropic, le plus grand écart composite de cette série.
• Coût par tâche Index terminée — 0,21 $ contre 0,37 $ sur le même tableau.
Durée de la tâche — 424,6 secondes contre 1 524,3 secondes.
• Terminal Bench 4.0 — 0,3283 contre 0,2525. Claude Haiku 5.5 de 7,6 points.
• SciCode — 0,5498 contre 0,5058. Claude Haiku 5.5 de 4,4 points.
• Humanity's Last Exam — 0,4439 contre 0,3804. Claude Haiku 5.5 de 6,4 points.
• AutomationBench, score partiel — 0,3541 contre 0,5591. Qwen3.8-Flash-Next de 20,5 points.
Six lignes pour Anthropic, dont certaines larges, et une ligne pour Qwen avec une marge de 20 points. Le profil est le même que celui qui parcourt toute cette gamme de prix : le petit modèle d'Anthropic est plus fort en raisonnement, en science et sur le coût et la latence pour obtenir une réponse, et plus faible pour mener une tâche à plusieurs étapes jusqu'à son terme. Qwen3.8-Flash-Next, c'est l'inverse.
L'écart entre la ligne composite et la ligne agentique est inhabituellement large ici — 3,57 points dans un sens, 20,5 dans l'autre — ce qui en fait la paire la moins ambiguë de la bande sur cet axe. Si votre travail consiste en une seule question difficile à laquelle on répond une fois, Claude Haiku 5.5 est en avance sur chaque mesure que vous remarquerez. Si votre travail est un agent qui doit aller au bout, Qwen3.8-Flash-Next est en avance sur la seule ligne qui le prédit, et son avantage dépasse l'écart composite d'un facteur cinq.

Les 180 milliards de paramètres que vous pouvez tenir
La ligne qui tranche cette comparaison pour beaucoup d’équipes ne figure pas du tout dans le tableau de référence.
Qwen3.8-Flash-Next est un modèle à mélange d'experts creux, avec 180 milliards de paramètres au total et 6 milliards actifs — un ratio qui maintient le calcul dépensé par jeton modeste par rapport à la capacité totale du modèle. Il est publié sous la Qwen Community License 1.0, qu'Artificial Analysis répertorie comme une licence commerciale plutôt que permissive ; cette distinction vaut la peine d'être lue avant de planifier en fonction, car une licence communautaire n'est pas MIT et comporte ses propres conditions en matière de redistribution et d'échelle. Il peut être téléchargé, auto-hébergé, épinglé à un checkpoint, quantifié et affiné, sous réserve de ces conditions.
Claude Haiku 5.5 ne peut être aucune de ces choses. Il est propriétaire, uniquement accessible via API, sans nombre de paramètres publié, sans licence et sans dépôt. Anthropic s'engage à garantir qu'il reste appelable jusqu'à une date non antérieure au 2027-10-07, ce qui est une garantie réelle et spécifique — mais une garantie de disponibilité est un produit différent des poids eux-mêmes.
La conséquence pratique joue dans les deux sens, et il vaut la peine de le dire clairement plutôt que d'en faire un argument de vente pour l'un ou l'autre camp. Les équipes qui ont besoin d'inférence à l'intérieur de leur propre environnement, d'un checkpoint figé sur lequel elles peuvent comparer des différences, ou de la possibilité d'affiner le modèle sur des données métier ne choisissent pas entre ces deux modèles sur des scores de benchmark. Elles choisissent Qwen3.8-Flash-Next, parce que l'autre option n'offre pas ce dont elles ont besoin, à aucun prix. Les équipes qui ont besoin d'un endpoint managé avec une system card publiée, un ensemble d'évaluation documenté et un engagement de retrait choisissent l'autre direction, et les poids ne sont pas une fonctionnalité qu'elles comptaient utiliser.
Gérer le côté forfaitaire
Une note sur le nom. Le comité indépendant répertorie ce modèle sous le nom de Qwen3.8-Flash-Next ; notre propre catalogue répertorie la même version sous le nom de fournisseur plus court Qwen3.8 Flash, au tarif identique de $0.15 / $0.47 avec un tarif de $0.0184 pour les entrées en cache, et fait pointer son dépôt vers les poids Hugging Face publiés le 2026-08-26. Lorsque les chiffres ci-dessous proviennent d’Artificial Analysis, ils se rapportent à l’entrée que celle-ci désigne sous le nom de Qwen3.8-Flash-Next. Il s’agit du même modèle ; le comité reprend simplement le plus long de ses noms.
Qwen3.8-Flash-Next figure au catalogue d'OrcaRouter au prix catalogue du fournisseur, avec 0 % de marge, répercuté tel quel plutôt que lissé — ainsi, les 0,15 $ et 0,47 $ ci-dessus sont les tarifs qui figurent sur la facture, et une modification du côté de Qwen se répercute chez nous le jour même plutôt que lors d'une révision tarifaire ultérieure. Claude Sonnet 5.5 et Claude Opus 5.5 figurent également au catalogue, ce qui fait du chemin d'escalade d'un petit modèle vers un modèle de milieu de gamme d'Anthropic une simple configuration de routage plutôt qu'une seconde intégration. Une seule API pour plus de 200 modèles, une seule clé, basculement automatique en dessous, et le DSL de routage lorsque le plafond de coût a sa place dans la route plutôt que dans le code applicatif.
Claude Haiku 5.5 ne figure pas au catalogue. Il est accessible via l'API d'Anthropic, et le volet Anthropic de cette comparaison ne fait pas partie de ce que nous proposons aujourd'hui — mieux vaut le dire que de laisser planer l'ambiguïté.

Lequel des deux, et sur quels motifs ?
Si votre trafic est à forte composante d’entrées, que vos prompts font moins de 100 000 tokens et que vous payez pour un volume réel, Claude Haiku 5.5 est le modèle le moins cher sur les deux lignes tarifaires et celui qui obtient les meilleurs scores sur six des sept mesures communes — avec la réserve que la différence de 30 % au niveau du tokenizer et la verbosité d’Anthropic réduisent toutes deux une remise qui paraît plus importante sur la grille tarifaire qu’elle ne l’est sur la facture.
Si votre trafic est à forte proportion de sorties, ou si vos invites sont assez longues pour dépasser le seuil d’Anthropic, ou si vous avez besoin du tarif forfaitaire pour vos prévisions, Qwen3.8-Flash-Next est moins cher — parfois d’un facteur cinq sur les sorties au-delà du palier — et c’est le modèle qui remporte la ligne d’achèvement agentique avec 20 points d’avance.
Si vous avez besoin des poids, la comparaison n'est pas serrée, et le prix n'entre jamais en ligne de compte.
Les deux cartes présentent moins de trois cents par million de tokens d’écart sur un mélange 3:1, ce qui est suffisamment proche pour que le tarif ne soit pas ce qui doit trancher. Ce qui tranche, c’est dans lequel de ces trois paragraphes vous vous situez, et c’est une question qui concerne votre pipeline plutôt que l’un ou l’autre des modèles.
