
Claude Haiku 5.5 vs Qwen3.8-Flash-Next : un contexte de 1 M pour deux décomptes de tokens très différents
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Le chiffre mis en avant pour ces deux modèles est le même, et c’est précisément pourquoi la comparaison mérite d’être faite correctement. Claude Haiku 5.5 offre une fenêtre de contexte d’un million de jetons. Qwen3.8-Flash-Next offre une fenêtre de contexte d’un million de jetons. Mais les deux fournisseurs mesurent cette fenêtre dans des unités différentes, les deux modèles découpent le même texte en jetons différemment, et les deux grilles tarifaires la facturent selon des logiques différentes — donc « les deux sont des modèles à un million de jetons » est vrai et presque inutile comme critère d’achat. Ce qui les distingue réellement, c’est la manière dont chacun consomme un million de jetons de votre document, et si les mesures indépendantes confortent l’argumentaire du fournisseur une fois les unités rendues comparables.
Les nombres, côte à côte et dans les mêmes unités
Les deux fournisseurs annoncent une fenêtre d’un million de tokens ; un seul publie un prix qui tient à cette taille. C’est la première véritable différence :
• Fenêtre de contexte — Claude Haiku 5.5 1 000 000 de jetons vs Qwen3.8-Flash-Next 1 000 000 de jetons (publié par le fournisseur)
• Prix pour un contexte inférieur à 100K — Haiku 5.5 0,10 $ / 0,50 $ par million vs Qwen3.8-Flash-Next 0,15 $ / 0,47 $ (liste du fournisseur)
• Tarif au-delà de 100K de contexte — Haiku 5.5 0,50 $ / 2,50 $ par million vs Qwen3.8-Flash-Next 0,15 $ / 0,15 $ (liste du fournisseur)
• Indice indépendant — Haiku 5.5 43,395 vs Qwen3.8-Flash-Next 39,822 (Artificial Analysis)
• Coût mesuré par tâche — Haiku 5.5 : 0,2128 $ contre Qwen3.8-Flash-Next : 0,37218 $ (Artificial Analysis)
• Tokens de sortie mesurés par tâche — Haiku 5.5 162 164 vs Qwen3.8-Flash-Next 107 885 (Artificial Analysis)
• Temps d'horloge mesuré par tâche — Haiku 5.5 426,26 s contre Qwen3.8-Flash-Next 1 530,19 s (Artificial Analysis)
• Architecture — non divulguée pour Haiku 5.5 ; Qwen3.8-Flash-Next est un modèle 180 B avec 6 B de paramètres actifs, à mélange d'experts (publié par le fournisseur)
• Licence — Haiku 5.5 fermé et accessible uniquement via API ; Qwen3.8-Flash-Next sous la Qwen Community Licence 1.0 (publiée par le fournisseur)
La ligne la plus déterminante de cette liste est la troisième, et de loin. Qwen3.8-Flash-Next facture un tarif unique — 0,15 $ et 0,47 $ — quelle que soit la taille de la requête. Claude Haiku 5.5, non : le tarif quintuple dès qu’une requête dépasse 100 000 tokens, pour passer à 0,50 $ et 2,50 $. Deux modèles qui annoncent des fenêtres de contexte identiques ont donc des courbes de coûts totalement différentes sur cette fenêtre, et un document de 500 000 tokens est le cas qui le révèle. Sur le Qwen, la requête coûte ce que coûte toujours une requête de 500 000 tokens. Sur le Haiku, elle coûte cinq fois ce que le tarif affiché du modèle laisserait supposer, parce que chaque token de la requête est facturé au palier long, et pas seulement les tokens au-delà du seuil.

Pourquoi le nombre de jetons par tâche compte davantage que la fenêtre
Les grilles tarifaires des fournisseurs comparent un jeton à un jeton, ce qui est parfait jusqu’à ce que vous remarquiez que les deux modèles ne produisent pas le même nombre de jetons pour le même travail. Les propres exécutions de tâches d’Artificial Analysis le rendent visible : Claude Haiku 5.5 consomme, selon les mesures, 162 164 jetons de sortie pour accomplir une tâche que Qwen3.8-Flash-Next termine en 107 885. Mettez cela en regard des prix par jeton et l’avantage de prix que Haiku 5.5 possède sur le papier s’évapore en partie — le Haiku est environ 50 % plus verbeux par tâche, ce qui constitue un véritable multiplicateur de coût qui n’apparaît jamais sur une grille tarifaire.
Ça fonctionne aussi dans l'autre sens, et c'est précisément le point qui compte pour la gamme flash. Qwen3.8-Flash-Next est un modèle Mixture-of-Experts, 180 milliards de paramètres dont 6 milliards actifs, et Artificial Analysis l'a mesuré à 56,04 jetons de sortie par seconde sur une tâche qu'il a mis 1 530 secondes à terminer. Claude Haiku 5.5 a terminé la même catégorie de tâche en 426 secondes. Sur le classement indépendant, le Haiku est à la fois plus rapide et, en dollars absolus, moins cher par tâche — 0,2128 $ contre 0,37218 $ — malgré le fait qu'il soit le plus verbeux des deux. Le prix catalogue du fournisseur présente le modèle flash comme l'option économique ; le coût mesuré pour terminer une tâche dit le contraire. Cet écart mérite d'être compris avant que l'un ou l'autre modèle ne se retrouve dans un modèle de coûts.
La propre présentation d'Anthropic concernant Claude Haiku 5.5 indique qu'il est en moyenne environ 75 % moins cher à exploiter que le modèle qu'il remplace, et que son nouveau tokeniseur produit environ 30 % de tokens en plus pour un même texte. Ces deux affirmations sont celles du fournisseur lui-même, et toutes deux importent ici, car c'est la seconde qui fait de la première un chiffre net plutôt qu'un chiffre de tarif catalogue. Pour une comparaison avec Qwen, ce qui compte, c'est que l'écart du nombre de tokens est réel et mesuré, et non théorique — les exécutions de tâches indépendantes le montrent directement.
Le cas du contexte long, traité avec soin
Placez un document véritablement volumineux devant les deux et les deux grilles tarifaires donnent des réponses opposées selon ce que vous en faites. À 60 000 jetons par requête, Claude Haiku 5.5 est moins cher en entrée comme en sortie — 0,10 $ / 0,50 $ contre 0,15 $ / 0,47 $ — et la pénalité de verbosité du Haiku n'est pas encore assez importante pour inverser cela sur un travail à dominante d'entrée. À 200 000 jetons par requête, le tarif d'entrée du Haiku est de 0,50 $ contre 0,15 $ pour le Qwen, et son tarif de sortie est de 2,50 $ contre 0,47 $. Le Qwen est trois fois moins cher en entrée et environ cinq fois moins cher en sortie, et le reste jusqu'au bout de la fenêtre d'un million de jetons.
Ce qui importe ici, au-delà de l'arithmétique, c'est que les deux modèles annoncent la même fenêtre pour des usages différents. L'argument de vente de Qwen3.8-Flash-Next est une grande fenêtre à prix fixe, et c'est ce qui en fait un candidat pour les charges de travail gourmandes en recherche et en documents : on lui donne tout le contenu, on paie un tarif prévisible, on cesse de construire une couche de récupération. La fenêtre d'un million de jetons de Claude Haiku 5.5 est bien réelle et exploitable, mais sa tarification pour le contexte long en fait un endroit que l'on traverse pour une raison précise plutôt qu'un endroit où l'on s'installe. Si votre charge de travail se résume à un gros document par appel, la structure tarifaire à elle seule vous pousse vers le Qwen ; s'il s'agit de nombreux petits appels avec un gros appel occasionnel, le palier court du Haiku est le foyer le moins cher pour les nombreux appels, et le gros appel occasionnel est un coût que vous pouvez budgéter individuellement.
Ce que le conseil indépendant dit à propos de la capacité
L'écart de capacités entre les deux est réel et il tourne à l'avantage de Claude Haiku 5.5, mais moins que ne pourrait le suggérer la structure tarifaire. Artificial Analysis classe le Haiku à 43,395 sur son Intelligence Index, contre 39,822 pour le Qwen — une différence d'environ neuf pour cent, ce qui est significatif mais loin d'être une génération. Sur les sous-benchmarks plus difficiles, l'ordre tient : 0,329 contre 0,253 sur Terminal-Bench Hard, 0,444 contre un score HLE inférieur, et le Haiku est en tête sur les mesures agentiques publiées par le classement.

En revanche, Qwen3.8-Flash-Next l'emporte sur l'économie du coût par paramètre et sur le fait que ses poids sont disponibles sous la Qwen Community Licence 1.0 — ainsi, comme la gamme GLM, il peut être auto-hébergé par une équipe qui le souhaite. Claude Haiku 5.5, non. Pour une charge de travail où l'inférence doit avoir lieu sur votre propre matériel, le modèle fermé n'est pas un candidat, quel que soit son score, et la configuration MoE 180B/6B est au moins une chose défendable à essayer de faire tourner soi-même si c'est la contrainte à laquelle vous êtes soumis.
Les fonctionnalités agentiques penchent dans l'autre sens. Claude Haiku 5.5 est livré avec une réflexion adaptative, un réglage d'effort par défaut sur medium et — pour la première fois dans la classe Haiku — un curseur d'effort ajustable allant de Low à Max. Qwen3.8-Flash-Next ne propose pas de contrôle équivalent. Pour le travail agentique, où l'on souhaite arbitrer entre latence et profondeur de raisonnement à chaque appel, ce curseur constitue un véritable facteur de différenciation en faveur du Haiku, et c'est une capacité que la comparaison des prix ne prend pas en compte.
Piloter les deux depuis un seul endroit
Les deux modèles se situent assez souvent de part et d'autre de la même ligne pour qu'une stack de production finisse par vouloir les deux — le Haiku pour les appels courts et de haute qualité, et le Qwen pour l'ingestion à long contexte. OrcaRouter sert qwen/qwen3.8-flash, le frère de Qwen3.8-Flash-Next, à 0,15 $ et 0,47 $ par million de jetons avec une fenêtre d'un million de jetons, au prix catalogue du fournisseur et sans marge, sur la même clé et la même facture que le reste d'un catalogue de plus de 200 modèles.
Ni Claude Haiku 5.5 ni Qwen3.8-Flash-Next lui-même ne figurent dans notre catalogue — pour ceux-là, c'est l'API du fournisseur lui-même et plusieurs plateformes tierces qui permettent de se les procurer. Ce que nous proposons dans cette comparaison, c'est le modèle de base Qwen3.8-Flash, qui couvre la plupart des cas de contexte long pour lesquels on achèterait la variante Next, ainsi qu'une tarification répercutée sans marge, pour qu'un changement de tarif du fournisseur soit effectif de notre côté le jour même, et un basculement automatique lorsqu'un chemin de production doit rester opérationnel pendant un après-midi difficile chez un fournisseur.
La réponse courte
Si vos requêtes font moins de 100 000 tokens et que vous voulez le modèle le plus puissant, Claude Haiku 5.5 est à la fois moins cher au token et mieux noté, et le choix est évident. Si vos requêtes dépassent régulièrement 100 000 tokens — la seule raison de s'intéresser à une fenêtre d'un million de tokens, d'ailleurs —, le tarif forfaitaire de Qwen3.8-Flash-Next le rend trois à cinq fois moins cher sur les requêtes longues, et son nombre mesuré de tokens de sortie est plus faible, si bien que l'écart sur votre facture sera plus important que ne le suggère la différence de prix affiché.

Le point à trancher avant de décider n’est pas de savoir quel modèle a la plus grande fenêtre ; les deux ont la même. C’est la forme de votre distribution des tailles de requêtes, car c’est elle qui détermine à laquelle de ces deux grilles tarifaires vous êtes réellement soumis. Prenez le 95e percentile de la taille des requêtes, mettez-le en regard de la barre des 100 000 tokens, et la comparaison ci-dessus se réduit à une seule phrase pour votre trafic.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
