
Claude Haiku 5.5 vs Qwen3.8-Flash-Next : le modèle à poids ouverts n'est pas le moins cher
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
L'instinct veut qu'un modèle à poids ouverts de la gamme flash d'Alibaba casse les prix face à un petit modèle fermé d'Anthropic, et sur les deux prix affichés, c'est le cas : Qwen3.8-Flash-Next est proposé à 0,15 $ par million de jetons d'entrée et 0,47 $ par million de jetons de sortie sur l'API propre d'Alibaba, contre 0,10 $ et 0,50 $ pour Claude Haiku 5.5. Soumettez pourtant les deux à la même suite de benchmarks, et l'ordre s'inverse. Artificial Analysis mesure Claude Haiku 5.5 en effort Max à 0,21 $ par tâche terminée de l'Intelligence Index ; Qwen3.8-Flash-Next coûte 0,37 $ sur la même mesure, pour un score inférieur de trois points. L'étiquette la moins chère appartient au modèle à la facture la plus élevée, et la raison est celle qui décide de la plupart de ces comparaisons : la grille tarifaire n'est pas le prix, et le modèle à poids ouverts justifie son coût ailleurs que sur une facture d'API managée. Ce « ailleurs » est le véritable sujet de ce duel.
Ce que chacun est
Les deux ont atterri à six semaines d’intervalle et ce ne sont pas le même genre d’artefact.
• Claude Haiku 5.5 — un modèle à poids fermés publié le 7 octobre 2026, sur l'API Claude, Amazon Bedrock, Google Cloud, Microsoft Foundry et Claude Platform on AWS. Un contexte de 1 M de tokens, jusqu'à 128 000 tokens de sortie sur l'API Messages synchrone, une réflexion adaptative avec un réglage d'effort allant de Low à Max et une valeur par défaut de medium, une date de coupure des connaissances de juin 2026, et une grille tarifaire à paliers à partir de 100 000 tokens.
• Qwen3.8-Flash-Next — un modèle mixture-of-experts à poids ouverts publié le 26 août 2026 sous la licence qwen-community-1.0, décrit par Alibaba comme un aperçu expérimental de l'architecture qui sous-tendra Qwen4. Il stocke 125 Md de paramètres du modèle principal plus une table d'embeddings de n-grammes distincte de 51 Md — environ 176 Md avant un module de prédiction multi-tokens de 4 Md — et active 6 Md par token, avec 512 experts, un routage top-10 et 48 couches. Il dispose nativement de 262 144 tokens de contexte, extensible à 1 M avec YaRN, et accepte en entrée du texte, des images et de la vidéo.
• Qwen3.8-Flash — l'équivalent commercial servi, également disponible depuis le 26 août 2026 sur QwenCloud d'Alibaba, à 0,16 $ par million de jetons en entrée et 0,47 $ par million de jetons en sortie, avec un contexte par défaut de 1 M de jetons. À distinguer de Flash-Next : l'un est un checkpoint que vous pouvez télécharger et inspecter, l'autre est un point de terminaison géré avec un tarif.
La distinction entre les deux derniers est toute la raison pour laquelle cette comparaison est intéressante. Claude Haiku 5.5 et Qwen3.8-Flash-Next ne rivalisent que sur très peu de points, car un seul d’entre eux peut être exécuté sur votre propre matériel.
La facture mesurée, qui pointe dans l'autre sens.
Tous les chiffres indépendants suivants proviennent d’Artificial Analysis pour l’Intelligence Index v4.3.2. Les grilles tarifaires d’Anthropic et d’Alibaba correspondent aux prix publiés par les fournisseurs eux-mêmes.
• Indice d'intelligence — Claude Haiku 5.5 en effort Max 43, deuxième sur 182 modèles. Qwen3.8-Flash-Next 40, sixième sur 117 dans sa catégorie. Trois points d'écart, en faveur d'Anthropic.
• Coût par tâche — 0,21 $ contre 0,37 $. Le modèle plus cher par token est 43 % moins cher par tâche terminée.
• Jetons de sortie lors de l’exécution de l’Index — 440 millions pour Claude Haiku 5.5 et 240 millions pour Qwen3.8-Flash-Next, tous deux comparés à une médiane de 100 millions. Le modèle Qwen est le rédacteur le plus efficace et représente pourtant la tâche la plus coûteuse, ce qui montre que l’écart ne tient pas uniquement au volume de jetons, mais à la combinaison d’entrées et à la valorisation que l’évaluateur applique.
• Vitesse de sortie — 241,9 jetons par seconde contre 56,0. Claude Haiku 5.5 est plus de quatre fois plus rapide sur la même mesure, et son temps jusqu'au premier jeton de 295 secondes lors de cette exécution est un artefact de la réflexion à l'effort Max plutôt qu'un chiffre réseau ; le temps jusqu'au premier jeton de Qwen3.8-Flash-Next est de 2,53 secondes.
• Structure de la grille tarifaire — Claude Haiku 5.5 passe de 0,10 $ et 0,50 $ à 0,50 $ et 2,50 $ à 100 000 tokens. Qwen3.8-Flash reste fixe à 0,16 $ et 0,47 $ quelle que soit la longueur, ce qui constitue un véritable avantage sur les prompts longs et le seul endroit où l'argument du prix affiché survit au contact d'un long document.
• Tokeniseur — Claude Haiku 5.5 utilise le nouveau tokeniseur partagé avec Claude 4.7 et les versions ultérieures, de sorte qu'un même texte compte environ 30 % de tokens en plus que sur le Haiku précédent. Cela gonfle les prompts à l'approche du palier des 100 000 tokens ; c'est la documentation d'Anthropic elle-même, et cela joue contre le modèle précisément dans le cas des prompts longs où le tarif forfaitaire de Qwen semble le plus avantageux.
Donc la structure de l’arbitrage est la suivante : payer plus par token, obtenir une réponse plus rapide et légèrement plus intelligente qui coûte moins par tâche accomplie, avec une falaise tarifaire à surveiller sur les entrées longues. Ou payer moins par token et obtenir un modèle plus lent qui coûte plus par tâche accomplie, avec un tarif fixe et une fenêtre native de 262 144 tokens.


Où les poids ouverts changent réellement l'arithmétique
Tout ce qui précède compare deux API managées, et c’est la comparaison que Qwen3.8-Flash-Next n’était pas conçu pour gagner. Son argument, c’est qu’il n’a pas besoin d’être loué.
• Prise en charge du serving dès le premier jour. SGLang a livré une page de cookbook et une image dédiée ; vLLM dispose d’un build pour cela, tandis que la pull request de prise en charge de l’architecture est encore ouverte. NVIDIA a validé les deux, ainsi que TensorRT LLM, sur un rack GB300 NVL72, et NeMo couvre le fine-tuning.
• Le seuil matériel est bas pour un point de contrôle de 176B. La table de plongement de n-grammes de 51B peut résider dans la mémoire hôte plutôt que dans la VRAM, car ses adresses de recherche sont connues à l'avance et peuvent être préchargées. C'est ce qui permet au modèle de tourner sur des clusters DGX Spark et des stations de travail 4×RTX PRO 6000 ; et les quantifications communautaires réalisées le jour même — des versions 1-bit qui tiennent dans 75 Go de RAM à environ 80 % de la précision complète — permettent de l'exécuter sur du matériel qu'une petite équipe possède.
• Le fine-tuning est disponible. Pas au sens d'une API d'affinage hébergée : les poids vous appartiennent, sous une licence communautaire avec les conditions habituelles, et l'architecture est documentée dans un rapport technique qui publie les ablations et les résultats négatifs.
• La fenêtre est plus petite qu'elle n'en a l'air. 262 144 tokens en natif, extensible à 1 M avec YaRN — contre 1 M en natif sur Claude Haiku 5.5, sans réserve liée au rope-scaling. Sur les charges de travail à documents longs, là où le tarif fixe de Qwen paraît le plus attractif, le modèle capable de réellement contenir le document est l'autre.
• Les benchmarks sont déclarés par le fournisseur. Le tableau d'Alibaba lui-même classe Flash-Next devant DeepSeek-V4-Flash-0731 sur DeepSWE 1.1 (58,7 contre 54,4), SWE-bench Pro (62,5 contre 56,0) et GPQA Diamond (91,7 contre 90,8), et derrière lui sur NL2Repo-Bench (48,1 contre 54,2) — génération de code au niveau du dépôt, la seule dimension agentique où le modèle plus petit ne parvient pas à suivre. Rien de tout cela n'a été reproduit par un tiers, et le modèle a six semaines.
C'est la frontière honnête entre les deux. Claude Haiku 5.5 est un service facturé à l'usage, avec un plafond de qualité fixe et aucune surface opérationnelle. Qwen3.8-Flash-Next est un artefact dont la courbe de coût s'infléchit vers le prix de l'électricité et dont le plafond de qualité correspond à ce que vous pouvez servir, avec en plus le risque d'un tableau de référence non reproduit et d'une architecture encore en cours d'assimilation par les runtimes.
La manière réaliste de décider
Trois questions suffisent pour trancher, et seule la première porte sur les benchmarks.
Avez-vous des GPU, ou en voulez-vous ? Si non, le cas de l'auto-hébergement reste théorique et la comparaison avec les offres managées ci-dessus résume tout — et elle tourne à l'avantage de Claude Haiku 5.5 en termes de coût par tâche, de vitesse et de score, avec la réserve que son étape de 100 000 tokens pénalise les prompts longs. Si vous disposez d'accélérateurs dont l'utilisation est inférieure à un objectif, Qwen3.8-Flash-Next est l'un des rares modèles ouverts où un décodage à 6 B de paramètres actifs est véritablement bon marché à exécuter à grande échelle, et le chiffre de 0,37 $ par tâche cesse d'être le nombre pertinent.
Quelle est la longueur moyenne d’un prompt ? C’est le seul cas où l’argument du prix affiché tient. En dessous de 100 000 tokens — après un tokeniseur qui gonfle d’environ 30 % — Claude Haiku 5.5 est moins cher sur tous les compteurs. Au-dessus, le tarif fixe de 0,16 $ et de 0,47 $ est la meilleure carte, et son avantage s’accentue avec la longueur jusqu’à la fenêtre native de 262 144 tokens, au-delà de laquelle l’extension YaRN relève d’un autre problème d’ingénierie.
Quelle est la tolérance de la charge de travail aux variations de latence ? 241,9 jetons de sortie par seconde contre 56,0, c'est un écart considérable, et un déploiement auto-hébergé y ajoute de la mise en file d'attente. Un agent d'assistance en direct ou de pilotage de navigateur — les charges de travail qu'Anthropic cite pour ce niveau — ressentira la différence.
Pour quiconque veut répondre aux deuxième et troisième questions plutôt que d'en raisonner, l'instrument le moins cher est un point de terminaison partagé. Qwen3.8-Flash-Next ne figure pas encore au catalogue d'OrcaRouter, et Claude Haiku 5.5 non plus ; le frère Qwen que nous routons, lui, est Qwen3.8-Flash, au prix catalogue du fournisseur, avec 0 % de marge répercutée, qui est l'équivalent servi le plus proche du modèle de cette comparaison et la bonne référence pour un test de coût sur prompt long. Côté Anthropic, Claude Haiku 4.5, Claude Sonnet 5.5 et Claude Opus 5.5 sont tous appelables depuis la même clé aujourd'hui, si bien qu'une expérience tarifaire portant sur deux générations relève de la configuration plutôt que d'un second contrat — et comme la tarification est répercutée telle quelle plutôt que lissée, une baisse consentie par le fournisseur sur l'un ou l'autre volet se répercute chez nous le jour même de son annonce. Le basculement automatique est ce qui permet de lancer l'expérience sans risque sur du trafic réel : un modèle en preview ou un tableau de benchmarks non reproduit est exactement le cas de figure où l'on fait pointer une route vers quelque chose de nouveau tout en gardant un modèle de confiance derrière.
Qu’est-ce qui changerait la réponse ?
Deux choses, toutes deux vérifiables. La première est l'évaluation indépendante de Qwen3.8-Flash-Next sur un harnais qui fait aussi tourner Claude Haiku 5.5 — le tableau du fournisseur est face à DeepSeek, et le 40 du classement indépendant est un placement unique. Un score de codage au niveau du dépôt est la ligne à surveiller, car NL2Repo est le domaine où le modèle a déjà été montré en retrait. La seconde est de savoir si le travail sur le runtime aboutit : le support vLLM est encore en cours de fusion via des pull requests ouvertes, et tant que ce n'est pas fait, l'auto-hébergement de cette architecture est un exercice pour les équipes qui aiment ce genre de choses plutôt qu'un chemin pris en charge.
En attendant, le résumé est court. Qwen3.8-Flash-Next est le modèle le plus intéressant à posséder et le plus cher à louer. Claude Haiku 5.5 est l’option gérée la moins chère, la plus rapide et la mieux notée, avec une grille tarifaire qui pénalise tout ce qui est long. Choisissez selon que vous achetez des tokens ou un checkpoint — et si vous achetez des tokens, notez que le modèle à poids ouverts n’est pas le rabais que vous imaginiez.

