Une carte vedette générée intitulée « Claude Haiku 5.5 vs Qwen3.8 27B », avec le surtitre « POIDS OUVERTS VS L'API », affichant Claude Haiku 5.5 à Entrée 0,10 $, Sortie 0,50 $ et Indice 43,40 contre Qwen3.8 27B à Entrée 0,50 $, Sortie 3,00 $ et Indice 33,70, au-dessus d'une barre indiquant « Coût par tâche terminée 0,21 $ vs 1,01 $ ».
Engineering & Research

Claude Haiku 5.5 vs Qwen3.8 27B : une victoire nette sur l'API, et pourquoi les poids ouverts existent encore

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La plupart des comparaisons de cette série se résument à un compromis. Celle-ci non, et l'absence de compromis est en soi le constat. Claude Haiku 5.5, sorti le 7 octobre 2026, surpasse Qwen3.8 27B, le modèle dense à poids ouverts de 27B du 14 août 2026, sur le score d'intelligence composite, sur le coût par token, sur le coût par tâche terminée, sur la fenêtre de contexte, sur le plafond de réponse, sur le codage agentique et sur les lignes de raisonnement scientifique — et il y parvient depuis une unique API propriétaire qui ne nécessite aucun matériel. La seule ligne que Qwen3.8 27B remporte haut la main est l'entrée vidéo, et l'autre est une licence.

Ce n'est pas une raison pour enterrer le modèle, car une licence Apache-2.0 et une modalité vidéo ne sont pas des prix de consolation. C'est une raison d'être précis sur les raisons pour lesquelles quiconque choisirait le camp de l'open-weights, et d'arrêter de prétendre que le débat porte sur les benchmarks.

Les nombres sur lesquels les deux modèles ont réellement été exécutés

Par million de jetons en dollars américains. Les tarifs du fournisseur proviennent de sa propre documentation tarifaire ; les mesures partagées correspondent à l’Artificial Analysis Intelligence Index v4.3.2, relevé le 2026-10-08, les deux dans leur configuration d’effort la plus élevée publiée.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8 27B — the scoreboard' with rows Index v4.3.2 43.40 against 33.70, cost per task $0.21 against $1.01, input price $0.10 against $0.50, context window 1M tokens against 256K tokens, AutomationBench 0.3541 against 0.4824 and weights 'proprietary' against 'open, Apache 2.0', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; Qwen vendor-card scores are unreproduced by the board.'

• Entrée — Claude Haiku 5.5 0,10 $ jusqu'à 100 000 tokens et 0,50 $ au-delà ; Qwen3.8 27B 0,50 $ au tarif tiers enregistré par le conseil.

• Sortie — Claude Haiku 5.5 : 0,50 $ jusqu’à 100 000 tokens et 2,50 $ au-delà ; Qwen3.8 27B : 3,00 $.

• Entrée mise en cache — Claude Haiku 5.5 0,01 $ et 0,05 $, une réduction de 90 % ; Qwen3.8 27B 0,10 $, une réduction de 80 %.

• Score indépendant — 43,40 pour Claude Haiku 5.5 (Max) contre 33,70 pour Qwen3.8 27B (Xhigh). Un écart de 9,70 points, le plus large de ce lot.

• Coût par tâche terminée — 0,21 $ contre 1,01 $, sur la même exécution d’évaluation. Un écart de 4,7x, également le plus large ici.

• Contexte et sortie — 1 M de jetons et un plafond de réponse de 128 000 jetons pour Claude Haiku 5.5 ; un contexte de 256 K jetons pour Qwen3.8 27B.

• Modalité — les deux prennent en entrée du texte et des images et renvoient du texte. Qwen3.8 27B ajoute l’entrée vidéo ; ce n’est pas le cas de Claude Haiku 5.5.

• Poids — Qwen3.8 27B est un modèle à 27 milliards de paramètres denses sous Apache 2.0, téléchargeable. Claude Haiku 5.5 est propriétaire et accessible uniquement via API.

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the two-tier pricing lines and 'Released October 7, 2026'.

Pourquoi l'écart par tâche est quatre fois l'écart par token

La grille tarifaire montre déjà un écart de 5x en entrée et de 6x en sortie en faveur du fournisseur, donc le sens ne fait aucun doute. Ce qui mérite d'être relevé, c'est que le chiffre par tâche est inférieur à celui par jeton, soit l'inverse de ce qui s'est produit dans les autres confrontations de ce lot, et la raison est instructive.

Claude Haiku 5.5 émet 162 164 tokens de sortie par tâche de l'Intelligence Index — 129 047 pour le raisonnement et 33 118 pour la réponse. Qwen3.8 27B en émet 66 797, répartis en 47 711 pour le raisonnement et 19 087 pour la réponse. Le modèle du fournisseur consomme 2,4 fois plus de tokens par tâche, de sorte que son avantage de 6x en débit de sortie se réduit à un avantage de 4,7x par tâche. Il reste énorme. Ce n'est simplement pas le chiffre que la grille tarifaire annonce.

Le calcul du mélange est une façon plus claire d’en voir la structure. Sur un mélange 7:2:1 à forte composante d’entrée — la pondération que la plupart du trafic de production a réellement — Claude Haiku 5.5 revient à 0,077 $ par million de tokens, contre 0,470 $ pour Qwen3.8 27B. Sur un mélange équilibré 1:1, c’est 0,30 $ contre 1,75 $. Le seuil de 100 000 tokens du fournisseur est la seule chose qui parvient à combler cet écart : au-delà, les compteurs de Claude Haiku 5.5 passent à 0,50 $ et 2,50 $ sur toute la requête, et les deux modèles se rejoignent à peu près au même prix — moment où vous payez une prime de score de 9,7 points pour rien.

Là où la carte du fournisseur et la carte indépendante divergent

Voici l'ensemble de lignes qui mérite qu'on s'y attarde, car la fiche de modèle de Qwen3.8 27B elle-même se lit comme nettement plus flatteuse que ne le sont les mesures indépendantes, et cet écart est précisément la raison pour laquelle une affirmation du type « un modèle de 27B qui rivalise avec des modèles bien plus grands » a besoin d'une seconde source.

Les chiffres publiés par le fournisseur lui-même, tels que consignés sur notre page de catalogue pour le modèle, incluent 90,3 sur LiveCodeBench v6, 89,2 sur GPQA Diamond, 84,3 sur OSWorld-Verified et 79,0 sur QwenSWEBench. Ces chiffres sont rapportés par le fournisseur et non reproduits, et ils décrivent un modèle qui est compétitif bien au-dessus de sa catégorie de poids.

Lors de l'exécution indépendante d'Artificial Analysis, Qwen3.8 27B obtient 0,0556 sur Terminal-Bench 4.0, 0,4664 sur SciCode, 0,3392 sur Humanity's Last Exam et 1 423,21 sur GDPval-AA v2.1. Placez le 0,0556 à côté du 84,3 que la fiche du fournisseur indique sur OSWorld, et la forme du désaccord est claire : dans les tâches agentiques sur ordinateur et terminal, le classement indépendant situe ce modèle à peu près là où un modèle dense de 27B a sa place, et la fiche du fournisseur, non.

Deux lignes vont bien dans l'autre sens, et elles méritent d'être citées pour la même raison. Qwen3.8 27B obtient 0.4824 sur AutomationBench, contre 0.3541 pour Claude Haiku 5.5 — une victoire indépendante de 12.8 points sur ce qui ressemble le plus, dans l'un ou l'autre de ces tableaux, à un benchmark d'automatisation métier. C'est un chiffre bien réel, issu de la même exécution, sur la ligne la plus proche de ce pour quoi les gens déploient réellement de petits modèles.

L'interprétation honnête n'est pas « le fournisseur a tout exagéré ». C'est qu'une fiche de modèle mesure les tâches que ses auteurs ont choisies, que le comité indépendant évalue un ensemble fixe, et que les points forts de Qwen3.8 27B figurent sur la liste du fournisseur et non sur celle du comité.

L’économie change lorsque vous possédez le matériel

Tous les tarifs indiqués ci-dessus sont des prix d’API, et pour Qwen3.8 27B, ce n’est pas le bon cadre.

Il s'agit d'un modèle dense de 27B sous Apache 2.0. Il tient sur un seul accélérateur moderne à la quantification que la plupart des équipes accepteraient, ce qui signifie que le coût marginal d'un token cesse d'être le compteur d'un fournisseur pour devenir votre propre utilisation. C'est pourquoi le prix pour l'appeler diffère selon l'hôte d'une manière qu'aucun des modèles propriétaires de cette comparaison ne pourrait jamais égaler : le tableau enregistre un tarif tiers de 0,50 $ en entrée et 3,00 $ en sortie, et le catalogue OrcaRouter l'affiche à 0,33 $ en entrée et 2,40 $ en sortie, sans aucune ligne de lecture de cache, car nous exécutons les poids sur notre propre infrastructure plutôt que de revendre le point de terminaison de quelqu'un d'autre.

Pour une équipe qui paie déjà des GPU, la comparaison n’est pas 0,21 $ contre 1,01 $ par tâche. C’est le tarif facturé par le fournisseur face au coût marginal d’une requête sur du matériel que vous possédez, et ce sont des chiffres différents. C’est l’argument du camp des poids ouverts, et c’est le seul qui résiste au contact du tableau de référence.

Il existe une seconde conséquence, moins évidente, du fait que la licence soit Apache 2.0 : le modèle peut être intégré dans un produit, affiné sur votre propre trafic, épinglé à une révision spécifique et audité jusqu'aux poids. Rien de tout cela n'est disponible à aucun prix auprès d'un modèle propriétaire uniquement accessible via une API, et pour les charges de travail réglementées, il s'agit fréquemment de la contrainte décisive plutôt que d'une préférence.

A capture of the OrcaRouter model page for Qwen3.8 27B under qwen/qwen3.8-27b, showing a 262K-token context chip, text, image and video input, text output, a p50 time to first token of 1.84 seconds, public benchmarks by Qwen dated 2026-08-15, and the page's own description of the model as Alibaba's open-weight 27B dense multimodal model released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure.

Appeler l'un ou l'autre d'entre eux

Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.

Claude Haiku 5.5 ne figure pas au catalogue. Il est accessible directement via l'API du fournisseur ainsi que via AWS, Azure et les principales plateformes cloud, et c'est là l'affirmation exacte. Ce que le catalogue propose de la gamme du fournisseur, ce sont Claude Sonnet 5.5 et Claude Opus 5.5, ce qui fait du passage d'un petit modèle auto-hébergé à un modèle agentique hébergé de gamme intermédiaire un simple changement de routage plutôt qu'une seconde intégration — le basculement automatique se trouve de toute façon en dessous.

Le verdict, qui est inhabituellement déséquilibré

En tant qu'appel API sur du texte ou des images, Claude Haiku 5.5 remporte cette comparaison sur chaque ligne qui ne porte pas sur les licences. Neuf virgule sept points d'indice, 4,7 fois moins cher par tâche terminée, quatre fois la fenêtre de contexte, deux fois le plafond de réponse, et un tarif affiché cinq à six fois inférieur dans le régime des invites courtes. Aucun argument fondé sur la forme de la charge de travail ne sauve Qwen3.8 27B sur le prix, car le désavantage du fournisseur — une forte consommation de jetons en sortie — vaut bien moins que son avantage de tarif.

Ce qui le sauve, c'est tout ce que le prix de l'API ne capture pas : une licence qui autorise la redistribution, des poids que l'on peut conserver et épingler, une entrée vidéo, et un chemin auto-hébergé où le coût par token est votre propre matériel plutôt que la carte d'un fournisseur. Si vous cherchez la façon la moins chère de classifier, extraire, résumer et router du texte, Claude Haiku 5.5 est la réponse, et l'écart n'est pas mince. Si vous cherchez un modèle que vous pouvez intégrer dans votre propre produit, sur votre propre matériel, sous votre propre audit, alors l'écart de benchmark a cessé d'être la question depuis plusieurs paragraphes.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement