Une carte hero générée pour « Des tarifs identiques, une facture trois fois plus élevée », avec le badge « MÊME STICKER », le surtitre « DEUX MODÈLES, 0,10 $ ET 0,50 $, UNE SEULE QUESTION » et le sous-titre « Claude Haiku 5.5 face à GPT-6 Luna : les deux mêmes chiffres, et des seuils très différents. » Quatre pastilles indiquent « 0,10 $ / 0,50 $ pour les deux », « 100K vs 272K », « 0,21 $ vs 0,07 $ » et « 43,40 vs 38,12 ». Deux cartes en dessous sont intitulées « LES MÊMES » (« 0,10 $ en entrée et 0,50 $ en sortie sous le premier palier, et une fenêtre de 1 M de tokens pour les deux ») et « PAS LES MÊMES » (« le palier se situe à 100 000 tokens contre 272 000, et le coût par tâche diffère d'un facteur trois »). Un pied de page indique « Tarifs catalogue publiés par les fournisseurs ; mesures indépendantes d'Artificial Analysis, relevées le 8 octobre 2026. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

Claude Haiku 5.5 vs GPT-6 Luna : même prix affiché, facture trois fois plus élevée

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Claude Haiku 5.5 et GPT-6 Luna sont proposés exactement au même prix sur le papier : 0,10 $ par million de jetons d'entrée et 0,50 $ par million de jetons de sortie, les deux mêmes chiffres au centime près, de la part de deux fournisseurs qui sont rarement d'accord sur quoi que ce soit. Le billet de lancement d'Anthropic imprime même les scores de Luna dans la colonne à côté des siens, ce que les fournisseurs ne font pas pour des modèles qu'ils considèrent comme non menaçants.

Les deux fiches divergent sur tout ce que l’étiquette cache. Luna maintient ce tarif jusqu’à 272 000 tokens avant de franchir un palier ; Claude Haiku 5.5 franchit un palier à 100 000. Claude Haiku 5.5 obtient un score de 43,40 sur l’Artificial Analysis Intelligence Index v4.3.2, contre 38,12 pour Luna — et coûte 0,21 $ par tâche Index terminée, contre 0,07 $ pour Luna. Même prix, facture trois fois plus élevée, cinq points d’intelligence en plus. C’est tout l’arbitrage, et il est plus net que la plupart des face-à-face de cette gamme.

Deux cartes, côte à côte

Par million de tokens en dollars américains, d’après les tarifs publiés d’Ant​hropic et d’OpenAI tels qu’ils figurent dans notre propre catalogue, avec des mesures indépendantes attribuées à Artificial Analysis. Mis en cache le 2026-10-08.

A generated scoreboard titled 'Claude Haiku 5.5 vs GPT-6 Luna - two cards, side by side'. Claude Haiku 5.5 reads input $0.10 under the first tier and $0.50 past 100,000, output $0.50 and $2.50 past 100,000, maximum output 128,000 tokens, Intelligence Index v4.3.2 43.40, cost per task $0.21, output speed 241.9 tokens per second. GPT-6 Luna reads input $0.10 under the first tier and $0.20 past 272,000, output $0.50 and $0.75, maximum output 128,000 tokens, Intelligence Index v4.3.2 38.12, cost per task $0.07, output speed 129.4 tokens per second. A footer reads 'Vendors' published list rates; independent measurements from Artificial Analysis.'

• Entrée — Claude Haiku 5.5 0,10 $ jusqu'à 100 000 tokens, 0,50 $ au-dessus. GPT-6 Luna 0,10 $ jusqu'à 272 000 tokens, 0,20 $ au-dessus.

• Sortie — Claude Haiku 5.5 0,50 $ jusqu'à 100 000 jetons, 2,50 $ au-delà. GPT-6 Luna 0,50 $ jusqu'à 272 000 jetons, 0,75 $ au-delà.

• Entrée mise en cache et écritures — toutes deux à $0.01 et $0.125 sous le premier seuil, Claude Haiku 5.5 passant à $0.05 et $0.625 au-delà de 100 000 jetons, et GPT-6 Luna à $0.02 et $0.25 au-delà de 272 000.

• Contexte et sortie — 1 M de jetons pour les deux ; 128 000 en sortie maximale pour les deux. Ces deux-là sont vraiment identiques.

• Réflexion — adaptative sur les deux, toutes deux avec un paramètre d’effort. L’effort par défaut de Claude Haiku 5.5 est moyen ; les scores publiés ne sont pas tous à ce réglage.

• Score indépendant — Claude Haiku 5.5 (Max) 43,40, deuxième sur 182 modèles. GPT-6 Luna (Max) 38,12, huitième sur 182.

• Coût indépendant par tâche — 0,21 $ contre 0,07 $.

• Vitesse — 241,9 jetons de sortie par seconde contre 129,4, mesurée par le même évaluateur.

Le seuil est là où se situe la différence

Les deux fournisseurs ont établi une grille tarifaire à deux niveaux. Ils l'ont fait à des endroits très différents, et l'emplacement compte bien plus que le chiffre en haut.

Ant​hropic place son palier à 100 000 tokens. En dessous, vous payez 0,10 $ et 0,50 $ ; au-dessus, cinq fois et cinq fois — 0,50 $ et 2,50 $. Ant​hropic indique que les prompts sous ce seuil représentaient environ 90 % des requêtes adressées à son précédent modèle Haiku, ce qui correspond à la répartition du trafic du fournisseur lui-même et décrit raisonnablement les charges de travail à appels courts en général.

Le palier d’OpenAI se situe à 272 000 tokens. En dessous, 0,10 $ et 0,50 $ — identiques à ceux d’Anthropic. Au-dessus, 0,20 $ et 0,75 $, soit un doublement et une augmentation de 50 %. C’est un palier beaucoup plus doux et il commence presque trois fois plus loin.

Prenez un prompt de 200 000 tokens, ce qui est une taille plausible pour un pipeline de documents longs et tout à fait raisonnable pour une fenêtre de 1 M de tokens. Sur Claude Haiku 5.5, cette requête est facturée au deuxième palier : 0,50 $ en entrée, 2,50 $ en sortie. Sur GPT-6 Luna, elle relève encore du premier palier : 0,10 $ en entrée, 0,50 $ en sortie. Cinq fois le tarif d’entrée et cinq fois le tarif de sortie, pour la même requête, entre deux modèles affichés au même prix. Ce n’est pas une nuance — pour une charge de travail à prompts longs, c’est toute la comparaison.

Pourquoi le même taux produit une facture trois fois plus élevée

Le coût par tâche est le chiffre qui devrait décider d'un pipeline à fort volume, et c'est ici que les deux modèles divergent d'une manière que la grille tarifaire ne saurait expliquer.

Artificial Analysis évalue GPT-6 Luna (Max) à 0,07 $ par tâche de l'Intelligence Index et Claude Haiku 5.5 (Max) à 0,21 $ — un facteur de trois, à tarifs affichés identiques, pour un écart de score de 5,28 points. La cause se trouve sur la même page et elle n'est pas subtile. Claude Haiku 5.5 a généré 440 millions de tokens de sortie lors de l'exécution de l'Index, contre une médiane de 100 millions, et l'évaluateur le qualifie de très verbeux. GPT-6 Luna en a généré 140 millions contre la même médiane de 100 millions, décrit comme quelque peu verbeux. Trois fois plus de tokens de sortie, c'est trois fois la facture lorsque la sortie est le compteur qui domine.

Les propres chiffres d'Ant​hropic pointent dans la même direction. Les graphiques coût/fiabilité du fournisseur positionnent Haiku 5.5 sur toute la plage d'efforts, et la citation mise en avant au lancement est que Sonnet 5.5 et Opus 5.5 restent les meilleurs choix pour le travail de codage agentique complexe, Haiku 5.5 étant quant à lui positionné pour la compaction, le résumé et les sous-agents. Plus la tâche est petite, moins vous achetez ce problème de verbosité — ce qui correspond précisément à la charge de travail pour laquelle le modèle a été conçu, et précisément à la charge de travail où un écart de coût d'un facteur trois mérite d'être vérifié par rapport à vos propres journaux plutôt qu'à un tableau de bord.

Une entrée de plus au registre, provenant de la documentation d'Anthropic plutôt que de celle de l'évaluateur : Claude Haiku 5.5 utilise le tokeniseur plus récent, partagé avec Claude 4.7 et les versions ultérieures, donc le même texte compte environ 30 % de tokens en plus que sur le précédent Haiku. Le tarif est le même que celui de Luna ; le tokeniseur, non.

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 specifications row and the published pricing table, with the per-million-token input, output and cache rates and the 100,000-token threshold at which the second tier begins.

Que dit le tableau d’Anthropic lui-même à propos de Luna ?

La page de lancement d'Ant​hropic présente GPT-6 Luna comme une colonne de son tableau de benchmarks, et la façon honnête de le rapporter est d'y joindre l'attribution : il s'agit des évaluations d'Ant​hropic, exécutées sur le harnais d'Ant​hropic, face au modèle d'un concurrent. Elles sont rapportées par le fournisseur, non reproduites de manière indépendante, et un fournisseur qui fait tourner sa propre suite face aux scores d'un rival, c'est une comparaison à peser plutôt qu'à accepter.

• Travail de la connaissance — GDPval-AA v2.1 à 1620 pour Claude Haiku 5.5 contre 1437 pour GPT-6 Luna. AA-Briefcase v1.1 à 1578 contre 1336.

• Utilisation d'ordinateur — sous-ensemble hors ligne d'OSWorld 2.1 à 72,4 % contre 48,9 %.

• Codage agentique — Terminal-Bench 4.0 à 39,2 % contre 16,4 % ; FrontierCode 1.1 (Main) à 46,4 % contre 42,4 %.

• Raisonnement visuel — Chartography à 46,4 % sans outils contre 29,1 %.

Sur le propre banc d'essai du fournisseur, Claude Haiku 5.5 arrive en tête sur chaque ligne. Sur le classement indépendant, son avance est plus faible — 43,40 contre 38,12 —, ce qui correspond à la relation habituelle entre le tableau d'un fournisseur et celui d'un tiers, et c'est la raison pour laquelle les deux sont reproduits ici. Les deux concordent sur la direction et divergent sur l'ampleur.

Le projet de loi est le vote décisif.

Mettez les quatre faits qui comptent vraiment en regard les uns des autres, et le choix cesse d'être serré pour la plupart des charges de travail.

GPT-6 Luna revient moins cher par tâche accomplie d’un facteur trois selon la mesure indépendante, son premier palier tarifaire va dix-huit fois plus loin dans la fenêtre de contexte, ses taux de dépassement de seuil sont plus faibles sur les deux indicateurs, et c’est le seul des deux dont la pénalité de contexte long est un doublement plutôt qu’un facteur cinq. Claude Haiku 5.5 est en avance sur l’intelligence mesurée d’une marge réelle et modeste, plus rapide d’un facteur de près de deux en sortie, et — sur le propre banc d’essai du fournisseur, où l’écart est le plus grand — en avance sur chaque ligne de benchmark publiée.

Si vos appels sont courts, si le débit est la contrainte, ou si la différence de qualité se voit dans votre propre évaluation, payez le triple. Si vos appels sont longs, s'ils sont générés par une machine et jamais lus par un humain, ou si vous utilisez un palier de classification qui se déclenche un million de fois par jour, les mêmes 0,10 $ et 0,50 $ vous permettront d'obtenir une facture trois fois moins élevée de l'autre côté, et la capacité à laquelle vous renoncez représente cinq points sur un classement où les deux modèles figurent près du sommet.

Appeler l’un ou l’autre depuis un seul endroit

L'avantage d'une comparaison aussi serrée, c'est que vous ne devriez pas avoir à croire qui que ce soit sur parole, y compris nous. GPT-6 Luna figure dès aujourd'hui au catalogue OrcaRouter au tarif du fournisseur, avec 0 % de marge — la même structure tarifaire imprimée ci-dessus, répercutée plutôt que lissée — et il en va de même pour Claude Sonnet 5.5 et Claude Opus 5.5, ce qui fait d'un test d'escalade depuis un segment bon marché vers un palier intermédiaire une configuration plutôt qu'un projet. Une clé, un SDK, un basculement automatique en arrière-plan, et le DSL de routage si l'escalade a sa place dans la route plutôt que dans votre application.

Claude Haiku 5.5 n'est pas encore au catalogue. Le dire sans détour est plus utile que de laisser entendre le contraire : le côté Luna de cette comparaison est appelable de notre côté ce matin, et le côté Ant​hropic doit être joint chez Ant​hropic jusqu'à ce que ce ne soit plus le cas.

A screenshot of the OrcaRouter catalogue page for GPT-6 Luna, showing the model identifier openai/gpt-6-Luna, the provider OpenAI, a 1M-token context window, 128,000 maximum output, the release date September 22 2026, the $0.10 per million input and $0.50 per million output rates and a p50 time to first token of 1.49 seconds.

Qu’est-ce qui changerait la réponse ?

Deux choses, et toutes deux valent la peine d'être observées plutôt qu'estimées.

Le premier point est de savoir si la verbosité évolue. Le coût par tâche de Claude Haiku 5.5 est fonction du nombre de tokens qu'il dépense par réponse à effort maximal, et le paramètre d'effort est le levier sur ce point. Une équipe qui fixe un effort plus bas — la valeur par défaut du modèle est moyenne, pas maximale — obtiendra un coût par tâche plus proche de celui de Luna et un score plus proche de celui de Luna également. L'arbitrage est disponible ; ce qu'il vaut est une question qui concerne votre évaluation, pas le modèle.

Le second point est de savoir si les chiffres indépendants de coût par tâche tiennent à mesure que les deux modèles accumulent davantage d'exécutions mesurées. Une seule position dans un classement n'est qu'un instantané, et un écart d'un facteur trois qui apparaît dans un seul instantané mérite d'être confirmé par rapport à votre propre facture avant qu'un pipeline ne soit reconstruit autour de lui. C'est à cela que sert le point de terminaison partagé.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement