
Claude Haiku 5.5 vs GPT-6 Luna : même prix affiché, facture trois fois plus élevée
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Claude Haiku 5.5 et GPT-6 Luna sont proposés exactement au même prix sur le papier : 0,10 $ par million de jetons d'entrée et 0,50 $ par million de jetons de sortie, les deux mêmes chiffres au centime près, de la part de deux fournisseurs qui sont rarement d'accord sur quoi que ce soit. Le billet de lancement d'Anthropic imprime même les scores de Luna dans la colonne à côté des siens, ce que les fournisseurs ne font pas pour des modèles qu'ils considèrent comme non menaçants.
Les deux fiches divergent sur tout ce que l’étiquette cache. Luna maintient ce tarif jusqu’à 272 000 tokens avant de franchir un palier ; Claude Haiku 5.5 franchit un palier à 100 000. Claude Haiku 5.5 obtient un score de 43,40 sur l’Artificial Analysis Intelligence Index v4.3.2, contre 38,12 pour Luna — et coûte 0,21 $ par tâche Index terminée, contre 0,07 $ pour Luna. Même prix, facture trois fois plus élevée, cinq points d’intelligence en plus. C’est tout l’arbitrage, et il est plus net que la plupart des face-à-face de cette gamme.
Deux cartes, côte à côte
Par million de tokens en dollars américains, d’après les tarifs publiés d’Anthropic et d’OpenAI tels qu’ils figurent dans notre propre catalogue, avec des mesures indépendantes attribuées à Artificial Analysis. Mis en cache le 2026-10-08.

• Entrée — Claude Haiku 5.5 0,10 $ jusqu'à 100 000 tokens, 0,50 $ au-dessus. GPT-6 Luna 0,10 $ jusqu'à 272 000 tokens, 0,20 $ au-dessus.
• Sortie — Claude Haiku 5.5 0,50 $ jusqu'à 100 000 jetons, 2,50 $ au-delà. GPT-6 Luna 0,50 $ jusqu'à 272 000 jetons, 0,75 $ au-delà.
• Entrée mise en cache et écritures — toutes deux à $0.01 et $0.125 sous le premier seuil, Claude Haiku 5.5 passant à $0.05 et $0.625 au-delà de 100 000 jetons, et GPT-6 Luna à $0.02 et $0.25 au-delà de 272 000.
• Contexte et sortie — 1 M de jetons pour les deux ; 128 000 en sortie maximale pour les deux. Ces deux-là sont vraiment identiques.
• Réflexion — adaptative sur les deux, toutes deux avec un paramètre d’effort. L’effort par défaut de Claude Haiku 5.5 est moyen ; les scores publiés ne sont pas tous à ce réglage.
• Score indépendant — Claude Haiku 5.5 (Max) 43,40, deuxième sur 182 modèles. GPT-6 Luna (Max) 38,12, huitième sur 182.
• Coût indépendant par tâche — 0,21 $ contre 0,07 $.
• Vitesse — 241,9 jetons de sortie par seconde contre 129,4, mesurée par le même évaluateur.
Le seuil est là où se situe la différence
Les deux fournisseurs ont établi une grille tarifaire à deux niveaux. Ils l'ont fait à des endroits très différents, et l'emplacement compte bien plus que le chiffre en haut.
Anthropic place son palier à 100 000 tokens. En dessous, vous payez 0,10 $ et 0,50 $ ; au-dessus, cinq fois et cinq fois — 0,50 $ et 2,50 $. Anthropic indique que les prompts sous ce seuil représentaient environ 90 % des requêtes adressées à son précédent modèle Haiku, ce qui correspond à la répartition du trafic du fournisseur lui-même et décrit raisonnablement les charges de travail à appels courts en général.
Le palier d’OpenAI se situe à 272 000 tokens. En dessous, 0,10 $ et 0,50 $ — identiques à ceux d’Anthropic. Au-dessus, 0,20 $ et 0,75 $, soit un doublement et une augmentation de 50 %. C’est un palier beaucoup plus doux et il commence presque trois fois plus loin.
Prenez un prompt de 200 000 tokens, ce qui est une taille plausible pour un pipeline de documents longs et tout à fait raisonnable pour une fenêtre de 1 M de tokens. Sur Claude Haiku 5.5, cette requête est facturée au deuxième palier : 0,50 $ en entrée, 2,50 $ en sortie. Sur GPT-6 Luna, elle relève encore du premier palier : 0,10 $ en entrée, 0,50 $ en sortie. Cinq fois le tarif d’entrée et cinq fois le tarif de sortie, pour la même requête, entre deux modèles affichés au même prix. Ce n’est pas une nuance — pour une charge de travail à prompts longs, c’est toute la comparaison.
Pourquoi le même taux produit une facture trois fois plus élevée
Le coût par tâche est le chiffre qui devrait décider d'un pipeline à fort volume, et c'est ici que les deux modèles divergent d'une manière que la grille tarifaire ne saurait expliquer.
Artificial Analysis évalue GPT-6 Luna (Max) à 0,07 $ par tâche de l'Intelligence Index et Claude Haiku 5.5 (Max) à 0,21 $ — un facteur de trois, à tarifs affichés identiques, pour un écart de score de 5,28 points. La cause se trouve sur la même page et elle n'est pas subtile. Claude Haiku 5.5 a généré 440 millions de tokens de sortie lors de l'exécution de l'Index, contre une médiane de 100 millions, et l'évaluateur le qualifie de très verbeux. GPT-6 Luna en a généré 140 millions contre la même médiane de 100 millions, décrit comme quelque peu verbeux. Trois fois plus de tokens de sortie, c'est trois fois la facture lorsque la sortie est le compteur qui domine.
Les propres chiffres d'Anthropic pointent dans la même direction. Les graphiques coût/fiabilité du fournisseur positionnent Haiku 5.5 sur toute la plage d'efforts, et la citation mise en avant au lancement est que Sonnet 5.5 et Opus 5.5 restent les meilleurs choix pour le travail de codage agentique complexe, Haiku 5.5 étant quant à lui positionné pour la compaction, le résumé et les sous-agents. Plus la tâche est petite, moins vous achetez ce problème de verbosité — ce qui correspond précisément à la charge de travail pour laquelle le modèle a été conçu, et précisément à la charge de travail où un écart de coût d'un facteur trois mérite d'être vérifié par rapport à vos propres journaux plutôt qu'à un tableau de bord.
Une entrée de plus au registre, provenant de la documentation d'Anthropic plutôt que de celle de l'évaluateur : Claude Haiku 5.5 utilise le tokeniseur plus récent, partagé avec Claude 4.7 et les versions ultérieures, donc le même texte compte environ 30 % de tokens en plus que sur le précédent Haiku. Le tarif est le même que celui de Luna ; le tokeniseur, non.

Que dit le tableau d’Anthropic lui-même à propos de Luna ?
La page de lancement d'Anthropic présente GPT-6 Luna comme une colonne de son tableau de benchmarks, et la façon honnête de le rapporter est d'y joindre l'attribution : il s'agit des évaluations d'Anthropic, exécutées sur le harnais d'Anthropic, face au modèle d'un concurrent. Elles sont rapportées par le fournisseur, non reproduites de manière indépendante, et un fournisseur qui fait tourner sa propre suite face aux scores d'un rival, c'est une comparaison à peser plutôt qu'à accepter.
• Travail de la connaissance — GDPval-AA v2.1 à 1620 pour Claude Haiku 5.5 contre 1437 pour GPT-6 Luna. AA-Briefcase v1.1 à 1578 contre 1336.
• Utilisation d'ordinateur — sous-ensemble hors ligne d'OSWorld 2.1 à 72,4 % contre 48,9 %.
• Codage agentique — Terminal-Bench 4.0 à 39,2 % contre 16,4 % ; FrontierCode 1.1 (Main) à 46,4 % contre 42,4 %.
• Raisonnement visuel — Chartography à 46,4 % sans outils contre 29,1 %.
Sur le propre banc d'essai du fournisseur, Claude Haiku 5.5 arrive en tête sur chaque ligne. Sur le classement indépendant, son avance est plus faible — 43,40 contre 38,12 —, ce qui correspond à la relation habituelle entre le tableau d'un fournisseur et celui d'un tiers, et c'est la raison pour laquelle les deux sont reproduits ici. Les deux concordent sur la direction et divergent sur l'ampleur.
Le projet de loi est le vote décisif.
Mettez les quatre faits qui comptent vraiment en regard les uns des autres, et le choix cesse d'être serré pour la plupart des charges de travail.
GPT-6 Luna revient moins cher par tâche accomplie d’un facteur trois selon la mesure indépendante, son premier palier tarifaire va dix-huit fois plus loin dans la fenêtre de contexte, ses taux de dépassement de seuil sont plus faibles sur les deux indicateurs, et c’est le seul des deux dont la pénalité de contexte long est un doublement plutôt qu’un facteur cinq. Claude Haiku 5.5 est en avance sur l’intelligence mesurée d’une marge réelle et modeste, plus rapide d’un facteur de près de deux en sortie, et — sur le propre banc d’essai du fournisseur, où l’écart est le plus grand — en avance sur chaque ligne de benchmark publiée.
Si vos appels sont courts, si le débit est la contrainte, ou si la différence de qualité se voit dans votre propre évaluation, payez le triple. Si vos appels sont longs, s'ils sont générés par une machine et jamais lus par un humain, ou si vous utilisez un palier de classification qui se déclenche un million de fois par jour, les mêmes 0,10 $ et 0,50 $ vous permettront d'obtenir une facture trois fois moins élevée de l'autre côté, et la capacité à laquelle vous renoncez représente cinq points sur un classement où les deux modèles figurent près du sommet.
Appeler l’un ou l’autre depuis un seul endroit
L'avantage d'une comparaison aussi serrée, c'est que vous ne devriez pas avoir à croire qui que ce soit sur parole, y compris nous. GPT-6 Luna figure dès aujourd'hui au catalogue OrcaRouter au tarif du fournisseur, avec 0 % de marge — la même structure tarifaire imprimée ci-dessus, répercutée plutôt que lissée — et il en va de même pour Claude Sonnet 5.5 et Claude Opus 5.5, ce qui fait d'un test d'escalade depuis un segment bon marché vers un palier intermédiaire une configuration plutôt qu'un projet. Une clé, un SDK, un basculement automatique en arrière-plan, et le DSL de routage si l'escalade a sa place dans la route plutôt que dans votre application.
Claude Haiku 5.5 n'est pas encore au catalogue. Le dire sans détour est plus utile que de laisser entendre le contraire : le côté Luna de cette comparaison est appelable de notre côté ce matin, et le côté Anthropic doit être joint chez Anthropic jusqu'à ce que ce ne soit plus le cas.

Qu’est-ce qui changerait la réponse ?
Deux choses, et toutes deux valent la peine d'être observées plutôt qu'estimées.
Le premier point est de savoir si la verbosité évolue. Le coût par tâche de Claude Haiku 5.5 est fonction du nombre de tokens qu'il dépense par réponse à effort maximal, et le paramètre d'effort est le levier sur ce point. Une équipe qui fixe un effort plus bas — la valeur par défaut du modèle est moyenne, pas maximale — obtiendra un coût par tâche plus proche de celui de Luna et un score plus proche de celui de Luna également. L'arbitrage est disponible ; ce qu'il vaut est une question qui concerne votre évaluation, pas le modèle.
Le second point est de savoir si les chiffres indépendants de coût par tâche tiennent à mesure que les deux modèles accumulent davantage d'exécutions mesurées. Une seule position dans un classement n'est qu'un instantané, et un écart d'un facteur trois qui apparaît dans un seul instantané mérite d'être confirmé par rapport à votre propre facture avant qu'un pipeline ne soit reconstruit autour de lui. C'est à cela que sert le point de terminaison partagé.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
