Une carte de titre générée portant « Claude Haiku 5.5 vs GPT-6 Luna Pro » avec le sous-titre « L'un est un modèle que vous pouvez appeler ; l'autre est un interrupteur que vous pouvez basculer », deux cartes portant « Claude Haiku 5.5 : sorti le 7 octobre 2026, 0,10 $ / 0,50 $ par MTok » et « GPT-6 Luna Pro : GPT-6 Luna avec le mode de raisonnement défini sur pro », et une ligne de pied de page indiquant « Chiffres des fournisseurs selon Anthropic et OpenAI ; chiffres indépendants selon Artificial Analysis. » Le véritable logo OrcaRouter est incrusté en bas à droite.
Guides & Insights

Claude Haiku 5.5 vs GPT-6 Luna : un modèle contre un mode

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

L'un des côtés de cette comparaison est un modèle, et l'autre est un réglage. Claude Haiku 5.5 est passé en disponibilité générale le 7 octobre 2026 à 0,10 $ par million de jetons d'entrée et 0,50 $ par million de jetons de sortie, sur l'API Claude, Amazon Bedrock, Google Cloud, Microsoft Foundry et Claude Platform sur AWS. GPT-6 Luna Pro n'est pas du tout un modèle : pour l'atteindre, il faut appeler GPT-6 Luna — disponible depuis le 22 septembre 2026 aux mêmes tarifs de 0,10 $ et 0,50 $ — avec reasoning.mode défini sur pro au lieu de standard. Il n'existe aucun gpt-6-luna-pro identifiant sur la page des modèles d'OpenAI. Donc la présentation honnête de cette confrontation n'est pas « quel modèle gagne », mais « quelle est la meilleure façon de dépenser dix cents par million de jetons d'entrée » : un petit modèle avec un curseur d'effort, ou un modèle plus grand exploité dans un mode qui fait plus de travail et vous facture les jetons qu'il ne vous montre pas. Pour un travail court et à gros volume, la réponse est généralement la première. Pour un travail difficile et occasionnel, ce peut être la seconde — et le chiffre qui tranche, OpenAI ne l'a pas publié.

Ce qu’est « pro », mécaniquement

Le guide de raisonnement d'OpenAI indique que les modèles GPT-5.6 et GPT-6 prennent en charge deux modes dans l'API Responses, standard (le mode par défaut) et pro, sélectionnables via reasoning.mode. Le mode est un contrôle distinct de reasoning.effort : le mode détermine la quantité de travail que le modèle effectue avant de s'engager sur une réponse, tandis que l'effort détermine l'ampleur du raisonnement au sein du mode que vous avez choisi. Les valeurs d'effort documentées de GPT-6 Luna sont none, low, medium (la valeur par défaut), high, xhigh et max, et chacune d'elles peut être combinée avec le mode pro.

En matière de facturation, le guide est explicite et légèrement contre-intuitif. Le mode Pro agrège tout le travail du modèle derrière la réponse finale et facture ces jetons « aux tarifs standard de jetons du modèle sélectionné ». Il n'y a pas de supplément Pro sur la grille tarifaire. Le coût se manifeste sous forme de volume, car le mode Pro « effectue plus de travail de modèle que le mode standard, ce qui augmente l'utilisation de jetons et le coût » — et les jetons de raisonnement sont facturés comme des jetons de sortie tout en n'apparaissant que dans l'objet d'utilisation sous output_tokens_details.reasoning_tokens. Si vous ne lisez pas ce champ, l'augmentation reste invisible jusqu'à l'arrivée de la facture.

Deux comparaisons en découlent, et il vaut la peine de les distinguer. Face à GPT-6 Luna en mode standard, le mode pro est le même modèle avec un multiplicateur inconnu sur la consommation de tokens. Face à Claude Haiku 5.5, il s’agit aussi d’un modèle différent à une échelle différente — 1 050 000 tokens de contexte contre 1 M, un plafond d’entrée de 922 000 tokens et une date de connaissance au 18 mai 2026, sur un niveau que la propre documentation de lancement d’Anthropic situe légèrement au-dessus du Haiku pour les tâches agentiques difficiles. Les deux différences tirent dans le même sens sur le coût et en sens opposés sur la capacité, ce qui explique pourquoi aucune des deux ne peut être lue sur une grille tarifaire.

Les grilles tarifaires, côte à côte

Les deux modèles sont facturés selon deux paliers, et les seuils ne se situent pas au même endroit — ce qui compte davantage que le tarif affiché, car les deux tarifs affichés sont identiques.

• Entrée — Claude Haiku 5.5 : 0,10 $ par million jusqu'à 100 000 tokens, puis 0,50 $ au-delà. GPT-6 Luna : 0,10 $ jusqu'à 272 000 tokens, puis 0,20 $ au-delà.

• Sortie — Claude Haiku 5.5 à 0,50 $ jusqu'à 100 000 tokens, 2,50 $ au-delà. GPT-6 Luna à 0,50 $ jusqu'à 272 000 tokens, 0,75 $ au-delà.

• Mise en cache — Les lectures du cache de Claude Haiku 5.5 coûtent $0.01 et les écritures $0.125 en dessous de la ligne, $0.05 et $0.625 au-dessus. Les lectures du cache de GPT-6 Luna coûtent $0.01 et les écritures $0.125 sous 272 000 tokens, $0.02 et $0.25 au-dessus.

• Contexte et sortie — 1 M de tokens et 128 000 de sortie maximale pour Claude Haiku 5.5 ; 1 050 000 tokens avec une limite d'entrée de 922 000 tokens et une sortie maximale de 128 000 pour GPT-6 Luna.

• Thinking — adaptatif sur les deux. Claude Haiku 5.5 utilise par défaut l'effort medium ; GPT-6 Luna utilise par défaut l'effort medium et le mode standard, avec le mode pro en option supplémentaire.

• Remises sur les lots et la mise en cache — Claude Haiku 5.5 accorde 50 % de réduction sur l'API Message Batches ; GPT-6 Luna accorde 50 % de réduction sur Batch et Flex, double le tarif en mode Fast et ajoute une majoration de 10 % pour le traitement régional.

La seule ligne qui n’a pas la même forme est celle du tokeniseur. La documentation d’Anthropic indique que Claude Haiku 5.5 utilise le tokeniseur plus récent partagé avec Claude 4.7 et les versions ultérieures, de sorte que le même texte compte environ 30 % de tokens de plus que sur Claude Haiku 4.5. Cela ne change pas le tarif ; cela change la vitesse à laquelle une invite atteint le palier des 100 000 tokens, et c’est une différence de coût réelle qu’aucune grille tarifaire n’affiche. Une invite de 90 000 tokens compte environ 117 000 et coûte 0,50 $ par million de tokens d’entrée plutôt que 0,10 $ — un tarif cinq fois plus élevé pour une invite qui semble largement en dessous du seuil.

Ce que coûte le mode pro, dans les seules unités dont quiconque puisse se servir

Comme le multiplicateur n'est pas publié, il est utile d'indiquer ce que coûte chaque token supplémentaire, puis ce que donnent les fourchettes plausibles en volume.

• Avec le tarif de 0,50 $ par million de tokens de sortie de GPT-6 Luna, chaque tranche supplémentaire de 10 000 tokens de sortie par tâche coûte 0,005 $. Exécutez 100 000 tâches par jour et cet incrément représente un milliard de tokens supplémentaires — environ 500 $ par jour, soit 15 000 $ par mois, sur un modèle dont le prix affiché est de dix cents par million de tokens d’entrée.

• Pour donner un ordre d'idée, GPT-6 Luna à effort maximal consomme déjà 140 millions de tokens de sortie pour faire tourner l'Intelligence Index, contre une médiane de 100 millions, ce que l'évaluateur qualifie d'un peu verbeux. Le tableau de lancement d'Anthropic, exécuté sur le propre harnais d'Anthropic, place GPT-6 Luna à 16,4 % sur Terminal-Bench 4.0 et à 42,4 % sur FrontierCode 1.1, contre 39,2 % et 46,4 % pour Claude Haiku 5.5 — des chiffres rapportés par le fournisseur, sur la suite d'un seul fournisseur, pour le modèle d'un concurrent.

• Sur le classement indépendant, l'ordre est plus resserré. Artificial Analysis attribue à Claude Haiku 5.5, en effort maximal, un score de 43 sur l'Intelligence Index v4.3.2, soit le deuxième rang sur 182, et à GPT-6 Luna (Max) un score de 38, soit le huitième rang sur 182. Ces deux chiffres correspondent au mode standard, en effort maximal. Il n'existe aucune évaluation indépendante de GPT-6 Luna en mode pro : sa page ne comporte aucune entrée pro, et Artificial Analysis n'en répertorie aucune.

Le problème structurel du mode pro réside dans l’interaction entre ces deux derniers points. Tout l’avantage de coût de GPT-6 Luna sur Claude Haiku 5.5 vient de l’efficacité en tokens — 140 millions de tokens de sortie contre 440 millions pour la même suite, à tarifs identiques, ce qui explique pourquoi la même évaluation coûte 0,07 $ par tâche d’un côté et 0,21 $ de l’autre. Le mode pro est, par définition, un mode qui émet davantage de tokens. L’activer revient à désactiver ce qui rendait le modèle bon marché dans cette comparaison, et le multiplicateur qui vous dirait de combien n’est pas publié. Cela ne signifie pas que le mode pro est une mauvaise affaire — sur les tâches difficiles, plus de travail est généralement un meilleur travail — cela signifie que le mode pro est en concurrence sur la capacité, pas sur le prix, et qu’il devrait être évalué par rapport aux modèles de gamme intermédiaire dont il est proche en prix plutôt que par rapport à la gamme économique dans laquelle il s’inscrit.

A screenshot of OpenAI's developer documentation for GPT-6 Luna, showing the model identifier gpt-6-luna, a 1,050,000-token context window, a 922,000-token input limit, a 128,000-token output limit, a May 18, 2026 knowledge cutoff, reasoning effort values of none, low, medium, high, xhigh and max, and Standard pricing of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per million tokens. No pro model identifier appears on the page.

Là où chacun gagne réellement

Réduisez-le à la décision et la séparation est nette, même si aucun des deux côtés n’est exempt de réserves.

Claude Haiku 5.5 domine le segment bon marché. Il est plus rapide dans les deux sens qui comptent : 241,9 jetons de sortie par seconde mesurés par Artificial Analysis, contre 123,0 pour GPT-6 Luna, et un temps jusqu'au premier jeton de 295 secondes lors du test Index, qui découle du temps qu'il réfléchit avant de répondre avec l'effort réglé sur Max, plutôt que d'une donnée réseau. Sa grille tarifaire atteint le deuxième palier à 100 000 jetons, et son tokeniseur gonfle les prompts d'environ 30 %, de sorte que les charges de travail à prompts longs paient plus que ne le laisse supposer le prix affiché, et ce sur ces deux points. En retour, il offre un avantage de cinq points en intelligence sur l'indice indépendant et un curseur d'effort — de Faible à Max — qui est le moyen de maîtrise des coûts le plus utile que l'un ou l'autre des deux fournisseurs ait livré avec ces lancements. C'est en abaissant l'effort que l'on échange une partie de cette avance de cinq points contre un coût par tâche plus proche de celui de GPT-6 Luna.

GPT-6 Luna Pro domine le segment difficile, avec une facture non quantifiée. Le modèle sous-jacent est moins cher par token au-delà de 272 000 tokens d'entrée que Claude Haiku 5.5 ne l'est au-delà de 100 000, d'un facteur deux et demi en entrée et trois et un tiers en sortie, et son premier palier va dix-huit fois plus loin dans la fenêtre de contexte. Le mode Standard est mesurablement moins cher par tâche accomplie. Le mode Pro échange cela contre davantage de travail par réponse, aux mêmes tarifs, et savoir s'il bat Claude Haiku 5.5 en effort Max ou un modèle de milieu de gamme sur une tâche donnée est une question à laquelle aucun chiffre publié ne répond. La façon d'y répondre est d'exécuter la tâche des deux manières et de lire le champ des tokens de raisonnement.

A screenshot of OrcaRouter's model page for openai/gpt-6-luna, showing the model card, its 1,050,000-token context window, and its list pricing of $0.10 per million input tokens and $0.50 per million output tokens with a $0.01 per million cache read, captured in English.

Essayer l'un ou l'autre sans parier dessus

La partie délicate de cette comparaison est que son chiffre le plus important — le coût réel du mode pro — ne peut être obtenu qu’en faisant passer votre propre trafic par celui-ci, et le coût effectif du modèle plus petit dépend de l’endroit où vos prompts se situent par rapport à une ligne de 100 000 jetons après re-tokenisation. Ce sont tous deux des problèmes de mesure, et tous deux sont moins coûteux sur un endpoint partagé qu’à travers deux clients de fournisseurs.

GPT-6 Luna figure aujourd'hui au catalogue d'OrcaRouter au prix catalogue du fournisseur, avec 0 % de marge répercutée, si bien que la référence en mode standard pour cette comparaison est appelable depuis une seule clé, et qu'un changement de prix du fournisseur se répercute de notre côté le jour même plutôt qu'au cycle de facturation suivant. Claude Haiku 5.5 ne figure pas encore au catalogue ; le palier Anthropic que nous routons aujourd'hui, ce sont Claude Haiku 4.5, Claude Sonnet 5.5 et Claude Opus 5.5, ce qui fait d'un test d'escalade depuis un palier bon marché vers un palier intermédiaire une règle de routage plutôt qu'une modification de code. Le basculement automatique sous le capot est ce qui permet à un modèle vieux de deux jours d'écouler du trafic de production pendant que vous le mesurez encore : un fournisseur qui commence à échouer est contourné au lieu de faire tomber la requête, ce qui fait la différence entre un pilote que vous pouvez lancer cette semaine et une bascule que vous devez planifier.

Ce qui règle la question

Trois choses, par ordre de l’ampleur avec laquelle elles changeraient la réponse. Si OpenAI publiait un multiplicateur de jetons en mode pro, ou un slug pro avec sa propre ligne de prix, cela convertirait l’inconnue centrale en arithmétique. Si Artificial Analysis relançait GPT-6 Luna en mode pro à effort égal, cela le ferait du côté indépendant. Et une deuxième exécution indépendante de Claude Haiku 5.5 à moyen plutôt qu’à Max vous dirait ce que le modèle coûte réellement à son réglage par défaut, qui est la configuration que la plupart des gens déploieront — les 0,21 $ par tâche au tableau sont un chiffre pour effort Max, et Max n’est pas le paramètre par défaut.

D'ici là, le résumé précis reste limité. Claude Haiku 5.5 est un modèle que vous pouvez appeler, tarifer et évaluer dès aujourd'hui, et aux volumes pour lesquels son palier est conçu, c'est la réponse la moins chère, avec une manière documentée de réduire encore les coûts. GPT-6 Luna Pro est une configuration d'un modèle que vous pouvez appeler, sa grille tarifaire n'est pas le problème, sa consommation de tokens n'est pas auditée, et tout son intérêt repose sur des tâches suffisamment difficiles pour que dépenser plus de tokens soit précisément le but. Achetez-le pour ces tâches, mesurez-le avant de l'acheter, et ne le mettez pas sur un chemin à fort volume tant que quelqu'un n'a pas publié le multiplicateur.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs GPT-6 Luna Pro — the scoreboard'. Left column Claude Haiku 5.5: what it is, a released model, GA 7 October 2026; input price $0.10 per million up to 100,000 tokens; output price $0.50 per million up to 100,000 tokens; context window 1,000,000 tokens; independent score 43 on Intelligence Index v4.3.2 at Max effort, rank 2 of 182; cost per task $0.21. Right column GPT-6 Luna Pro: what it is, GPT-6 Luna in reasoning mode pro, not a separate model; input price $0.10 per million up to 272,000 tokens; output price $0.50 per million up to 272,000 tokens; token multiplier unpublished; independent score 38 for GPT-6 Luna at Max effort in standard mode, with no pro-mode evaluation available; cost per task $0.07 for standard mode. A footer line reads 'Vendor pricing per Anthropic and OpenAI; independent figures per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.