
GPT-5.6 Luna vs Claude Haiku 4.5 : gamme économique, deux factures très différentes
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
GPT-5.6 Luna et Claude Haiku 4.5 sont les paliers économiques de deux familles de pointe différentes, et l'écart entre elles dépend entièrement du chiffre que l'on regarde. Sur le prix affiché, c'est une déroute : 0,20 $ par million de jetons d'entrée contre 1,00 $. Sur le coût par tâche terminée de l'Intelligence Index d'Artificial Analysis, c'est 0,18 $ contre 0,21 $ — une différence d'environ 14 %. Les deux mêmes modèles, deux réponses honnêtes, et la raison de leur divergence est l'élément le plus utile à comprendre avant d'en choisir un.
En bref : Luna est le modèle le plus puissant sur le papier et le plus rapide en débit, mais il réfléchit longuement et le facture. Haiku 4.5 est plus ancien, de portée plus limitée, et nettement plus prévisible quant au coût d'une requête. Savoir lequel de ces aspects compte le plus dépend de votre charge de travail, et non des modèles.
En un coup d'œil
• Fournisseur — OpenAI contre Anthropic
• Publié — 9 juillet 2026 vs 15 octobre 2025
• Fenêtre de contexte — 1 M de jetons contre 200 K de jetons
• Sortie max — 128K jetons vs 64K jetons
• Entrée — texte, image et fichier vs texte, image et PDF
• Prix par million de jetons — 0,20 $ en entrée / 1,20 $ en sortie contre 1,00 $ en entrée / 5,00 $ en sortie
• Artificial Analysis Intelligence Index — 38, 4e sur 177 contre 18, 138e sur 200 (tous deux en configuration de raisonnement)
• Coût par tâche de l'Intelligence Index — 0,18 $ vs 0,21 $
• Vitesse de sortie — 109,4 tokens/s vs 84,7 tokens/s
• Contrôle du raisonnement — un réglage d'effort allant de aucun à max, par opposition à la réflexion étendue activée manuellement, sans paramètre d'effort
• Date limite des connaissances fiables — février 2026 vs février 2025 (données d'entraînement jusqu'à juillet 2025)
• Engagement de retrait — aucun publié vs pas avant le 15 octobre 2026
Là où GPT-5.6 Luna gagne vraiment

La capacité, et de loin. Un indice d'intelligence de 38 face à 18, ce n'est pas un écart serré. Luna devance Haiku sur le score composite qu'Artificial Analysis construit à partir d'évaluations de raisonnement, de connaissances, de mathématiques et de codage, et ce tout en étant le modèle le moins cher par token. Quiconque a comparé ces deux familles pour la dernière fois sur l'indice d'avant septembre — où Luna affichait 51 et 52 — doit savoir que toute l'échelle a été re-notée en septembre 2026, et que l'avantage de Luna a survécu à cette re-notation.
Le contexte, multiplié par cinq. Une fenêtre de 1 M de tokens contre 200 K détermine à elle seule une catégorie de travail : des passes sur un dépôt entier, de longs ensembles de documents, de longues transcriptions d’agents qui nécessiteraient un résumé sur Haiku. Si votre application se définit par la quantité de contexte qu’elle doit contenir, la comparaison s’arrête ici.
Marge de sortie, doublée. 128K jetons de sortie maximum contre 64K, cela compte pour la génération de texte long et pour les boucles agentiques qui renvoient des plans structurés plutôt que des réponses d'une seule ligne.
Débit. 109,4 jetons de sortie par seconde contre 84,7, c'est une vraie différence pour les interfaces de streaming, même si ce n'est pas la même chose que la réactivité — voir la section sur la latence ci-dessous.
Le prix, sur l'étiquette.Cinq fois moins cher en entrée et environ quatre fois moins cher en sortie, ce n'est pas une erreur d'arrondi, et pour les travaux à sortie courte, c'est toute la décision.
Où Claude Haiku 4.5 mérite encore sa place
Coût prévisible. Le raisonnement de Haiku 4.5 est une réflexion étendue que l'on active manuellement. Désactivé, il répond directement et facture de manière prévisible. Le curseur d'effort de GPT-5.6 Luna va jusqu'au maximum, et chaque cran supplémentaire représente davantage de jetons de sortie au tarif de sortie. Une équipe qui veut un plafond de coûts qu'elle peut annoncer à l'avance trouvera Haiku plus facile à appréhender, même à un prix affiché plus élevé.
La configuration sans raisonnement est véritablement peu coûteuse à exécuter.Artificial Analysis attribue à la configuration sans raisonnement de Claude 4.5 Haiku un Intelligence Index de 15, sans chiffre publié de coût par tâche, et elle convient raisonnablement aux tâches dont l'exigence se résume à « analyser correctement ceci » — classification d'intention, extraction de champs, décisions de routage, triage de modération. Sur ces tâches, l'écart d'indice entre 15 et 38 est en grande partie sans importance, car on ne demande à aucun des deux modèles de réfléchir.
La mise en cache et les remises sur les lots sont des dispositifs matures. Haiku 4.5 offre une remise de 90 % sur la lecture du cache de prompt et une remise de 50 % sur l'API Batch. Luna présente une économie de cache comparable, donc c'est plus proche de l'égalité que d'un avantage — mais si votre pipeline traite déjà par lots via les outils d'Anthropic, le coût de migration pour quitter Haiku est un coût réel, et il n'apparaîtra dans aucun benchmark.
Un historique opérationnel. Haiku 4.5 est en production depuis octobre 2025 et s’accompagne d’un engagement publié de retrait au plus tôt le 15 octobre 2026. Luna a deux mois. Pour une charge de travail où le modèle est un détail plutôt que le produit, un historique de production de onze mois vaut quelque chose qu’un benchmark ne peut pas exprimer.
C'est le modèle le plus véridique, sur le seul axe qui le mesure.Le comparatif en face-à-face d'Artificial Analysis place Luna en tête sur presque toutes les lignes de capacités — AA-Briefcase 1 339 contre 614, GDPval-AA v2 1 489 contre 854, AutomationBench-AA 50 % contre 3 %, Humanity's Last Exam 39 % contre 10 %, GDPpdf 24 % contre 4 %. L'exception est AA-Omniscience, qui pénalise les réponses fausses données avec assurance à des questions de connaissances : Luna y obtient -10, contre -4 pour Haiku. Un score négatif signifie que la pénalité pour hallucination l'emporte sur le crédit de précision, et la pénalité de Luna est plus importante. Un indice composite plus élevé n'est pas la même chose qu'une réponse plus fiable, et sur la seule évaluation conçue pour distinguer ces deux choses, le modèle plus ancien s'en sort mieux.
Le calcul des coûts sur une charge de travail réelle
Prenons un pipeline qui consomme 100 M de tokens d’entrée et émet 20 M de tokens de sortie par mois.
• GPT-5.6 Luna — 100 × 0,20 $ = 20 $, plus 20 × 1,20 $ = 24 $. Soit un total de 44 $ par mois.
• Claude Haiku 4.5 — 100 × 1,00 $ = 100 $, plus 20 × 5,00 $ = 100 $. Total de 200 $ par mois.
À ces ratios, Luna est environ 4,5 fois moins chère, et c'est le calcul que publient la plupart des comparaisons. Changez maintenant une hypothèse. Si l'on augmente l'effort de raisonnement de Luna, ses tokens de sortie augmentent, et la sortie est le poste coûteux — à 1,20 $, elle coûte six fois ce que coûte l'entrée. Poussez Luna au point où elle émet 150 M de tokens de sortie pour le même volume de travail, comme elle le fait sur le jeu d'évaluation d'Artificial Analysis, et les 44 $ passent confortablement au-dessus de 180 $. Le facteur 4,5 s'effondre vers la parité.
La leçon n'est pas que Luna coûte cher. C'est que l'avantage de prix de Luna dépend de combien il parle, un paramètre que vous contrôlez. Baissez le raisonnement pour l'extraction et la classification, et la réduction est réelle. Laissez-le au maximum pour tout, et vous avez acheté un modèle plus performant à un prix qui ne ressemble plus à son prix affiché.
Latence, et un nombre auquel vous ne devriez pas vous fier
Les chiffres publiés de temps jusqu’au premier token pour ces deux modèles sont quasiment inutiles, et il vaut la peine de comprendre pourquoi. Sur Artificial Analysis, les configurations de raisonnement des deux modèles affichent des latences du premier token de l’ordre de dizaines, voire de centaines de secondes, car le harnais n’émet pas de token avant que le modèle ait terminé son raisonnement. Ce chiffre mesure le dispositif d’évaluation, pas la réactivité du modèle.
La télémétrie de routage est une meilleure source, car elle mesure le modèle en production. Les propres chiffres d'OrcaRouter placent GPT-5.6 Luna à une médiane de 1,83 seconde jusqu'au premier token et à un 95e percentile de 10,00 secondes, contre Claude Haiku 4.5 à 3,81 secondes de médiane et 9,47 secondes au 95e percentile. Lu correctement, cela signifie que les deux sont plus proches que ne le suggèrent les classements : Luna l'emporte sur la requête typique, et les queues se situent à environ une demi-seconde l'une de l'autre. Si votre préoccupation est le pire cas plutôt que la moyenne, il y a très peu de différence entre eux.
Lequel choisir
Choisissez GPT-5.6 Luna si vous travaillez avec de longs contextes, si la tâche bénéficie d'un véritable raisonnement, si la sortie est longue ou structurée, ou si vous voulez le modèle le plus puissant disponible dans le bas de la gamme de prix. C'est aussi le choix le plus naturel si le reste de votre stack fonctionne déjà selon le comportement de la famille OpenAI.
Choisissez Claude Haiku 4.5 si votre travail produit des sorties courtes en grand volume, si vous avez besoin d'un plafond de coût que vous pouvez annoncer avant l'exécution de la requête, si votre pipeline est déjà construit autour du traitement par lots et de la mise en cache d'Anthhropic, ou si vous accordez de l'importance à un modèle doté d'un historique de production et d'un cycle de vie publié plutôt qu'à un modèle vieux de deux mois.
Ne choisissez ni l’un ni l’autre pour une tâche pour laquelle un petit modèle de raisonnement ou un classificateur affiné suffirait. Une grande partie du trafic que ces deux niveaux absorbent relève de la classification et de l’extraction, qui coûteraient moins cher sur quelque chose de plus spécialisé — et le modèle le moins cher est toujours celui dont vous n’aviez pas besoin.
Utiliser les deux sur une seule touche

Le duel cesse d'être exclusif dès lors que les deux modèles sont accessibles via un seul point de terminaison. Sur OrcaRouter, Claude Haiku 4.5 et GPT-5.6 Luna se trouvent derrière la même URL de base compatible OpenAI — une seule API pour plus de 200 modèles, une seule clé, une seule ligne de facturation, aucun second contrat, et aucune modification de code au-delà de l'identifiant du modèle. Pour une décision de palier dont vous n'êtes pas encore sûr, cela transforme une migration en une simple valeur de configuration.
Deux fonctionnalités font ici un vrai travail. Le basculement automatique entre fournisseurs signifie qu’une offre économique peut supporter le trafic de production sans dépendance à un seul fournisseur — utile lorsque le modèle est assez bon marché pour que vous lui envoyiez des milliers d’appels par heure plutôt qu’un seul appel important. Et le DSL de routage vous permet de composer un appel à partir de plusieurs modèles : acheminez la majorité des requêtes simples vers Luna, faites passer le reste à GPT-5.6 Terra, et gardez Haiku 4.5 dans le pool comme solution de repli lorsque vous voulez la réponse d’un second fournisseur plutôt qu’une nouvelle tentative.
Vérifiez le tarif par token en temps réel sur GPT-5.6 Luna et Claude Haiku 4.5 avant de faire passer l’un ou l’autre en production — les deux tarifs sont répercutés avec 0 % de marge, ils changent donc le jour même où le fournisseur les modifie, et les outils tiers de suivi des prix accusent un retard de quelques jours à plusieurs semaines.
Des questions qui méritent vraiment qu'on y réponde
GPT-5.6 Luna est-il vraiment cinq fois moins cher que Claude Haiku 4.5 ? Sur les tokens d'entrée, oui — 0,20 $ contre 1,00 $. Sur le coût pour mener à bien la même tâche évaluée, non : 0,18 $ contre 0,21 $. L'écart entre ces deux affirmations, c'est la verbosité de Luna. Elle produit environ deux fois plus de tokens de sortie que Haiku pour accomplir le même travail, et les tokens de sortie coûtent six fois plus cher que les tokens d'entrée. Pour les réponses courtes, le prix affiché est globalement honnête. Pour le travail à forte composante de raisonnement, il ne l'est pas.
Puis-je régler les coûts de la même manière sur les deux ? Non, et c'est la différence la plus sous-estimée entre eux. Luna expose un réglage d'effort de raisonnement allant de none jusqu'à max, de sorte que le coût et la qualité se compensent explicitement à chaque requête. La réflexion étendue de Haiku 4.5 est soit activée, avec un budget de tokens, soit elle ne l'est pas — il n'existe aucun paramètre effort. Si le contrôle des coûts par requête compte pour vous, un seul de ces deux modèles vous offre ce levier.
Et que dire d'un classificateur à fort volume qui effectue quelques millions d'appels par jour ? Aucun des deux modèles n'a besoin de raisonnement pour cela. Exécutez Haiku 4.5 avec la réflexion étendue désactivée, ou Luna avec l'effort réglé sur aucun, et comparez sur la latence et la longueur de sortie plutôt que sur l'indice composite — à ce stade, les questions pertinentes sont la vitesse d'arrivée du premier token et le nombre de tokens que la réponse consomme, et les benchmarks d'intelligence cessent de les distinguer.

Laquelle sera encore là dans un an ?Claude Haiku 4.5 fait l'objet d'un engagement publié : aucun retrait avant le 15 octobre 2026. OpenAI ne publie aucune date équivalente pour GPT-5.6 Luna, et la gamme GPT-5.6 compte déjà une génération plus récente au-dessus d'elle, GPT-6 Astra. Ni l'un ni l'autre n'est une raison d'éviter Luna, mais si votre feuille de route suppose un horizon de planification de onze mois, c'est une raison de conserver l'identifiant du modèle dans la configuration plutôt que de le coder en dur.
Tarif en direct par token pour GPT-5.6 Luna sur la même clé, répercuté à 0 % de marge, sans seconde relation de facturation.
Tarif en direct par token pour Claude Haiku 4.5 sur le même point de terminaison, afin que les deux niveaux puissent être comparés sans un second contrat.
