Een gegenereerde titelkaart met de tekst 'Claude Haiku 5.5 vs GPT-6 Luna Pro' met de ondertitel 'De een is een model dat je kunt aanroepen; de ander is een schakelaar die je kunt omzetten', twee kaarten met de tekst 'Claude Haiku 5.5: uitgebracht op 7 okt 2026, $0,10 / $0,50 per MTok' en 'GPT-6 Luna Pro: GPT-6 Luna met redeneermodus ingesteld op pro', en een voettekstregel met de tekst 'Leverancierscijfers volgens Anthropic en OpenAI; onafhankelijke cijfers volgens Artificial Analysis.' Het echte OrcaRouter-logo is rechtsonder gecompositeerd.
Guides & Insights

Claude Haiku 5.5 vs GPT-6 Luna Pro: Een model tegen een modus

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Eén kant van deze vergelijking is een model, en de andere is een instelling. Claude Haiku 5.5 werd algemeen beschikbaar op 7 oktober 2026 voor $0,10 per miljoen inputtokens en $0,50 per miljoen output, op de Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry en Claude Platform op AWS. GPT-6 Luna Pro is helemaal geen model: de manier om het te bereiken is het aanroepen van GPT-6 Luna — live sinds 22 september 2026 tegen dezelfde $0,10 en $0,50 — met reasoning.mode ingesteld op pro in plaats van standard. Er staat geen gpt-6-luna-pro identifier op de modelpagina van OpenAI. De eerlijke framing van deze vergelijking is dus niet "welk model wint", maar "wat is de betere manier om tien cent per miljoen inputtokens uit te geven": een klein model met een instelknop voor inspanning, of een groter model dat draait in een modus die meer werk verricht en je factureert voor de tokens die het je niet toont. Voor kort, hoogvolume werk is het antwoord meestal het eerste. Voor moeilijk, incidenteel werk kan het het tweede zijn — en het getal dat daarover beslist, heeft OpenAI niet gepubliceerd.

Wat "pro" is, mechanisch

Volgens de reasoninggids van OpenAI ondersteunen de GPT-5.6- en GPT-6-modellen twee modi in de Responses API, standard (de standaard) en pro, geselecteerd via reasoning.mode. De modus is een andere instelling dan reasoning.effort: de modus bepaalt hoeveel werk het model doet voordat het zich op een antwoord vastlegt, effort bepaalt hoeveel redenering plaatsvindt binnen de modus die je hebt gekozen. De gedocumenteerde effortwaarden van GPT-6 Luna zijn none, low, medium (de standaard), high, xhigh en max, en elk ervan kan worden gecombineerd met de pro-modus.

Over facturering is de gids expliciet en licht contra-intuïtief. Pro-modus bundelt al het modelwerk achter het uiteindelijke antwoord en brengt die tokens in rekening "tegen de standaard token tarieven van het geselecteerde model". Er is geen pro-toeslag op de tariefkaart. De kosten komen tot uiting als volume, omdat pro-modus "meer modelwerk verricht dan de standaardmodus, wat het tokengebruik en de kosten verhoogt" — en reasoning-tokens worden gefactureerd als output-tokens terwijl ze alleen verschijnen in het usage-object onder output_tokens_details.reasoning_tokens. Als je dat veld niet leest, is de toename onzichtbaar totdat de factuur arriveert.

Daaruit volgen twee vergelijkingen, en het loont om ze uit elkaar te houden. Tegenover GPT-6 Luna in standaardmodus is de pro-modus hetzelfde model met een onbekende vermenigvuldigingsfactor voor het tokenverbruik. Tegenover Claude Haiku 5.5 is de pro-modus ook een ander model op een andere schaal — 1.050.000 tokens context tegenover 1M, een inputplafond van 922.000 tokens en een kennisafsluitingsdatum van 18 mei 2026, op een niveau dat de eigen lanceringsdocumentatie van Anthropic iets boven de Haiku positioneert voor veeleisend agentisch werk. De twee verschillen werken op het gebied van kosten in dezelfde richting en op het gebied van capaciteiten in tegengestelde richting, waardoor geen van beide uit een prijslijst kan worden afgelezen.

De tariefkaarten naast elkaar

Beide modellen worden in twee tariefschijven gefactureerd, en de drempels liggen op verschillende plekken — wat belangrijker is dan het meest in het oog springende tarief, want die tarieven zijn bij beide identiek.

• Invoer — Claude Haiku 5.5 $0,10 per miljoen tot 100.000 tokens, $0,50 daarboven. GPT-6 Luna $0,10 tot 272.000 tokens, $0,20 daarboven.

• Uitvoer — Claude Haiku 5.5 $0,50 tot 100.000 tokens, $2,50 daarboven. GPT-6 Luna $0,50 tot 272.000 tokens, $0,75 daarboven.

• Caching — Claude Haiku 5.5: cache-leesbewerkingen $0,01 en schrijfbewerkingen $0,125 onder de grens, $0,05 en $0,625 erboven. GPT-6 Luna: cache-leesbewerkingen $0,01 en schrijfbewerkingen $0,125 onder 272.000 tokens, $0,02 en $0,25 erboven.

• Context en uitvoer — 1M tokens en 128.000 maximale uitvoer voor Claude Haiku 5.5; 1.050.000 tokens met een invoerlimiet van 922.000 tokens en 128.000 maximale uitvoer voor GPT-6 Luna.

• Denken — adaptief op beide. Claude Haiku 5.5 is standaard ingesteld op medium inspanning; GPT-6 Luna is standaard ingesteld op medium inspanning en de standaardmodus, met pro-modus als optionele extra erbovenop.

• Kortingen voor batchverwerking en caching — Claude Haiku 5.5 geeft 50% korting op de Message Batches API; GPT-6 Luna geeft 50% korting op Batch en Flex, verdubbelt in Fast mode en rekent 10% toeslag voor regionale verwerking.

De enige regel die niet dezelfde vorm heeft, is de tokenizer. In de documentatie van Anthropic staat dat Claude Haiku 5.5 de nieuwere tokenizer gebruikt die wordt gedeeld met Claude 4.7 en later, dus dezelfde tekst telt als ongeveer 30% meer tokens dan op Claude Haiku 4.5. Dat verandert het tarief niet; het verandert hoe snel een prompt de stap van 100.000 tokens bereikt, en het is een reëel kostenverschil dat geen enkele tariefkaart toont. Een prompt van 90.000 tokens wordt geteld als ongeveer 117.000 en er wordt $0,50 per miljoen input betaald in plaats van $0,10 — een vijfvoudig tarief voor een prompt die ruim onder de grens lijkt te vallen.

Wat de pro-modus kost, in de enige eenheden die iemand kan gebruiken

Omdat de multiplier niet is gepubliceerd, is het nuttige om te vermelden wat elke extra token kost, en vervolgens wat de plausibele ranges bij volume doen.

• Bij GPT-6 Luna kost $0,50 per miljoen outputtokens, en elke extra 10.000 outputtokens per taak kost $0,005. Voer je 100.000 taken per dag uit, dan is die toename een miljard extra tokens — ongeveer $500 per dag, of $15.000 per maand, voor een model waarvan de meest in het oog springende prijs een dubbeltje per miljoen input is.

• Om een idee van de schaal te geven: GPT-6 Luna verbruikt bij maximale inspanning al 140 miljoen outputtokens bij het draaien van de Intelligence Index, tegen een mediaan van 100 miljoen, wat de evaluator als enigszins wijdlopig beschrijft. Anthropics lanceertabel, uitgevoerd op Anthropics eigen harness, zet GPT-6 Luna op 16,4% op Terminal-Bench 4.0 en 42,4% op FrontierCode 1.1, tegenover 39,2% en 46,4% voor Claude Haiku 5.5 — door de leverancier gerapporteerd, de suite van één leverancier, een model van een concurrent.

• Op de onafhankelijke ranglijst is de ordening nauwer. Artificial Analysis scoort Claude Haiku 5.5 bij Max effort 43 op Intelligence Index v4.3.2, als tweede van 182, en GPT-6 Luna (Max) op 38, als achtste van 182. Beide cijfers zijn afkomstig uit de standaardmodus met maximale inspanning. Er is geen onafhankelijke evaluatie van GPT-6 Luna in pro-modus: de pagina bevat geen pro-vermelding, en Artificial Analysis vermeldt er geen.

Het structurele probleem voor de pro-modus is de interactie tussen die laatste twee punten. Het volledige kostenvoordeel van GPT-6 Luna ten opzichte van Claude Haiku 5.5 komt voort uit token-efficiëntie — 140 miljoen outputtokens tegenover 440 miljoen voor dezelfde suite, bij identieke tarieven, wat verklaart waarom dezelfde eval aan de ene kant $0,07 per taak kost en aan de andere kant $0,21. De pro-modus is per definitie een modus die meer tokens uitstuurt. Hem inschakelen betekent het uitschakelen van datgene wat het model in deze vergelijking goedkoop maakte, en de vermenigvuldigingsfactor die zou aangeven met hoeveel, is niet gepubliceerd. Dat is geen argument dat de pro-modus een slechte deal is — bij moeilijke taken is meer werk meestal beter werk — het is een argument dat de pro-modus concurreert op capaciteiten, niet op prijs, en moet worden geëvalueerd tegen de modellen uit het middensegment waar hij qua prijs dicht bij zit, in plaats van tegen het goedkope segment waarin hij zich bevindt.

A screenshot of OpenAI's developer documentation for GPT-6 Luna, showing the model identifier gpt-6-luna, a 1,050,000-token context window, a 922,000-token input limit, a 128,000-token output limit, a May 18, 2026 knowledge cutoff, reasoning effort values of none, low, medium, high, xhigh and max, and Standard pricing of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per million tokens. No pro model identifier appears on the page.

Waar elk van hen daadwerkelijk wint

Reduceer het tot de deal en de splitsing is zuiver, geen van beide kanten is vrij van mitsen en maren.

Claude Haiku 5.5 beheerst het goedkope segment. Het is sneller in beide opzichten die ertoe doen: 241,9 uitvoertokens per seconde gemeten door Artificial Analysis tegenover 123,0 voor GPT-6 Luna, en een tijd tot het eerste token van 295 seconden in de Index-run, wat veeleer een product is van hoe lang het nadenkt voordat het antwoordt bij Max-inspanning dan een netwerkcijfer. Zijn tariefkaart bereikt het tweede niveau bij 100.000 tokens, en zijn tokenizer vergroot prompts met ongeveer 30%, dus workloads met lange prompts betalen op beide punten meer dan het prijskaartje suggereert. Wat het daarvoor teruggeeft, is een vijfpuntsvoorsprong in intelligentie op de onafhankelijke index en een inspanningsdraaiknop — van Low tot Max — die de nuttigste kostenbeheersing is die een van beide leveranciers bij deze lanceringen heeft meegeleverd. Inspanning vastzetten is hoe je een deel van die vijfpuntsvoorsprong inruilt voor een kosten-per-taakcijfer dat dichter bij dat van GPT-6 Luna ligt.

GPT-6 Luna Pro domineert het moeilijke uiteinde, met een niet-gekwantificeerde rekening. Het onderliggende model is per token goedkoper boven 272.000 inputtokens dan Claude Haiku 5.5 boven 100.000 is, met een factor tweeënhalf op invoer en drie en een derde op uitvoer, en zijn eerste niveau reikt achttien keer verder in het contextvenster. Standardmodus is meetbaar goedkoper per voltooide taak. Pro-modus ruilt dat in voor meer werk per antwoord tegen dezelfde tarieven, en of het Claude Haiku 5.5 bij Max effort of een model uit het middensegment verslaat bij een bepaalde taak, is een vraag die geen enkel gepubliceerd cijfer beantwoordt. De manier om die vraag te beantwoorden is de taak op beide manieren uit te voeren en het veld voor reasoning-tokens te lezen.

A screenshot of OrcaRouter's model page for openai/gpt-6-luna, showing the model card, its 1,050,000-token context window, and its list pricing of $0.10 per million input tokens and $0.50 per million output tokens with a $0.01 per million cache read, captured in English.

Een van beide proberen zonder erop te wedden

Het lastige aan deze vergelijking is dat het belangrijkste cijfer — de werkelijke kosten van de pro-modus — alleen kan worden verkregen door je eigen verkeer erdoorheen te laten lopen, en dat de effectieve kosten van het kleinere model afhangen van waar je prompts na hertokenisatie ten opzichte van een grens van 100.000 tokens terechtkomen. Beide zijn meetproblemen, en beide zijn goedkoper op een gedeeld endpoint dan via twee clients van verschillende leveranciers.

GPT-6 Luna staat vandaag in de catalogus van OrcaRouter tegen de listprijs van de provider met 0% opslag doorberekend, dus de standaardmodus-baseline voor deze vergelijking is aanroepbaar met één sleutel, en een prijswijziging van een leverancier komt dezelfde dag bij ons terecht in plaats van bij de volgende factureringscyclus. Claude Haiku 5.5 staat nog niet in de catalogus; de Anthropic-tier die we vandaag wel routeren is Claude Haiku 4.5, Claude Sonnet 5.5 en Claude Opus 5.5, waardoor een escalatietest vanaf een goedkope poot omhoog via een midden-tier een routeringsregel is in plaats van een codewijziging. Automatische failover eronder is wat een twee dagen oud model productieverkeer laat dragen terwijl je het nog aan het meten bent: een provider die begint te falen wordt omzeild in plaats van het verzoek te laten falen, wat het verschil is tussen een pilot die je deze week kunt draaien en een cutover die je moet plannen.

Wat de doorslag geeft

Drie dingen, in volgorde van hoeveel ze het antwoord zouden veranderen. Als OpenAI een token-multiplier voor de pro-modus publiceert, of een pro-slug met een eigen prijsregel, zou dat de centrale onbekende omzetten in rekenwerk. Als Artificial Analysis GPT-6 Luna opnieuw zou draaien in pro-modus bij gelijkwaardige inspanning, zou dat het van de onafhankelijke kant doen. En een tweede onafhankelijke run van Claude Haiku 5.5 op medium in plaats van Max zou je vertellen wat het model daadwerkelijk kost bij zijn standaardinstelling, de configuratie die de meeste mensen zullen uitrollen — de $0,21 per taak op het scorebord is een cijfer voor Max-inspanning, en Max is niet de standaard.

Tot dan is de nauwkeurige samenvatting beperkt. Claude Haiku 5.5 is een model dat je vandaag kunt aanroepen, prijzen en benchmarken, en bij de volumes waarvoor zijn tier is bedoeld, is het de goedkopere oplossing, met een gedocumenteerde manier om nog goedkoper te worden. GPT-6 Luna Pro is een configuratie van een model dat je kunt aanroepen; de tariefkaart is niet het probleem, het tokenverbruik is niet geauditeerd, en de hele argumentatie ervoor berust op taken die zo moeilijk zijn dat het juist de bedoeling is om meer tokens te besteden. Koop het voor die taken, meet het voordat je dat doet, en zet het niet op een hoogvolumeroute totdat iemand de vermenigvuldigingsfactor publiceert.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs GPT-6 Luna Pro — the scoreboard'. Left column Claude Haiku 5.5: what it is, a released model, GA 7 October 2026; input price $0.10 per million up to 100,000 tokens; output price $0.50 per million up to 100,000 tokens; context window 1,000,000 tokens; independent score 43 on Intelligence Index v4.3.2 at Max effort, rank 2 of 182; cost per task $0.21. Right column GPT-6 Luna Pro: what it is, GPT-6 Luna in reasoning mode pro, not a separate model; input price $0.10 per million up to 272,000 tokens; output price $0.50 per million up to 272,000 tokens; token multiplier unpublished; independent score 38 for GPT-6 Luna at Max effort in standard mode, with no pro-mode evaluation available; cost per task $0.07 for standard mode. A footer line reads 'Vendor pricing per Anthropic and OpenAI; independent figures per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.