Een gegenereerde hero-kaart voor 'Identieke tarieven, drie keer de rekening', met het label 'ZELFDE STICKER', de kicker 'TWEE MODELLEN, $0,10 EN $0,50, ÉÉN VRAAG' en de ondertitel 'Claude Haiku 5.5 tegenover GPT-6 Luna: dezelfde twee getallen, en heel verschillende drempels.' Vier chips tonen '$0,10 / $0,50 beide', '100K vs 272K', '$0,21 vs $0,07' en '43,40 vs 38,12'. Twee kaarten daaronder hebben het label 'HETZELFDE' ('$0,10 input en $0,50 output onder de eerste tier, en een venster van 1M tokens bij beide') en 'NIET HETZELFDE' ('de stap ligt op 100.000 tokens tegenover 272.000, en de kosten per taak verschillen met een factor drie'). In de footer staat 'Gepubliceerde lijsttarieven van leveranciers; onafhankelijke metingen van Artificial Analysis, gelezen op 8 oktober 2026.' Het OrcaRouter-logo is gecomponeerd in de rechteronderhoek.
Guides & Insights

Claude Haiku 5.5 vs GPT-6 Luna: Zelfde prijskaartje, drie keer de rekening

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Claude Haiku 5.5 en GPT-6 Luna hebben op papier dezelfde prijs: $0,10 per miljoen inputtokens en $0,50 per miljoen outputtokens, dezelfde twee getallen tot op de cent, van twee leveranciers die het zelden ergens over eens zijn. In de lanceringspost van Ant​hropic worden zelfs de scores van Luna afgedrukt in de kolom naast die van Ant​hropic zelf, iets wat leveranciers niet doen bij modellen die ze als niet-bedreigend beschouwen.

De twee kaarten lopen uiteen op alles wat de sticker verbergt. Luna houdt dat tarief aan tot 272.000 tokens voordat het omhooggaat; Claude Haiku 5.5 gaat al bij 100.000 omhoog. Claude Haiku 5.5 scoort 43,40 op de Artificial Analysis Intelligence Index v4.3.2 tegenover de 38,12 van Luna — en kost $0,21 per afgeronde Index-taak tegenover de $0,07 van Luna. Dezelfde prijs, drie keer de rekening, vijf punten meer intelligentie. Dat is de hele afweging, en het is een schonere afweging dan de meeste directe vergelijkingen in dit segment.

Twee kaarten, naast elkaar

Per miljoen tokens in Amerikaanse dollars, op basis van de gepubliceerde tarieven van Anthropic en OpenAI zoals weergegeven in onze eigen catalogus, met onafhankelijke metingen toegeschreven aan Artificial Analysis. Gecachet op 2026-10-08.

A generated scoreboard titled 'Claude Haiku 5.5 vs GPT-6 Luna - two cards, side by side'. Claude Haiku 5.5 reads input $0.10 under the first tier and $0.50 past 100,000, output $0.50 and $2.50 past 100,000, maximum output 128,000 tokens, Intelligence Index v4.3.2 43.40, cost per task $0.21, output speed 241.9 tokens per second. GPT-6 Luna reads input $0.10 under the first tier and $0.20 past 272,000, output $0.50 and $0.75, maximum output 128,000 tokens, Intelligence Index v4.3.2 38.12, cost per task $0.07, output speed 129.4 tokens per second. A footer reads 'Vendors' published list rates; independent measurements from Artificial Analysis.'

• Invoer — Claude Haiku 5.5 $0,10 tot 100.000 tokens, $0,50 daarboven. GPT-6 Luna $0,10 tot 272.000 tokens, $0,20 daarboven.

• Uitvoer — Claude Haiku 5.5 $0,50 tot 100.000 tokens, $2,50 daarboven. GPT-6 Luna $0,50 tot 272.000 tokens, $0,75 daarboven.

• Gecachte invoer en schrijfacties — beide tegen $0,01 en $0,125 onder de eerste drempel, waarbij Claude Haiku 5.5 na 100.000 tokens naar $0,05 en $0,625 gaat en GPT-6 Luna na 272.000 naar $0,02 en $0,25.

• Context en uitvoer — 1M tokens voor beide; 128.000 maximale uitvoer voor beide. Deze twee hebben echt dezelfde vorm.

• Denken — adaptief op beide, beide met een effort-parameter. De standaard effort van Claude Haiku 5.5 is medium; niet alle gepubliceerde scores zijn bij die instelling.

• Onafhankelijke score — Claude Haiku 5.5 (Max) 43,40, tweede van 182 modellen. GPT-6 Luna (Max) 38,12, achtste van 182.

• Onafhankelijke kosten per taak — $ 0,21 tegenover $ 0,07.

• Snelheid — 241,9 outputtokens per seconde tegenover 129,4, gemeten door dezelfde evaluator.

De drempel is waar het verschil zit.

Beide leveranciers bouwden een tariefkaart met twee niveaus. Ze deden dat op heel verschillende plekken, en de plaatsing is veel belangrijker dan het getal bovenaan.

De tariefstap van Ant​hropic ligt op 100.000 tokens. Daaronder betaal je $0,10 en $0,50; daarboven vijf keer zoveel en vijf keer zoveel — $0,50 en $2,50. Ant​hropic zegt dat prompts onder de drempel ongeveer 90% van de verzoeken aan zijn vorige Haiku-model uitmaakten, wat de eigen verkeersmix van de leverancier is en een redelijke beschrijving van workloads met korte calls in het algemeen.

De tariefstap van OpenAI ligt op 272.000 tokens. Daaronder $0,10 en $0,50 — identiek aan Ant​hropic. Daarboven $0,20 en $0,75, een verdubbeling en een stijging van 50%. Dat is een veel geleidelijker stap en hij begint bijna drie keer zo ver.

Neem een prompt van 200.000 tokens, een plausibele omvang voor een pipeline voor lange documenten en volkomen redelijk voor een venster van 1M tokens. Bij Claude Haiku 5.5 wordt dat verzoek in de tweede tariefklasse gefactureerd: $0,50 invoer, $2,50 uitvoer. Bij GPT-6 Luna valt het nog steeds in de eerste tariefklasse: $0,10 invoer, $0,50 uitvoer. Vijf keer het invoertarief en vijf keer het uitvoertarief, bij hetzelfde verzoek, tussen twee modellen met dezelfde geadverteerde prijs. Dat is geen nuance — voor een workload met lange prompts is dat de hele vergelijking.

Waarom hetzelfde tarief een drie keer zo hoge rekening oplevert

Kosten per taak is het getal dat de doorslag zou moeten geven bij een pijplijn met een hoog volume, en hier lopen de twee modellen uiteen op een manier die de tariefkaart niet kan verklaren.

Artificial Analysis zet GPT-6 Luna (Max) op $0,07 per Intelligence Index-taak en Claude Haiku 5.5 (Max) op $0,21 — een factor drie, bij identieke stickerprijzen, voor een verschil van 5,28 punten in score. De oorzaak staat op dezelfde pagina en is allesbehalve subtiel. Claude Haiku 5.5 genereerde 440 miljoen outputtokens tijdens het uitvoeren van de Index, tegenover een mediaan van 100 miljoen, en de evaluator noemt het zeer breedsprakig. GPT-6 Luna genereerde 140 miljoen tegenover dezelfde mediaan van 100 miljoen, en wordt omschreven als enigszins breedsprakig. Drie keer zoveel outputtokens is drie keer de rekening wanneer output de dominante meter is.

De eigen cijfers van Ant​hropic wijzen in dezelfde richting. De kosten-versus-nauwkeurigheidsgrafieken van de leverancier zetten Haiku 5.5 af over het hele inspanningsbereik, en het kerncitaat uit de lancering is dat Sonnet 5.5 en Opus 5.5 de betere keuzes blijven voor complex agentisch programmeerwerk, terwijl Haiku 5.5 juist gepositioneerd is voor compactie, samenvatting en subagents. Hoe kleiner de taak, hoe minder van dat breedsprakigheidsprobleem je erbij koopt — precies de werklast waarvoor het model is gebouwd, en precies de werklast waarbij het de moeite waard is een drievoudig kostenverschil af te zetten tegen je eigen logs in plaats van tegen die van een ranglijst.

Nog een regel in het grootboek, uit de documentatie van Anthropic in plaats van die van de evaluator: Claude Haiku 5.5 gebruikt de nieuwere tokenizer die wordt gedeeld met Claude 4.7 en later, dus dezelfde tekst telt als ongeveer 30% meer tokens dan bij de vorige Haiku. Het tarief is hetzelfde als dat van Luna; de tokenizer niet.

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 specifications row and the published pricing table, with the per-million-token input, output and cache rates and the 100,000-token threshold at which the second tier begins.

Wat zegt Anthropics eigen tabel over Luna?

De lanceringspagina van Ant​hropic neemt GPT-6 Luna op als een kolom in de benchmarktabel, en de eerlijke manier om erover te rapporteren is met de bronvermelding erbij: dit zijn evaluaties van Ant​hropic, uitgevoerd op de testomgeving van Ant​hropic, tegen het model van een concurrent. Ze zijn door de leverancier gerapporteerd, niet onafhankelijk gereproduceerd, en een leverancier die zijn eigen suite tegen de scores van een rivaal draait, is een vergelijking om af te wegen in plaats van te accepteren.

• Kenniswerk — GDPval-AA v2.1 op 1620 voor Claude Haiku 5.5 tegen 1437 voor GPT-6 Luna. AA-Briefcase v1.1 op 1578 tegen 1336.

• Computergebruik — offline subset van OSWorld 2.1 op 72,4% tegenover 48,9%.

• Agentisch coderen — Terminal-Bench 4.0 op 39,2% tegenover 16,4%; FrontierCode 1.1 (Main) op 46,4% tegenover 42,4%.

• Visueel redeneren — Chartography op 46,4% zonder hulpmiddelen tegenover 29,1%.

Op de eigen testomgeving van de leverancier staat Claude Haiku 5.5 in elke rij aan de leiding. Op het onafhankelijke scorebord leidt Claude Haiku 5.5 met een kleinere marge — 43,40 tegen 38,12 — wat de gebruikelijke verhouding is tussen een tabel van een leverancier en die van een derde partij, en de reden dat beide hier worden weergegeven. De twee zijn het eens over de richting en verschillen van mening over de grootte.

Het wetsvoorstel is de doorslaggevende stem

Zet de vier feiten die er echt toe doen tegen elkaar af, en de keuze is voor de meeste workloads niet langer spannend.

GPT-6 Luna is op de onafhankelijke meting drie keer goedkoper per voltooide taak, de eerste prijsklasse reikt achttien keer verder in het contextvenster, de overschrijdingspercentages zijn lager op beide meters, en het is de enige van de twee waarvan de long-contextstraf een verdubbeling is in plaats van een vijfvoudige stap. Claude Haiku 5.5 ligt voor op gemeten intelligentie met een marge die reëel en bescheiden is, is bijna twee keer sneller op output, en — op de eigen testomgeving van de leverancier, waar de kloof het grootst is — ligt voor op elke gepubliceerde benchmarkrij.

Als je aanroepen kort zijn, als doorvoer de beperking is, of als het kwaliteitsverschil in je eigen evaluatie naar voren komt, betaal dan drie keer zoveel. Als je aanroepen lang zijn, als ze door een machine zijn gegenereerd en nooit door een mens worden gelezen, of als je een classificatielaag draait die een miljoen keer per dag wordt aangeroepen, dan leveren dezelfde $0,10 en $0,50 je aan de andere kant een factuur op die een derde zo groot is, en het vermogen dat je opgeeft is vijf punten op een ranglijst waar beide modellen dicht bij de top staan.

Een van hen vanaf één plek bellen

Het nuttige van een vergelijking die zo dicht bij elkaar ligt, is dat je niemand op zijn woord hoeft te geloven, ook ons niet. GPT-6 Luna staat vandaag in de OrcaRouter-catalogus tegen het tarief van de provider met 0% markup — dezelfde tariefstructuur als hierboven weergegeven, doorgegeven in plaats van vermengd — en dat geldt ook voor Claude Sonnet 5.5 en Claude Opus 5.5, waardoor een escalatietest van een goedkope leg naar een middentier een configuratie is in plaats van een project. Eén sleutel, één SDK, automatische failover eronder, en de routing-DSL als de escalatie in de route thuishoort in plaats van in je applicatie.

Claude Haiku 5.5 staat nog niet in de catalogus. Dat ronduit zeggen is nuttiger dan iets anders te suggereren: de Luna-kant van deze vergelijking kunnen wij vanmorgen aanroepen, en de Ant​hropic-kant moet bij Ant​hropic worden bereikt totdat dat niet meer zo is.

A screenshot of the OrcaRouter catalogue page for GPT-6 Luna, showing the model identifier openai/gpt-6-Luna, the provider OpenAI, a 1M-token context window, 128,000 maximum output, the release date September 22 2026, the $0.10 per million input and $0.50 per million output rates and a p50 time to first token of 1.49 seconds.

Wat zou het antwoord veranderen

Twee dingen, en beide zijn het waard om te observeren in plaats van te schatten.

Het eerste is of de breedsprakigheid meebeweegt. De kosten per taak van Claude Haiku 5.5 zijn een functie van hoeveel tokens het per antwoord verbruikt bij maximale effort, en de effortparameter is de hefboom daarvoor. Een team dat effort lager vastzet — de eigen standaardinstelling van het model is medium, niet max — zal een kosten-per-taakwaarde zien die dichter bij die van Luna ligt, en ook een score die dichter bij die van Luna ligt. De afweging is beschikbaar; wat die waard is, is een vraag over je evaluatie, niet over het model.

Het tweede is of de onafhankelijke kosten-per-taakcijfers standhouden naarmate beide modellen meer gemeten runs verzamelen. Een enkele plaatsing op een leaderboard is een momentopname, en een drievoudig verschil dat in één momentopname opduikt, is het waard om aan de hand van je eigen factuur te bevestigen voordat een pipeline eromheen wordt herbouwd. Daar is het gedeelde endpoint voor bedoeld.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt