
Claude Haiku 5.5 vs. GPT-6 Luna Pro: Ein Modell gegen einen Modus
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Eine Seite dieses Vergleichs ist ein Modell, die andere eine Einstellung. Claude Haiku 5.5wurde am 7. Oktober 2026 allgemein verfügbar, zu 0,10 $ pro Million Input-Tokens und 0,50 $ pro Million Output-Tokens, über die Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry und Claude Platform on AWS. GPT-6 Luna Proist überhaupt kein Modell: Der Weg dorthin führt über den Aufruf von GPT-6 Luna – live seit dem 22. September 2026 zu denselben 0,10 $ und 0,50 $ – mit reasoning.mode auf pro statt standard. Es gibt keine gpt-6-luna-pro-Kennung auf der Modellseite von OpenAI. Die ehrliche Formulierung dieses Duells lautet also nicht „welches Modell gewinnt“, sondern „wie gibt man zehn Cent pro Million Input-Tokens am besten aus“: ein kleines Modell mit einem Aufwandsregler oder ein größeres Modell, das in einem Modus läuft, der mehr Arbeit leistet und Ihnen die Tokens in Rechnung stellt, die es Ihnen nicht anzeigt. Für kurze Arbeit mit hohem Volumen ist die Antwort meist die erste. Für schwierige, gelegentliche Arbeit kann es die zweite sein – und die Zahl, die den Ausschlag gibt, hat OpenAI nicht veröffentlicht.
Was „pro“ mechanisch ist
Der Reasoning-Leitfaden von OpenAI besagt, dass GPT-5.6- und GPT-6-Modelle zwei Modi in der Responses API unterstützen, standard (die Standardeinstellung) und pro, ausgewählt über reasoning.mode. Der Modus ist eine andere Steuerung als reasoning.effort: Der Modus entscheidet, wie viel Arbeit das Modell leistet, bevor es sich auf eine Antwort festlegt; Effort entscheidet, wie viel Reasoning innerhalb des gewählten Modus stattfindet. Die dokumentierten Effort-Werte von GPT-6 Luna sind none, low, medium (die Standardeinstellung), high, xhigh und max, und jeder davon kann mit dem Pro-Modus kombiniert werden.
Bei der Abrechnung ist der Leitfaden eindeutig und etwas kontraintuitiv. Der Pro-Modus aggregiert die gesamte Modellarbeit hinter der endgültigen Antwort und berechnet diese Tokens „zu den Standard-Token-Preisen des ausgewählten Modells“. Es gibt keinen Pro-Aufschlag auf der Preisliste. Die Kosten erscheinen als Volumen, weil der Pro-Modus „mehr Modellarbeit als der Standardmodus leistet, was die Token-Nutzung und die Kosten erhöht“ – und Reasoning-Tokens werden als Output-Tokens abgerechnet und erscheinen nur im Usage-Objekt unter output_tokens_details.reasoning_tokens. Wenn Sie dieses Feld nicht lesen, bleibt die Erhöhung unsichtbar, bis die Rechnung eintrifft.
Daraus ergeben sich zwei Vergleiche, die man auseinanderhalten sollte. Gegenüber GPT-6 Luna im Standardmodus ist der Pro-Modus dasselbe Modell mit einem unbekannten Multiplikator beim Tokenverbrauch. Gegenüber Claude Haiku 5.5 ist es außerdem ein anderes Modell in einem anderen Maßstab – 1.050.000 Tokens Kontext gegenüber 1 Mio., eine Obergrenze von 922.000 Tokens für die Eingabe und ein Wissensstichtag vom 18. Mai 2026, auf einer Stufe, die Anthropics eigene Einführungsdokumentation bei schwieriger agentischer Arbeit leicht oberhalb des Haiku positioniert. Die beiden Unterschiede wirken sich auf die Kosten in dieselbe Richtung und auf die Leistungsfähigkeit in entgegengesetzte Richtungen aus, weshalb sich keiner von beiden aus einer Preisliste ablesen lässt.
Die Tarifkarten, nebeneinander
Beide Modelle werden in zwei Stufen abgerechnet, und die Schwellenwerte liegen an unterschiedlichen Stellen — was mehr zählt als der Nennpreis, denn beide Nennpreise sind identisch.
• Eingabe — Claude Haiku 5.5 0,10 $ pro Million bis 100.000 Token, darüber 0,50 $. GPT-6 Luna 0,10 $ bis 272.000 Token, darüber 0,20 $.
• Ausgabe — Claude Haiku 5.5 0,50 $ bis zu 100.000 Token, 2,50 $ darüber. GPT-6 Luna 0,50 $ bis zu 272.000 Token, 0,75 $ darüber.
• Caching — Bei Claude Haiku 5.5 kosten Cache-Lesevorgänge unterhalb der Grenze $0.01 und Cache-Schreibvorgänge $0.125; oberhalb sind es $0.05 bzw. $0.625. Bei GPT-6 Luna kosten Cache-Lesevorgänge unter 272.000 Token $0.01 und Cache-Schreibvorgänge $0.125; darüber sind es $0.02 bzw. $0.25.
• Kontext und Ausgabe — 1 Mio. Token und 128.000 maximale Ausgabe für Claude Haiku 5.5; 1.050.000 Token mit einer Eingabeobergrenze von 922.000 Token und 128.000 maximale Ausgabe für GPT-6 Luna.
• Denken — bei beiden adaptiv. Claude Haiku 5.5 verwendet standardmäßig mittleren Aufwand; GPT-6 Luna verwendet standardmäßig mittleren Aufwand und den Standardmodus, wobei der Pro-Modus zusätzlich als Opt-in verfügbar ist.
• Batch- und Caching-Rabatte — Claude Haiku 5.5 gewährt 50 % Rabatt auf die Message Batches API; GPT-6 Luna gewährt 50 % Rabatt auf Batch und Flex, verdoppelt im Fast-Modus und berechnet einen Aufschlag von 10 % für die regionale Verarbeitung.
Die eine Zeile, die nicht dieselbe Form hat, ist der Tokenizer. In der Dokumentation von Anthropic heißt es, dass Claude Haiku 5.5 den neueren Tokenizer verwendet, der auch von Claude 4.7 und späteren Versionen genutzt wird, sodass derselbe Text ungefähr 30 % mehr Tokens ergibt als bei Claude Haiku 4.5. Das ändert nicht den Tarif; es ändert, wie schnell ein Prompt die 100.000-Token-Stufe erreicht, und es ist ein echter Kostenunterschied, den keine Tarifkarte zeigt. Ein 90.000-Token-Prompt misst ungefähr 117.000 und kostet 0,50 $ pro Million Eingabe statt 0,10 $ — ein fünffacher Tarif für einen Prompt, der anscheinend bequem unter der Grenze liegt.
Was der Pro-Modus kostet – in den einzigen Einheiten, mit denen irgendjemand etwas anfangen kann
Da der Multiplikator nicht veröffentlicht ist, sollte man angeben, was jedes zusätzliche Token kostet und dann, wie sich die plausiblen Spannen bei hohem Volumen auswirken.
• Bei den 0,50 $ pro Million Ausgabe-Tokens von GPT-6 Luna kostet jede zusätzliche 10.000 Ausgabe-Tokens pro Aufgabe 0,005 $. Laufen 100.000 Aufgaben pro Tag, summiert sich dieser Zuwachs auf eine Milliarde zusätzliche Tokens – etwa 500 $ pro Tag oder 15.000 $ pro Monat, bei einem Modell, dessen beworbener Preis 10 Cent pro Million Eingabe-Tokens beträgt.
• Zum Vergleich: GPT-6 Luna verbraucht bei maximalem Aufwand bereits 140 Millionen Ausgabe-Tokens, wenn es den Intelligence Index gegen einen Median von 100 Millionen ausführt, was der Evaluator als etwas weitschweifig beschreibt. Anthropics Einführungstabelle, ausgeführt auf Anthropics eigenem Harness, führt GPT-6 Luna mit 16,4 % auf Terminal-Bench 4.0 und 42,4 % auf FrontierCode 1.1 auf, gegenüber 39,2 % und 46,4 % für Claude Haiku 5.5 — vom Anbieter gemeldet, die Suite eines Anbieters, das Modell eines Wettbewerbers.
• Auf der unabhängigen Rangliste ist die Reihenfolge enger. Artificial Analysis bewertet Claude Haiku 5.5 bei Max effort mit 43 im Intelligence Index v4.3.2, auf Platz zwei von 182, und GPT-6 Luna (Max) mit 38, auf Platz acht von 182. Beide Werte gelten für Standardmodus, maximalen Aufwand. Es gibt keine unabhängige Bewertung von GPT-6 Luna im Pro-Modus: Auf der Seite von GPT-6 Luna gibt es keinen Pro-Eintrag, und Artificial Analysis führt auch keinen auf.
Das strukturelle Problem des Pro-Modus ist die Wechselwirkung zwischen den letzten beiden Punkten. Der gesamte Kostenvorteil von GPT-6 Luna gegenüber Claude Haiku 5.5 rührt von der Token-Effizienz her – 140 Millionen Ausgabe-Tokens gegenüber 440 Millionen für dieselbe Suite, bei identischen Tarifen, weshalb dieselbe Eval auf der einen Seite 0,07 $ pro Aufgabe kostet und auf der anderen 0,21 $. Der Pro-Modus ist per Definition ein Modus, der mehr Tokens ausgibt. Ihn einzuschalten bedeutet, genau das auszuschalten, was das Modell in diesem Vergleich günstig gemacht hat, und der Multiplikator, der angeben würde, um wie viel, wird nicht veröffentlicht. Das ist kein Argument dafür, dass der Pro-Modus ein schlechtes Geschäft ist – bei schwierigen Aufgaben ist mehr Arbeit meist bessere Arbeit –, sondern ein Argument dafür, dass der Pro-Modus über Fähigkeiten konkurriert, nicht über den Preis, und an den Modellen der mittleren Kategorie gemessen werden sollte, denen er preislich nahesteht, statt an der günstigen Kategorie, in der er sitzt.

Wo jedes einzelne tatsächlich gewinnt
Reduziert man es auf die Entscheidung, ist die Trennung sauber, obwohl keine der beiden Seiten frei von Vorbehalten ist.
Claude Haiku 5.5 besetzt das günstige Ende. Es ist in beiden entscheidenden Bedeutungen schneller: 241,9 Ausgabe-Token pro Sekunde, gemessen von Artificial Analysis, gegenüber 123,0 für GPT-6 Luna, und eine Zeit bis zum ersten Token von 295 Sekunden im Index-Lauf, was darauf zurückzuführen ist, wie lange es bei der Einstellung Max nachdenkt, bevor es antwortet, und keine Netzwerkkennzahl darstellt. Seine Preisliste erreicht die zweite Stufe bei 100.000 Token, und sein Tokenizer bläht Prompts um rund 30 % auf, sodass Workloads mit langen Prompts in beiderlei Hinsicht mehr zahlen, als der nominelle Preis vermuten lässt. Zurück bekommt man einen Fünf-Punkte-Intelligenzvorteil im unabhängigen Index und einen Effort-Regler – von Low bis Max –, der die mit Abstand nützlichste Kostenkontrolle ist, die einer der beiden Anbieter mit diesen Markteinführungen ausgeliefert hat. Indem man den Effort nach unten festlegt, tauscht man einen Teil dieses Fünf-Punkte-Vorsprungs gegen einen Kosten-pro-Aufgabe-Wert ein, der näher an dem von GPT-6 Luna liegt.
GPT-6 Luna Pro dominiert das schwierige Ende, mit einer nicht bezifferten Rechnung. Das darunterliegende Modell ist pro Token oberhalb von 272.000 Eingabe-Tokens günstiger als Claude Haiku 5.5 oberhalb von 100.000, und zwar um den Faktor zweieinhalb bei der Eingabe und drei und ein Drittel bei der Ausgabe, und seine erste Stufe reicht achtzehnmal weiter in das Kontextfenster hinein. Der Standardmodus ist pro abgeschlossener Aufgabe messbar günstiger. Der Pro-Modus tauscht das gegen mehr Arbeit pro Antwort zu denselben Raten ein, und ob er Claude Haiku 5.5 bei maximalem Aufwand oder ein Mittelklassemodell bei einer bestimmten Aufgabe schlägt, ist eine Frage, die keine veröffentlichte Zahl beantwortet. Der Weg, sie zu beantworten, besteht darin, die Aufgabe auf beide Arten auszuführen und das Reasoning-Token-Feld zu lesen.

Eines von beiden ausprobieren, ohne darauf zu wetten
Der unangenehme Teil dieses Vergleichs ist, dass seine wichtigste Zahl — die tatsächlichen Kosten des Pro-Modus — nur erzeugt werden kann, indem man den eigenen Traffic durch ihn laufen lässt, und dass die effektiven Kosten des kleineren Modells davon abhängen, wo Ihre Prompts relativ zu einer 100.000-Token-Grenze nach der Re-Tokenisierung landen. Beide sind Messprobleme, und beide sind an einem gemeinsam genutzten Endpunkt günstiger als über zwei Anbieter-Clients hinweg.
GPT-6 Luna ist heute im Katalog von OrcaRouter zum Listenpreis des Anbieters mit 0 % Aufschlag durchgereicht verfügbar, sodass die Standardmodus-Basislinie für diesen Vergleich über einen einzigen Schlüssel aufrufbar ist und eine Preisänderung des Anbieters noch am selben Tag bei uns landet statt erst zum nächsten Abrechnungszyklus. Claude Haiku 5.5 ist noch nicht im Katalog; die Anthropic-Stufe, die wir heute tatsächlich routen, besteht aus Claude Haiku 4.5, Claude Sonnet 5.5 und Claude Opus 5.5, was einen Eskalationstest von einem günstigen Leg über eine mittlere Stufe hinauf zu einer Routing-Regel statt zu einer Code-Änderung macht. Automatisches Failover darunter ist das, was ein zwei Tage altes Modell Produktionsverkehr tragen lässt, während Sie es noch messen: Ein Anbieter, der auszufallen beginnt, wird umgangen, anstatt die Anfrage scheitern zu lassen, was der Unterschied zwischen einem Pilotprojekt, das Sie diese Woche fahren können, und einer Umstellung ist, die Sie planen müssen.
Was den Ausschlag gibt
Drei Dinge, geordnet danach, wie stark sie die Antwort verändern würden. Wenn OpenAI einen Token-Multiplikator für den Pro-Modus veröffentlicht, oder einen Pro-Slug mit eigener Preiszeile, würde das die zentrale Unbekannte in Arithmetik verwandeln. Wenn Artificial Analysis GPT-6 Luna im Pro-Modus bei angeglichenem Effort erneut laufen lässt, würde das dies von der unabhängigen Seite aus erledigen. Und ein zweiter unabhängiger Lauf von Claude Haiku 5.5 bei medium statt Max würde dir sagen, was das Modell bei seiner Standardeinstellung tatsächlich kostet, und das ist die Konfiguration, die die meisten ausliefern werden — die $0.21 pro Aufgabe auf dem Board sind ein Max-Effort-Wert, und Max ist nicht die Standardeinstellung.
Bis dahin bleibt die korrekte Zusammenfassung eng. Claude Haiku 5.5 ist ein Modell, das Sie heute aufrufen, bepreisen und benchmarken können, und bei den Volumina, für die seine Stufe ausgelegt ist, ist es die günstigere Antwort – mit einem dokumentierten Weg, noch günstiger zu werden. GPT-6 Luna Pro ist eine Konfiguration eines Modells, das Sie aufrufen können, seine Preisliste ist nicht das Problem, sein Token-Verbrauch ist nicht auditiert, und die gesamte Rechtfertigung dafür beruht auf Aufgaben, die schwer genug sind, dass das Ausgeben von mehr Tokens gerade der Punkt ist. Kaufen Sie es für diese Aufgaben, messen Sie es, bevor Sie das tun, und setzen Sie es nicht auf einen Hochvolumenpfad, bis jemand den Multiplikator veröffentlicht.

