
GPT-5.6 Luna vs. Claude Haiku 4.5: Günstige Preisklasse, zwei sehr unterschiedliche Abrechnungen
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
GPT-5.6 Luna und Claude Haiku 4.5 sind die günstigen Stufen zweier unterschiedlicher Frontier-Familien, und der Unterschied zwischen ihnen hängt ganz davon ab, welche Zahl man betrachtet. Beim Listenpreis ist das ein Kantersieg: 0,20 $ pro Million Eingabe-Token gegenüber 1,00 $. Bei den Kosten pro abgeschlossener Aufgabe im Intelligence Index von Artificial Analysis sind es 0,18 $ gegenüber 0,21 $ – ein Unterschied von etwa 14 %. Dieselben zwei Modelle, zwei ehrliche Antworten, und der Grund, warum sie voneinander abweichen, ist die nützlichste einzelne Sache, die man verstehen sollte, bevor man sich für eines entscheidet.
Die Kurzfassung: Luna ist auf dem Papier das stärkere Modell und beim Durchsatz das schnellere, aber es denkt ausführlich und stellt das in Rechnung. Haiku 4.5 ist älter, im Umfang kleiner und deutlich besser darin vorherzusagen, was eine Anfrage kosten wird. Welches davon wichtiger ist, ist eine Eigenschaft Ihrer Arbeitslast, nicht der Modelle.
Auf einen Blick
• Anbieter — OpenAI vs. Anthropic
• Veröffentlicht — 9. Juli 2026 vs. 15. Oktober 2025
• Kontextfenster — 1M Token vs. 200K Token
• Maximale Ausgabe — 128K Tokens vs. 64K Tokens
• Eingabe — Text, Bild und Datei vs. Text, Bild und PDF
• Preis pro Million Token — 0,20 $ Eingabe / 1,20 $ Ausgabe vs. 1,00 $ Eingabe / 5,00 $ Ausgabe
• Artificial Analysis Intelligence Index — 38, 4. von 177 vs. 18, 138. von 200 (beide in der Reasoning-Konfiguration)
• Kosten pro Aufgabe des Intelligence Index — 0,18 $ vs. 0,21 $
• Ausgabegeschwindigkeit — 109,4 Tokens/Sek. vs. 84,7 Tokens/Sek.
• Reasoning-Steuerung — ein Aufwandsregler von none bis max im Gegensatz zu manuell aktiviertem erweitertem Denken ohne Effort-Parameter
• Zuverlässiger Wissensstichtag — Februar 2026 vs. Februar 2025 (Trainingsdaten bis Juli 2025)
• Rücktrittszusage — keine veröffentlicht vs. nicht vor dem 15. Oktober 2026
Wo GPT-5.6 Luna tatsächlich gewinnt

Leistungsfähigkeit, und das mit großem Abstand. Ein Intelligence Index von 38 gegen 18 ist kein knappes Ergebnis. Luna übertrifft Haiku im Composite, den Artificial Analysis aus Bewertungen zu Reasoning, Wissen, Mathematik und Coding erstellt, und das, obwohl es das günstigere Modell pro Token ist. Wer diese beiden Familien zuletzt anhand des Index vor September verglichen hat — wo Luna 51 und 52 zeigte —, sollte beachten, dass die gesamte Skala im September 2026 neu bewertet wurde und Lunas Vorteil die Neubewertung überstanden hat.
Kontext, und zwar fünffach. Ein Fenster von 1 Mio. Token gegenüber 200K entscheidet für sich genommen über eine ganze Kategorie von Arbeit: Durchläufe über ein gesamtes Repository, lange Dokumentensammlungen, ausgedehnte Agent-Transkripte, die auf Haiku zusammengefasst werden müssten. Wenn Ihre Anwendung dadurch definiert ist, wie viel Kontext sie aufnehmen muss, endet der Vergleich hier.
Doppelter Ausgabespielraum. 128K maximale Ausgabe-Tokens gegenüber 64K sind entscheidend für die Generierung langer Texte und für agentische Schleifen, die strukturierte Pläne statt einzeiliger Antworten zurückgeben.
Durchsatz. 109,4 Ausgabe-Tokens pro Sekunde gegenüber 84,7 ist ein echter Unterschied für Streaming-Schnittstellen, auch wenn es nicht dasselbe wie Reaktionsfähigkeit ist — siehe den Abschnitt zur Latenz unten.
Der Preis auf dem Etikett. Fünfmal günstiger beim Input und rund viermal günstiger beim Output ist kein Rundungsfehler, und bei kurzem Output ist es die gesamte Entscheidung.
Wo Claude Haiku 4.5 noch seinen Platz verdient
Vorhersehbare Kosten. Das Reasoning von Haiku 4.5 ist erweitertes Denken, das man manuell einschaltet. Ist es aus, antwortet es direkt und rechnet vorhersehbar ab. Der Effort-Regler von GPT-5.6 Luna geht bis zum Maximum, und jede Stufe nach oben bedeutet mehr Output-Tokens zum Output-Tarif. Ein Team, das eine Kostengrenze möchte, die es im Voraus nennen kann, wird Haiku als leichter kalkulierbar empfinden – selbst bei einem höheren Listenpreis.
Die Non-Reasoning-Konfiguration ist wirklich günstig im Betrieb. Artificial Analysis bewertet die Non-Reasoning-Konfiguration von Claude 4.5 Haiku mit einem Intelligence Index von 15, ohne veröffentlichte Angabe zu den Kosten pro Aufgabe, und sie passt gut für Aufgaben, bei denen die Messlatte schlicht „das hier korrekt parsen" lautet – Intent-Klassifizierung, Feldextraktion, Routing-Entscheidungen, Moderations-Triage. Bei diesen Aufgaben ist die Indexlücke zwischen 15 und 38 weitgehend irrelevant, weil keinem der beiden Modelle abverlangt wird zu denken.
Caching- und Batch-Rabatte sind ausgereift. Haiku 4.5 bietet einen Rabatt von 90 % auf das Lesen aus dem Prompt-Cache und einen Rabatt von 50 % auf die Batch-API. Luna hat eine vergleichbare Cache-Ökonomie, daher ist das eher ein Gleichstand als ein Vorteil — aber wenn Ihre Pipeline bereits über Anthropics Tooling Batches verarbeitet, sind die Migrationskosten für den Wechsel weg von Haiku echte Kosten, und sie werden in keinem Benchmark auftauchen.
Eine operative Erfolgsbilanz. Haiku 4.5 ist seit Oktober 2025 in Produktion und verfügt über eine veröffentlichte Zusage, nicht vor dem 15. Oktober 2026 außer Betrieb genommen zu werden. Luna ist zwei Monate alt. Für einen Workload, bei dem das Modell ein Detail und nicht das Produkt ist, ist eine elfmonatige Produktionshistorie etwas wert, das ein Benchmark nicht ausdrücken kann.
Es ist das wahrheitsgetreuere Modell, auf der einzigen Achse, die genau das misst. Der Direktvergleich von Artificial Analysis setzt Luna in fast jeder Fähigkeitskategorie an die Spitze – AA-Briefcase 1.339 gegen 614, GDPval-AA v2 1.489 gegen 854, AutomationBench-AA 50 % gegen 3 %, Humanity's Last Exam 39 % gegen 10 %, GDPpdf 24 % gegen 4 %. Die Ausnahme ist AA-Omniscience, das selbstsichere falsche Antworten auf Wissensfragen bestraft: Luna erzielt dort -10, gegenüber -4 bei Haiku. Ein negativer Wert bedeutet, dass die Halluzinationsstrafe die Gutschrift für Genauigkeit überwiegt, und Lunas Strafe ist größer. Ein höherer zusammengesetzter Index ist nicht dasselbe wie eine verlässlichere Antwort, und in der einzigen Evaluation, die entwickelt wurde, um diese beiden Dinge zu trennen, schneidet das ältere Modell besser ab.
Die Kostenrechnung anhand einer realen Arbeitslast
Nimm eine Pipeline, die 100 Mio. Eingabe-Tokens verbraucht und 20 Mio. Ausgabe-Tokens pro Monat ausgibt.
• GPT-5.6 Luna — 100 × 0,20 $ = 20 $, plus 20 × 1,20 $ = 24 $. Insgesamt 44 $ pro Monat.
• Claude Haiku 4.5 — 100 × 1,00 $ = 100 $, plus 20 × 5,00 $ = 100 $. Insgesamt 200 $ pro Monat.
Bei diesen Verhältnissen ist Luna etwa 4,5-mal günstiger, und das ist die Berechnung, die die meisten Vergleiche veröffentlichen. Ändern Sie nun eine Annahme. Wenn Lunas Reasoning-Aufwand erhöht wird, steigt die Zahl ihrer Output-Tokens, und Output ist die teure Seite – bei 1,20 $ kostet er sechsmal so viel wie Input. Treibt man Luna an den Punkt, an dem sie für dasselbe Arbeitsvolumen 150 Mio. Output-Tokens ausgibt, so wie es im Evaluierungsset von Artificial Analysis der Fall ist, werden aus den 44 $ locker über 180 $. Der 4,5-fache Vorteil bricht in Richtung Parität zusammen.
Die Lektion ist nicht, dass Luna teuer ist. Sie ist, dass Lunas Preisvorteil eine Funktion davon ist, wie viel es redet – ein Parameter, den du steuerst. Dreh den Denkaufwand für Extraktion und Klassifizierung herunter, und der Rabatt ist real. Lässt du ihn für alles auf Maximum, hast du ein leistungsfähigeres Modell zu einem Preis gekauft, der nicht mehr an sein Preisschild erinnert.
Latenz, und eine Zahl, der du nicht trauen solltest
Veröffentlichte Werte für die Zeit bis zum ersten Token sind für diese beiden Modelle nahezu nutzlos, und es lohnt sich zu verstehen, warum. Bei Artificial Analysis zeigen die Reasoning-Konfigurationen beider Modelle Latenzen bis zum ersten Token im Bereich von Zehnern oder sogar Hunderten von Sekunden, weil die Testumgebung erst dann ein Token ausgibt, wenn das Modell das Reasoning abgeschlossen hat. Diese Zahl misst das Evaluations-Setup, nicht die Reaktionsfähigkeit des Modells.
Routing-Telemetrie ist eine bessere Quelle, weil sie das Modell im Produktivbetrieb misst. OrcaRouters eigene Zahlen setzen GPT-5.6 Luna bei einem Median von 1,83 Sekunden bis zum ersten Token und einem 95. Perzentil von 10,00 Sekunden an, gegenüber Claude Haiku 4.5 mit 3,81 Sekunden im Median und 9,47 Sekunden beim 95. Perzentil. Richtig gelesen heißt das, dass die beiden näher beieinanderliegen, als die Ranglisten vermuten lassen: Luna gewinnt bei der typischen Anfrage, und die Tail-Bereiche liegen nur etwa eine halbe Sekunde auseinander. Wenn Ihnen der Worst Case wichtiger ist als der Durchschnitt, liegt kaum etwas zwischen ihnen.
Welches soll man wählen?
Wähle GPT-5.6 Luna, wenn du langen Kontext hältst, wenn die Aufgabe von echtem Reasoning profitiert, wenn die Ausgabe lang oder strukturiert ist oder wenn du das stärkste Modell am unteren Ende der Preisspanne möchtest. Es ist außerdem die natürlichere Wahl, wenn der Rest deines Stacks bereits auf dem Verhalten der OpenAI-Familie läuft.
Wähle Claude Haiku 4.5, wenn deine Arbeit aus kurzen Ausgaben bei hohem Volumen besteht, wenn du eine Kostengrenze brauchst, die du nennen kannst, bevor die Anfrage ausgeführt wird, wenn deine Pipeline bereits auf das Batching und Caching von Anthhropic ausgelegt ist, oder wenn du ein Modell mit Produktionshistorie und veröffentlichtem Lebenszyklus einem vorziehst, das erst zwei Monate alt ist.
Wählen Sie keinen der beiden für eine Aufgabe, bei der ein kleines Reasoning-Modell oder ein fein abgestimmter Klassifikator genügen würde. Ein großer Teil des Traffics, den diese beiden Stufen absorbieren, ist Klassifikation und Extraktion, die auf etwas Engerem günstiger laufen würden – und das günstigste Modell ist immer das, das Sie nicht gebraucht haben.
Beide auf einer Taste ausführen

Das Duell ist nicht mehr exklusiv, sobald beide über einen einzigen Endpunkt erreichbar sind. Bei OrcaRouter stehen Claude Haiku 4.5 und GPT-5.6 Luna hinter derselben OpenAI-kompatiblen Basis-URL — eine API für 200+ Modelle, ein Schlüssel, eine Abrechnungszeile, kein zweiter Vertrag und keine Codeänderung außer der Modellkennung. Bei einer Tier-Entscheidung, bei der Sie sich noch nicht sicher sind, wird aus einer Migration so ein Konfigurationswert.
Zwei Funktionen leisten hier echte Arbeit. Der automatische Failover über Anbieter hinweg bedeutet, dass eine kostengünstige Stufe Produktionsverkehr tragen kann, ohne von einem einzigen Anbieter abhängig zu sein – nützlich, wenn das Modell billig genug ist, dass man ihm Tausende Aufrufe pro Stunde schickt statt einen einzigen wichtigen. Und die Routing-DSL lässt einen einen Aufruf aus mehreren Modellen zusammensetzen: die unkomplizierte Mehrheit der Anfragen an Luna leiten, den Rest an GPT-5.6 Terra eskalieren und Haiku 4.5 im Pool als Fallback behalten, wenn man die Antwort eines zweiten Anbieters statt eines erneuten Versuchs möchte.
Prüfen Sie den aktuellen Preis pro Token für GPT-5.6 Luna und Claude Haiku 4.5, bevor Sie eine der beiden für einen Produktionspfad einplanen – beide Preise werden mit 0 % Aufschlag durchgereicht, sie ändern sich also am Tag, an dem der Anbieter sie ändert, und Preis-Tracker von Drittanbietern hinken um Tage bis Wochen hinterher.
Fragen, die sich wirklich zu beantworten lohnen
Ist GPT-5.6 Luna wirklich fünfmal günstiger als Claude Haiku 4.5? Bei Eingabe-Tokens: ja – 0,20 $ gegenüber 1,00 $. Bei den Kosten für die Erledigung derselben evaluierten Aufgabe: nein – 0,18 $ gegenüber 0,21 $. Die Kluft zwischen diesen beiden Aussagen ist Lunas Ausführlichkeit. Es erzeugt ungefähr doppelt so viele Ausgabe-Tokens wie Haiku, um dieselbe Arbeit zu erledigen, und Ausgabe-Tokens kosten sechsmal so viel wie Eingabe-Tokens. Bei kurzen Antworten ist das Preisschild weitgehend ehrlich. Bei stark auf Schlussfolgerungen ausgerichteter Arbeit nicht.
Kann ich die Kosten bei beiden auf dieselbe Weise steuern? Nein, und das ist der am meisten unterberichtete Unterschied zwischen ihnen. Luna bietet einen Regler für den Reasoning-Aufwand mit Einstellungen von none bis max, sodass Kosten und Qualität pro Anfrage explizit gegeneinander abgewogen werden. Das erweiterte Denken von Haiku 4.5 ist entweder aktiviert, mit einem Token-Budget, oder eben nicht – es gibt keinen Effort-Parameter. Wenn Kostenkontrolle pro Anfrage für Sie wichtig ist, bietet nur einer der beiden diesen Hebel.
Wie sieht es mit einem Klassifikator für hohes Aufkommen aus, der ein paar Millionen Aufrufe pro Tag verarbeitet?Keines der beiden Modelle braucht dafür Reasoning. Lassen Sie Haiku 4.5 mit ausgeschaltetem erweiterten Denken laufen, oder Luna mit auf »none« gesetztem Effort, und vergleichen Sie dann Latenz und Ausgabelänge statt den zusammengesetzten Index — an diesem Punkt sind die relevanten Fragen, wie schnell das erste Token ankommt und wie viele Token die Antwort benötigt, und die Intelligenz-Benchmarks unterscheiden nicht mehr zwischen ihnen.

Welches wird in einem Jahr noch da sein? Für Claude Haiku 4.5 gilt eine veröffentlichte Zusage, dass es nicht vor dem 15. Oktober 2026 eingestellt wird. OpenAI veröffentlicht kein entsprechendes Datum für GPT-5.6 Luna, und die GPT-5.6-Reihe hat mit GPT-6 Astra bereits eine neuere Generation über sich. Beides ist kein Grund, Luna zu meiden, aber wenn Ihre Roadmap einen Planungshorizont von elf Monaten voraussetzt, ist es ein Grund, die Modellkennung in der Konfiguration zu belassen statt sie fest zu verdrahten.
Live-Preis pro Token für GPT-5.6 Luna über denselben Schlüssel, zu 0 % Aufschlag durchgereicht, ohne zweite Abrechnungsbeziehung.
Aktueller Preis pro Token für Claude Haiku 4.5 auf demselben Endpoint, sodass die beiden Tarifstufen ohne einen zweiten Vertrag verglichen werden können.
