Eine generierte Hero-Karte für „Identische Preise, dreifache Rechnung“, versehen mit dem Badge „GLEICHER STICKER“, dem Kicker „ZWEI MODELLE, 0,10 $ UND 0,50 $, EINE FRAGE“ und dem Untertitel „Claude Haiku 5.5 gegen GPT-6 Luna: dieselben zwei Zahlen und sehr unterschiedliche Schwellenwerte.“ Vier Chips zeigen „0,10 $ / 0,50 $ bei beiden“, „100K vs. 272K“, „0,21 $ vs. 0,07 $“ und „43,40 vs. 38,12“. Zwei Karten darunter sind mit „DASSELBE“ („0,10 $ für Input und 0,50 $ für Output unter der ersten Stufe sowie ein 1M-Token-Fenster bei beiden“) und „NICHT DASSELBE“ („die Stufe liegt bei 100.000 Tokens gegenüber 272.000, und die Kosten pro Aufgabe unterscheiden sich um das Dreifache“) beschriftet. Eine Fußzeile lautet: „Von Anbietern veröffentlichte Listenpreise; unabhängige Messungen von Artificial Analysis, abgelesen am 8. Oktober 2026.“ Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

Claude Haiku 5.5 vs. GPT-6 Luna: Gleicher Listenpreis, dreifache Rechnung

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Claude Haiku 5.5 und GPT-6 Luna kosten auf dem Papier identisch: 0,10 US-Dollar pro Million Eingabe-Token und 0,50 US-Dollar pro Million Ausgabe-Token – dieselben zwei Zahlen, bis auf den Cent genau, von zwei Anbietern, die sich selten über irgendetwas einig sind. Anthropics Launch-Post druckt sogar Lunas Werte in der Spalte neben seinen eigenen ab, was Anbieter bei Modellen, die sie für ungefährlich halten, nicht tun.

Die beiden Karten unterscheiden sich in allem, was der Sticker verbirgt. Luna hält diesen Tarif bis zu 272.000 Tokens, bevor er ansteigt; Claude Haiku 5.5 steigt bei 100.000. Claude Haiku 5.5 erzielt 43,40 im Artificial Analysis Intelligence Index v4.3.2 gegenüber Lunas 38,12 — und kostet 0,21 $ pro abgeschlossener Index-Aufgabe gegenüber Lunas 0,07 $. Gleicher Preis, dreimal so hohe Rechnung, fünf Punkte mehr Intelligenz. Das ist der ganze Deal, und er ist sauberer als die meisten Direktvergleiche in dieser Klasse.

Zwei Karten, nebeneinander

Pro Million Token in US-Dollar, aus den veröffentlichten Preisen von Ant​hropic und OpenAI, wie sie in unserem eigenen Katalog wiedergegeben sind, mit unabhängigen Messungen, die Artificial Analysis zugeschrieben werden. Zwischengespeichert am 2026-10-08.

A generated scoreboard titled 'Claude Haiku 5.5 vs GPT-6 Luna - two cards, side by side'. Claude Haiku 5.5 reads input $0.10 under the first tier and $0.50 past 100,000, output $0.50 and $2.50 past 100,000, maximum output 128,000 tokens, Intelligence Index v4.3.2 43.40, cost per task $0.21, output speed 241.9 tokens per second. GPT-6 Luna reads input $0.10 under the first tier and $0.20 past 272,000, output $0.50 and $0.75, maximum output 128,000 tokens, Intelligence Index v4.3.2 38.12, cost per task $0.07, output speed 129.4 tokens per second. A footer reads 'Vendors' published list rates; independent measurements from Artificial Analysis.'

• Eingabe — Claude Haiku 5.5: 0,10 $ bis zu 100.000 Token, 0,50 $ darüber. GPT-6 Luna: 0,10 $ bis zu 272.000 Token, 0,20 $ darüber.

• Ausgabe — Claude Haiku 5.5: 0,50 $ bis zu 100.000 Token, darüber 2,50 $. GPT-6 Luna: 0,50 $ bis zu 272.000 Token, darüber 0,75 $.

• Zwischengespeicherte Eingaben und Schreibvorgänge – beide bei 0,01 $ und 0,125 $ unterhalb der ersten Schwelle, wobei Claude Haiku 5.5 ab 100.000 Tokens auf 0,05 $ und 0,625 $ wechselt und GPT-6 Luna ab 272.000 auf 0,02 $ und 0,25 $.

• Kontext und Ausgabe — 1 Mio. Token für beide; maximale Ausgabe von 128.000 für beide. Diese beiden haben wirklich dieselbe Form.

• Denken — bei beiden adaptiv, beide mit einem Effort-Parameter. Der Standard-Effort von Claude Haiku 5.5 ist medium; nicht alle veröffentlichten Ergebnisse wurden mit dieser Einstellung erzielt.

• Unabhängige Bewertung — Claude Haiku 5.5 (Max) 43.40, Zweiter von 182 Modellen. GPT-6 Luna (Max) 38.12, Achter von 182.

• Unabhängige Kosten pro Aufgabe — 0,21 $ gegenüber 0,07 $.

• Geschwindigkeit — 241,9 Ausgabe-Token pro Sekunde gegenüber 129,4, gemessen vom selben Evaluator.

Die Schwelle ist der Punkt, an dem der Unterschied liegt.

Beide Anbieter haben eine zweistufige Preisliste erstellt. Sie haben es an ganz unterschiedlichen Stellen getan, und die Platzierung ist weitaus wichtiger als die Zahl oben.

Anthropics Stufe liegt bei 100.000 Tokens. Darunter zahlen Sie 0,10 $ und 0,50 $; darüber das Fünffache und das Fünffache – 0,50 $ und 2,50 $. Anthropic zufolge machten Prompts unterhalb der Schwelle etwa 90 % der Anfragen an sein vorheriges Haiku-Modell aus, was dem eigenen Traffic-Mix des Anbieters entspricht und eine sinnvolle Beschreibung von Short-Call-Workloads im Allgemeinen ist.

OpenAIs Stufe liegt bei 272.000 Tokens. Darunter 0,10 $ und 0,50 $ — identisch mit Anthropic. Darüber 0,20 $ und 0,75 $, eine Verdopplung und ein Anstieg um 50 %. Das ist eine viel sanftere Stufe, und sie beginnt fast dreimal weiter oben.

Nehmen Sie einen Prompt mit 200.000 Token, was für eine Langdokument-Pipeline eine plausible Größe und für ein 1-Mio.-Token-Fenster völlig vernünftig ist. Bei Claude Haiku 5.5 wird diese Anfrage in der zweiten Preisstufe abgerechnet: 0,50 $ für Eingabe, 2,50 $ für Ausgabe. Bei GPT-6 Luna ist es noch die erste Preisstufe: 0,10 $ für Eingabe, 0,50 $ für Ausgabe. Das Fünffache der Eingaberate und das Fünffache der Ausgaberate, bei derselben Anfrage, zwischen zwei Modellen mit demselben Nennpreis. Das ist keine Feinheit – für eine Workload mit langen Prompts ist es der gesamte Vergleich.

Warum derselbe Tarif zur dreifachen Rechnung führt

Die Kosten pro Aufgabe sind die Kennzahl, die eine Pipeline mit hohem Volumen entscheiden sollte, und hier gehen die beiden Modelle auf eine Weise getrennte Wege, die die Preisliste nicht erklären kann.

Artificial Analysis beziffert GPT-6 Luna (Max) mit 0,07 $ pro Intelligence-Index-Aufgabe und Claude Haiku 5.5 (Max) mit 0,21 $ – ein Faktor von drei bei identischen Listenpreisen für einen Unterschied von 5,28 Punkten im Ergebnis. Die Ursache steht auf derselben Seite und ist nicht subtil. Claude Haiku 5.5 erzeugte beim Durchlaufen des Index 440 Millionen Output-Tokens gegenüber einem Median von 100 Millionen, und der Evaluator nennt es sehr geschwätzig. GPT-6 Luna erzeugte 140 Millionen gegenüber demselben Median von 100 Millionen und wird als etwas geschwätzig beschrieben. Dreimal so viele Output-Tokens bedeuten dreimal so hohe Rechnung, wenn der Output der dominierende Abrechnungsfaktor ist.

Anthropics eigene Zahlen weisen in dieselbe Richtung. Die Kosten-gegen-Genauigkeit-Diagramme des Anbieters tragen Haiku 5.5 über den gesamten Effort-Bereich auf, und das hervorgehobene Zitat zum Launch lautet, dass Sonnet 5.5 und Opus 5.5 weiterhin die besseren Wahl für komplexe agentische Coding-Arbeit bleiben, während Haiku 5.5 stattdessen für Kompaktierung, Zusammenfassung und Subagenten positioniert wird. Je kleiner die Aufgabe, desto weniger von diesem Verbosity-Problem kauft man sich ein – genau die Workload, für die das Modell gebaut wurde, und genau die Workload, bei der sich eine dreifache Kostendifferenz lohnt, anhand der eigenen Logs geprüft zu werden statt anhand eines Leaderboards.

Noch ein Eintrag im Hauptbuch, aus der Dokumentation von Ant​hropic statt aus der des Evaluators: Claude Haiku 5.5 verwendet den neueren Tokenizer, der mit Claude 4.7 und späteren Modellen geteilt wird, sodass derselbe Text rund 30 % mehr Token zählt als beim vorherigen Haiku. Der Tarif ist derselbe wie bei Luna; der Tokenizer ist es nicht.

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 specifications row and the published pricing table, with the per-million-token input, output and cache rates and the 100,000-token threshold at which the second tier begins.

Was Anthropics eigene Tabelle über Luna sagt

Ant​hropics Startseite führt GPT-6 Luna als Spalte in der eigenen Benchmark-Tabelle auf, und die ehrliche Art, darüber zu berichten, besteht darin, die Zuordnung anzugeben: Dies sind Ant​hropics Evaluierungen, ausgeführt mit Ant​hropics Harness, gegen das Modell eines Wettbewerbers. Sie sind vom Anbieter gemeldet, nicht unabhängig reproduziert, und wenn ein Anbieter seine eigene Suite gegen die Ergebnisse eines Rivalen laufen lässt, ist das ein Vergleich, den man abwägen sollte, statt ihn einfach zu übernehmen.

• Wissensarbeit — GDPval-AA v2.1 bei 1620 für Claude Haiku 5.5 gegenüber 1437 für GPT-6 Luna. AA-Briefcase v1.1 bei 1578 gegenüber 1336.

• Computernutzung — OSWorld 2.1 Offline-Teilmenge bei 72,4 % gegenüber 48,9 %.

• Agentisches Codieren – Terminal-Bench 4.0 bei 39,2 % gegenüber 16,4 %; FrontierCode 1.1 (Main) bei 46,4 % gegenüber 42,4 %.

• Visuelles Schlussfolgern: Chartography bei 46,4 % ohne Werkzeuge gegenüber 29,1 %.

In der anbietereigenen Testumgebung führt Claude Haiku 5.5 jede Zeile an. Auf der unabhängigen Vergleichsplattform liegt es mit einem kleineren Vorsprung vorn – 43,40 gegenüber 38,12 –, was dem üblichen Verhältnis zwischen der Tabelle eines Anbieters und der eines Dritten entspricht und der Grund dafür ist, dass beide hier abgedruckt sind. Die beiden stimmen in der Richtung überein und gehen beim Ausmaß auseinander.

Der Gesetzentwurf ist die entscheidende Stimme.

Stellt man die vier tatsächlich gegeneinander auf, ist die Entscheidung für die meisten alles andere als knapp.

GPT-6 Luna ist bei der unabhängigen Messung pro abgeschlossener Aufgabe um den Faktor drei günstiger, seine erste Preisstufe reicht achtzehnmal weiter in das Kontextfenster hinein, seine Raten oberhalb der Schwelle sind bei beiden Messgrößen niedriger, und es ist das einzige der beiden, dessen Langkontext-Strafe eine Verdopplung statt eines fünffachen Sprungs ist. Claude Haiku 5.5 liegt bei der gemessenen Intelligenz mit einem realen und moderaten Vorsprung vorn, ist bei der Ausgabe um fast den Faktor zwei schneller und – beim eigenen Harness des Anbieters, wo die Lücke am größten ist – in jeder veröffentlichten Benchmark-Zeile vorn.

Wenn Ihre Aufrufe kurz sind, wenn der Durchsatz der limitierende Faktor ist oder wenn sich der Qualitätsunterschied in Ihrer eigenen Evaluation zeigt, zahlen Sie das Dreifache. Wenn Ihre Aufrufe lang sind, wenn sie maschinengeneriert sind und nie von einem Menschen gelesen werden oder wenn Sie eine Klassifizierungsstufe betreiben, die eine Million Mal am Tag ausgelöst wird, verschaffen Ihnen dieselben $0,10 und $0,50 eine Rechnung, die auf der anderen Seite nur ein Drittel so groß ist, und die Leistungsfähigkeit, die Sie dafür aufgeben, entspricht fünf Punkten auf einem Leaderboard, auf dem beide Modelle nahe der Spitze stehen.

Eines von beiden von einer Stelle aus aufzurufen

Das Nützliche an einem so engen Vergleich ist, dass man niemandem einfach glauben muss, auch uns nicht. GPT-6 Luna ist heute im OrcaRouter-Katalog zum Tarif des Anbieters mit 0 % Aufschlag verfügbar — dieselbe Tarifstruktur wie oben aufgeführt, durchgereicht statt vermischt — und ebenso Claude Sonnet 5.5 und Claude Opus 5.5, was einen Eskalationstest von einem günstigen Einstieg auf eine mittlere Stufe zu einer Konfiguration statt zu einem Projekt macht. Ein Schlüssel, ein SDK, automatisches Failover darunter und die Routing-DSL, falls die Eskalation in die Route gehört und nicht in Ihre Anwendung.

Claude Haiku 5.5 ist noch nicht im Katalog. Das klar zu sagen ist nützlicher, als etwas anderes nahezulegen: Die Luna-Seite dieses Vergleichs ist heute Morgen von uns aus aufrufbar, und die Anthropic-Seite muss bei Anthropic erreicht werden, bis sie es nicht mehr muss.

A screenshot of the OrcaRouter catalogue page for GPT-6 Luna, showing the model identifier openai/gpt-6-Luna, the provider OpenAI, a 1M-token context window, 128,000 maximum output, the release date September 22 2026, the $0.10 per million input and $0.50 per million output rates and a p50 time to first token of 1.49 seconds.

Was würde die Antwort ändern?

Zwei Dinge – und beide sollte man lieber beobachten als schätzen.

Das Erste ist, ob sich die Ausführlichkeit ändert. Die Kosten pro Aufgabe von Claude Haiku 5.5 sind eine Funktion davon, wie viele Tokens es pro Antwort bei maximalem Aufwand verbraucht, und der Aufwands-Parameter ist der Hebel dafür. Ein Team, das den Aufwand niedriger festlegt – der Standard des Modells selbst ist mittel, nicht maximal –, wird einen Kosten-pro-Aufgabe-Wert näher an dem von Luna sehen und auch eine Punktzahl näher an der von Luna. Der Trade-off ist verfügbar; was er wert ist, ist eine Frage Ihrer Evaluation, nicht des Modells.

Der zweite Punkt ist, ob die unabhängigen Kosten-pro-Aufgabe-Zahlen Bestand haben, während beide Modelle mehr gemessene Durchläufe ansammeln. Eine einzelne Leaderboard-Platzierung ist eine Momentaufnahme, und eine Lücke um den Faktor drei, die in einer Momentaufnahme erscheint, sollte man anhand Ihrer eigenen Rechnung überprüfen, bevor eine Pipeline darauf neu aufgebaut wird. Dafür ist der gemeinsame Endpunkt da.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert