Hero-Karte mit dem Titel Claude Sonnet 5.5 vs. Grok 4.6, mit dem Untertitel: Die Preisliste sagt das eine, die Token-Rechnung das andere, mit Pillen-Angaben: Output 10 $ vs. 6 $, Kosten pro Aufgabe 7,60 $ vs. 1,86 $ und Index 56 vs. 44, und einer Fußzeile, die Artificial Analysis v4.3.2 und Anbieterpreise zitiert.
Guides & Insights

Claude Sonnet 5.5 vs. Grok 4.6: Die Preisliste sagt das eine, die Token-Rechnung das andere

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die Arithmetik der Überschrift scheint schon vor Beginn des Artikels festzustehen. Grok 4.6 kostet 2 US-Dollar pro Million Eingabe-Tokens und 6 US-Dollar pro Million Ausgabe-Tokens; Claude Sonnet 5.5 kostet 2 US-Dollar bzw. 10 US-Dollar. Das Modell von Space​XAI ist bei den Ausgaben um 40 % günstiger, bei den Eingaben gleich teuer und seit dem 12. August 2026 allgemein verfügbar – lange genug, dass seine Eigenheiten dokumentiert und nicht bloß Gegenstand von Gerüchten sind. Das Modell von Anthro​pic kam am 28. September 2026 auf den Markt, einen Tag bevor dies geschrieben wurde, und ist mit großem Abstand das Neueste in dieser Klasse.

Dann stößt man auf die unabhängigen Effizienzwerte, und die Reihenfolge kippt. Artificial Analysis misst Modelle der GPT- und Claude-Klasse auf Kosten-pro-Aufgabe-Basis neben seinem Intelligence Index, und in der Revision v4.3.2 kosten die beiden hier betrachteten Modelle 1,86 US-Dollar pro Index-Aufgabe für Grok 4.6 und 7,60 US-Dollar für Claude Sonnet 5.5. Das Modell mit dem günstigeren Tarif ist das teurere im Betrieb, um den Faktor vier. Herauszufinden, warum das so ist und wann diese Umkehr gilt und wann nicht, macht den ganzen Vergleich aus.

Zwei Modelle, zwei Positionen in ihren eigenen Familien

Grok 4.6 ist das aktuelle Flaggschiff der Grok-Reihe – die eigene Entwicklerdokumentation von SpaceXAI führt es als das neueste auf, und es trat die Nachfolge von Grok 4.5 an, mit demselben Kontextfenster von 500.000 Token, derselben Eingabeoberfläche für Text, Bilder und Dateien und derselben Basispreisgestaltung. Es unterstützt konfigurierbaren Reasoning-Aufwand, natives Tool-Calling, strukturierte Ausgaben und die vollständige Sampling-Oberfläche und fügt sich als erstklassiges OpenAI-Responses-Modell ohne Übersetzungsschicht in bestehende Agent-Frameworks ein. Artificial Analysis führt es mit einem Intelligence Index von 44, auf Rang 31 der 216 Modelle, die es misst, bei einem GPQA-Diamond-Wert von 94,9 %.

Two-column scoreboard for Claude Sonnet 5.5 and Grok 4.6 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, verbosity 410M output tokens. Right column Grok 4.6: input $2.00 per million, output $6.00 per million, 500K-token context, AA Intelligence Index 44, cost per Index task $1.86, verbosity 94M output tokens. A footer line reads Index, cost per task and verbosity per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 ist der zweite Eintrag in der 5.5-Generation von Anthropic und das Modell, das das Unternehmen als die beste Kombination aus Geschwindigkeit und Intelligenz in seinem Lineup positioniert hat. Es wird als claude-sonnet-5-5/ auf der Claude API und den drei großen Clouds ausgeliefert, verfügt über ein Kontextfenster von 1 Mio. Tokens mit einer synchronen Ausgabegrenze von 128K, behält die Preise von Claude Sonnet 5 von 2 $ / 10 $ für Eingabe, Ausgabe und Caching bei und ist mit Zero-Data-Retention verfügbar. In derselben Indexrevision erreicht es 56 Punkte und belegt Platz drei von 216.

Die beiden sind also nicht wirklich im selben Markt. Das eine ist ein Frontier-Modell mit 500.000 Token, das seit sieben Wochen zu einem günstigen Tarif erhältlich ist. Das andere ist eine Allzweck-Stufe mit 1 Mio. Token, die pro Token nicht mehr kostet als ihr Vorgänger und beim Composite zwölf Punkte höher liegt. Der Vergleich lohnt sich trotzdem, denn beide sind 2-Dollar-Input-Modelle, und genau dort beginnen Beschaffungsentscheidungen tatsächlich.

Die Vierfach-Lücke, die niemand auf eine Folie bringt

Tarifkarten bepreisen Tokens. Rechnungen lauten auf Aufgaben, und die Anzahl der Tokens, die ein Modell für das Erreichen einer Antwort aufwendet, ist eine Designentscheidung statt einer Konstante. Genau darin weichen die beiden voneinander ab, und die gemessenen Zahlen sind deutlich:

• Ausgaberate — Claude Sonnet 5.5 10 $ pro Million vs. Grok 4.6 6 $ pro Million

• Kosten pro Aufgabe im Intelligence Index — Claude Sonnet 5.5 7,60 $ vs. Grok 4.6 1,86 $

• Ausführlichkeit auf dem Index — Claude Sonnet 5.5 410 M Ausgabe-Tokens vs. Grok 4.6 94 M

• Intelligenzindex — Claude Sonnet 5.5 56 vs. Grok 4.6 44, beide auf v4.3.2

• Ausgabegeschwindigkeit — Grok 4.6 wurde mit 67,7 Token pro Sekunde gemessen, gegenüber einem Median von 82,7; Anthropic berichtet, dass Claude Sonnet 5.5 die Ausgabe um über 30 % schneller generiert als Claude Sonnet 5, das Artificial Analysis mit 78,7 Token pro Sekunde maß

Die Ausführlichkeitslinie ist der Mechanismus. Ein Modell, das viermal so viele Tokens ausgibt, braucht keine um 67 % höhere Ausgaberate, um pro Aufgabe viermal so viel zu kosten — aber es hilft, und beide Effekte weisen hier in dieselbe Richtung. Anthropics eigene Darstellung stützt die Interpretation, statt ihr zu widersprechen: Das Material zur Markteinführung behauptet, Claude Sonnet 5.5 koste bei identischen Preisen pro Token „bis zu 30 % weniger pro Aufgabe“ als Claude Sonnet 5, was eine Aussage über Token-Anzahlen ist, nicht über Raten. Gegenüber einer externen Baseline, die weit schlanker ist, wird dieselbe Eigenschaft zum größten Kostenrisiko des Modells.

Nichts davon lässt die Indexlücke verschwinden. Zwölf Punkte im Composite sind ein echter Fähigkeitsunterschied, und eine günstigere Aufgabe, die scheitert, ist nicht günstiger. Es bedeutet aber, dass die ehrliche Frage nicht lautet „welche Rate ist niedriger“, sondern „wie viele Tokens braucht die schwierigere Aufgabe“, und diese Zahl existiert erst, wenn man seine eigene Workload laufen lässt.

Artificial Analysis model page for Claude Sonnet 5 (Adaptive Reasoning, Max Effort), released June 2026, showing an Intelligence Index of 38, an output speed of 78.7 tokens per second against an average of 83, a cost of $2.00 per million input tokens and $10.00 per million output tokens, $5.09 per Intelligence Index task, a verbosity of 370M output tokens, and a 1M-token context window.

Kontext, Aufwand und die Ausgestaltung der Integration

Die zweite Abweichung ist architektonischer Natur, und sie entscheidet darüber, welche der beiden Sie übernehmen können, ohne irgendetwas neu schreiben zu müssen.

OrcaRouter model page for grok/grok-4.6, attributed to SpaceXAI and dated 2026-08-12, showing a 500K-token context window, text, image and file input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 3.00 seconds, and OpenAI-compatible base URL https://api.orcarouter.ai/v1

Claude Sonnet 5.5 ändert sechs Verhaltensweisen gegenüber Claude Sonnet 5, fünf davon sind Breaking Changes. Das Senden von thinking: {"type": "disabled"}/ gibt jetzt einen 400-Fehler zurück und muss ersetzt werden durch between_tools/. Erzwungene Tool-Nutzung — tool_choice/ von "any"/ oder ein benanntes Tool — wird rundweg abgelehnt, sodass eine Schleife, die einen schema-gültigen Aufruf erzwingt, wechseln muss zu auto/ mit strikter Tool-Nutzung oder strukturierten Ausgaben. Das ältere computer_20251124/ Computer-Use-Tool wird in der Claude API und in Google Cloud abgelehnt. Thinking-Blöcke sind jetzt an das Modell und das Konto gebunden, die sie erzeugt haben, sodass eine Konversation ihren Denkprozess von Claude Sonnet 5 aus weiterführen, aber nicht seitwärts in eine andere Modellfamilie übertragen kann. Und das Advisor-Tool akzeptiert Claude Opus 4.8, Claude Opus 4.7 oder Claude Sonnet 5 nicht mehr als Berater hinter einem Sonnet 5.5-Executor.

Grok 4.6 verlangt nichts davon. Es ist ein Modell im OpenAI-Format mit intakter Sampling-Oberfläche, und die Migration von Grok 4.5 ist eine Änderung des Modell-Strings. Seine eigene Kostenstruktur hat allerdings einen Haken, und sie ist ein Spiegelbild der von Anthropic: Der Tarif von 2 $ / 6 $ gilt bis zu 200.000 Eingabe-Tokens, und alles darüber wird mit 4 $ / 12 $ abgerechnet. Claude Sonnet 5.5 berechnet den Standardtarif über das gesamte 1M-Fenster.

Stellen Sie die beiden Strukturen nebeneinander, und schon geht es bei der Entscheidung nicht mehr darum, welcher Anbieter günstiger ist:

• Kurze Prompts, dichte Ausgabe — Grok 4.6s sparsamere Token-Gewohnheit und niedrigere Ausgaberate gewinnen entscheidend

• Sehr lange Eingaben — der pauschale 1M-Tarif von Claude Sonnet 5.5 unterbietet eine sich verdoppelnde Tarifstufe bereits deutlich vor dem Kontextlimit

• Große einzelne Ausgaben — Die 128K-Obergrenze von Sonnet 5.5 entspricht der von Grok 4.6, und es erreicht 300K bei der Message Batches API hinter dem output-300k-2026-03-24/ header

• Bestehender Code im OpenAI-Format – Grok 4.6 erfordert keine Änderungen; Sonnet 5.5 benötigt die oben beschriebene Arbeit an Tool-Nutzung und Thinking

Beide auf eine einzige Zugangsberechtigung bringen

Einen v-Vergleich im Kopf zu behalten, ist einfach. Ihn durchzuführen, ist der Punkt, an dem die Kosten verborgen liegen: zwei Konten, zwei Limitsätze, zwei Abrechnungsoberflächen und eine Token-Anzahl, die zweimal gemessen werden muss, bevor sie irgendetwas aussagt.

OrcaRouter fasst das in einem einzigen OpenAI-kompatiblen Endpunkt zusammen, der über 200 Modelle abdeckt, wobei die Listenpreise der Anbieter unverändert weitergegeben werden und kein Aufschlag anfällt – eine Preisänderung eines Anbieters, ob auf der Grok- oder der Claude-Seite, ist hier noch am selben Tag live statt erst bei der nächsten Vertragsverlängerung. Die gesamte Grok-4.x-Reihe steht im Katalog zu den Preisen des Anbieters selbst, und Claude Sonnet 5 ist seit dem 30. Juni zu Anthropics 2 $ / 10 $ routbar – das Modell, über das nach wie vor der meiste Claude-API-Traffic läuft, gemessen mit 150 Ausgabe-Tokens pro Sekunde und einer p50-Zeit bis zum ersten Token von rund fünf Sekunden.

Gerade Claude Sonnet 5.5 ist noch nicht in unserem Katalog. Bis dahin führt der Weg dorthin über die API des Anbieters selbst, und um es zu testen, ohne eine Arbeitslast auf ein Modell zu setzen, das niemand unabhängig über einen einzigen zusammengesetzten Benchmark hinaus getestet hat, schickt man ihm einen Prozentsatz des Traffics hinter automatischem Failover, wobei Grok 4.6 oder Claude Sonnet 5 auffängt, was es fallen lässt. Eine brandneue Stufe auszuprobieren ist eine Routing-Entscheidung, kein Migrationsprojekt.

Was ist mit den Zahlen zu tun?

Grok 4.6 ist das bessere Modell, zu dem man greifen sollte, wenn die Aufgabe kurz ist, die Ausgabe dicht ausfällt und die Integration bereits OpenAI spricht. Es ist pro Aufgabe messbar schlanker als alles andere in dieser Preisklasse, seine Sampling-Steuerungen sind intakt, und sieben Wochen Verfügbarkeit bedeuten, dass andere seine Fehlermodi bereits gefunden haben.

Claude Sonnet 5.5 ist das bessere Modell, wenn der Input riesig ist, wenn der zusammengesetzte Score das ist, was man kauft, oder wenn die Arbeit agentisch genug ist, dass eine Zwölf-Punkte-Lücke im Index und eine Obergrenze von 128K bei der Ausgabe mehr wiegen als ein vierfacher Unterschied bei den Kosten pro Aufgabe. Die Migrations-Checkliste ist real, und sie bedeutet einen Tag Arbeit statt einer Änderung am Modell-String.

Was die Frage klären würde, ist eine Messung der Tokens pro Aufgabe anhand Ihres eigenen Traffics, durchgeführt mit beiden. Jede Zahl in diesem Artikel, die über das Ergebnis entscheidet – 1,86 $ gegen 7,60 $, 94 Mio. gegen 410 Mio. –, ist ein Stellvertreter für genau diese eine Zahl, und sie ist die einzige davon, die Sie selbst ermitteln können.

In diesem Artikel verglichen4

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert