Hero-Titelkarte für Claude Opus 5.5 vs. Grok 4.6 generiert, geteilt durch einen vertikalen Trenner: „Claude Opus 5.5" mit „$4.00 / $20.00" auf der linken Seite, „Grok 4.6" mit „$2.00 / $6.00" auf der rechten Seite, und der Slogan „EIN MODELL LIEST, DAS ANDERE HANDELT" am unteren Rand, mit dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Claude Opus 5.5 vs. Grok 4.6: Das eine Modell liest, das andere handelt

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Claude Opus 5.5 und Grok 4.6 sind die zwei günstigsten Möglichkeiten, ein Modell der Frontier-Klasse zu kaufen, das einen Kontext von einer halben Million Token fassen kann – und sie sind nicht dasselbe Produkt. Bei einer Messung liegt Grok 4.6 drei Punkte unter der absoluten Obergrenze: 94,9 auf GPQA Diamond, einem wissenschaftlichen Fragenkatalog auf Graduiertenniveau, in dem Anthropics Flaggschiff im selben Bereich liegt. Bei der nächsten liegt es achtunddreißig Punkte zurück. Bei Terminal-Bench 4.0, dem agentischen Terminal-Benchmark, bei dem ein Modell echte Arbeit in einer Shell erledigen muss, bewertete Artificial Analysis Grok 4.6 mit 21,21 % und Claude Opus 5.5 mit 59,60 %. Das ist in keiner Richtung ein Druckfehler, und die ganze Gestalt dieser Paarung besteht darin, zu erklären, warum beide Zahlen zugleich wahr sind.

Zwei Veröffentlichungen, eine Preisklasse, vier Monate Abstand

SpaceXAI veröffentlichte Grok 4.6 am 12. August 2026 als aktuelles Flaggschiff der Grok-Reihe, zu 2,00 US-Dollar pro Million Input-Tokens und 6,00 US-Dollar für Output-Tokens, mit einem Kontextfenster von 500.000 Tokens und einer Eingabeoberfläche für Text, Bilder und Dateien. Anthropic veröffentlichte Claude Opus 5.5 am 22. September 2026, etwa sechs Wochen später, zu 4,00/20,00 US-Dollar mit einem Kontextfenster von 1.000.000 Tokens und 128.000 Output-Tokens. Beide unterstützen konfigurierbaren Reasoning-Aufwand, Tool-Aufrufe und strukturierte Ausgaben; beide bieten eine OpenAI-kompatible Chat-Oberfläche sowie das eigene Format ihres Anbieters.

Die naive Lesart ist also ein sauberer Tausch: Grok 4.6 kostet beim Input die Hälfte und beim Output etwa ein Drittel, und Claude Opus 5.5 antwortet mit einem doppelt so großen Kontextfenster. Dieser Tausch ist real, und bei der Arbeit mit langen Dokumenten mag er das Einzige sein, was zählt. Er ist auch nicht dort, wo die interessante Divergenz liegt, denn die beiden Modelle wurden auf demselben unabhängigen Test-Harness gemessen und landeten auf den Achsen, die für agentische Arbeit zählen, nicht an derselben Stelle.

Was der Katalog zu den Achsen sagt, auf denen beide gemessen wurden

Der Katalog von OrcaRouter enthält pro Zeile die Benchmark-Herkunft – jede Zahl nennt den Evaluator, von dem sie stammt –, sodass die untenstehenden Paare alle aus einer einzigen Quelle für beide Modelle stammen, Artificial Analysis, und nicht aus einer Anbieterzahl auf der einen und einer Drittanbieterzahl auf der anderen Seite:

• GPQA Diamond — Claude Opus 5.5 ist in unserem Katalog auf dieser Achse nicht aufgeführt; Grok 4.6 erreicht 94,9 %

• Humanity's Last Exam — 61,4 % für Claude Opus 5.5 gegenüber 42,9 % für Grok 4.6

• SciCode — 66,9 % gegenüber 56,5 %

• Langkontext-Recall — 84,7 % gegenüber 80,3 %

• Terminal-Bench 4.0 — 59,60 % gegenüber 21,21 %

• AA Intelligence Index — 57,6 gegen 44,3

Die GPQA-Zeile wird auf der Anthropic-Seite bewusst leer gelassen, anstatt aus einem Anbieter-Deck gefüllt zu werden. Grok 4.6s 94,9 dort ist die stärkste Zahl auf seiner Karte und sie ist echt – eine unabhängige Messung, keine Behauptung von SpaceXAI – und sie sagt etwas Wahres über das Modell aus: Wenn die Aufgabe eine wohlgeformte Frage mit einer vertretbaren Antwort ist, performt Grok 4.6 an der Frontier. Liest man es neben Terminal-Bench 4.0s 21,21 %, wird das Muster erkennbar. Eine korrekte Antwort über Wissenschaft zu produzieren und eine fünfstufige Aufgabe in einer Shell gegen ein echtes Dateisystem auszuführen, sind unterschiedliche Kompetenzen, und Grok 4.6 ist bei der ersten viel weiter fortgeschritten als bei der zweiten.

Ein Vorbehalt zu dieser Gegenüberstellung, bevor sie als Urteil herangezogen wird: Die Artificial-Analysis-Werte der beiden Modelle wurden zu unterschiedlichen Evaluierungszeitpunkten erfasst, und die von Grok 4.6 sind der ältere Datensatz. Der Vergleich steht zwischen einem im August evaluierten Modell und einem im September evaluierten Modell in einer Testumgebung, die in diesem Zeitraum selbst überarbeitet wurde. Die Richtung der Lücke ist über fünf separate Achsen hinweg konsistent, weshalb wir sie als Signal behandeln; die genauen Punktwerte sollten jedoch als August-gegen-September-Vergleich gelesen werden, nicht als Vergleich vom selben Tag.

Ein Index, der von jemandem erstellt wurde, der auch nichts verkauft.

Es gibt ein zweites unabhängiges Maß, und es stimmt in der Richtung überein, ist aber viel weniger bereit, feine Unterscheidungen zu treffen. Der Epoch Capabilities Index, von Epoch AI als zusammengesetztes Maß aus mehr als fünfzig Benchmarks erstellt und so neu skaliert, dass Claude 3.5 Sonnet bei 130 und GPT-5 bei 150 liegt, setzt Claude Opus 5.5 in der Datei, die wir am 2. Oktober 2026 gelesen haben, auf 167,35. Grok 4.6 liegt bei 156,61, basierend auf einer Auswertung vom 12. August. Das ist eine Lücke von 10,74 Punkten auf einer Skala, auf der bei der Einführung des Index beobachtet wurde, dass etwa fünf Punkte einer Verdopplung des METR-Zeithorizont-Maßes entsprechen – groß und deutlich außerhalb der veröffentlichten Intervalle der beiden Modelle von 164,0 bis 172,0 und 154,66 bis 158,93, die sich überhaupt nicht überschneiden.

Bemerkenswert ist, was dieser Index nicht klärt. Er setzt Claude Sonnet 5.5 auf 165,2 und Claude Fable 5.1 auf 164,82, beide über Grok 4.6, und beide sind pro Million Output-Tokens günstiger als der Tarif der zweiten Stufe von Grok 4.6. Wer allein nach Leistung pro Dollar auswählt, hat eine dritte und vierte Option in derselben Anbieterfamilie, und bei der Gegenüberstellung in diesem Artikel geht es um etwas anderes: wofür die beiden Modelle jeweils gut sind.

Die Tarifkarten und die Zeile, die nur auf einer von ihnen erscheint

A two-column scoreboard comparing Claude Opus 5.5 and Grok 4.6 across six rows. Left column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K max output, AA Intelligence Index 57.6, Epoch Capabilities Index 167.35. Right column Grok 4.6: input $2.00 doubling to $4.00 above 200K tokens, output $6.00 doubling to $12.00, cache read $0.50, context 500K tokens, AA Intelligence Index 44.3, Epoch Capabilities Index 156.61. A footer line reads 'Prices and catalogue figures per the OrcaRouter catalogue; Index figures per Artificial Analysis and the Epoch Capabilities Index.'

Die Preistabelle von Grok 4.6 enthält eine Stufe, die die von Claude Opus 5.5 nicht hat: Anfragen mit mehr als 200.000 Prompt-Tokens werden zum doppelten Grundtarif abgerechnet, sodass der Input von 2,00 $ auf 4,00 $ und der Output von 6,00 $ auf 12,00 $ steigt, während der Cache-Read von 0,50 $ auf 1,00 $ steigt. Claude Opus 5.5 berechnet 4,00 $/20,00 $ mit 0,20 $ für Cache-Reads, pauschal über das gesamte 1.000.000-Token-Fenster. Diese Umkehrung ist die praktische Konsequenz daraus, langen Kontext bei einem der beiden Modelle zu kaufen, und sie kippt den Preisvergleich auf dem Papier, sobald eine Workload tatsächlich wächst:

• Preis bei 30.000 Eingabe-Tokens — Claude Opus 5.5 ist das teure Modell, bei rund 28 Cent für 30.000 Eingabe- und 8.000 Ausgabe-Tokens, gegenüber etwa 11 Cent für Grok 4.6

• Preis bei 250.000 Eingabe-Tokens – die Reihenfolge kehrt sich um, weil Grok 4.6 in seine verdoppelte Stufe gewechselt ist, während Claude Opus 5.5 dies nicht getan hat

• Cache-Lesevorgänge — 0,20 $ pro Million für Claude Opus 5.5 gegenüber 0,50 $, oberhalb der Stufe steigend auf 1,00 $, für Grok 4.6

• Maximale Ausgabe — 128.000 Tokens für Claude Opus 5.5; die Ausgabe-Obergrenze von Grok 4.6 ist nicht im Katalogdatensatz veröffentlicht

Grok 4.6 weist außerdem eine Lücke auf, die man besser klar benennt, als sie später zu entdecken. In seinen Angaben ist überhaupt kein Wert für die maximale Ausgabe aufgeführt — das Feld ist nicht ermittelt, nicht null —, sodass eine Workload, die auf sehr langen einzelnen Antworten basiert, auf dieser Seite des Vergleichs keine veröffentlichte Zahl hat, an der sie sich orientieren kann.

Die Performance-Spalte, die nicht gelesen werden sollte

Unser Katalog enthält außerdem ein Panel zur Serving-Performance pro Modell, und bei Grok 4.6 ist es das Irreführendste auf der Seite. Die Karte weist eine p50-Latenz von 10.000 Millisekunden und eine Fehlerrate von 97,58 % über ein Sieben-Tage-Fenster aus, wobei in diesem Zeitraum 26.184 Tokens bereitgestellt wurden. Diese Felder beschreiben kein langsames Modell. Sie beschreiben ein Modell, das kaum aufgerufen wurde: Bei diesem Verkehrsaufkommen ist die Stichprobe zu dünn, als dass eine Latenzverteilung irgendetwas bedeuten könnte, und die Fehlerrate spiegelt eine Handvoll Versuche wider, nicht die Servicequalität. Diesen Block als Beleg dafür zu behandeln, dass Grok 4.6 langsam ist, hieße, ein Messartefakt als Messung zu lesen.

Das Panel von Claude Opus 5.5 hingegen hat eine Population hinter sich – einen p50 im Bereich von 4,4 Sekunden über ein Sieben-Tage-Fenster mit täglichen Stichproben und 156 Millionen Tokens, die im selben Zeitraum ausgeliefert wurden. Selbst das sollte als das gelesen werden, was es ist: unser eigener Playground-Traffic, der eine Stichprobe unserer Nutzer und keine Eigenschaft des Modells darstellt.

Welche weitergeleitet werden soll und wie Sie es anhand Ihrer eigenen Arbeit herausfinden

Die Aufteilung, die die Zahlen beschreiben, ist stabil genug, um darauf zu handeln. Claude Opus 5.5 ist die Wahl für agentische und langfristige Arbeit – der Terminal-Bench-4.0-Abstand von 59,60 % gegenüber 21,21 % ist die größte Trennung auf jeder Achse, auf der beide Modelle gemessen wurden, und es ist die Achse, die vorhersagt, ob einem Modell eine Aufgabe statt einer Frage übergeben werden kann. Es ist außerdem die Wahl, wenn der Prompt wirklich lang ist, weil die Preisstaffel nicht springt und das Fenster doppelt so groß ist. Grok 4.6 ist die Wahl für fragenförmige Arbeit in großem Umfang: ein GPQA-Diamond-Wert von 94,9 % für 2,00 $/6,00 $ innerhalb der ersten 200.000 Token ist ein sehr gutes Angebot für Retrieval-and-Answer-Workloads, die nie in die verdoppelte Tarifstufe hineinwachsen.

Beide sind auf OrcaRouter zum Listenpreis des Anbieters mit 0 % Aufschlag verfügbar — Claude Opus 5.5 zu 4,00 $/20,00 $ mit 0,20 $ für Cache-Lesevorgänge, Grok 4.6 zu 2,00 $/6,00 $, wobei die Tarifstufe oberhalb von 200K genau so angewendet wird, wie SpaceXAI sie festlegt — hinter einem einzigen Schlüssel, sodass die oben genannte Aufteilung an Ihrem eigenen Prompt-Set getestet werden kann, statt darüber zu streiten. Wo beide geroutet werden, liegt darunter ein automatisches Failover, was sich lohnt, wenn das günstigere Modell dasjenige ist, das den agentischen Pfad hält.

Das Urteil, das dieses Duo verdient: Grok 4.6 ist der bessere Leser und Claude Opus 5.5 ist der bessere Arbeiter. Die 94,9 auf GPQA Diamond und die 21,21 auf Terminal-Bench sind dasselbe Modell, zweimal gemessen, und zu wissen, welcher dieser beiden Zahlen Ihre Arbeitslast ähnelt, ist die ganze Entscheidung.

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.Screenshot of the OrcaRouter model page for Grok 4.6 (grok/grok-4.6), showing the model header, the context window of 500,000 tokens, the text, image and file input surface, the capability tags, and the input and output price figures per million tokens.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert