
Grok 4.7 vs. Claude Opus 5: Die Preislücke ist real, die Parität nicht.
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Sie können Grok 4.7 für 2,00 $ pro Million Eingabe-Tokens und 6,00 $ pro Million Ausgabe-Tokens aufrufen. Claude Opus 5 können Sie für 5,00 $ und 25,00 $ aufrufen. Das ist ein 4,2-facher Unterschied bei der Ausgabe – die Art von Abstand, die einen Vergleich normalerweise entscheidet, noch bevor die Benchmarks überhaupt geöffnet werden. Diesen hier entscheidet er nicht. In der Version des Artificial Analysis Intelligence Index, gegen die beide Modelle derzeit bewertet werden – v4.3.2, die am 19. September 2026 veröffentlichte Revision –, steht Claude Opus 5 bei 51 und Grok 4.7, vom Anbieter am 21. September 2026 veröffentlicht, bei 46. Fünf Punkte sind keine Abfuhr, aber die Form dieser fünf Punkte ist: Opus 5 gewinnt acht der zehn Evaluierungen in diesem Index. Das Argument des günstigeren Modells ist der Preis, beim Kontext herrscht Gleichstand, und die eine Stelle, an der der Preisvorteil von Grok 4.7 am meisten hätte zählen sollen, ist genau die Stelle, an der er verschwindet.
Zwei Flaggschiffe, zwei sehr unterschiedliche Preislisten
Claude Opus 5 ist seit dem 24. Juli 2026 auf dem Markt und ist Anthropics Flaggschiff der Opus-Klasse, das in der unternehmenseigenen Produktpalette unter Claude Fable 5.1 angesiedelt ist. Es bietet ein Kontextfenster von 1 Mio. Token zu einheitlicher Preisgestaltung – Anthropic stellt unmissverständlich klar, dass eine Anfrage mit 900k Token zum selben Preis pro Token abgerechnet wird wie eine mit 9k Token, ganz ohne Langkontext-Aufschlag – sowie eine maximale Ausgabe von 128K, erweiterbar auf 300K über die Message Batches API. Das Denken ist adaptiv und standardmäßig aktiviert, mit einer Effort-Stufenleiter von low, medium, high, xhigh und max, standardmäßig high. Die Gewichte sind geschlossen.
Grok 4.7 ist einen Tag alt. Es verfügt über einen Kontext von 500k Token, nimmt Text und Bilder entgegen und gibt Text zurück und bietet einen eigenen Reasoning-Aufwand-Regler. Der Listenpreis beträgt $2,00 für Eingabe und $6,00 für Ausgabe pro Million Token unter 200k Prompt-Token und steigt auf $4,00 und $12,00 ab oder über dieser Schwelle; gecachte Lesevorgänge kosten $0,50 und $1,00 in denselben beiden Stufen. xAI führt außerdem eine schnellere Variante auf, die mit etwa der doppelten Ausgabegeschwindigkeit für etwa den doppelten Preis läuft, wobei diese Konfiguration ohne angehängte veröffentlichte Geschwindigkeitsmessung ausgeliefert wurde. Auch hier sind die Gewichte geschlossen, was die „selbst ausführen“-Notlösung von beiden Seiten dieses Vergleichs entfernt.
Das unabhängige Gremium ist nicht nah dran, und es ist nicht schmeichelhaft.
Beide dieser Modelle werden auf dem v4.3.2-Index von Artificial Analysis bewertet, der zehn Evaluierungen umfasst, die Agenten, Coding, Allgemeinwissen und wissenschaftliches Schlussfolgern abdecken. Stellt man die beiden Spalten nebeneinander, wirkt die Fünf-Punkte-Headline gegenüber dem günstigeren Modell großzügig – eine einzelne Fünf-Punkte-Lücke in einem zusammengesetzten Wert kann viel verbergen, und hier verbirgt sie einen Beinahe-Sweep.
• Kombinierte Intelligenz — Grok 4.7 (xhigh): 46 im Artificial Analysis Intelligence Index v4.3.2. Claude Opus 5 (adaptives Reasoning, maximaler Aufwand): 51 in derselben Revision.
• Anspruchsvolles Schlussfolgern — Grok 4.7: Humanity's Last Exam 43, CritPt 18. Claude Opus 5: HLE 55, CritPt 29. Ein Abstand von zwölf bzw. elf Punkten, beide zugunsten von Opus 5.
• Agentische Terminals — Grok 4.7: Terminal-Bench 4.0 26. Claude Opus 5: 49. Dies ist die größte einzelne Lücke auf dem Board, und sie betrifft den Benchmark, der echter autonomer Arbeit am nächsten kommt.
• Arbeitsplatzautomatisierung — Grok 4.7: AutomationBench-AA 66%. Claude Opus 5: 57%. Grok 4.7s einziger klarer Sieg – und ein echter: neun Punkte in der Bewertung, die erfasst, ob ein Agent einen Workflow abschließt, ohne einen Guardrail auszulösen.
• Wissen und Ehrlichkeit — Grok 4.7: AA-Omniscience 32. Claude Opus 5: 37. Beide Modelle halluzinieren; Opus 5 tut dies bei diesem Maß weniger.
• Langer Kontext — Grok 4.7: AA-LCR v1.1 77 %, Fenster 500k Tokens. Claude Opus 5: 79 %, Fenster 1M Tokens.
• Kosten für den Betrieb des Index — Grok 4.7: 240 Mio. Output-Tokens über die gesamte Evaluation, von Artificial Analysis als ungewöhnlich wortreich eingestuft. Claude Opus 5: 140 Mio. Grok 4.7 verbraucht 1,7-mal so viele Tokens, um ein niedrigeres Ergebnis zu erzielen.

Wo der Preisvorteil von Grok 4.7 stirbt
Hier ist die Rechnung, die das Preisblatt verbirgt. Nehmen wir eine realistische agentische Anfrage: 30k Input-Tokens, 8k Output. Grok 4.7 berechnet $0,06 für die Eingabe und $0,048 für die Ausgabe — etwa elf Cent. Claude Opus 5 berechnet $0,15 für die Eingabe und $0,20 für die Ausgabe — etwa fünfunddreißig Cent. Das ist ein echtes 3x, und bei dieser Größe ist Grok 4.7 allein wegen der Kosten die offensichtliche Wahl.
Nimm nun die Anfrage, um die das eigene Marketing von Grok 4.7 herum aufgebaut ist: eine agentische Sitzung mit langem Kontext. Schiebe den Prompt über 200k Token hinaus, und die Tarife von Grok 4.7 verdoppeln sich auf 4,00 $ Eingabe und 12,00 $ Ausgabe. Claude Opus 5 bewegt sich nicht — sein 1M-Fenster wird pauschal mit 5,00 $ Eingabe und 25,00 $ Ausgabe abgerechnet. Bei 250k Input und 8k Output kostet Grok 4.7 1,00 $ Eingabe und 0,096 $ Ausgabe, etwa 1,10 $. Opus 5 kostet 1,25 $ Eingabe und 0,20 $ Ausgabe, etwa 1,45 $. Die Lücke ist von 3x auf ungefähr 1,3x zusammengeschrumpft. Geh noch weiter — 400k, 500k, das obere Ende des Fensters von Grok 4.7 — und der Pauschaltarif von Opus 5 holt weiter auf, während sein Fenster weiter bis zu einer Million Token reicht. Grok 4.7 ist das günstige Modell bei kurzen Prompts und preislich fast gleichauf bei den langen, was die Intuition umkehrt, die die Preisseite erzeugen soll.
Zwei Einschränkungen sorgen dafür, dass das ehrlich bleibt. Erstens ist die Long-Context-Stufe eine dokumentierte Listenpreisstruktur aus xAIs eigener Modelldokumentation, keine Messung – echte Rechnungen hängen vom Caching ab, und der Cached-Read-Preis von 0,50 $ für Grok 4.7 ist wirklich günstig. Zweitens hat Artificial Analysis noch keine Geschwindigkeitsmessung für Grok 4.7 veröffentlicht, sodass die „es ist schneller"-Hälfte des Günstig-und-schnell-Arguments derzeit unbestätigt ist. Was gemessen ist, ist Opus 5 mit 59 Token pro Sekunde bei einer Zeit bis zum ersten Token von 49 Sekunden – langsam, teuer und in fast jeder Qualitätsdimension voraus.
Was Sie tatsächlich routen würden
Dies ist ein Vergleich, bei dem die ehrliche Antwort je nach Workload unterschiedlich ausfällt, und ein Router ist der günstigste Weg, danach zu handeln. Claude Opus 5 ist auf OrcaRouter verfügbar, auf einer eigenen Modellseite gelistet, wobei der Preis des Anbieters mit 0 % Aufschlag weitergegeben wird – die 5,00 $ und 25,00 $ für Opus 5 in unserem Katalog sind also Anthropics Listenpreis, keine Kopie mit Aufschlag, und wenn Anthropic ihn ändert, ändert sich die Zahl am selben Tag unter demselben Key. Grok 4.7 ist zum Zeitpunkt dieses Textes nicht im OrcaRouter-Katalog; um es heute aufzurufen, gehst du über xAIs eigene API und die Drittplattformen, die es führen. Diese Asymmetrie solltest du kennen, bevor du darauf aufbaust.

Das Routing-Muster, das sich aus den Zahlen ergibt, ist unkompliziert. Senden Sie Arbeiten mit langem Kontext, starkem Reasoning-Anteil und Terminal-Agent-Aufgaben an Opus 5 – es gewinnt Terminal-Bench 4.0 um 23 Punkte und bietet bei pauschaler Preisgestaltung das doppelte Fenster, was genau dem Profil einer schwierigen, langen Aufgabe entspricht. Senden Sie Automatisierungs- und Workflow-Aufgaben mit hohem Volumen an Grok 4.7: Es gewinnt AutomationBench-AA um neun Punkte und kostet bei kurzen Prompts ein Drittel. Da beide über einen einzigen Endpunkt erreichbar sind, wenn sie im Katalog enthalten sind, ist diese Aufteilung eine Routing-Regel und kein zweiter Anbietervertrag, und automatisches Failover bedeutet, dass ein Rate Limit auf einem Pfad zu einem Routing-Ereignis statt zu einem Ausfall wird. Wo eine Workload wirklich beides braucht – einen günstigen ersten Durchlauf und einen teuren Verifizierungsdurchlauf –, fügt die Routing-DSL sie zu einem einzigen Aufruf zusammen statt zu zwei Integrationen.
Das Urteil
Wenn Sie nach Evidenz entscheiden, gewinnt Claude Opus 5 diesen Vergleich, und zwar deutlich: acht von zehn Bewertungen, die beiden größten Abstände, doppelt so viel Kontext zu gleichbleibendem Preis und ein Token-Budget deutlich unter zwei Dritteln der Größe für eine höhere Punktzahl. Der Fünf-Punkte-Gesamtwert unterschätzt, wie deutlich er führt. Der Fall für Grok 4.7 ist enger, als sein Preisblatt vermuten lässt, aber nicht leer – es ist bei den Prompt-Größen, die die meisten Anwendungen tatsächlich nutzen, wirklich günstiger, es ist das bessere Automatisierungsmodell, und es ist einen Tag alt, während eine Anbieter-Benchmark-Suite noch unabhängig reproduziert wird. Kaufen Sie es für kostenempfindliche Automatisierung, behalten Sie seine Geschwindigkeitswerte im Auge, wenn Artificial Analysis sie veröffentlicht, und betrachten Sie die Preisstufe für langen Kontext als das, was entscheidet, ob das günstige Modell günstig bleibt.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
