
Grok 4.7 vs. Qwen 3.8 Max: Identischer Preis, ein Punkt Unterschied, gegensätzliche Formen
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Zwei geschlossene Flaggschiffmodelle, beide zu 2 $ pro Million Eingabe-Token und 6 $ pro Million Ausgabe-Token, beide mit nur einem Punkt Unterschied zueinander im selben unabhängigen Benchmark, neunzehn Tage auseinander veröffentlicht. Grok 4.7 erschien am 21. September 2026 von SpaceXAI; Qwen 3.8 Max wurde vom Anbieter am 3. August 2026 veröffentlicht und am 2. September 2026 aktualisiert. Im aktuellen Artificial Analysis Intelligence Index, Version v4.3.2, erzielt Grok 4.7 46 Punkte und Qwen 3.8 Max 45 Punkte. Beim Preis und bei der gemessenen Leistungsfähigkeit sind diese beiden Modelle derselbe Kauf. In allem anderen – Kontext, Modalität, Serving-Geschwindigkeit, Offenheit und dem, was jeder Anbieter zu optimieren beschloss – könnten sie nicht unterschiedlicher sein, und genau das macht diesen Vergleich lohnenswert, statt ihn zu überspringen.
Zuerst die Zeitleiste, denn Qwen 3.8 Max hat zwei Daten.
Das sorgt in vielen Berichten für Verwirrung, daher lohnt es sich, es gleich zu Beginn klarzustellen. Qwen 3.8 Max wurde am 3. August 2026 als Alibabas größtes und leistungsfähigstes Modell eingeführt, aufgebaut auf der Vision-Language-Architektur von Qwen 3.5 mit einem spärlichen Mixture-of-Experts-Design, das mit insgesamt 2,4 Billionen Parametern und 95 Milliarden pro Token aktiven Parametern angegeben wird. Am 2. September 2026 veröffentlichte Alibaba einen aktualisierten Build – die Revision 0902, die die aktuellen Modell-IDs trägt und die Version ist, auf die Artificial Analysis seine Seite datiert. Wenn Sie sowohl ein August- als auch ein September-Datum für Qwen 3.8 Max gesehen haben, dann deshalb: Das eine ist der Launch, das andere die Revision, die die meisten heute tatsächlich nutzen.
Grok 4.7 hat eine sauberere Historie – und eine unordentlichere hinter sich. SpaceXAI veröffentlichte es am 21. September 2026 nach einem Start, der sich wiederholt verzögerte – Musk hatte auf Zeitfenster Ende August, Anfang September und Mitte September hingewiesen, bevor das Modell tatsächlich herauskam. Die Veröffentlichung selbst fiel schmal aus: ein größeres Basismodell als Grok 4.6, ein längerer, auf mehrstündige Aufgaben ausgerichteter Reinforcement-Learning-Lauf und keine Änderung an der $2/$6-Preiskarte, die Grok 4.6 seit dem 12. August beibehalten hatte.
Worauf jeder Anbieter optimiert hat
Liest man die beiden Launch-Ankündigungen als Paar, stehen sich die Design-Wetten nahezu perfekt entgegengesetzt gegenüber.
SpaceXAI ist auf agentische Ausführung optimiert. Die vom Anbieter gemeldeten Zahlen von Grok 4.7 konzentrieren sich auf Terminal- und Repository-Arbeit: Terminal-Bench 4.0 bei 38,0 % gegenüber 20,3 % bei Grok 4.6, CursorBench 4.0 bei 46,3 %, DeepSWE v1.1 bei 71,0 % bei hohem Reasoning-Aufwand, EEBench bei 64,0 %. In der eigenen Beschreibung des Releases durch das Unternehmen werden Selbstverifizierung und der Umgang mit langem Kontext innerhalb der Grok-Bot-Umgebung als Ziele genannt. Grok 4.7 bedient ein 500.000-Token-Fenster, nimmt Text und Bilder entgegen, gibt Text zurück und bietet Reasoning-Aufwand von low bis xhigh. Es ist ein Modell, das dafür gebaut wurde, Aufgaben zu erledigen.
Alibaba hat auf Reichweite optimiert. Qwen 3.8 Max bietet ein Kontextfenster von rund 984.000 Tokens – effektiv eine Million – und seine veröffentlichten Stärken liegen in der Breite statt in der Tiefe in einem einzigen Bereich: 86,6 bei Terminal Bench 2.1, 67,7 bei SWE-bench Pro, 93,0 bei PaperBench, 92,6 bei GPQA Diamond, 82,3 bei MMMU-Pro und 86,1 bei OSWorld-Verified. Es akzeptiert Text-, Bild- und Videoeingaben und gibt Text aus, unterstützt Stufen für den Reasoning-Aufwand, wobei xhigh der Standard ist, und sein schwächerer veröffentlichter Wert ist 43,6 bei Humanity's Last Exam. Es ist ein Modell, das dafür gebaut wurde, alles zu bewältigen, was man ihm gibt.
Jede Zahl in diesem Absatz stammt von den Anbietern selbst. Keine der beiden Datensätze wurde unabhängig reproduziert, und die beiden Datensätze sind ohnehin nicht direkt vergleichbar – Terminal-Bench 2.1 und Terminal-Bench 4.0 sind unterschiedliche Benchmarks, daher dürfen Qwens 86.6 und Groks 38.0 niemals nebeneinander gestellt werden.
• Unabhängiger zusammengesetzter Wert — Grok 4.7 mit 46 im AA Intelligence Index v4.3.2 vs. Qwen 3.8 Max mit 45 in derselben Version. Ein statistischer Gleichstand.
• Preis pro Million Token — 2,00 $ Eingang / 6,00 $ Ausgang bei beiden. Qwens Cache-Rabatt wird mit 88 % angegeben, was einen gemischten Preis von 1,18 $ pro Million ergibt; die Cache-Bedingungen von Grok 4.7 sind nicht auf derselben Grundlage veröffentlicht.
• Kontextfenster — Grok 4.7: 500.000 Token vs. Qwen 3.8 Max: ungefähr 984.000. Qwen liegt mit fast dem Doppelten vorn, und dies ist der größte einzelne Spezifikationsunterschied zwischen ihnen.
• Eingabemodalitäten — Grok 4.7 Text und Bild vs. Qwen 3.8 Max Text, Bild und Video.
• Gewichte — beide proprietär. Keines der beiden Modelle kann heruntergeladen werden, was das übliche Open-Weights-Argument aus diesem Vergleich vollständig entfernt.
• Parameter — Grok 4.7 auf keinem SpaceXAI-Datenblatt offengelegt (die Zahl von ~2,1T ist eine Behauptung von Musk) vs. Qwen 3.8 Max, gemeldet mit insgesamt 2,4T und 95B aktiven Parametern, was Alibaba ebenfalls nicht auf einem Spezifikationsblatt bestätigt hat.
• Serving-Geschwindigkeit — Qwen 3.8 Max mit 38,8 Ausgabe-Tokens pro Sekunde und 3,08 Sekunden bis zum ersten Token, laut Artificial Analysis; Grok 4.7 wird von SpaceXAI als etwa doppelt so schnell wie vergleichbare Modelle positioniert, laut Herstellerangabe, wobei noch keine unabhängige Durchsatzzahl veröffentlicht wurde.

Der Kontextunterschied ist die eigentliche Entscheidung
Wenn Preis und Leistungsfähigkeit identisch sind, entscheidet das, was sich sonst noch unterscheidet – und hier ist das der Kontext. Das Fenster von 500.000 auf rund 984.000 Token zu verdoppeln ist kein bloßes Datenblatt-Detail – es ist der Unterschied zwischen dem Aufteilen eines Repositorys und dem Halten des gesamten Repositorys.
Das längere Kontextfenster von Qwen 3.8 Max bringt einen dokumentierten Vorbehalt mit sich, der für Käufer wichtig ist: Die Open-Weights-Version, die Alibaba für die Woche vom 10. August 2026 angekündigt hatte, war textbasiert und enthielt nicht den vollständigen Kontext von einer Million Token. Das betrifft nicht den gehosteten Endpoint, um den es in diesem Vergleich geht, aber es ist gut zu wissen, wenn Sie die offene Veröffentlichung in Ihre Planungen einbezogen hatten.
Auf der Grok-Seite gibt es eine zweite Überlegung. Die Grok-Linie hat historisch eine Preisschwelle bei 200.000 Eingabe-Tokens angewandt, bei der eine Anfrage, die die Schwelle überschreitet, die gesamte Anfrage zum doppelten Satz neu bepreist – 4 $ für die Eingabe und 12 $ für die Ausgabe. Bei einem 500.000-Token-Fenster liegt diese Schwelle weit innerhalb des Arbeitsbereichs des Modells. Bevor Sie Long-Context-Arbeit an Grok 4.7 weiterleiten, bestätigen Sie die aktuelle Preisliste für das eingesetzte Modell, denn das Zusammenspiel zwischen einem großen Fenster und einer Preisschwelle mit Neuberechnung ist genau der Punkt, an dem Long-Context-Abrechnungen schiefgehen.
Was ein Monat Arbeit bei jedem kostet
Da die beworbenen Tarife identisch sind, muss der Kostenvergleich aus dem Token-Verhalten und nicht aus der Preisliste abgeleitet werden, und dort weichen die beiden Modelle auf messbare Weise voneinander ab.
Artificial Analysis hat gemessen, dass Grok 4.7 während der Ausführung seines Intelligence Index 240 Millionen Ausgabe-Tokens generierte, gegenüber einem Median von 92 Millionen über die Modelle auf dem Board – es ist ein ausführlicher Reasoner. Qwen 3.8 Max generierte im selben Index 190 Millionen Ausgabe-Tokens, bei Gesamtbewertungskosten von 4.934,79 $ und gemessenen 38,8 Tokens pro Sekunde. Beide liegen deutlich über der medianen Ausführlichkeit, und Grok 4.7 ist der ausführlichere der beiden.
Bei identischen 6 $ pro Million Output-Tokens kostet das Modell, das pro Aufgabe mehr Tokens ausgibt, auch mehr pro Aufgabe. Die veröffentlichten Ausführlichkeitswerte legen nahe, dass Grok 4.7 bei gleichwertiger Indexarbeit mehr Output-Tokens verbraucht, was bedeutet, dass der Preisgleichstand in Wirklichkeit ein kleiner Vorteil für Qwen 3.8 Max bei den Kosten pro Aufgabe ist – ausgeglichen durch den behaupteten Geschwindigkeitsvorteil von Grok 4.7, der die reale Laufzeit verkürzt und damit die menschlichen Kosten des Wartens auf einen Agentenlauf. Keiner dieser Ausgleichseffekte ist auf einem Tarifblatt sichtbar, und beide sollten anhand Ihres eigenen Traffics gemessen statt angenommen werden.
Die eine Asymmetrie, die unstrittig ist, ist das Caching. Qwen 3.8 Max gibt einen Cache-Rabatt von 88 % und einen Mischpreis von 1,18 $ bei einem 7:2:1-Mix aus Cache-Hits/Input/Output an. Bei Workloads mit einem großen, stabilen Präfix – einem System-Prompt, einem Codebase-Header, einem Dokumentensatz – liegt in diesem Rabatt die eigentliche Ersparnis, und es lohnt sich zu prüfen, wie die Cache-Bedingungen von Grok 4.7 im Vergleich abschneiden, bevor Sie sich auf ein Volumen festlegen.

Entscheiden, wenn die Zahlen sich weigern, für dich zu entscheiden.
Eine 46 und eine 45 im selben Index, zum selben Preis – näher an ein echtes Unentschieden wird dieser Blog wohl kaum herankommen. Das heißt, die Entscheidung sollte anhand der Achsen getroffen werden, in denen sich die beiden Modelle tatsächlich unterscheiden, und davon gibt es vier.
Wählen Sie Grok 4.7, wenn Ihre Arbeit agentisches Coding und Terminal-Ausführung umfasst, wenn die Wall-Clock-Geschwindigkeit bei langen Läufen wichtiger ist als Kontextspielraum und wenn Sie einen Reasoning-Regler pro Anfrage möchten, um einfachen Traffic günstig zu halten. Wählen Sie Qwen 3.8 Max, wenn Sie regelmäßig Eingaben mit mehr als einer halben Million Tokens verarbeiten, wenn Videoeingabe auf Ihrer Roadmap steht, wenn Sie den Cache-Rabatt von 88 % für Prefix-lastige Workloads möchten oder wenn Sie ein Modell möchten, dessen Anbieter eine breite Evaluationsmatrix veröffentlicht statt einer, die sich auf einen einzigen Bereich konzentriert.
Wenn die ehrliche Antwort „ein bisschen von beidem" lautet, dann ist das die normale Antwort, und genau für diesen Fall ist dieses Paar gemacht. Qwen 3.8 Max gibt es auf OrcaRouter zum Listenpreis von Alibaba, und OrcaRouter gibt die Listenpreise der Anbieter mit 0 % Aufschlag weiter, sodass die oben genannten 2 $/6 $ tatsächlich das sind, was Sie zahlen, und eine Tarifänderung des Anbieters hier noch am selben Tag live ist statt erst bei der Verlängerung. Ein einziger API-Schlüssel deckt Qwen 3.8 Max plus über 200 weitere Modelle ab, was bedeutet, dass die Kontextentscheidung zu einer Routing-Regel pro Anfrage wird statt zu einer Plattform-Festlegung: Schicken Sie die übergroßen Eingaben an das 984k-Fenster und belassen Sie alles andere auf dem Endpunkt, der für diese Aufgabe am schnellsten und günstigsten ist, mit automatischem Failover, falls ein Anbieter schwächelt. Wo eine Aufgabe wirklich beide Formen braucht – einen Long-Context-Lesevorgang gefolgt von einem agentischen Ausführungsdurchlauf –, setzt die Routing-DSL Modelle zu einem einzigen Aufruf zusammen, statt Sie zu zwingen, sich für eine Seite zu entscheiden.
Eine Klarstellung, die erwähnt werden sollte, da keines der beiden Modelle offen ist: Nichts in diesem Vergleich beinhaltet herunterladbare Gewichte. Beide sind gehostete Endpunkte, und Selbsthosting ist für keines von beiden eine Option.
Die eine Zahl, die Sie im Auge behalten sollten
Sechsundvierzig gegen fünfundvierzig ist kein Grund, ein Modell zu wählen, und sollte es auch nicht sein. Was diesen Vergleich entscheidet, ist das Kontextfenster – 500.000 Tokens gegenüber ungefähr 984.000 – und die Ausrichtung, für die sich jeder Anbieter entschieden hat: Grok 4.7 ist darauf optimiert, schwierige agentische Aufgaben schnell zu erledigen, Qwen 3.8 Max darauf, alles zu bewältigen, was man ihm übergibt. Gleicher Preis, gleiche gemessene Leistungsfähigkeit, unterschiedliche Aufgaben. Das ist eine Routing-Entscheidung, und es ist die Art von Entscheidung, die man an einem Nachmittag testen können sollte, statt ein Quartal für ihre Beschaffung zu brauchen.

In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
