
Gemini 3.7 Flash vs. Grok 4.6: Googles Preiskrieg vs. SpaceXAIs selbstprüfender Agent
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0259Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0258Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0166Intelligenz82Coding
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2658Intelligenz72Coding
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
Drei Wochen nachdem Gemini 3.6 Flash weitgehend gefloppt war, halbierte Google den Preis und veröffentlichte Gemini 3.7 Flash – ein Schritt, den die meisten Medien als direkten Angriff auf Grok 4.6 lasen, das agentenoptimierte Flaggschiff, das SpaceXAI am Tag zuvor zu 2 und 6 Dollar herausgebracht hatte. Das Timing ist der springende Punkt: Zwei Modelle nahe der Spitzenklasse, einen Tag auseinander, beide auf denselben Käufer ausgerichtet – ein Team, das agentisches Codieren will, ohne Spitzenpreise zu zahlen – und mit gegensätzlichen Preisphilosophien. Google kauft die Reaktion mit einer Fünf-Monats-Aktion. SpaceXAI verkauft Vertrauen pro Aufgabe zu einem festen Listenpreis.
Grok 4.6, veröffentlicht am 12. August 2026, ist SpaceXAIs Verfeinerung seines auf 1,5 Billionen Parametern basierenden Grok-4.5-Grundmodells, entwickelt für langlaufende Agenten, die die Erledigung ihrer eigenen Teilaufgaben verifizieren, mit einem 500K-Kontextfenster, Text- und Bildeingabe und einem Preis von $2/$6, der sich bei über 200K Eingabe-Tokens verdoppelt. Gemini 3.7 Flash, veröffentlicht am 13. August 2026, ist Googles algorithmische Verfeinerung von Gemini 3.6 Flash — 1M Kontext, multimodale Eingabe einschließlich Video und Audio, und ein Werbepreis von $0.75/$3.75, der sich am 1. Januar 2027 auf $1.50/$7.50 verdoppelt. Im unabhängigen Artificial Analysis Intelligence Index liegt Grok 4.6 bei 61, eine klare Stufe über den frühen Messwerten von etwa 56 für Gemini 3.7 Flash.
Der Preiskrieg, eine Zeile pro Dimension
• Preis pro 1M Input — Gemini 3.7 Flash $0.75 (Einführung) vs. Grok 4.6 $2.00. Google unterbietet um mehr als 60 %.
• Preis pro 1M Output — Gemini 3.7 Flash $3.75 (Einführungspreis) vs. Grok 4.6 $6.00.
• Nach dem 1. Januar 2027 — verdoppelt sich Gemini auf 1,50 $/7,50 $, während Grok unverändert bei 2 $/6 $ bleibt.
• Kontextfenster — Gemini 3.7 Flash 1M vs Grok 4.6 500K.
• Abrechnung für lange Eingaben — Gemini berechnet pauschal über sein Fenster; Grok verdoppelt auf 4$/12$ bei 200K oder mehr Eingabe.
• Denk-Tokens — Gemini rechnet sie als Ausgabe ab; Groks Kosten sind in einem unabhängig gemessenen Betrag von ~0,84 $ pro Aufgabe enthalten.
Kurz gesagt: Gemini 3.7 Flash ist heute auf jeder Zeile des Preisschilds günstiger, und der Großteil dieses Vorteils verpufft am 1. Januar. Grok 4.6 kostet im August genauso viel wie im März.

Wohin das Geld von Gemini 3.7 Flash ging
Googles eigene Zahlen weisen für Gemini 3.7 Flash gegenüber 3.6 Flash große Sprünge aus: 65,3 % bei DeepSWE v1.1 (von 49,0 %), 43,6 % bei FrontierCode 1.1 Main (von 34,4 %), 85,8 % bei Terminal-bench 2.1 (von 78,0 %) und eine WebDev-Arena-Elo von 1588 (von 1538). Das sind vom Anbieter gemeldete, nicht reproduzierte Zahlen – die Art von Kennzahl, die eine Entwicklung misst und kein Urteil zwischen Anbietern fällt. Aber genau auf die Entwicklung kommt es an: Die Korrekturen kamen drei Wochen nach einem Launch, den Kritiker weitgehend abgeschrieben hatten. Das zeigt, dass Google die Flash-Klasse als Schlachtfeld betrachtet – nicht das Flaggschiff.
Die andere Sache, die Googles Werbeaktion bewirkt, ist die Komprimierung des Kaufzeitfensters. Bei $0.75/$3.75 ist das Modell günstig genug, um es in großem Umfang zu testen; bei $1.50/$7.50 ist es immer noch wettbewerbsfähig, aber keine Preiskampfwaffe mehr. Jedes Produktionsteam, das es im Einführungsfenster übernimmt, sollte seine Wirtschaftlichkeit im Dezember neu bewerten, anstatt anzunehmen, dass die Zahl mit ihm Schritt hält.
Wohin das Geld von Grok 4.6 floss
Das Verkaufsargument von Grok 4.6 ist ein anderes: nicht günstigere Tokens, sondern weniger verschwendete. Es wurde darauf trainiert, sich selbst zu verifizieren – zu prüfen, ob eine Teilaufgabe tatsächlich erledigt ist, bevor es weitermacht – und unabhängige Messungen stützen diesen Effekt: Artificial Analysis beziffert die Kosten auf etwa 0,84 $ pro Aufgabe, mit einem GDPVal-AA v2 von 1.753 und einem Intelligence Index von 61. Das sind Drittanbieter-Zahlen, und sie sind die stärkste Kennzahl in diesem Vergleich, denn sie erfassen das, was der Preis pro Token übersieht: Ein Modell, das weniger Schritte braucht, um eine Aufgabe abzuschließen, ist pro abgeschlossener Aufgabe günstiger, selbst bei einem höheren Token-Preis.
Der Trade-off liegt dort, wo das günstigere Modell Luft hat. Der 500K-Kontext von Grok 4.6 ist halb so groß wie der 1M-Kontext von Gemini 3.7 Flash, und der $2/$6-Preis verdoppelt sich bei über 200K Input – also sind Langkontext- und High-Input-Workloads genau der Bereich, in dem der Listenpreis von Grok 4.6 nicht mehr mit dem Promotionspreis von Gemini konkurrieren kann.
Die Ökonomie pro Aufgabe
Beim Einführungspreis liegt der gemischte Satz von Gemini 3.7 Flash bei einer 80/20-Aufteilung von Eingabe/Ausgabe bei ungefähr 1,35 $ pro Million Token; Grok 4.6 steht bei derselben Aufteilung mit 2,80 $ pro Million zu Buche, bevor die Strafe für lange Eingaben anfällt. Auf dem Papier sieht das Google-Modell wie der Volumensieger mit Abstand aus. Die Komplikation ist, dass Geminis Denk-Token als Ausgabe abgerechnet werden, seine Benchmark-Behauptungen eine Woche alt sind und seine Effizienz pro Aufgabe noch nicht unabhängig gemessen wurde – während die von Grok 4.6 gemessen wurde. Billige Token plus verschwendete Runden können teurer sein als teure Token, die ans Ziel kommen, und dies ist ein Aufeinandertreffen, bei dem eine Seite Daten zu dieser Frage hat und die andere nicht.
Auf das neue Modell setzen, ohne auf die Pipeline zu setzen.
Grok 4.6 ist auf OrcaRouter zu SpaceXAIs Listenpreis von 2 $/6 $ mit 0 % Aufschlag erhältlich, einschließlich des 2x-Schritts über 200K, den die Modellseite live von der Routing-Schicht abruft. Gemini 3.7 Flash ist einen Tag alt und in Googles eigener API; dessen Vorgänger Gemini 3.6 Flash ist auf OrcaRouter zum Listenpreis von Google erhältlich.


Wenn die Frage, die dieser Vergleich wirklich stellt, lautet: „Soll ich meine Agent-Pipeline auf das neue günstige Modell setzen?“, dann ist die Routing-Ebene die Absicherung: eine Failover-Regel, die den Agenten heute auf Grok 4.6 laufen lässt und an dem Tag, an dem es erscheint, auf Gemini 3.7 Flash umschaltet – oder ein Fusion-Panel, bei dem beide antworten und ein Richter die Antworten abgleicht – die Art von Setup, für die die Routing-DSL existiert, und eines, das nicht verlangt, sich zu entscheiden, bevor die Beweislage vorliegt.
Die ehrliche Lesart
Wenn Sie heute den günstigsten Token wollen und der dreiwöchigen Bearbeitungszeit vertrauen, ist Gemini 3.7 Flash die aggressive Wette – der Preiskampf ist real, die Benchmark-Verbesserungen sind gemeldet, und das Einführungsfenster ist ein echtes Schnäppchen. Wenn Sie ein Modell wollen, dessen Agenteneffizienz unabhängig gemessen wird, dessen Preis sich im Januar nicht ändert und dessen Selbstverifizierungsschleife für langlaufende Arbeiten ausgelegt ist, ist Grok 4.6 die konservative Wahl, und die AA-Daten geben ihm einen Vorteil bei den Kosten pro abgeschlossener Aufgabe. Die eine Seite ist ein Sonderangebot mit Countdown, die andere ein Preis mit einer Erfolgsbilanz. Beide sind vertretbar – genau das macht dies zu einem echten Vergleich und nicht zu einer Formsache.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
