Ein Titelbild für den Vergleich von Gemini 3.7 Flash gegen Grok 4.6, das ein Preisschild mit 50 % Rabatt und einem Blitz auf der Seite von Gemini 3.7 Flash zeigt, das einem Schild mit einem Häkchen auf der Seite von Grok 4.6 gegenübersteht.
Guides & Insights

Gemini 3.7 Flash vs. Grok 4.6: Googles Preiskrieg vs. SpaceXAIs selbstprüfender Agent

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Drei Wochen nachdem Gemini 3.6 Flash weitgehend gefloppt war, halbierte Go​ogle den Preis und veröffentlichte Gemini 3.7 Flash – ein Schritt, den die meisten Medien als direkten Angriff auf Grok 4.6 lasen, das agentenoptimierte Flaggschiff, das SpaceXAI am Tag zuvor zu 2 und 6 Dollar herausgebracht hatte. Das Timing ist der springende Punkt: Zwei Modelle nahe der Spitzenklasse, einen Tag auseinander, beide auf denselben Käufer ausgerichtet – ein Team, das agentisches Codieren will, ohne Spitzenpreise zu zahlen – und mit gegensätzlichen Preisphilosophien. Go​ogle kauft die Reaktion mit einer Fünf-Monats-Aktion. SpaceXAI verkauft Vertrauen pro Aufgabe zu einem festen Listenpreis.

Grok 4.6, veröffentlicht am 12. August 2026, ist SpaceXAIs Verfeinerung seines auf 1,5 Billionen Parametern basierenden Grok-4.5-Grundmodells, entwickelt für langlaufende Agenten, die die Erledigung ihrer eigenen Teilaufgaben verifizieren, mit einem 500K-Kontextfenster, Text- und Bildeingabe und einem Preis von $2/$6, der sich bei über 200K Eingabe-Tokens verdoppelt. Gemini 3.7 Flash, veröffentlicht am 13. August 2026, ist Go​ogles algorithmische Verfeinerung von Gemini 3.6 Flash — 1M Kontext, multimodale Eingabe einschließlich Video und Audio, und ein Werbepreis von $0.75/$3.75, der sich am 1. Januar 2027 auf $1.50/$7.50 verdoppelt. Im unabhängigen Artificial Analysis Intelligence Index liegt Grok 4.6 bei 61, eine klare Stufe über den frühen Messwerten von etwa 56 für Gemini 3.7 Flash.

Der Preiskrieg, eine Zeile pro Dimension

Preis pro 1M Input — Gemini 3.7 Flash $0.75 (Einführung) vs. Grok 4.6 $2.00. Go​ogle unterbietet um mehr als 60 %.

Preis pro 1M Output — Gemini 3.7 Flash $3.75 (Einführungspreis) vs. Grok 4.6 $6.00.

Nach dem 1. Januar 2027 — verdoppelt sich Gemini auf 1,50 $/7,50 $, während Grok unverändert bei 2 $/6 $ bleibt.

Kontextfenster — Gemini 3.7 Flash 1M vs Grok 4.6 500K.

Abrechnung für lange Eingaben — Gemini berechnet pauschal über sein Fenster; Grok verdoppelt auf 4$/12$ bei 200K oder mehr Eingabe.

Denk-Tokens — Gemini rechnet sie als Ausgabe ab; Groks Kosten sind in einem unabhängig gemessenen Betrag von ~0,84 $ pro Aufgabe enthalten.

Kurz gesagt: Gemini 3.7 Flash ist heute auf jeder Zeile des Preisschilds günstiger, und der Großteil dieses Vorteils verpufft am 1. Januar. Grok 4.6 kostet im August genauso viel wie im März.

A comparison scoreboard for Gemini 3.7 Flash and Grok 4.6: Gemini at AA Index ~56, $0.75/$3.75 intro pricing, 1M context, Google-reported GDPVal-AA v2 of 1,525 and per-task cost not yet measured, versus Grok 4.6 at AA Index 61, $2/$6, 500K context, GDPVal-AA v2 of 1,753 and about $0.84 per task per Artificial Analysis, both proprietary.

Wohin das Geld von Gemini 3.7 Flash ging

Go​ogles eigene Zahlen weisen für Gemini 3.7 Flash gegenüber 3.6 Flash große Sprünge aus: 65,3 % bei DeepSWE v1.1 (von 49,0 %), 43,6 % bei FrontierCode 1.1 Main (von 34,4 %), 85,8 % bei Terminal-bench 2.1 (von 78,0 %) und eine WebDev-Arena-Elo von 1588 (von 1538). Das sind vom Anbieter gemeldete, nicht reproduzierte Zahlen – die Art von Kennzahl, die eine Entwicklung misst und kein Urteil zwischen Anbietern fällt. Aber genau auf die Entwicklung kommt es an: Die Korrekturen kamen drei Wochen nach einem Launch, den Kritiker weitgehend abgeschrieben hatten. Das zeigt, dass Go​ogle die Flash-Klasse als Schlachtfeld betrachtet – nicht das Flaggschiff.

Die andere Sache, die Go​ogles Werbeaktion bewirkt, ist die Komprimierung des Kaufzeitfensters. Bei $0.75/$3.75 ist das Modell günstig genug, um es in großem Umfang zu testen; bei $1.50/$7.50 ist es immer noch wettbewerbsfähig, aber keine Preiskampfwaffe mehr. Jedes Produktionsteam, das es im Einführungsfenster übernimmt, sollte seine Wirtschaftlichkeit im Dezember neu bewerten, anstatt anzunehmen, dass die Zahl mit ihm Schritt hält.

Wohin das Geld von Grok 4.6 floss

Das Verkaufsargument von Grok 4.6 ist ein anderes: nicht günstigere Tokens, sondern weniger verschwendete. Es wurde darauf trainiert, sich selbst zu verifizieren – zu prüfen, ob eine Teilaufgabe tatsächlich erledigt ist, bevor es weitermacht – und unabhängige Messungen stützen diesen Effekt: Artificial Analysis beziffert die Kosten auf etwa 0,84 $ pro Aufgabe, mit einem GDPVal-AA v2 von 1.753 und einem Intelligence Index von 61. Das sind Drittanbieter-Zahlen, und sie sind die stärkste Kennzahl in diesem Vergleich, denn sie erfassen das, was der Preis pro Token übersieht: Ein Modell, das weniger Schritte braucht, um eine Aufgabe abzuschließen, ist pro abgeschlossener Aufgabe günstiger, selbst bei einem höheren Token-Preis.

Der Trade-off liegt dort, wo das günstigere Modell Luft hat. Der 500K-Kontext von Grok 4.6 ist halb so groß wie der 1M-Kontext von Gemini 3.7 Flash, und der $2/$6-Preis verdoppelt sich bei über 200K Input – also sind Langkontext- und High-Input-Workloads genau der Bereich, in dem der Listenpreis von Grok 4.6 nicht mehr mit dem Promotionspreis von Gemini konkurrieren kann.

Die Ökonomie pro Aufgabe

Beim Einführungspreis liegt der gemischte Satz von Gemini 3.7 Flash bei einer 80/20-Aufteilung von Eingabe/Ausgabe bei ungefähr 1,35 $ pro Million Token; Grok 4.6 steht bei derselben Aufteilung mit 2,80 $ pro Million zu Buche, bevor die Strafe für lange Eingaben anfällt. Auf dem Papier sieht das Google-Modell wie der Volumensieger mit Abstand aus. Die Komplikation ist, dass Geminis Denk-Token als Ausgabe abgerechnet werden, seine Benchmark-Behauptungen eine Woche alt sind und seine Effizienz pro Aufgabe noch nicht unabhängig gemessen wurde – während die von Grok 4.6 gemessen wurde. Billige Token plus verschwendete Runden können teurer sein als teure Token, die ans Ziel kommen, und dies ist ein Aufeinandertreffen, bei dem eine Seite Daten zu dieser Frage hat und die andere nicht.

Auf das neue Modell setzen, ohne auf die Pipeline zu setzen.

Grok 4.6 ist auf OrcaRouter zu SpaceXAIs Listenpreis von 2 $/6 $ mit 0 % Aufschlag erhältlich, einschließlich des 2x-Schritts über 200K, den die Modellseite live von der Routing-Schicht abruft. Gemini 3.7 Flash ist einen Tag alt und in Go​ogles eigener API; dessen Vorgänger Gemini 3.6 Flash ist auf OrcaRouter zum Listenpreis von Go​ogle erhältlich.

The OrcaRouter model page for grok/grok-4.6, showing the New and Featured badges, the $2.00 per million input and $6.00 per million output pricing, a 500K-token context window, and the released August 12, 2026 label.The OrcaRouter model page for google/gemini-3.6-flash, showing the $1.50 per million input and $7.50 per million output pricing and the 1M-token context window.

Wenn die Frage, die dieser Vergleich wirklich stellt, lautet: „Soll ich meine Agent-Pipeline auf das neue günstige Modell setzen?“, dann ist die Routing-Ebene die Absicherung: eine Failover-Regel, die den Agenten heute auf Grok 4.6 laufen lässt und an dem Tag, an dem es erscheint, auf Gemini 3.7 Flash umschaltet – oder ein Fusion-Panel, bei dem beide antworten und ein Richter die Antworten abgleicht – die Art von Setup, für die die Routing-DSL existiert, und eines, das nicht verlangt, sich zu entscheiden, bevor die Beweislage vorliegt.

Die ehrliche Lesart

Wenn Sie heute den günstigsten Token wollen und der dreiwöchigen Bearbeitungszeit vertrauen, ist Gemini 3.7 Flash die aggressive Wette – der Preiskampf ist real, die Benchmark-Verbesserungen sind gemeldet, und das Einführungsfenster ist ein echtes Schnäppchen. Wenn Sie ein Modell wollen, dessen Agenteneffizienz unabhängig gemessen wird, dessen Preis sich im Januar nicht ändert und dessen Selbstverifizierungsschleife für langlaufende Arbeiten ausgelegt ist, ist Grok 4.6 die konservative Wahl, und die AA-Daten geben ihm einen Vorteil bei den Kosten pro abgeschlossener Aufgabe. Die eine Seite ist ein Sonderangebot mit Countdown, die andere ein Preis mit einer Erfolgsbilanz. Beide sind vertretbar – genau das macht dies zu einem echten Vergleich und nicht zu einer Formsache.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube