Hero-Titelkarte für den Artikel 'Gemini 3.7 Flash vs Gemini 3.1 Pro' mit dem Untertitel 'Hat Googles Flash-Stufe ihr eigenes Flaggschiff überflüssig gemacht?', Pillen-Badges mit der Aufschrift 'AA Index 56 vs 48', '/bin/bash.75 / .75 vs / 2', 'Stabil vs. Vorschau' und dem OrcaRouter-Logo unten rechts.
Guides & Insights

Gemini 3.7 Flash vs. Gemini 3.1 Pro: Hat Googles Flash-Stufe sein eigenes Flaggschiff obsolet gemacht?

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

In Googles Modellpalette für 2026 steckt eine unbequeme Frage, und sie richtet sich an jedes Team, das derzeit für Gemini 3.1 Pro zahlt: Warum schlägt das günstige Flash-Modell das Flaggschiff im unabhängigen Index? Gemini 3.7 Flash, veröffentlicht am 13. August 2026 zu 0,75 $ pro Million Input-Tokens und 3,75 $ pro Million Output-Tokens, erreicht beim hohen Reasoning 56 Punkte auf dem Artificial Analysis Intelligence Index. Gemini 3.1 Pro, die Vorschau, die Google am 19. Februar 2026 ausgeliefert hat, kostet 2,00 $ / 12,00 $ – über 200K Kontext 4,00 $ / 18,00 $ – und misst auf demselben Index heute in den oberen 40ern. Das Flaggschiff, das beim Start den Index anführte, ist von seiner eigenen Arbeitstier-Kategorie überholt worden, und dieser Artikel handelt davon, was das für die beiden Modelle bedeutet und für die Teams, die zwischen ihnen wählen müssen.

Die Prämisse: Googles Flaggschiff-Stufe steckt in der Vorschau fest.

Der Kontext ist wichtiger als die Zahlen. Gemini 3.1 Pro befindet sich seit Februar 2026 in der Vorschau – sieben Monate, Stand heute – und sein Nachfolger, Gemini 3.5 Pro, wurde im Mai auf der Google I/O mit den Worten „kommt nächsten Monat“ angekündigt, verpasste dann aber Juni, Juli und August. Anfang September hat die Flaggschiff-Stufe weder einen veröffentlichten Nachfolger noch ein Datum, und es gibt Berichte über eine mögliche Einstellung. In der Zwischenzeit brachte die Flash-Stufe in demselben Zeitraum drei Generationen heraus: Gemini 3.6 Flash am 21. Juli, Gemini 3.7 Flash am 13. August und die agentische Videoverständnisfähigkeit für beide am 1. September. Der Vergleich ist nicht wirklich „Pro gegen Flash“. Es geht um „die Stufe, die Google ausliefert“ gegen „die Stufe, die Google nicht mehr ausliefert“.

Der Spec-Kontrast

• Preis — Gemini 3.7 Flash 0,75 $ / 3,75 $ pro 1 Mio. Tokens (Aktionspreis bis 31. Dez. 2026, danach 1,50 $ / 7,50 $) vs. Gemini 3.1 Pro 2,00 $ / 12,00 $ bei unter 200K Kontext, über 200K steigend auf 4,00 $ / 18,00 $. Drei- bis viermal günstiger zum Listenpreis, vor den Reasoning-Stufen-Kontrollen.

• Kontext / maximale Ausgabe — 1M / 64K vs 1M / 64K. Identische Obergrenzen.

• Eingaben — sowohl Text, Bild, Audio, Video als auch PDF. Die multimodale Oberfläche ist dieselbe; der Unterschied besteht darin, was das Modell mit Video macht (unten).

• Denksteuerung — Gemini 3.7 Flash niedrige / mittlere / hohe Denkstufe. Gemini 3.1 Pro niedrige / mittlere / hohe Denkstufe, wobei dynamisches Denken standardmäßig aktiviert ist.

• Unabhängiger Punktestand — Gemini 3.7 Flash erreicht 56 beim Artificial Analysis Intelligence Index, gegenüber Gemini 3.1 Pro in den oberen 40ern bei der aktuellen Indexversion (es erzielte 57 beim Start unter der vorherigen Version).

• Ausgabegeschwindigkeit — Gemini 3.7 Flash etwa 285 Tokens/s bei hohem Reasoning vs. Gemini 3.1 Pro etwa 112–125 Tokens/s — etwa zweieinhalbmal so schnell.

• Status — Gemini 3.7 Flash stabil, GA. Gemini 3.1 Pro in der Vorschau, mit deren kurzem Deprecation-Zeitfenster.

Der Index und das Benchmark-Durcheinander darunter.

Die Schlagzeile ist der Index: Artificial Analysis, der unabhängige anbieterübergreifende Evaluator, stuft Gemini 3.7 Flash nun auf 56 und Gemini 3.1 Pro auf die oberen 40er-Werte ein — das Arbeitstier vor dem Flaggschiff, eine Umkehrung der Positionen beim Start von 3.1 Pro, als dessen 57 den Index anführte. Das ist die wichtigste Tatsache in diesem Vergleich, und sie stammt aus unabhängiger Quelle und nicht vom Anbieter.

Unterhalb des Index ist das Benchmark-Register ein Durcheinander nicht vergleichbarer Testumgebungen, und wer es naiv liest, erhält die falsche Antwort. Gemini 3.1 Pros veröffentlichter Rekord — 80,6 % bei SWE-bench Verified, 77,1 % bei ARC-AGI-2, 94,3 % bei GPQA Diamond, 2887 Elo bei LiveCodeBench Pro — wurde von Google bei der Markteinführung im Februar gemeldet, verwendet andere Benchmark-Versionen als die Flash-Zahlen und wurde nie einheitlich reproduziert. Gemini 3.7 Flashs 43,6 % bei FrontierCode 1.1, 65,3 % bei DeepSWE v1.1 und 1588 Elo in der Webentwicklungs-Arena wurden ebenfalls vom Hersteller auf den neueren Testumgebungen gemeldet. Wo sich die beiden in einem unabhängigen Gesamtwert überschneiden — dem AA Index — gewinnt Flash. Wer Ihnen sagt: „Pro schlägt Flash bei SWE-bench“, vergleicht zwei Versionen von zwei verschiedenen Tests und sagt das nicht dazu.

A two-column scoreboard titled 'Gemini 3.7 Flash vs Gemini 3.1 Pro — the scoreboard'. Left column 'Gemini 3.7 Flash': 'Price /bin/bash.75 / .75 (promo)', 'AA Index 56', 'Speed ~285 tok/s (high)', 'Status stable, GA', 'Agentic video understanding: yes', 'Released Aug 13, 2026'. Right column 'Gemini 3.1 Pro': 'Price .00 / 2.00 ( / 8 above 200K)', 'AA Index upper-40s (57 at launch)', 'Speed ~112-125 tok/s', 'Status preview', 'Agentic video understanding: no', 'Released Feb 19, 2026'. Footer: 'AA figures per Artificial Analysis; component benchmarks vendor-reported, unreproduced.'Screenshot of the Artificial Analysis model page for Gemini 3.7 Flash at high reasoning, showing an Intelligence Index of 56 (ranked #20 of 187 models), an output speed of 285 tokens per second in the high-reasoning configuration, and a price of /bin/bash.75 per 1M input and .75 per 1M output tokens.

Die Lücke bei den Videofähigkeiten

Die Fähigkeit, die den Vergleich so einseitig wirken lässt, ist Video. Googles neuer agentischer Videoverständnis-Modus — angekündigt am 1. September 2026 — gilt für Gemini 3.7 Flash, Gemini 3.6 Flash und Gemini 3.5 Flash-Lite. Gemini 3.1 Pro steht nicht auf der Liste. Das Flash-Modell liest Videos so, wie der neue Modus das Lesen von Videos definiert: Das Modell entscheidet, was es ansieht, mit welcher Geschwindigkeit und über Frames, Audio oder Transkript, und lädt nur die relevanten Segmente — mit vom Anbieter gemeldeten Einsparungen von bis zu 66 % bei den Kosten und 88 % bei den Tokens. Gemini 3.1 Pro akzeptiert zwar technisch Videoeingaben, nutzt aber den älteren statischen Sampling-Pfad und erhält keines der neuen Werkzeuge. Für die Nutzer des Flaggschiffs gilt: Die neueste Videofunktion der Gemini-Familie erscheint zuerst auf dem günstigeren Modell, und für die Pro-Stufe wurde kein Termin für die Bereitstellung angekündigt.

Geschwindigkeit und das Vorschau-Risiko-Problem

Geschwindigkeit verstärkt die Preisdifferenz auf dieselbe Weise wie in jedem Gemini-3.7-Flash-Vergleich: etwa die dreifache Ausgaberate bei einem Modell, das bereits ein Drittel des Preises kostet. Aber der zweite Unterschied ist der, den Teams zu bepreisen vergessen: Status. Gemini 3.1 Pro ist eine Vorschauversion, und Vorschauversionen haben ein kurzes Ankündigungsfenster für die Einstellung, wenn der Nachfolger erscheint. Ein Produktions-Workload auf einem Vorschaumodell ist ein ständiges Risiko, dass sich die Modell-ID ändert, sich die Preisgestaltung ändert oder die Funktionalität mit wenig Vorwarnung verschoben wird. Gemini 3.7 Flash ist GA – stabil, dokumentiert und nicht dafür vorgesehen, kurzerhand ersetzt zu werden, auch wenn Googles nahezu monatlicher Flash-Rhythmus bedeutet, dass ein 3.8-Flash schnell folgen könnte. Das Einstellungsrisiko der 3.1-Pro-Vorschau ist nicht hypothetisch; es ist der aktuelle Zustand einer Stufe, deren Nachfolger seit drei Monaten verzögert wurde.

Wo Gemini 3.1 Pro immer noch die Nase vorn hat

Das ehrliche Plädoyer für 3.1 Pro stützt sich auf drei Säulen, und keine davon ist rohe Leistungsfähigkeit. Erstens der Custom-Tools-Endpunkt: Gemini 3.1 Pro wird mit einer dedizierten API-Oberfläche für bash/custom-tools ausgeliefert, die Flash nicht bietet, und Teams, die darauf Agent-Tooling aufgebaut haben, verfügen heute über ein funktionierendes System. Zweitens abgestimmte Workloads: Eine Pipeline, die bereits auf die Dynamic-Thinking-Standardwerte, Cache-Muster und Eval-Scores von 3.1 Pro abgestimmt ist, ist ein bewegliches Ziel, und ein Umstieg kostet echte Entwicklungszeit, selbst wenn die Alternative schneller und günstiger ist. Drittens die spezifischen Aufgaben, bei denen Pro aufgrund seiner längeren Produktionshistorie noch immer kein Flash-Pendant hat – die Benchmarks der Launch-Generation wie GPQA und ARC-AGI-2, an denen Flash noch nie gemessen wurde. Wenn Ihr Workload zu diesen gehört, beantwortet „Flash schlägt Pro im Index“ Ihre Frage nicht; nur ein Test mit Ihrem eigenen Eval kann das.

Das Fazit: was die Übernahme der Flash-Stufe bedeutet

Die Richtung ist eindeutig. Für eine neue Workload ist Gemini 3.7 Flash heute das bessere Standard-Gemini: günstiger, schneller, GA-stabil, höher im unabhängigen Index, und es bekommt die neue Videofunktion zuerst. Gemini 3.1 Pro behält eine echte, aber schmale Anhängerschaft — Nutzer von Custom-Tools, feinabgestimmte Pipelines und Aufgaben, bei denen seine älteren Benchmark-Ergebnisse weiterhin gelten. Die übergreifende Geschichte ist, dass Googles Flaggschiff-Stufe stagniert, während das Unternehmen im Arbeitstier-Segment tatsächlich konkurriert — und die Teams, die immer noch Flaggschiff-Preise für 3.1 Pro zahlen, zahlen für einen Status, den das Unternehmen selbst nicht mehr verteidigt.

Screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview showing a 1M-token context window, .00 per 1M input and 2.00 per 1M output tokens, and Vision/Audio/Tools/JSON/Reasoning capability chips.

Für Teams, die ohne ein Projekt migrieren möchten, ist der Wechsel zwischen Gemini-Modellen eine reine Namensänderung des Modells und keine Integration. Gemini 3.1 Pro wird auf OrcaRouter zu seinem Listenpreis von 2,00 $ / 12,00 $ ohne Aufschlag durchgereicht, zusammen mit Gemini 3.6 Flash und dem übrigen routbaren Gemini-Tier hinter einem einzigen Schlüssel – so kann eine Workload einen Teil des Datenverkehrs an ein Flash-Modell senden, 3.1 Pro für die Aufgaben als Fallback behalten, bei denen es weiterhin besser abschneidet, und das automatische Failover das Risiko abfangen lassen, dass sich eines der Google-Modelle ändert. Gemini 3.7 Flash selbst ist über Googles eigene API und mehrere Drittanbieter-Plattformen verfügbar. Das Routing-DSL und die Modellfusion sind genau das, womit Sie vor dem Wechsel einen direkten Vergleich der beiden Gemini-Modelle in Ihrer eigenen Evaluierung durchführen würden. Die Wahl, zu der die Produktreihe Sie drängt, ist eindeutig: Standardmäßig die Flash-Stufe verwenden und Pro nur für die wenigen Fälle aufheben, in denen es nachweislich seinen Aufpreis wert ist.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube