Eine Hero-Karte mit der Überschrift „Claude Haiku 5.5 vs. Gemini 3.7 Flash“, die links Claude Haiku 5.5, veröffentlicht am 7. Oktober 2026, und rechts Gemini 3.7 Flash, als veraltet gekennzeichnet, gegenüberstellt, eine Zeile Intelligence Index v4.3.2 mit 43,40 gegenüber 39,06 sowie eine Zeile Terminal Bench 4.0 mit 0,3283 gegenüber 0,1364.
Guides & Insights

Claude Haiku 5.5 vs. Gemini 3.7 Flash: Eines dieser beiden ist bereits ausgemustert.

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Unter jedem heute geschriebenen Claude Haiku 5.5 versus Gemini 3.7 Flash-Vergleich steckt eine unangenehme Tatsache: Gemini 3.7 Flash ist veraltet. Der Anbieter veröffentlichte es am 13. August 2026, ersetzte es am 2. September durch Gemini 3.8 Flash, und Artificial Analysis führt die 3.7-Seite jetzt mit einer Veraltungs-Kennzeichnung. Claude Haiku 5.5 hingegen wurde am 7. Oktober 2026 eingeführt und verfügt über eine Zusage, nicht vor Oktober 2027 abgekündigt zu werden.

Das macht den Vergleich nicht nutzlos. Es verschiebt die Frage. Es geht nicht mehr darum, „welches der beiden ich aufrufen sollte“ – für die meisten Teams lautet die Antwort darauf: keines von beiden, denn die 3.7-Linie wurde innerhalb ihrer eigenen Familie abgelöst. Wofür er aber gut ist, ist etwas Subtileres und wohl Nützlicheres: ein klarer Blick darauf, wie schnell sich Googles Flash-Tier in drei Wochen bewegt hat, und darauf, welche Teile des Datenblatts eines Flash-Tier-Modells tatsächlich darüber entscheiden, ob es eingesetzt wird.

Was Sie noch messen können

Beide Modelle wurden auf demselben unabhängigen Board getestet, dem einzigen Ort, an dem die beiden überhaupt gegenübergestellt werden können. Auf dem Artificial Analysis Intelligence Index v4.3.2 erzielt Claude Haiku 5.5 in seiner Max-Konfiguration 43,40 gegenüber 39,06 für Gemini 3.7 Flash in seiner High-Konfiguration — eine Differenz von 4,33 Punkten.

Beide Anbieter veröffentlichen außerdem ihre eigenen Evaluierungssets, und sie überschneiden sich nicht in einer Weise, die einen direkten Vergleich ermöglicht. Die gemeinsamen unabhängigen Zeilen sind die vier, die Artificial Analysis bei beiden ausgeführt hat:

• Terminal Bench 4.0 — 0,3283 für Claude Haiku 5.5 gegenüber 0,1364 für Gemini 3.7 Flash. Eine absolute Differenz von 19 Punkten und die größte Asymmetrie im Set.

• SciCode — 0,5498 gegenüber 0,5718. Gemini 3.7 Flash setzt sich mit 2,2 Punkten knapp durch.

• Humanity's Last Exam — 0,4439 gegen 0,4787. Gemini 3.7 Flash um 3,5 Punkte.

• AutomationBench, Teilwertung — 0,3541 gegenüber 0,6203. Gemini 3.7 Flash um 27 Punkte.

Lesen Sie diese Zusammenstellung sorgfältig, denn sie enthält das interessante Ergebnis. Gemini 3.7 Flash gewinnt drei der vier gemeinsamen Benchmarks und liegt beim zusammengesetzten Index dennoch um 4,3 Punkte zurück. Ein Index ist eine gewichtete Mischung, und die Gewichtung stellt die Terminal- und Code-Zeilen – bei denen die Lücke in die andere Richtung deutlich größer ausfällt – über das Aggregat der übrigen. Das ist weniger ein Bewertungsartefakt als vielmehr eine Aussage darüber, wofür der Index gedacht ist: Er soll vorhersagen, ob ein Modell eine Aufgabe abschließen kann, und in dieser Frage war die 3.7-Linie auf eine Weise schwach, die sich durch ihre respektablen Science-Benchmark-Ergebnisse nicht verbergen ließ.

A two-column scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.7 Flash - the scoreboard' with rows Index v4.3.2 43.40 against 39.06, Terminal Bench 4.0 0.3283 against 0.1364, SciCode 0.5498 against 0.5718, Humanity's Last Exam 0.4439 against 0.4787, cost per task $0.21 against $0.93 and input price $0.10 against $0.75, footed 'Gemini 3.7 Flash is listed as deprecated; all figures per Artificial Analysis v4.3.2.'

Worin die 3.7-Linie tatsächlich schlecht war

Zwei Zeilen erzählen die Geschichte besser als der Index.

Terminal Bench 4.0 mit 0,1364 ist ein niedriger Wert, und er steht neben einem 0,8577 in der vorherigen Terminal-Bench-Generation desselben Modells. Das ist kein Modell, das schlechter geworden ist; es ist ein Benchmark, der geändert hat, was er misst, und Gemini 3.7 Flash hat den Übergang nicht geschafft. Claude Haiku 5.5 erzielt im selben überarbeiteten Benchmark 0,3283 – in absoluten Zahlen nicht spektakulär, aber fast zweieinhalb Mal so viel wie der Wert von 3.7 Flash, und zwar in der Zeile, die die agentische Coding-Leistung am direktesten vorhersagt.

Die zweite Zeile ist Tau-Bench Banking, wo Gemini 3.7 Flash 0.3278 erreicht. Zuverlässigkeit bei der Tool-Nutzung in einer strukturierten Domäne ist genau das, wofür ein günstiges Modell eingesetzt wird, und ein Wert unter 0,33 ist die Art von Zahl, die einen Pilotversuch still und leise zu Fall bringt. Claude Haiku 5.5 hat in derselben Tabelle keinen veröffentlichten Tau-Bench-Wert, daher ist dort kein Vergleich möglich — das Ehrliche ist, das zu sagen, statt einen Wert abzuleiten.

Wo Gemini 3.7 Flash bestand, bestand es schon immer: GPQA mit 0,9455 und MMMU-Pro mit 0,8549 sind beides echte Stärken, und seine multimodale Eingabe stand nie infrage. Die Schwäche lag in dem Teil des Datenblatts, der darüber entscheidet, ob eine Agentenschleife funktioniert, nicht in dem Teil, der Bestenlisten-Zeilen gewinnt.

Was hat sich in den drei Wochen danach geändert?

Gemini 3.8 Flash erschien am 2. September 2026, und die Entwicklung innerhalb von Googles eigener Flash-Kategorie ist der nützlichere Vergleich für alle, die eine Pipeline für 2027 planen.

Auf demselben Index misst Gemini 3.8 Flash 40,93 gegenüber 39,06 der 3.7-Reihe – ein Zugewinn von 1,87 Punkten in drei Wochen. Terminal Bench 4.0 stieg von 0,1364 auf 0,1970. Tau-Bench Banking stieg von 0,3278 auf 0,4495. Das sind genau die Zeilen, in denen das 3.7-Modell am schlechtesten abschnitt, was darauf hindeutet, dass der Nachfolger genau auf diese Schwäche abzielte und nicht auf einen allgemeinen Leistungsschub.

Der Preis bewegte sich überhaupt nicht. Gemini 3.7 Flash wurde mit 0,75 $ Input und 3,75 $ Output pro Million Tokens gelistet, und Gemini 3.8 Flash startete mit denselben 0,75 $ und 3,75 $ — identische Preisliste, gekoppelt an ein Modell, das in den für Agenten relevanten Zeilen zwei Indexpunkte besser ist.

A capture of Google's Gemini API pricing documentation page, headed 'Gemini Developer API pricing', with the banner 'Gemini 3.8 Flash is now available. Try it out.' and the documentation's left-hand model list showing Gemini 3.8 Flash, Gemini 3.7 Flash, Gemini 3.6 Flash and Gemini 3.5 Flash.

Die Preisliste ist der Punkt, an dem sich dieser Vergleich wirklich entscheidet

Gegenüber Claude Haiku 5.5 ist Googles Preis das Einzige, was zählt – und das nicht zu knapp.

• Eingabe — Claude Haiku 5.5 0,10 $ pro Million Token bis 100.000, darüber 0,50 $; Gemini 3.7 Flash 0,75 $ pauschal, oder siebeneinhalbmal so viel wie der Anthropic-Tarif innerhalb der ersten Stufe.

• Ausgabe — 0,50 $ für Claude Haiku 5.5 in der ersten Stufe, 2,50 $ darüber; 3,75 $ für Gemini 3.7 Flash.

• Cache-Eingabe — 0,01 $ und 0,125 $ für Claude Haiku 5.5; 0,075 $ Lesen und 0,75 $ Schreiben für Gemini 3.7 Flash.

• Kontext – eine Million Token für beide. Maximale Ausgabe – 128.000 Token für Claude Haiku 5.5 gegenüber 65.536 für Gemini 3.7 Flash.

• Eingabemodalität — Text und Bilder für Claude Haiku 5.5; Text, Bilder, Sprache und Video für Gemini 3.7 Flash. Dies bleibt die einzige Zeile, in der Googles Spezifikation strikt länger ist, und sie hat den Übergang zu 3.8 unverändert überstanden.

• Unabhängige Kosten pro abgeschlossener Index-Aufgabe — 0,21 $ für Claude Haiku 5.5 gegenüber 0,93 $ für Gemini 3.7 Flash. Eine Differenz um den Faktor 4,4, die größer ist, als es das Eingabeverhältnis von siebeneinhalb zu eins vermuten ließe, denn das Modell von Anthropic ist hier das wortreichere: 162.164 Ausgabe-Tokens pro Index-Aufgabe gegenüber 58.387 für Gemini 3.7 Flash. Anthropic dokumentiert außerdem einen Tokenizer, der mit Claude 4.7 und später gemeinsam verwendet wird und für denselben Text rund 30 % mehr Tokens zählt, was in dieselbe Richtung wirkt.

• Geschwindigkeit — 212,3 Sekunden pro Index-Aufgabe für Gemini 3.7 Flash gegenüber 424,6 für Claude Haiku 5.5. Googles Modell ist das schnellere der beiden, und zwar um den Faktor zwei, was die einzige Zeile in diesem Abschnitt ist, in der das günstigere Modell nicht auch das bessere ist.

Was das bedeutet, wenn Sie heute wählen

Die praktische Lesart ist, dass keiner der beiden die richtige Antwort ist, und zwar aus unterschiedlichen Gründen.

Gemini 3.7 Flash ist veraltet, wird zum gleichen Tarif wie sein Nachfolger angeboten und ist genau in den Zeilen, die ein günstiges Produktionsmodell braucht, schlechter als dieser Nachfolger. Eine Empfehlung dafür wäre die Empfehlung einer Preisliste, die zu einem überholten Modell gehört – der Nachfolger kostet dasselbe und leistet mehr. Niemand, der im Oktober 2026 zwischen diesen beiden wählt, sollte bei der 3.7-Reihe landen, und die Tatsache, dass seine Preisliste unverändert ist, gibt den Ausschlag.

Claude Haiku 5.5 ist das Live-Modell, und bei Text-in-Text-out-Arbeit ist es nach jedem Maßstab günstiger, beim Composite-Wert höher und deutlich besser in den beiden Zeilen, die agentischen Erfolg vorhersagen. Außerdem ist es das langsamere Modell und kann weder Sprache noch Video verarbeiten. Ob das eine Rolle spielt, ist eine Frage Ihrer Pipeline, nicht der Modelle.

Die dritte Option, die die Indexpunkt-Lücke zwischen 3,8 und 3,7 sichtbar macht, ist, dass sich Googles Flash-Tier schnell genug bewegt, dass ein drei Wochen alter Vergleich bereits Geschichte ist. Behandeln Sie jeden Flash-Tier-Direktvergleich so, als hätte er eine Haltbarkeit von Wochen, nicht von Quartalen.

Laufen, egal auf welcher Seite du landest.

Gemini 3.8 Flash – der Nachfolger, nicht das veraltete 3.7 – ist im OrcaRouter-Katalog zu Googles Listenpreis mit 0 % Aufschlag, sodass der von Google veröffentlichte Preis der Preis ist, der auf Ihrer Rechnung landet, und eine Änderung auf deren Seite noch am selben Tag bei uns live geht. Claude Sonnet 5.5 und Claude Opus 5.5 sind ebenfalls im Katalog, wodurch ein Routing-Test mit zwei Anbietern zu einer Konfiguration statt zu einem Projekt wird: eine API für über 200 Modelle, ein Schlüssel, automatisches Failover darunter, und die Routing-DSL, wenn Sie die Eskalation lieber in der Route als im Code halten möchten.

Gemini 3.7 Flash selbst ist nicht in unserem Katalog, und Claude Haiku 5.5 ebenfalls nicht. Beide bleiben über die eigenen APIs ihrer Anbieter erreichbar und, im Fall von Google, über mehrere Drittanbieter-Plattformen. Das sollte man klar sagen, statt es den Leser selbst herausfinden zu lassen.

A capture of the OrcaRouter model page for Gemini 3.8 Flash under google/gemini-3.8-flash, showing a 65K maximum output, text, image, video, file and audio input, benchmarks published by Google on 2026-09-02, a p50 time to first token of 3.838 seconds, and the rates $0.75 input and $3.75 output per million tokens.

Die Zahl, die abgezogen wird

Es ist nicht der Abstand von 4,33 Punkten im Index. Es ist, dass Gemini 3.7 Flash drei der vier gemeinsamen Benchmarks gewann und beim Gesamtwert dennoch um vier Punkte verlor, weil der Benchmark, den der Index am stärksten gewichtet, derjenige war, bei dem es 0,1364 erreichte. Die Science-Scores eines Modells der Flash-Klasse können gut aussehen, während es genau dort versagt, wofür günstige Modelle gekauft werden.

Daraus folgt, dass der Nachfolger genau diese Zeilen innerhalb von drei Wochen zu unverändertem Preis korrigierte. Angesichts dieser Belege ist der Wettbewerbsdruck in dieser Stufe nicht der Preis. Es geht darum, ob das Modell eine mehrstufige Aufgabe abschließen kann, und das entwickelt sich jetzt schneller als Preislisten.