Eine generierte Hero-Karte mit dem Titel „Claude Haiku 5.5 vs. Gemini 3.6 Flash“ und dem Kicker „7,5x DIE KOSTEN PRO ANTWORT“, die Claude Haiku 5.5 mit Eingabe $0,10, Ausgabe $0,50 und Index 43,40 gegenüber Gemini 3.6 Flash mit Eingabe $0,75, Ausgabe $3,75 und Index 33,98 zeigt, über einem Balken mit der Aufschrift „Kosten pro abgeschlossener Aufgabe $0,21 vs. $1,60“.
Engineering & Research

Claude Haiku 5.5 vs. Gemini 3.6 Flash: 7,5-mal die Kosten pro Antwort, um neun Punkte schlechteres Modell

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Claude Haiku 5.5 und Gemini 3.6 Flashliegen in derselben Stufe ihrer jeweiligen Produktreihen — der kleinen, schnellen, günstigen — und genau dort endet die Ähnlichkeit. Im Artificial Analysis Intelligence Index v4.3.2 erreicht Claude Haiku 5.5 in seiner Max-Konfiguration 43,40 Punkte gegenüber 33,98 für Gemini 3.6 Flash in seiner High-Konfiguration. Im selben Durchlauf kostet eine abgeschlossene Index-Aufgabe 0,21 $ bei Claude Haiku 5.5 und 1,60 $ bei Gemini 3.6 Flash.

Lesen Sie diese beiden Zahlen zusammen, denn jede für sich allein führt in die Irre. Das günstigere Modell ist nicht geringfügig günstiger; es ist 7,5-mal günstiger pro abgeschlossener Aufgabe. Und das Modell, das es schlägt, ist nicht geringfügig schwächer; es ist 9,42 Indexpunkte schwächer, was auf einem Board mit 182 Modellen dem Abstand zwischen dem oberen Quartil und der Mitte entspricht.

Beide Fakten stammen aus demselben unabhängigen Durchlauf, was wichtig ist, weil die Anbieterkarten hier einem weder das eine noch das andere verraten. Anthropic startete Claude Haiku 5.5 am 7. Oktober 2026; Google lieferte Gemini 3.6 Flash am 21. Juli 2026 aus. Die drei Monate dazwischen sind der interessante Teil.

Die beiden Karten, nebeneinander

Pro Million Tokens in US-Dollar. Die Tarife von Anthropic und Google stammen aus ihrer eigenen Preisdokumentation; die gemeinsamen Zeilen sind der Artificial Analysis Intelligence Index v4.3.2. Zwischengespeichert am 2026-10-08.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.6 Flash — the scoreboard' with rows Index v4.3.2 43.40 against 33.98, cost per task $0.21 against $1.60, input price $0.10 against $0.75, output tokens per task 162,164 against 41,606, Terminal Bench 4.0 0.3283 against 0.0707 and input modality 'text, image' against 'text, image, video, audio', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; Gemini 3.6 Flash is flagged deprecated on the board.'

• Eingabe — Claude Haiku 5.5: 0,10 $ bis zu 100.000 Token und 0,50 $ darüber; Gemini 3.6 Flash heute pauschal 0,75 $, steigt am 1. Januar 2027 auf 1,50 $.

• Ausgabe — Claude Haiku 5.5 0,50 $ bis zu 100.000 Tokens und 2,50 $ darüber; Gemini 3.6 Flash heute pauschal 3,75 $, steigt am selben Datum auf 7,50 $.

• Zwischengespeicherte Eingabe — Claude Haiku 5.5 0,01 $ und 0,05 $; Gemini 3.6 Flash 0,075 $, plus eine Speichergebühr von 0,50 $ pro Million Token pro Stunde.

• Kontext- und Ausgabegrenze — 1 Mio. Token für beide. Claude Haiku 5.5 begrenzt eine Antwort auf 128.000 Token; Gemini 3.6 Flash auf 65.536.

• Modalität — Claude Haiku 5.5 verarbeitet Text und Bilder. Gemini 3.6 Flash verarbeitet Text, Bilder, Video, Audio und Dateien. Dies ist die eine Zeile, in der Googles Seite eindeutig vorn liegt, und für eine Pipeline zum Medienverständnis kann sie die ganze Frage entscheiden.

• Unabhängige Bewertung — 43,40 für Claude Haiku 5.5 (Max) gegenüber 33,98 für Gemini 3.6 Flash (High).

• Kosten pro abgeschlossener Aufgabe — $0,21 gegenüber $1,60, im selben Evaluationslauf.

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the pricing lines $0.10/$0.50 up to 100,000 tokens and $0.50/$2.50 over it, and the release line 'Released October 7, 2026'.

Warum die Zahl pro Aufgabe und nicht pro Token verwendet werden sollte

Der Preislisten-Multiplikator liegt bei der Eingabe bereits bei 7,5 und bei der Ausgabe bei 7,5, daher ist die Kennzahl pro Aufgabe hier keine Überraschung – aber es lohnt sich zu zeigen, warum die beiden Modelle bei einem Maß am selben Punkt landen und beim anderen so weit auseinanderliegen, weil dieselbe Arithmetik bei den anderen Paarungen in diesem Batch in die entgegengesetzte Richtung wirkt.

Gemini 3.6 Flash ist das weniger ausführliche der beiden. Es erzeugt pro Intelligence-Index-Aufgabe 41.606 Ausgabe-Tokens – 20.061 Reasoning- und 21.545 Antwort-Tokens – gegenüber 162.164 bei Claude Haiku 5.5, aufgeteilt in 129.047 Reasoning- und 33.118 Antwort-Tokens. Das Modell von Anthropic verbraucht für dieselbe Aufgabe fast viermal so viele Tokens, und es ist dasjenige, dessen Ausgaberate ein Siebtel der von Google beträgt, sodass sich die Token-Lücke und die Ausgaberaten-Lücke multiplizieren, statt sich gegenseitig aufzuheben.

Diese Kombination – günstiger Tarif mal intensive Nutzung – ist die ehrliche Beschreibung der Wirtschaftlichkeit von Claude Haiku 5.5, und Anthropics eigener Launch-Post räumt die andere Seite davon ein: Das Modell sei „besonders preiswert, wenn es für Aufgaben mit Prompts von bis zu 100.000 Tokens eingesetzt wird, die etwa 90 % der Anfragen an unser vorheriges Haiku-Modell ausmachen.“ Jenseits von 100.000 Tokens wird der Input-Tarif zu $0,50 und der Output-Tarif zu $2,50, woraufhin sich das Vielfache gegenüber Gemini 3.6 Flash auf ungefähr 1,5x verringert.

Was Googles eigene Stufe tat, während dieser Vergleich stillstand

An dieser Stelle ist der Beitrag kein Zwei-Modell-Vergleich mehr, sondern wird zu einer Warnung darüber, mit welchem Gemini man eigentlich vergleicht.

Google hat den Flash-Preis über drei Generationen hinweg konstant gehalten. Gemini 3.6 Flash, Gemini 3.7 Flash und Gemini 3.8 Flash sind in Googles eigener Preis-Dokumentation alle mit 0,75 $ Input und 3,75 $ Output aufgeführt, mit demselben Cache-Satz von 0,075 $ und derselben Erhöhung zum 1. Januar 2027 auf 1,50 $ und 7,50 $. Googles Karte für die 3.6-Linie beschreibt es als „unser Flash-Modell der vorherigen Generation“, was die eigenen Worte des Anbieters dafür sind.

Bewegt hat sich der Score, nicht der Preis. Auf der unabhängigen Rangliste erzielt Gemini 3.6 Flash 33,98, Gemini 3.7 Flash 39,06 und Gemini 3.8 Flash 40,93 – alle in ihrer veröffentlichten Konfiguration mit der höchsten Intensität. Neun Indexpunkte kamen innerhalb von sechs Wochen in Googles Flash-Tier hinzu, bei unverändertem Tarif.

Die Konsequenz für alle, die mitten in der Evaluierung stecken, ist konkret: Wenn Sie diesen Vergleich vor drei Wochen gegen Gemini 3.7 Flash gebenchmarkt haben, ist Ihr Ergebnis veraltet, und wenn Sie ihn gegen Gemini 3.8 Flash benchmarken, verringert sich der Abstand zu Claude Haiku 5.5 auf 2,47 Punkte. Gemini 3.6 Flash ist die Version dieses Vergleichs, die Anthropic am meisten schmeichelt, und sie ist zugleich die Version, deren Verkauf Google am fernsten liegt.

Artificial Analysis kennzeichnet den 3.6-Eintrag als veraltet. Googles Preisgestaltungsdokumentation veröffentlicht den Preis weiterhin, und seine Modellliste führt weiterhin zu einem 3.6-Abschnitt. Die ehrliche Lesart ist also nicht „verschwunden“, sondern „zweimal innerhalb seiner eigenen Familie in zehn Wochen überholt“ – und das ist eine Tatsache darüber, wie schnell sich diese Stufe bewegt, kein Grund, den Vergleich auszulassen.

Für wen dies tatsächlich entscheidet

Es gibt wirklich gute Gründe für Gemini 3.6 Flash – und es ist nicht der Score.

Wenn Sie Audio oder Video im Prompt benötigen, kann Claude Haiku 5.5 das überhaupt nicht – es liest Text und Bilder und sonst nichts. Gemini 3.6 Flash liest Text, Bilder, Video, Audio und Dateien, und unser eigener Katalog verzeichnet es mit gemessenen 582 Ausgabe-Tokens pro Sekunde bei einer medianen Zeit bis zum ersten Token von 4,1 Sekunden in der letzten Woche, was selbst für Flash-Verhältnisse ein schnelles Modell ist. Für eine Pipeline zum Medienverständnis ist die Modalitätenliste die gesamte Entscheidung, und die Indexlücke ist eine Fußnote.

Wenn es bei Ihrer Arbeit um Text und Bilder geht, ist die Rechnung zu eindeutig, um darüber zu streiten. Bei einer input-lastigen Mischung von 7:2:1 – der Form, die der meiste Produktionsverkehr hat – kommt Claude Haiku 5.5 auf 0,077 $ pro Million Tokens gegenüber 0,63 $ für Gemini 3.6 Flash. Bei über einer Million gemischter Tokens pro Tag sind das 77 Cent gegenüber 6,30 $, und die zweite Zahl wird am 1. Januar 2027 noch schlechter, während sich die erste nicht bewegt.

Die 100.000-Token-Klippe ist die eine Bedingung, die das kippen lässt. Eine Retrieval- oder Langdokument-Pipeline, die routinemäßig Prompts mit 150.000 Tokens zusammenstellt, zahlt den $0,50/$2,50-Tarif von Anthropic für die gesamte Anfrage, und an diesem Punkt liegen die beiden Modelle preislich nur noch um höchstens den Faktor 1,5 auseinander, während Gemini 3.6 Flash weiterhin bei der Modalität und bei der 91,8%-Zahl gewinnt, die Google für Multi-Needle-Retrieval bei durchschnittlich 128k veröffentlicht. Das ist eine Herstellerangabe und nicht reproduziert, und es gehört genau in diese Rahmung.

A capture of the OrcaRouter model page for Gemini 3.6 Flash under google/gemini-3.6-flash, showing a 65K maximum output, text, image, video, file and audio input, public benchmarks published by Google dated 2026-07-21, a p50 time to first token of 4.1 seconds, and the page's own description of the model as Google's fast, cost-efficient multimodal model in the Gemini 3 family with a 1M-token context window.

Beide anrufen oder einen anrufen

Gemini 3.6 Flash ist ab heute im OrcaRouter-Katalog verfügbar unter google/gemini-3.6-flash, zum Google-Listenpreis mit 0 % Aufschlag — 0,75 $ und 3,75 $ mit 0,075 $ pro Cache-Read, weitergegeben so, wie der Anbieter es berechnet. Das ist bei genau diesem Modell wichtig, weil Googles Erhöhung zum 1. Januar eine Tarifänderung ist und ein durchgereichter Katalog sie am Tag ihres Inkrafttretens übernimmt und nicht erst bei der nächsten Vertragsverlängerung. Ein API-Schlüssel und ein SDK-Aufruf steuern entweder dieses Modell oder eines der über 200 anderen im Katalog, sodass ein A/B-Test zwischen einem Google-Zweig und einem Anthropic-Zweig eine Änderung des Modell-Strings ist, mit automatischem Failover darunter, statt einer zweiten Integration.

Claude Haiku 5.5 ist nicht im Katalog. Anthropics Modell ist über die eigene API von Anthropic sowie über AWS, Google Cloud und Microsoft Azure erreichbar, und das ist die ganze ehrliche Antwort. Was wir aus dieser Reihe tatsächlich führen, ist Claude Sonnet 5.5 und Claude Opus 5.5 – und genau das macht den Eskalationspfad von einem günstigen Klassifizierungsaufruf hin zu einem agentischen Aufruf der mittleren Stufe zu einer Routing-Entscheidung statt zu einem Projekt.

Was das Urteil einfach genug zu formulieren macht. Bei Text- und Bildarbeit mit kurzen Prompt-Längen gewinnt Claude Haiku 5.5 auf jeder Achse außer der Antwortobergrenze. Bei allem, was Audio oder Video enthält, ist Gemini 3.6 Flash der einzige der beiden, der überhaupt antworten kann – und wenn du Googles Tarif für diese Fähigkeit zahlen willst, frag, für welches Gemini du ihn zahlst, denn in dieser Stufe bekommst du für dasselbe Geld neun Indexpunkte mehr von einem neueren Geschwistermodell.

Eine API für über 200 Modelle, ein Schlüssel, automatisches Failover darunter, sodass ein A/B-Test zwischen einem Google-Zweig und einem Anthropic-Zweig eine Änderung des Modell-Strings statt einer zweiten Integration ist.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert