Eine generierte Hero-Karte für „Günstiger pro Token, teurer pro Antwort“, mit dem Badge „KOSTEN PRO ANTWORT“, dem Kicker „ZWEI GÜNSTIGE STUFEN, EIN GEMEINSAMES BOARD“ und dem Untertitel „Claude Haiku 5.5 mit 43,40 gegen Gemini 3.5 Flash-Lite mit 22,2 auf dem Intelligence Index v4.3.2.“ Vier Chips zeigen „43,40 vs. 22,2“, „$0,21 vs. $0,12“, „$0,10 vs. $0,30“ und „$0,50 vs. $2,50“. Zwei Karten darunter sind mit „ANTHROPICS VORTEIL“ („einundzwanzig Punkte höher auf dem gemeinsamen Board und günstiger bei beiden Messwerten“) und „GOOGLES VORTEIL“ („günstiger für eine erledigte Aufgabe, und es unterstützt Video und Audio“) beschriftet. Eine Fußzeile lautet: „Unabhängige Bewertungen und Kosten pro Aufgabe von Artificial Analysis; Listenpreise gelesen am 8. Oktober 2026.“ Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

Claude Haiku 5.5 vs. Gemini 3.5 Flash-Lite: Günstiger pro Token, teurer pro Antwort

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Claude Haiku 5.5 kostet 0,10 $ pro Million Input-Tokens und 0,50 $ pro Million Output-Tokens. Gemini 3.5 Flash-Lite kostet 0,30 $ bzw. 2,50 $ nach denselben zwei Maßstäben. Das Ant​hropic-Modell kostet beim Input ein Drittel und beim Output ein Fünftel des Preises und erreicht 43,40 gegenüber 22,2 im Artificial Analysis Intelligence Index v4.3.2 — eine Lücke von mehr als zwanzig Punkten in einem Feld, in dem zehn Punkte einen Generationensprung bedeuten. Auf der Preisliste ist dieser Vergleich nicht knapp, und bei der Leistungsfähigkeit ebenso wenig.

Auf der Rechnung ist es ein knapper Vergleich, und es geht in die andere Richtung. Setzt man beide Modelle auf dasselbe unabhängige Board und stellt jedem von ihnen eine erledigte Aufgabe statt eines Tokens in Rechnung, dann erweist sich Gemini 3.5 Flash-Lite als günstiger pro Antwort. Artificial Analysis beziffert Claude Haiku 5.5 mit 0,21 $ pro Intelligence-Index-Aufgabe und Gemini 3.5 Flash-Lite mit 0,1235 $ — ein Vorteil von 1,7 zu eins für das Modell, das fünfmal mehr für jedes Token bezahlt, das es ausgibt.

Diese Umkehrung macht den ganzen Vergleich aus. Claude Haiku 5.5 ersetzt die günstigste Stufe, die Ant​hropic je herausgebracht hat, und schlägt auf der gemeinsamen Rangliste alles in seiner Nähe. Gemini 3.5 Flash-Lite wurde am 21. Juli 2026 veröffentlicht und ist seit dem Sommer die Preis-Leistungs-Empfehlung in diesem Segment. Die Frage, die sich ein Käufer tatsächlich stellt, ist nicht, welches besser ist, denn die Antwort darauf steht fest. Vielmehr geht es darum, welches man vor eine Anfrage setzt, die kostengünstig zurückkommen muss.

Alle folgenden Angaben beziehen sich auf eine Million Tokens in US-Dollar. Die Listenpreise sind die von den Anbietern selbst veröffentlichten Preise. Die unabhängigen Bewertungen, die Kosten-pro-Aufgabe-Werte und die Geschwindigkeitsmessungen, die Artificial Analysis zugeschrieben werden, stammen von diesem Evaluator. Die Latenzwerte für Gemini 3.5 Flash-Lite stammen aus unserem eigenen gemessenen Datenverkehr. Wenn eine Zahl in dem von uns geführten Modelldatensatz enthalten ist und nicht am jeweiligen Tag von der Seite des Evaluators abgelesen wurde, haben wir diesen Evaluator als Quelle behandelt und nicht uns selbst.

Der Aufkleber und die Rechnung stimmen nicht überein.

Die Lücke bei den Kosten pro Aufgabe lässt sich nicht durch die Preisliste erklären, und es lohnt sich, den Grund dafür zu kennen, bevor eines der beiden Modelle in die Nähe der Produktion kommt.

Claude Haiku 5.5 ist wortreich, und der Evaluator sagt es unverblümt. Beim Intelligence Index verzeichnete Artificial Analysis 440 Millionen Output-Tokens des Modells gegenüber einem Median von 100 Millionen über alle hinweg und stufte es als sehr wortreich ein. Denken wird als Output abgerechnet, Denken ist standardmäßig aktiviert, mit einem Aufwandsregler, der bei mittel beginnt, und ein günstiger Input-Tarif hilft einer Arbeitslast nicht, deren Rechnung überwiegend aus Output besteht.

Gemini 3.5 Flash-Lite ist ebenfalls nicht knapp gefasst, aber pro Aufgabe messbar kostengünstiger. Dieselbe Übersicht verzeichnet 17.507 Ausgabe-Tokens pro abgeschlossener Index-Aufgabe für dieses Modell – 10.405 davon entfallen auf Reasoning und 7.102 auf die Antwort. Setzt man das gegen das Token-Volumen des Anthropic-Modells, geht die Rechnung auf: Ein Fünf-zu-eins-Vorteil bei der Ausgaberate wird teilweise von einem Modell aufgezehrt, das die größere Antwort ausgibt, und was auf Aufgabenebene übrig bleibt, ist ein kleiner Nachteil statt eines großen Vorteils.

Es gibt einen zweiten, leiseren Effekt, der in dieselbe Richtung wirkt. In der Dokumentation von Ant​hropic heißt es, dass Claude Haiku 5.5 denselben Tokenizer wie Claude 4.7 und später verwendet, sodass derselbe Text etwa 30 % mehr Tokens zählt als auf dem Modell, das dieses ersetzt. Die Rate fiel gegenüber Goo​gles Tarif um den Faktor drei. Die Tokenanzahl sank nicht, und bei demselben Text stieg sie.

Beide Modelle, bei den Zahlen, auf die es ankommt

Zwischengespeicherte Tarife und Listenpreise aus der eigenen Dokumentation von Ant​hropic und Goo​gle; unabhängige Zahlen, die Artificial Analysis zugeschrieben werden; Live-Latenz aus unserem eigenen Sieben-Tage-Traffic-Fenster. Zwischengespeichert am 08.10.2026.

A generated scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite - on the numbers that matter'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cached input $0.01 and $0.05, maximum output 128,000 tokens, input modality text and images, Intelligence Index v4.3.2 43.40, cost per task $0.21. Gemini 3.5 Flash-Lite reads input $0.30, output $2.50, cached input $0.03, maximum output 65,536 tokens, input modality text images video audio and files, Intelligence Index v4.3.2 22.2, cost per task $0.12. A footer reads 'Vendors' published list rates; independent scores and cost per task from Artificial Analysis.'

• Eingabe — Claude Haiku 5.5 0,10 $ für bis zu 100.000 Token und 0,50 $ darüber; Gemini 3.5 Flash-Lite 0,30 $ pauschal über ein 1.048.576-Token-Fenster.

• Ausgabe — Claude Haiku 5.5 0,50 $ bis zu 100.000 Token und darüber 2,50 $; Gemini 3.5 Flash-Lite 2,50 $ pauschal.

• Zwischengespeicherte Eingabe — Claude Haiku 5.5 0,01 $ bis zu 100.000 Token und 0,05 $ darüber; Gemini 3.5 Flash-Lite 0,03 $. Cache-Schreibvorgänge kosten 0,125 $ und 0,625 $ pro Million Token für Claude Haiku 5.5.

• Kontext und Ausgabe — jeweils eine Million Token. Die maximale Ausgabe beträgt 128.000 Token für Claude Haiku 5.5 gegenüber 65.536 für Gemini 3.5 Flash-Lite, die Obergrenze von Ant​hropic ist also ungefähr doppelt so hoch.

• Eingabemodalität — Text und Bilder für Claude Haiku 5.5; Text, Bilder, Video, Audio und Dateien für Gemini 3.5 Flash-Lite. Beide geben Text zurück.

• Unabhängiger Score — 43,40 für Claude Haiku 5.5 (Max), an zweiter Stelle von 182 Modellen auf dem Intelligence Index v4.3.2, gegenüber 22,2 für Gemini 3.5 Flash-Lite, Sechsundneunzigster von 147 und im vierunddreißigsten Perzentil dieser Rangliste.

• Unabhängige Kosten pro Aufgabe — 0,21 $ gegenüber 0,1235 $ bei derselben Aufgabe.

• Durchsatz — 241,9 Ausgabe-Token pro Sekunde, gemessen für Claude Haiku 5.5 von Artificial Analysis, gegenüber 280,0 für Gemini 3.5 Flash-Lite, gemessen in unserem eigenen Playground über die letzten sieben Tage. Das sind zwei verschiedene Testumgebungen, nicht eine, also betrachte sie als Größenordnung und nicht als Wettrennen.

Einundzwanzig Punkte und woraus sie bestehen

Ein Abstand von einundzwanzig Punkten auf einem Index, der bis in die Sechziger reicht, ist keine bloße Marge. Er ist der Unterschied zwischen einem Modell, das eine agentische Schleife bewältigen kann, und einem Modell, dem man einen einzigen gut spezifizierten Aufruf übergeben sollte.

Die beiden Anbieter messen nicht die Test-Harnesses des jeweils anderen, daher lassen sich ihre eigenen Suiten nicht direkt miteinander vergleichen. Anthropic veröffentlicht für Claude Haiku 5.5 Ergebnisse zu GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 und FrontierCode; Google veröffentlicht einen eigenen Satz für die Flash-Lite-Stufe; keiner von beiden hat die des anderen ausgeführt. Der einzige verfügbare direkte Vergleich ist die unabhängige Rangliste, und dort liegt das Anthropic-Modell mit einem Vorsprung vorn, der alles andere als knapp ist.

Die Teil-Scores des Evaluators für Gemini 3.5 Flash-Lite dokumentieren das Profil dieser Stufe. Es erzielt 83,8 % bei GPQA Diamond und 54,2 % bei SWE-Bench Pro, 54 % bei Terminal-bench 2.1, 41,3 % bei SciCode und 39,2 % bei MLE-Bench sowie 18,8 % bei Humanity's Last Exam. Das sind die Werte einer kompetenten, preiswerten Allzweck-Stufe – stark bei Wissensfragen, sichtbar zurück bei den schwierigsten Reasoning- und Forschungsevaluierungen. Claude Haiku 5.5 liegt mit 43,40 im Gesamtscore in einer völlig anderen Liga, und die praktische Schlussfolgerung ist, dass Arbeit, die mehrstufige Planung über einen langen Zeithorizont erfordert, überhaupt keine Aufgabe für die Google-Stufe ist.

Eine Million Token Kontextfenster und 65.536 Token für die Antwort

Die beiden Kontextfenster sind gleich groß und sie sind nicht dasselbe Produkt.

Langkontext auf Gemini 3.5 Flash-Lite verschlechtert sich mit der Distanz auf eine Weise, die es wert ist, vor dem Vertrauen eingepreist zu werden. Bei GDM-MRCR v2, der Retrieval-Evaluierung mit acht Needles, erreicht es durchschnittlich 72,2 %, wenn die Needles innerhalb von 128.000 Tokens liegen, und 21,3 % bei der punktweisen Variante mit einer Million Tokens. Seine Long-Context-Recall-Zahl liegt bei 76 %, und CharXiv Reasoning kommt auf 74,5 % ohne Tools und 76,5 % mit ihnen. Ein Fenster mit einer Million Tokens ist eine echte Fähigkeit; zuverlässig vom entfernten Ende daraus abzurufen, ist eine kleinere, und die beiden obigen Zahlen sind der Abstand zwischen ihnen. Das Fenster des Claude-Modells wurde nicht auf dieselbe Weise auf demselben Board gemessen, daher ist keine entsprechende Zahl dafür verfügbar, und dieser Artikel wird keine erfinden.

Die Ausgabegrenzen sind der unmittelbar nützlichere Unterschied. Claude Haiku 5.5 gibt in einer Antwort 128.000 Token aus; Gemini 3.5 Flash-Lite endet bei 65.536. Wenn das Artefakt, das Sie zurückerhalten möchten, eine lange Datei, eine vollständige Migration, eine generierte Testsuite oder eine Umschreibung im Umfang eines Transkripts ist, kann eines dieser beiden Modelle es in einem einzigen Aufruf erzeugen und das andere nicht – und eine auf zwei Aufrufe aufgeteilte Aufgabe kostet mehr als doppelt so viel wie ein Aufruf, weil das gemeinsame Präfix zweimal gesendet wird.

A screenshot of the Artificial Analysis model page for Gemini 3.5 Flash-Lite, showing the model name over the provider Google, the release month July 2026, a one-million-token context window, the input modality list covering text, image, video, audio and PDF, an Intelligence Index v4.3.2 score of 22, the per-million-token input and output rates with the cached-input discount, and the measured output speed, total response time and cost per task.

Audio und Video ist keine Preisfrage.

Gemini 3.5 Flash-Lite akzeptiert Video, Audio und Dateien zum gleichen Tarif wie Text. Claude Haiku 5.5 akzeptiert Text und Bilder.

Für eine Pipeline, die aufgezeichnete Anrufe, Bildschirmaufnahmen oder Überwachungsmaterial einliest, besteht der entscheidende Leistungsunterschied nicht in den 21 Indexpunkten. Er besteht vielmehr darin, dass eines dieser Modelle die Eingabe direkt verarbeitet, während das andere eine Transkriptions- oder Frame-Extraktionsstufe davor benötigt – ein zweites Modell, eine zweite Rechnung und ein neuer Fehlermodus, der zwischen der Quelle und der Antwort liegt. Teams in dieser Situation wählen nicht zwischen zwei günstigen Stufen. Sie wählen zwischen einem Modell und einer Pipeline.

Für Bilder und Dokumente gilt das Umgekehrte. Beide Modelle lesen Bilder nativ, und Claude Haiku 5.5 erzielt dabei 43,40 im Composite, also gehört eine Workload zur Extraktion von Seitenbildern oder zum Diagrammverständnis ohne Audio darin nach den Zahlen auf die Ant​hropic-Seite und nicht aufgrund eines Modalitätsarguments.

Eines der beiden von hier aus ausführen

Gemini 3.5 Flash-Lite ist im OrcaRouter-Katalog zu Goo​gles Listenpreis mit 0 % Aufschlag verfügbar, was bedeutet, dass der Tarif des Anbieters durchgereicht und nicht gemischt wird und eine Änderung an Goo​gles Preiskarte am selben Tag auf Ihrer Rechnung ankommt, an dem sie bei deren ankommt. Das ist ein Schlüssel und ein SDK für Goo​gles Tier neben Claude Sonnet 5.5 und Claude Opus 5.5, die ebenfalls im Katalog sind – ein A/B zwischen einem Goo​gle-Flash-Lite-Zweig und einem Ant​hropic-Zweig ist also bereits eine Konfiguration statt eines Integrationsprojekts. Automatisches Failover liegt darunter, sodass kein Zweig einen Single Point of Failure darstellt, und die Routing-DSL wird die Eskalation in der Route ausdrücken, wenn die Logik dort hingehört.

Das Latenzprofil dieses Teilabschnitts beruht auf unserer eigenen Messung und nicht auf der des Anbieters. Über die letzten sieben Tage Live-Traffic hinweg hat Gemini 3.5 Flash-Lite einen p50 von 2.426 Millisekunden und einen p95 von 8.600 Millisekunden bei 280 Ausgabe-Tokens pro Sekunde gehalten, mit einer Fehlerrate von 0,313 %. Betrachten Sie es als rollierendes Fenster, nicht als Versprechen: Es verändert sich, wenn sich Traffic und Anbieterbedingungen verändern, und die Zahl, auf die Sie sich für eine bestimmte Pipeline verlassen können, ist die, die Sie nach einer Woche selbst messen.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing the Anthropic model name and an October 2026 release, Intelligence Index v4.3.2 of 43 ranking second of 182, speed ninth of 182 at 241.9 output tokens per second, a $0.21 cost per task, input $0.10 and output $0.50 per million tokens, and a one-million-token context window.

Claude Haiku 5.5 ist nicht im Katalog. Es erschien am 7. Oktober 2026 – einen Tag bevor dies geschrieben wurde – und ist heute von uns aus nicht routbar, sodass die Ant​hropic-Seite dieses Vergleichs derzeit nur bei Ant​hropic erreichbar ist. Das offen zu sagen ist besser, als es implizit zu lassen. Dass zwischen der Veröffentlichung eines Modells und seiner Aufrufbarkeit über uns eine Lücke liegt, ist normal, es ist kein Versprechen dazu, wann sie sich schließt, und wer eine Migration plant, sollte mit dem Kalender planen, den er sehen kann, statt mit dem, den er bevorzugen würde.

Welche, und für wen?

Wenn es sich um Text rein, Text raus handelt, wenn die Prompts unter 100.000 Token passen und wenn die Aufgabe Mehrschrittplanung oder Long-Horizon-Agenten erfordert, ist Claude Haiku 5.5 das stärkere Modell – um einundzwanzig Punkte – und pro Token das günstigere, und zwar um den Faktor drei bis fünf. Kalkuliere mit den Kosten pro Aufgabe statt mit der Preisliste, rechne mit ungefähr 0,21 $ für die Art von Aufgabe, die das unabhängige Gremium misst, und zähle deine Prompts neu, bevor du irgendetwas prognostizierst, denn die Tokenizer-Änderung verschiebt die Zahl schon für sich genommen um etwa dreißig Prozent.

Wenn die Arbeit kurz, hochvolumig und antwortförmig ist – ein Tag, eine Kategorie, eine Extraktion, eine Guardrail-Entscheidung –, dann spricht die Arithmetik für Gemini 3.5 Flash-Lite, und das aus einem wenig glamourösen Grund. Die Rechnung für einen Aufruf, der sehr wenig ausgibt, wird von der Eingabe dominiert, die beiden Eingabepreise liegen bei 0,30 $ gegenüber 0,10 $, und der deutlich kürzere Aufgaben-Footprint des Goo​gle-Modells bedeutet, dass der günstigere Preis den fertigen Auftrag gewinnt, obwohl er beim Listenpreis verliert. Kommen Video-, Audio- oder Dateieingaben hinzu, geht es bei der Wahl überhaupt nicht mehr um den Preis.

Was der Vergleich tatsächlich klärt, ist enger gefasst als „das neue Haiku ist günstig“. Er klärt, dass der beworbene Preis einer günstigen Stufe ein schlechter Anhaltspunkt dafür ist, was diese Stufe dich kostet, und dass das Modell, das auf der Preisseite dreimal teurer aussieht, dir die kleinere Rechnung schicken kann. Wie du dich auch entscheidest: Miss die Tokens, die du ausgibst, und nicht die, die du sendest, denn bei beiden dieser Modelle ist das der Zähler, nach dem die Rechnung wirklich abgerechnet wird.