Eine generierte Hero-Karte mit dem Titel „Claude Haiku 5.5 vs. DeepSeek V4.1 Flash“ und dem Kicker „ZWEI MODELLE, ZWEI IDEEN VON GÜNSTIG“, die Claude Haiku 5.5 bei Eingabe $0,10, Ausgabe $0,50 und Index 43,40 gegenüber DeepSeek V4.1 Flash bei Eingabe $0,30, Ausgabe $1,20 und Index 39,46 zeigt, über einem Balken mit der Aufschrift „Kosten pro abgeschlossener Aufgabe $0,21 vs. $0,27“.
Engineering & Research

Claude Haiku 5.5 vs. DeepSeek V4.1 Flash: Der billigere Preis ist nicht das billigere Modell

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Auf der Preisliste ist das überhaupt nicht knapp. Claude Haiku 5.5, das der Anbieter am 7. Oktober 2026 auf den Markt gebracht hat, wird mit 0,10 US-Dollar pro Million Eingabe-Tokens und 0,50 US-Dollar pro Million Ausgabe-Tokens gelistet. DeepSeek V4.1 Flash, veröffentlicht am 10. September 2026, wird mit 0,30 und 1,20 US-Dollar auf der unabhängigen Tarifübersicht gelistet, oder mit 0,15 und 0,60 US-Dollar auf der eigenen Nebenzeiten-Preisliste des Anbieters. Der Anbieter ist bei beiden Messwerten zwei- bis dreimal günstiger, und das ist das erste Mal, dass ein Modell der Haiku-Klasse unter einem DeepSeek-Flash-Tarif liegt.

Dann misst man, was eine abgeschlossene Aufgabe kostet, und die Lücke schließt sich. Im selben Evaluationslauf kostet eine Aufgabe des Intelligence Index $0,21 bei Claude Haiku 5.5 und $0,27 bei DeepSeek V4.1 Flash — ein Vorsprung von 20 %, nicht von 200 %. Der Grund steht auf derselben Seite: Claude Haiku 5.5 generierte 162.164 Output-Tokens pro Aufgabe gegenüber 88.574 bei DeepSeek. Man zahlt weniger pro Token und kauft fast doppelt so viele davon.

Diese Umkehrung macht den gesamten Vergleich aus, und alles Folgende ist eine Argumentation darüber, auf welcher Seite davon Ihre Arbeitslast landet.

Beide Tarifkarten, gelesen wie geschrieben

Pro Million Tokens in US-Dollar. Die Zahlen von Anthropic stammen aus Anthropics eigener Preisdokumentation; die von DeepSeek stammen von DeepSeeks Seite „Model & Pricing“, der maßgeblichen Übersicht für ihre Peak- und Off-Peak-Struktur. Unabhängige Messungen sind Artificial Analysis Intelligence Index v4.3.2, ausgelesen am 2026-10-08.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs DeepSeek V4.1 Flash — the scoreboard' with rows Index v4.3.2 43.40 against 39.46, cost per task $0.21 against $0.27, output tokens per task 162,164 against 88,574, Terminal Bench 4.0 0.3283 against 0.2677, AutomationBench 0.3541 against 0.6889 and open weights 'no' against 'yes, MIT', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; prices per vendor documentation.'

• Eingabe — Claude Haiku 5.5 0,10 $ bis zu 100.000 Token und 0,50 $ darüber. DeepSeek V4.1 Flash 0,30 $ pauschal auf der Karte des Boards oder 0,15 $ in DeepSeeks Off-Peak-Zeitfenstern.

• Ausgabe — Claude Haiku 5.5: 0,50 $ bis 100.000 Token und 2,50 $ darüber. DeepSeek V4.1 Flash: 1,20 $ pauschal oder 0,60 $ außerhalb der Stoßzeiten.

• Zwischengespeicherte Eingabe – Claude Haiku 5.5: 0,01 $ unter 100.000 Tokens und 0,05 $ darüber, ein Rabatt von 90 %. DeepSeek V4.1 Flash: 0,006 $, ein Rabatt von 98 %. Dies ist die eine Messgröße, bei der die DeepSeek-Karte in absoluten Zahlen günstiger ist, und sie ist günstiger, als man erwartet.

• Tageszeitabhängige Preisgestaltung – Anthropic hat keine. DeepSeek verdoppelt beide Zähler zwischen 01:00 und 04:00 Uhr UTC und erneut zwischen 06:00 und 10:00 Uhr UTC an Wochentagen, ausgenommen chinesische Feiertage. Jede andere Stunde, einschließlich des gesamten Wochenendes, fällt in die Nebenzeit.

• Kontext- und Ausgabeobergrenze — jeweils 1 Mio. Tokens. Claude Haiku 5.5 begrenzt eine einzelne Antwort auf 128.000 Tokens; DeepSeek V4.1 Flash begrenzt sie auf 384.000.

• Gewichte — Claude Haiku 5.5 ist proprietär, nur per API verfügbar, Modell-ID claude-haiku-5-5. DeepSeek V4.1 Flash ist unter MIT quelloffen, 552B Parameter insgesamt, davon 16B aktiv, auf Hugging Face.

• Modalität — beide nehmen Text und Bilder entgegen und geben Text zurück. Keines von beiden ist video-nativ.

• Unabhängige Punktzahl — 43,40 für Claude Haiku 5.5 (Max) gegenüber 39,46 für DeepSeek V4.1 Flash (Max). Eine Differenz von 3,94 Punkten auf einem Board mit 182 Modellen.

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the pricing lines $0.10/$0.50 up to 100,000 tokens and $0.50/$2.50 over it, and the release line 'Released October 7, 2026'.

Warum die Pro-Aufgabe-Zahl die Pro-Token-Zahl schlägt

Listenpreise werden pro Token angegeben, weil genau das gemessen wird. Sie sind ein schlechter Anhaltspunkt dafür, was eine Workload kostet, denn ein Reasoning-Modell entscheidet, wie viele Tokens eine Aufgabe benötigt, und die beiden Modelle hier weichen um den Faktor 1,8 voneinander ab.

Claude Haiku 5.5 gibt pro Aufgabe im Intelligence Index 162.164 Ausgabe-Tokens aus, aufgeteilt in 129.047 Reasoning- und 33.118 Antwort-Tokens. DeepSeek V4.1 Flash gibt 88.574 aus, aufgeteilt in 62.670 Reasoning- und 25.904 Antwort-Tokens. Beide rechnen Denken als Ausgabe ab. Das Modell mit der um 60 % niedrigeren Ausgaberate verbraucht also fast doppelt so viel auf dem teuren Zähler, und rechnerisch liegen sie innerhalb von sechs Cent voneinander.

Es gibt einen zweiten Effekt, der in dieselbe Richtung wirkt. Der Index-Lauf wird sowohl vom Input als auch vom Output dominiert, weil das Harness den Kontext erneut sendet: Die $0,2128 pro Aufgabe bei Claude Haiku 5.5 teilen sich auf in $0,1317 Input und $0,0811 Output, und innerhalb der Input-Position entfallen $0,0954 auf Cache-Lesevorgänge und $0,0337 auf Cache-Schreibvorgänge, gegenüber nur $0,0026 an frischem Input. Die $0,2652 von DeepSeek teilen sich in $0,1589 Input und $0,1063 Output auf, wobei $0,0966 des Inputs auf Cache-Schreibvorgänge entfallen. Die beiden Modelle lesen ungefähr dieselbe Menge an gecachtem Kontext; DeepSeek zahlt mehr für dieselben Lese- und Schreibvorgänge.

Anthropics eigener Launch-Post beginnt mit einer ähnlichen Warnung aus der anderen Richtung. Darin heißt es, Haiku 5.5 sei „ein besonders gutes Preis-Leistungs-Verhältnis, wenn es für Aufgaben mit Prompts von bis zu 100.000 Tokens verwendet wird, die etwa 90 % der Anfragen an unser vorheriges Haiku-Modell ausmachen“. Diese Einschränkung ist durchaus ernst zu nehmen – siehe den Absturz unten.

Die 100.000-Token-Klippe ist die eigentliche Weggabelung.

Anthropic berechnet Claude Haiku 5.5 nicht pauschal. Die Abrechnungssätze von 0,10 $ und 0,50 $ gelten für Prompts bis zu 100.000 Tokens und steigen danach auf 0,50 $ und 2,50 $ — ein Sprung um das Fünffache beim Input und um das Fünffache beim Output, angewendet auf die gesamte Anfrage statt nur auf den Überschuss.

DeepSeeks Struktur ist völlig anders. Sein Tarif hängt davon ab, wann Sie senden, nicht davon, wie viel. Ein Prompt mit 150.000 Token kostet pro Token dasselbe wie ein Prompt mit 500 Token; innerhalb zweier Zeitfenster an Wochentagen verdoppelt sich der Preis.

Betreibt man beide mit einer Long-Prompt-Pipeline, kehrt sich der Vergleich stark um. Bei 150.000 Eingabe-Tokens und 20.000 Ausgabe-Tokens berechnet Claude Haiku 5.5 0,125 $ für den Input und 0,05 $ für den Output — 0,175 $ für den Aufruf —, während DeepSeek außerhalb der Stoßzeiten 0,0225 $ und 0,012 $ berechnet, was unter vier Cent liegt. Damit gewinnt DeepSeek um den Faktor etwa 4,5 — bei genau denselben zwei Modellen, bei denen im Kurz-Prompt-Fall Anthropic um den Faktor drei gewann.

Keine der beiden Strukturen ist abstrakt betrachtet besser. Die eine bepreist danach, wie viel Sie senden, die andere danach, wann Sie es senden, und nur eine dieser beiden Variablen liegt zum Zeitpunkt der Anfrage in Ihrer Hand.

DeepSeeks anderer Hebel, den niemand einpreist

Die Cache-Linie verdient eine eigene Betrachtung, denn sie ist der günstigste Zähler im gesamten Vergleich und diejenige, die mit dem Produktionsvolumen wächst statt zu schrumpfen.

DeepSeeks Cache-Trefferrate beträgt 0,006 $ pro Million Tokens bei einem angegebenen Rabatt von 98 % – etwa ein Sechstel von Anthropics 0,01 $ und ein Bruchteil dessen, was frischer Input auf beiden Seiten kostet. Alles, was ein stabiles Präfix erneut sendet – ein langer System-Prompt, ein abgerufenes Dokumentenset, ein Tool-Schema –, zahlt diesen Satz bei jedem Turn nach dem ersten. Der obige Indexlauf zeigt bereits, wie groß dieser Anteil ist: 0,0954 $ der Input-Kosten pro Aufgabe von Claude Haiku 5.5 entfallen auf Cache-Reads, bei nur 0,0026 $ nicht gecachtem Input.

Die praktische Aufteilung ist also enger als „Anthropic ist günstiger“. Wenn deine Anfragen kurz, Single-Turn und cache-warm sind, liegt Claude Haiku 5.5 beim Preis vorn, bei der Leistungsfähigkeit um 3,94 Indexpunkte vorn und bei den zusammengesetzten agentischen Zeilen vorn. Wenn deine Anfragen lang oder präfixlastig sind oder sich in DeepSeeks Off-Peak-Fenster einplanen lassen, dominiert DeepSeek V4.1 Flash bei den Kosten, und zwar nicht besonders knapp.

Was Sie heute tatsächlich anrufen können

Beide Modelle sind erreichbar, aber nicht symmetrisch, und diese Asymmetrie sollte man benennen, statt sie selbst herausfinden zu müssen.

DeepSeek V4.1 Flash ist jetzt im OrcaRouter-Katalog, durchgereicht zum Listenpreis des Anbieters mit 0 % Aufschlag – was hier mehr als sonst zählt, denn DeepSeeks Tarif hat eine Peak-Struktur. Wir listen $0,15 für Input und $0,60 für Output mit $0,003 für Cache-Read und den zwei Verdopplungsfenstern an Wochentagen im Preisdatensatz, sodass eine über den DeepSeek-Pfad geroutete Anfrage so abgerechnet wird, wie DeepSeek sie abrechnet – nicht zu einem gemittelten Durchschnitt. Automatisches Failover liegt unter der Route, sodass ein 429 im Peak-Fenster oder ein Teilausfall beim Anbieter die Anfrage verlagert, statt sie scheitern zu lassen.

Claude Haiku 5.5 ist nicht im Katalog. Anthropics Modell ist direkt über Anthropic und über seine drei Cloud-Partner erreichbar – AWS, Google Cloud und Microsoft Azure, die der Launch-Post nennt – und das ist die einzige ehrliche Art, es zu sagen. Was der Katalog aus der Anthropic-Reihe tatsächlich führt, ist Claude Sonnet 5.5 und Claude Opus 5.5, was einen Eskalationspfad von einem kostengünstigen Klassifizierungsaufruf zu einem agentischen Aufruf der mittleren Ebene zu einer Routing-Konfiguration statt zu einer zweiten Integration macht.

A capture of the OrcaRouter model page for DeepSeek V4.1 Flash under deepseek/deepseek-v4.1-flash, showing a 1M-token context, a 384K maximum output, text and image input, public benchmarks dated 2026-09-10, a p50 time to first token of 1.74 seconds, and the page's own description of the model as the smallest in DeepSeek's new architecture family, released September 10, 2026.

Welches soll man wählen?

Wenn Ihr Traffic aus Klassifizierung, Extraktion, Routing-Entscheidungen, Zusammenfassung und Subagent-Turns besteht – kurze Prompts, hohes Volumen, Bilder inklusive –, dann ist Claude Haiku 5.5 das bessere Modell und unter 100.000 Tokens das günstigere. Es erzielt 3,94 Indexpunkte mehr, verarbeitet Bilder, und Anthropic liefert einen einstellbaren Effort-Regler, mit dem Sie Leistungsfähigkeit gegen Kosten pro Aufruf eintauschen können, ohne das Modell zu wechseln.

Wenn Ihr Traffic aus langen Dokumenten besteht, stark retrieval-lastig ist oder Sie ihn planen können, punktet DeepSeek V4.1 Flash bei der Rechnung: drei- bis viermal günstiger pro langem Aufruf, eine Cache-Rate, die ein Sechstel der von Anthropic beträgt, eine Antwortobergrenze von 384.000 Token und offene Gewichte, die Sie behalten können, falls das Pro-Token-Modell irgendwann nicht mehr passt.

Was dieser Vergleich tatsächlich klärt, ist enger gefasst als „Anthropic ist jetzt die günstige Option“. Er klärt, dass ein kleines Anthropic-Modell einen DeepSeek-Flash-Tarif auf dem Preisschild unterbieten kann, während es auf der Rechnung innerhalb von 20 % davon landet – und dass der Abstand zwischen diesen beiden Tatsachen eine Verbosity-Einstellung ist.

Eine API für über 200 Modelle, ein Schlüssel, automatisches Failover darunter, sodass ein 429 in der Spitzenlast oder ein Teilstörung eines Anbieters den Aufruf verlagert, statt ihn fehlschlagen zu lassen.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert