Generierte Hero-Titelkarte für Claude Sonnet 5.5 vs. DeepSeek V4 Pro, untertitelt mit „Zwanzig Indexpunkte und ein Cache-Lesevorgang für 0,022 $“, die 2,00 $ und 10,00 $ pro Million Token gegenüber 0,66 $ und 1,98 $ zeigt, mit dem in der unteren rechten Ecke eingefügten OrcaRouter-Logo.
Guides & Insights

Claude Sonnet 5.5 vs. DeepSeek V4 Pro: 20 Indexpunkte und ein Cache-Read für 0,022 $

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Legt man die beiden Preistabellen nebeneinander, wirkt der Vergleich entschieden, bevor er überhaupt beginnt. Claude Sonnet 5.5, allgemein verfügbar seit dem 28. September 2026, kostet 2,00 US-Dollar pro Million Eingabe-Tokens und 10,00 US-Dollar pro Million Ausgabe-Tokens. DeepSeek V4 Pro, veröffentlicht am 24. April 2026, kostet 0,66 US-Dollar und 1,98 US-Dollar. Bei Agentenarbeit ist die Ausgabe der entscheidende Posten, und 10,00 US-Dollar gegenüber 1,98 US-Dollar sind ein Verhältnis von fünf zu eins – ein Dollar gegenüber zwanzig Cent pro hunderttausend Tokens. Dann die Leistungsseite: Artificial Analysis setzt Claude Sonnet 5.5 auf 56 im Intelligence Index v4.3 und DeepSeek V4 Pro auf 36 – ein Abstand von zwanzig Punkten auf demselben Prüfstand. Das ist die ganze Spannung: Das Modell von DeepSeek liegt bei einem Fünftel des Ausgabepreises und etwa zwei Dritteln der gemessenen Leistungsfähigkeit, und die beiden Fakten lassen sich nicht zu einer einzigen Empfehlung verdichten, ohne zu wissen, was Ihre Workload tatsächlich mit einem Token macht.

Was jedes Modell genau ist

Die Benennung ist der erste Punkt, an dem dieser Vergleich schiefgeht, also korrigieren wir das hier. DeepSeek V4 Pro, wie wir es führen, ist deepseek/deepseek-v4-pro, veröffentlicht am 24. April 2026, ein Modell mit 1.048.576 Token Kontext, einer maximalen Ausgabe von 384.000 Token und rein textueller Eingabe. Artificial Analysis verfolgt einen Snapshot, den es als DeepSeek V4 Pro 0813 bezeichnet – ein Build vom 13. August –, und die unten zitierten Zahlen stammen aus dieser Zeile. Auf der Sonnet-Seite steht Anthropics anthropic/claude-sonnet-5.5, Text-, Bild- und Dateieingabe, 1M Kontext, 128K maximale Ausgabe. Wenn Sie eine Anbieterseite mit einer Evaluator-Seite vergleichen und die Zahlen nicht übereinstimmen, prüfen Sie das Build-Suffix, bevor Sie schlussfolgern, dass eine von beiden falsch ist.

DeepSeek V4 Pro unterstützt nur Texteingabe. Claude Sonnet 5.5 akzeptiert auch Bilder und Dateien. Das ist der erste strukturelle Unterschied, und er ist keineswegs marginal: Jede Pipeline, die Screenshots, PDFs oder Diagramme einliest, kann nicht einfach das eine durch das andere ersetzen, weil eines von beiden nicht sehen kann.

Die Preisliste, Zeile für Zeile

• Eingabe — 0,66 $ pro Million für DeepSeek V4 Pro gegenüber 2,00 $ für Claude Sonnet 5.5; DeepSeek ist 67 % günstiger

• Ausgabe — $1,98 pro Million gegenüber $10,00; DeepSeek ist 80 % günstiger, die größte einzelne Differenz in diesem Vergleich

• Cache-Lesen — 0,022 $ pro Million gegenüber 0,20 $; DeepSeek ist bei dem Posten, der lange Agenten-Schleifen dominiert, 89 % günstiger

• Cache-Schreibvorgang — 2,50 $ pro Million für das Fünf-Minuten-Fenster bei Claude Sonnet 5.5; die Katalogzeile von DeepSeek V4 Pro enthält keine separate Cache-Schreib-Zeile

• Kontext — 1.048.576 Token gegenüber 1.000.000; DeepSeek ist geringfügig länger, ein Unterschied ohne praktische Konsequenz

• Maximale Ausgabe — 384.000 Tokens gegenüber 128.000; DeepSeek gewinnt um den Faktor drei bei der Obergrenze, die die Massengenerierung einschränkt

• Eingabemodalität — nur Text gegenüber Text, Bild und Datei

• Reasoning — beide nutzen konfigurierbaren Reasoning-Aufwand statt eines festen Denkbudgets, daher ist die Tiefe bei jedem ein Request-Parameter.

Auf der DeepSeek-Seite gibt es ein Abrechnungsdetail, das ein Tarifvergleich verbergen wird. Unsere Katalogzeile enthält ein zeitgesteuertes Preisfenster: Zwischen 01:00 und 04:00 UTC und erneut zwischen 06:00 und 10:00 UTC werden die aufgeführten Tarife verdoppelt. Zu diesen Zeiten kostet V4 Pro 1,32 $ für Input und 3,96 $ für Output – immer noch um 34 % bzw. 60 % günstiger als Claude Sonnet 5.5, aber nicht mehr mit dem Vorsprung, den die Schlagzeilenzahlen nahelegen. Batch-Workloads, die sich planen lassen, sollten geplant werden, und Workloads, die sich nicht planen lassen, sollten zum Peak-Tarif statt zum Durchschnitt bepreist werden. Das ist außerdem die Art von Sache, die nur auffällt, wenn man den Katalog statt die Marketingseite liest, was das Argument dafür ist, jedes Kandidatenmodell hinter einen einzigen Endpoint statt hinter drei Anbieterkonten zu stellen.

Zwei Fähigkeitszahlen, eine davon nicht unabhängig

Auf Seiten der Drittanbieter ist die Rangfolge eindeutig. Artificial Analysis bewertet Claude Sonnet 5.5 mit 56 und DeepSeek V4 Pro mit 36 auf dem Intelligence Index v4.3, beide in einer Reasoning-Konfiguration mit maximalem Aufwand. Derselbe Evaluator setzt Claude Opus 5 auf 51 und Gemini 3.1 Pro Preview auf 30, sodass V4 Pro mit 36 unter dem vorherigen Anthropic-Flaggschiff und über Googles Pro-Tier liegt – eine respektable Position für ein Modell zu einem Fünftel des Preises und weit entfernt von der Spitze.

Die Umkehr bei den Kosten pro Aufgabe zeigt sich auch hier, und in diesem Vergleich verläuft sie in die entgegengesetzte Richtung wie beim letzten Mal. DeepSeek V4 Pro kostet $0.67 für die Evaluation auf der Index-Suite. Claude Sonnet 5.5 kostet $7.60. Das ist kein Tippfehler und kein Rundungsartefakt: Das neuere Anthropic-Modell gibt über die Suite hinweg 410 Millionen Token aus, gegenüber einem Median von 88 Millionen, und die Ausführlichkeit des DeepSeek-Modells reicht nicht annähernd aus, um eine Preisdifferenz dieser Größe zu schließen. Bei uneingeschränkten offenen Aufgaben ist das günstigere Modell in der Praxis um eine Größenordnung günstiger, nicht nur auf der Preisliste.

Die Anbieterzahlen müssen mit mehr Sorgfalt behandelt werden. DeepSeek veröffentlicht für V4 Pro einen τ²-Bench-Wert von 96,2, was eine starke Zahl ist, aber sie stammt vom Anbieter selbst, und τ²-Bench wurde inzwischen mit der Revision v4.3 aus dem Artificial-Analysis-Index entfernt – es ist also ein Wert, der sich nicht unabhängig auf derselben Skala verorten lässt wie irgendetwas, das Anthropic veröffentlicht. Anthropics eigene Launch-Tabelle für Claude Sonnet 5.5 enthält ihre eigenen Einschränkungen, darunter eine Fußnote, dass die Einstellung Max effort auf FrontierCode niedriger abschneidet als Xhigh, und einen Hinweis, dass zwei der Benchmarks auf einem Pre-Release-Deployment mit einem Structured-Outputs-Bug ausgeführt wurden. Stellt man die Tabellen der beiden Anbieter nebeneinander, hat man zwei Marketingdokumente, kein Ranking. Die einzigen Zahlen in diesem Artikel, die auf dieselbe Achse gehören, sind die beiden Indexwerte und die beiden Kosten pro Aufgabe, denn ein einziger Evaluator hat alle vier erzeugt.

Warum die Ausgabeobergrenze wichtiger ist als der Preis

Die Zahl in diesem Vergleich, die die geringste Aufmerksamkeit erhält, ist diejenige, die die Architektur verändert: 384.000 Ausgabe-Tokens gegenüber 128.000.

Die Ausgabegrenze ist keine Komfortfunktion. Sie entscheidet, ob eine Aufgabe ein einzelner Aufruf oder eine Kette ist. Eine große Quelldatei zu erzeugen, ein vollständiges Dokument auszugeben, einen langen strukturierten Bericht zu erstellen, ein Buchkapitel zu übersetzen – alles, bei dem das Artefakt größer als 128.000 Tokens ist, lässt sich nicht in einem einzigen Aufruf an Claude Sonnet 5.5 erledigen und muss in eine Sequenz zerlegt werden, bei der der Zustand zwischen den Aufrufen weitergereicht wird. Zerlegung bedeutet mehr Eingabe-Tokens, die bei jedem Schritt erneut gesendet werden, mehr Cache-Lesevorgänge, mehr Orchestrierungscode und eine neue Klasse von Fehlern, bei der die Nahtstellen zwischen den Blöcken die Stellen sind, an denen die Fehler sitzen. Ein Modell zum fünffachen Preis, das eine ganze Orchestrierungsschicht überflüssig macht, kann bei den Entwicklungsstunden günstiger sein, bevor es bei den Tokens günstiger ist, und umgekehrt ist eine Aufgabe, die in einen Aufruf passt, eine Aufgabe, bei der die Obergrenze überhaupt nicht in die Rechnung eingeht.

Die Frage nach der Obergrenze kommt also vor der Frage nach dem Preis. Wenn dein längstes Artefakt unter 128.000 Tokens passt, ignoriere diesen Abschnitt und vergleiche anhand der Kosten pro abgeschlossener Aufgabe. Wenn nicht, kalkuliere die Pipeline, die du bauen müsstest, nicht nur die Tokens.

Wechselkosten und das Fallback-Problem

Die Migration in beide Richtungen dreht sich größtenteils um Prompting statt um Code – mit einer Ausnahme, für die man Budget einplanen sollte.

Beide Modelle konfigurieren Reasoning über einen Effort-Parameter, doch es sind Parameter verschiedener Anbieter, mit unterschiedlichen Stufen und unterschiedlichen Standardwerten. Ein Prompt, der auf eine Anthropic-Einstellung mit hohem Effort abgestimmt ist, lässt sich nicht als Eins-zu-eins-Austausch auf eine DeepSeek-Effort-Einstellung übertragen; er überträgt sich als Neuvermessung. Rechnen Sie damit, einen Tag pro Workload aufzuwenden, um die Qualität neu zu etablieren, bevor Sie einer Kostenprojektion vertrauen – auf beiden Seiten des Wechsels.

Die Ausnahme ist die Bildverarbeitung. Claude Sonnet 5.5 liest Bilder und Dateien; DeepSeek V4 Pro liest nur Text. Jeder Teil Ihrer Pipeline, der einem Modell einen Screenshot, eine gescannte Seite oder ein gerendertes Diagramm übergibt, hat keine Entsprechung bei DeepSeek. Eine vollständige Migration ist daher nur für den textförmigen Teil Ihres Traffics möglich. Das ist eine Trennlinie, die früh gezogen werden sollte, denn meist bedeutet sie, dass die Antwort nicht ein Modell ist, sondern eine Aufteilung.

Beide sind heute auf OrcaRouter routbar – deepseek/deepseek-v4-pro und anthropic/claude-sonnet-5 sind beide aktive Katalogeinträge, zum Listenpreis des Anbieters mit 0 % Aufschlag, über ein einziges Credential. Das ist gerade bei genau dieser Art von Vergleich entscheidend, bei dem nicht die Frage ist, welches Modell abstrakt besser ist, sondern an welches Modell eine bestimmte Anfrage gehen sollte. Eine Aufteilung, die reine Text-Massenarbeit an das günstige Modell und Vision-Aufgaben an das teure schickt, ist eine Routing-Regel, und sie ist weit einfacher zu formulieren, wenn beide Endpunkte auf denselben Schlüssel und dieselbe Failover-Richtlinie hören. Claude Sonnet 5.5 selbst ist noch keine Route auf unserer Plattform, daher kombiniert die heutige Version dieser Aufteilung das Anthropic-Modell mit DeepSeek V4 Pro, statt es zu ersetzen.

Die Entscheidung, als Regel formuliert

Schicken Sie es an Claude Sonnet 5.5, wenn die Aufgabe es erfordert, zu sehen – Bilder, PDFs, Screenshots, gerenderte Ausgaben –, wenn das Artefakt länger als eine Seite Prosa ist und Sie wollen, dass ein Frontier-Modell es schreibt, oder wenn ein Indexabstand von zwanzig Punkten den Unterschied zwischen einem Entwurf, den ein Mensch überarbeiten muss, und einem, den er ausliefern kann, ausmacht.

Senden Sie es an DeepSeek V4 Pro, wenn die Arbeitslast Text rein, Text raus, hohes Volumen und tolerant gegenüber einer niedrigeren Obergrenze bei der Reasoning-Qualität ist: Klassifizierung, Extraktion, Zusammenfassung, Massenumschreibung, Codetransformation mit klarer Spezifikation und alles, wofür Sie sonst zehn Dollar pro Million Ausgabe-Token bezahlen würden, um Wörter hin- und herzuschieben. Der 89 % Cache-Lese-Rabatt macht Long-Context-Agenten-Schleifen auf diesem Modell strukturell günstig, in einer Weise, wie es nichts anderes im Vergleich ist.

Das ehrliche Urteil: Dies ist kein Fähigkeitswettlauf, den DeepSeek verliert, sondern eine Entscheidung über Ressourcenallokation, die die meisten Teams in die falsche Richtung treffen, indem sie Fähigkeiten kaufen, die sie nicht nutzen. Wenn Ihr Traffic Text ist und Ihre Qualitätslatte „gut genug zum Prüfen“ statt „gut genug, um ungeprüft ausgeliefert zu werden“ lautet, ist V4 Pro bei 20 % des Ausgabepreises und 0,022 $ für Cache-Reads die richtige Standardeinstellung, und die zwanzig Indexpunkte sind eine Steuer, die Sie derzeit freiwillig zahlen.

A two-column scoreboard for Claude Sonnet 5.5 and DeepSeek V4 Pro across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50 for the five-minute window, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column DeepSeek V4 Pro: input $0.66, output $1.98, cache read $0.022, no separate cache-write line, 1,048,576-token context with 384K max output, input modality text only, AA Intelligence Index v4.3 score 36, $0.67 per task on the index run. The card heading reads "Twenty index points against an 89% cache-read discount", and a footer line notes that a timed-pricing window multiplies the DeepSeek rates by two between 01:00-04:00 and 06:00-10:00 UTC.Screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro), showing the model header, the 1,048,576-token context window with 384,000 maximum output tokens, text-only input, the Tools, JSON and Reasoning capability tags with no Vision tag, a 1.86-second p50 time to first token, a "Public benchmarks by DeepSeek · 2026-04-24" line, and the $0.66 input and $1.98 output prices per million tokens.Screenshot of Artificial Analysis's model page for "DeepSeek V4 Pro 0813 (Reasoning, Max Effort)", marked an open-weights model and released August 2026, showing In $1.32 and Out $3.96 with a 97% cache discount, the Intelligence Index score of 36, an output rate of 96.6 tokens per second, the $0.67 average cost per task, and 160M output tokens described as somewhat verbose against a median of 140M.

In diesem Artikel verglichen3

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert