Gegenereerde hero-titelkaart voor Claude Sonnet 5.5 vs DeepSeek V4 Pro, met als ondertitel 'Twintig indexpunten en een cache-read van $0,022', waarop $2,00 en $10,00 per miljoen tokens tegenover $0,66 en $1,98 te zien zijn, met het OrcaRouter-logo gecompositeerd in de rechteronderhoek.
Guides & Insights

Claude Sonnet 5.5 vs DeepSeek V4 Pro: 20 indexpunten, en een cacheread voor $0,022

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Leg de twee tariefkaarten naast elkaar en de vergelijking lijkt al beslecht voordat ze begint. Claude Sonnet 5.5, algemeen beschikbaar sinds 28 september 2026, kost $2,00 per miljoen inputtokens en $10,00 per miljoen outputtokens. DeepSeek V4 Pro, uitgebracht op 24 april 2026, kost $0,66 en $1,98. Output is de regel die ertoe doet bij agentwerk, en $10,00 tegenover $1,98 is een verschil van vijf tegen één — een dollar tegen twintig cent per honderdduizend tokens. Kijk dan naar de capaciteitskant, waar Artificial Analysis Claude Sonnet 5.5 op 56 zet op Intelligence Index v4.3 en DeepSeek V4 Pro op 36, een verschil van twintig punten op dezelfde testopstelling. Dat is de hele spanning: het model van Deep​Seek zit op een vijfde van de outputprijs en ongeveer twee derde van de gemeten capaciteit, en die twee feiten leiden niet tot één enkele aanbeveling zonder te weten wat jouw workload daadwerkelijk met een token doet.

Wat elk model precies is

Naamgeving is de eerste plek waar deze vergelijking misgaat, dus los het hier op. DeepSeek V4 Pro zoals wij die vermelden is deepseek/deepseek-v4-pro, uitgebracht op 24 april 2026, een model met een context van 1.048.576 tokens, een maximale output van 384.000 tokens en alleen tekstinvoer. Artificial Analysis volgt een snapshot die het DeepSeek V4 Pro 0813 noemt — een build van 13 augustus — en de hieronder aangehaalde cijfers komen uit die rij. De Sonnet-kant is Anthropic's anthropic/claude-sonnet-5.5, tekst-, afbeeldings- en bestandsinvoer, 1M context, 128K maximale output. Als je een leverancierspagina vergelijkt met een evaluatorpagina en de cijfers komen niet overeen, controleer dan het build-achtervoegsel voordat je concludeert dat een van beide onjuist is.

DeepSeek V4 Pro ondersteunt alleen tekstinvoer. Claude Sonnet 5.5 accepteert ook afbeeldingen en bestanden. Dat is het eerste structurele verschil, en het is geen marginaal verschil: elke pipeline die schermafbeeldingen, pdf's of diagrammen verwerkt, kan de een niet zomaar door de ander vervangen, omdat een van de twee niet kan zien.

De tariefkaart, regel voor regel

• Invoer — $0,66 per miljoen voor DeepSeek V4 Pro tegen $2,00 voor Claude Sonnet 5.5; DeepSeek is 67% goedkoper

• Output — $1,98 per miljoen tegenover $10,00; DeepSeek is 80% goedkoper, het grootste afzonderlijke verschil in deze vergelijking

• Cache-lezen — $0,022 per miljoen tegenover $0,20; DeepSeek is 89% goedkoper op de regel die lange agentloops domineert

• Cache-schrijfactie — $2,50 per miljoen voor het venster van vijf minuten op Claude Sonnet 5.5; de catalogusregel van DeepSeek V4 Pro bevat geen aparte regel voor cache-schrijfacties

• Context — 1.048.576 tokens tegenover 1.000.000; DeepSeek is marginaal langer, een onderscheid zonder praktische gevolgen

• Maximale output — 384.000 tokens tegenover 128.000; DeepSeek wint met een factor drie op het plafond dat bulkgeneratie beperkt

• Invoermodaliteit — alleen tekst tegenover tekst, afbeelding en bestand

• Reasoning — beide gebruiken configureerbare reasoning-inspanning in plaats van een vast denkbudget, dus de diepgang is bij elk een requestparameter.

Er zit aan de DeepSeek-kant een planningsdetail dat een vergelijking van tariefkaarten verbergt. Onze catalogusregel bevat een tijdgebonden prijsvenster: tussen 01:00 en 04:00 UTC, en nogmaals tussen 06:00 en 10:00 UTC, worden de vermelde tarieven verdubbeld. In die uren kost V4 Pro $1,32 voor input en $3,96 voor output — nog steeds goedkoper dan Claude Sonnet 5.5, met respectievelijk 34% en 60%, maar niet meer met de marges die de kopcijfers suggereren. Batchworkloads die kunnen worden ingepland, zijn het waard om te worden ingepland, en workloads die dat niet kunnen, kun je beter tegen het piektarief prijzen dan tegen het gemiddelde. Dit is ook zo'n ding dat alleen opvalt als je de catalogus leest in plaats van de marketingpagina, wat het argument is om elk kandidaatmodel achter één endpoint te zetten in plaats van achter drie leveranciersaccounts.

Twee capaciteitsgetallen, waarvan één niet onafhankelijk

Bij externe partijen is de rangschikking ondubbelzinnig. Artificial Analysis kent Claude Sonnet 5.5 een score van 56 toe en DeepSeek V4 Pro een score van 36 op Intelligence Index v4.3, beide in een redeneerconfiguratie met maximale inspanning. Dezelfde beoordelaar plaatst Claude Opus 5 op 51 en Gemini 3.1 Pro Preview op 30, dus de 36 van V4 Pro plaatst het onder het vorige Anthropic-vlaggenschip en boven Google's Pro-tier — een respectabele positie voor een model dat een vijfde van de prijs kost, en ver van de top.

De omkering van de kosten per taak doet zich hier ook voor, en in deze confrontatie gaat die de andere kant op dan bij de vorige. DeepSeek V4 Pro kost $0,67 om op de indexsuite te evalueren. Claude Sonnet 5.5 kost $7,60. Dat is geen typfout en geen afrondingsartefact: het nieuwere Anthropic-model produceert 410 miljoen tokens over de hele suite, tegenover een mediaan van 88 miljoen, en de breedsprakigheid van het DeepSeek-model komt niet in de buurt van het dichten van een prijsverschil van die omvang. Bij onbeperkte taken met open einde is het goedkopere model in de praktijk een orde van grootte goedkoper, niet alleen op de tariefkaart.

De leverancierscijfers moeten zorgvuldiger worden behandeld. DeepSeek publiceert een τ²-Bench-score van 96,2 voor V4 Pro — een sterk cijfer, maar het is door de leverancier gerapporteerd en τ²-Bench is sindsdien verwijderd uit de Artificial Analysis-index in de v4.3-revisie. Het is dus een cijfer dat niet onafhankelijk op dezelfde schaal kan worden geplaatst als welk cijfer van Anthropic dan ook. De eigen lanceringstabel van Anthropic voor Claude Sonnet 5.5 bevat zijn eigen voorbehouden, waaronder een voetnoot die zegt dat de instelling Max effort lager scoort dan Xhigh op FrontierCode, en een opmerking dat twee van de benchmarks zijn uitgevoerd op een pre-release-implementatie met een bug in de gestructureerde outputs. Zet de tabellen van de twee leveranciers naast elkaar en je hebt twee marketingdocumenten, geen ranglijst. De enige cijfers in dit artikel die op één as thuishoren, zijn de twee indexscores en de twee kosten per taak, omdat één evaluator alle vier heeft geproduceerd.

Waarom het outputplafond belangrijker is dan de prijs

Het getal in deze vergelijking dat de minste aandacht krijgt, is het getal dat de architectuur verandert: 384.000 outputtokens tegenover 128.000.

Het uitvoerplafond is geen comfortfunctie. Het bepaalt of een taak één aanroep is of een keten. Het genereren van een groot bronbestand, het uitschrijven van een compleet document, het produceren van een lang gestructureerd rapport, het vertalen van een boekhoofdstuk — alles waarbij het artefact groter is dan 128.000 tokens — kan niet in één aanroep naar Claude Sonnet 5.5 worden gedaan, en moet worden opgedeeld in een reeks waarin de toestand tussen aanroepen wordt meegedragen. Opdelen betekent meer invoertokens die bij elke stap opnieuw worden verzonden, meer cachelezingen, meer orchestratiecode, en een nieuwe klasse van fouten waarbij de naden tussen chunks de plekken zijn waar de fouten leven. Een model dat vijf keer zo duur is en een hele orchestratielaag overbodig maakt, kan goedkoper zijn in engineeringuren voordat het goedkoper is in tokens, en in de andere richting is een taak die in één aanroep past een taak waarbij het plafond helemaal niet in de berekening terechtkomt.

Dus de plafondkwestie komt vóór de prijskwestie. Als je langste artefact onder 128.000 tokens past, negeer deze sectie en vergelijk op kosten per voltooide taak. Als dat niet het geval is, bereken dan de kosten van de pipeline die je zou moeten bouwen, niet alleen van de tokens.

Overstapkosten en het terugvalprobleem

De migratie in beide richtingen gaat vooral om prompting, niet om code, met één uitzondering waarvoor je budget moet reserveren.

Beide modellen configureren hun redeneervermogen via een inspanning-parameter, maar het zijn parameters van verschillende leveranciers, met verschillende niveaus en verschillende standaardwaarden. Een prompt die is afgestemd op een Anthropic-instelling met hoge inspanning, wordt niet als een een-op-een vervanging overgezet naar een inspanningsinstelling van DeepSeek; hij wordt overgezet als een hermeting. Reken erop dat je per werklast een dag kwijt bent aan het opnieuw vaststellen van de kwaliteit voordat je een kostenprognose vertrouwt, aan beide kanten van de overstap.

De uitzondering is vision. Claude Sonnet 5.5 leest afbeeldingen en bestanden; DeepSeek V4 Pro leest alleen tekst. Elk onderdeel van je pipeline dat een model een screenshot, een gescande pagina of een gerenderde grafiek voorlegt, heeft geen DeepSeek-equivalent, dus een volledige migratie is alleen beschikbaar voor het tekstvormige deel van je verkeer. Dat is een scheidslijn die je vroeg moet trekken, want meestal betekent het dat het antwoord niet één model is, maar een splitsing.

Beide zijn vandaag routeerbaar op OrcaRouter — deepseek/deepseek-v4-pro en anthropic/claude-sonnet-5 zijn beide live catalogusvermeldingen, geprijsd tegen de lijstprijs van de provider met 0% opslag, op één credential. Dat maakt vooral uit in precies dit soort vergelijkingen, waar de beslissende factor niet is welk model in abstracto beter is, maar naar welk model een bepaald verzoek moet gaan. Een splitsing die tekstueel bulkwerk naar het goedkope model stuurt en visiewerk naar het dure, is een routeringsregel, en die is veel gemakkelijker uit te drukken wanneer beide endpoints op dezelfde sleutel en hetzelfde failoverbeleid reageren. Claude Sonnet 5.5 is zelf nog geen route op ons platform, dus de huidige versie van die splitsing koppelt het Anthropic-model aan DeepSeek V4 Pro in plaats van het te vervangen.

De beslissing, als regel geformuleerd

Stuur het naar Claude Sonnet 5.5 wanneer de taak moet kunnen zien — afbeeldingen, PDF's, screenshots, gerenderde uitvoer — wanneer het artefact langer is dan een pagina proza en je een frontier-model wilt laten schrijven, of wanneer een indexverschil van twintig punten het verschil is tussen een concept dat een mens moet herschrijven en een dat diegene kan opleveren.

Stuur het naar DeepSeek V4 Pro wanneer de werkbelasting tekst in, tekst uit is, met grote volumes, en tolerant ten aanzien van een lager plafond voor redeneerkwaliteit: classificatie, extractie, samenvatting, bulkherschrijving, codetransformatie met een duidelijke specificatie, en alles waarvoor je anders tien dollar per miljoen outputtokens zou betalen om woorden te verplaatsen. De korting van 89% op cache-leesbewerkingen maakt long-context agent-loops op dit model structureel goedkoop op een manier waarop niets anders in de vergelijking dat is.

Het eerlijke oordeel: dit is geen capaciteitenwedloop die DeepSeek verliest, het is een beslissing over de toewijzing van middelen die de meeste teams verkeerd nemen door capaciteiten te kopen die ze niet gebruiken. Als je verkeer tekst is en je kwaliteitslat 'goed genoeg om te beoordelen' is in plaats van 'goed genoeg om ongelezen te verzenden', dan is V4 Pro tegen 20% van de outputprijs en $0,022 voor cache-reads de juiste standaard, en de twintig indexpunten zijn een belasting die je op dit moment vrijwillig betaalt.

A two-column scoreboard for Claude Sonnet 5.5 and DeepSeek V4 Pro across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50 for the five-minute window, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column DeepSeek V4 Pro: input $0.66, output $1.98, cache read $0.022, no separate cache-write line, 1,048,576-token context with 384K max output, input modality text only, AA Intelligence Index v4.3 score 36, $0.67 per task on the index run. The card heading reads "Twenty index points against an 89% cache-read discount", and a footer line notes that a timed-pricing window multiplies the DeepSeek rates by two between 01:00-04:00 and 06:00-10:00 UTC.Screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro), showing the model header, the 1,048,576-token context window with 384,000 maximum output tokens, text-only input, the Tools, JSON and Reasoning capability tags with no Vision tag, a 1.86-second p50 time to first token, a "Public benchmarks by DeepSeek · 2026-04-24" line, and the $0.66 input and $1.98 output prices per million tokens.Screenshot of Artificial Analysis's model page for "DeepSeek V4 Pro 0813 (Reasoning, Max Effort)", marked an open-weights model and released August 2026, showing In $1.32 and Out $3.96 with a 97% cache discount, the Intelligence Index score of 36, an output rate of 96.6 tokens per second, the $0.67 average cost per task, and 160M output tokens described as somewhat verbose against a median of 140M.

Vergeleken in dit artikel3

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt