Een gegenereerde hero-kaart met de titel 'NV-Reason-CT vs DeepSeek V4 Pro' en de ondertitel 'De kosten van het lezen van een scan, en wanneer de batch moet worden gedraaid'. Twee tegenover elkaar staande kaarten worden gescheiden door een paar blauwe pijlen: de linkerkaart heeft het label 'NV-Reason-CT' met een lichaamsscanpictogram en 'één CT-volume - 13.824 visuele tokens - geen gepubliceerde doorvoer'; de rechterkaart heeft het label 'DeepSeek V4 Pro' met een chippictogram en '1,6T totaal / 49B actieve MoE - 1M context - $0,66 / $1,98 per M, verdubbeld in twee UTC-vensters'. Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Guides & Insights

NV-Reason-CT vs DeepSeek V4 Pro: De kosten van het lezen van een scan, en wanneer je de batch moet draaien

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Hier is een operationeel feit dat meer invloed heeft op budgetten voor klinische pijplijnen dan welke benchmark dan ook: DeepSeek V4 Pro kost $0,66 per miljoen inputtokens en $1,98 per miljoen outputtokens, en die tarieven verdubbelen tijdens twee vensters per dag, 01:00 tot 04:00 en 06:00 tot 10:00 UTC. Batchwerk dat buiten die vensters draait, kost de helft van wat het binnen die vensters kost. Ondertussen NV-Reason-CT, NVIDIA's 3D-CT-redeneermodel met 4,69 miljard parameters, heeft helemaal geen tariefkaart — het is een set gewichten die je downloadt en draait, zonder gepubliceerd doorvoercijfer voor één enkele studie van 13.824 tokens. Een van deze modellen plan je in. Het andere moet je meten voordat je er een budget voor kunt opstellen.

Die asymmetrie is de nuttige ingang voor deze vergelijking, omdat de twee modellen zich aan tegenovergestelde uiteinden van de pijplijn bevinden en financieel op tegenovergestelde manieren falen. NV-Reason-CT is een instrument met vaste kosten: de marginale studie is bijna gratis zodra de hardware is gekocht, maar de hardwarebeslissing is groot en de latentie per studie is niet gedocumenteerd. DeepSeek V4 Pro is een motor met variabele kosten: niets om te kopen, alles gemeten, en de meter heeft een schema dat je van de kalender kunt aflezen.

Wat elk ervan is, in één regel per stuk

• Taak — NV-Reason-CT leest een CT-volume van de borstkas of de buik en genereert gestructureerde bevindingen; DeepSeek V4 Pro leest en schrijft tekst

• Architectuur — een 3D-vision transformer genaamd Primus, geïnitialiseerd vanuit COLIPRI, met een Qwen3.5-4B-taalbackbone en 3D multi-axis rotary position embedding, met 4,69 miljard parameters waarvan 4,35 miljard actief; tegen een mixture of experts met 1,6 biljoen parameters en 49 miljard actief per token

• Invoer — eenkanaals NIfTI-volumes (.nii, .nii.gz) in Hounsfield-eenheden, LPS-georiënteerd, geresampled naar 2 mm isotroop en bijgesneden tot de anatomie; tegenover tekst

• Context — één enkel volume wordt 13.824 visuele tokens in een raster van 24 x 24 x 24, zonder ruimtelijke downsampling en zonder samenvoeglaag; tegenover 1.048.576 tokens in en 384.000 uit

• Ondersteunde anatomieën — borst en buik, en niets anders; tegen alles wat tekst kan beschrijven

• Prijs — geen lijstprijs, self-hosted, geen gepubliceerde doorvoer per studie; tegen $0,66 / $1,98 per miljoen tokens, een verdubbeling in de twee hierboven genoemde UTC-vensters, met cache-reads tegen $0,022

• Gemeten latentie — niet gepubliceerd; tegenover een mediane tijd tot het eerste token van 3.483 milliseconden bij 96,01 uitvoertokens per seconde, met een foutpercentage van 0,75%

Twee rijen daarin zijn elk meer dan een regel waard. De contextrij is de voor de hand liggende — een miljoen tokens tegenover 13.824 — maar de eenheden zijn niet vergelijkbaar en het is een fout om ze in welke richting dan ook als een capaciteitskloof te lezen. 13.824 tokens is wat het kost om één CT-studie getrouw weer te geven. Een miljoen tokens is hoeveel omringende tekst je kunt vasthouden. Het eerste getal is een uitspraak over resolutie; het tweede is een uitspraak over geheugen.

De latentie-rij is degene die wordt overgeslagen. De 3,48 seconden mediaan tot het eerste token en 96 tokens per seconde van DeepSeek V4 Pro zijn gemeten, gepubliceerde cijfers, en ze laten je een tekstklus op papier inschatten. Het ontbreken van enig equivalent cijfer voor NV-Reason-CT is geen kritiek op het model; het is kritiek op de pijplijn? Een model van 4,69B over 13.824 visuele tokens is geen kleine berekening, en totdat je het op je eigen hardware hebt...

De twee benchmarkrecords lezen zonder jezelf voor de gek te houden

De staat van dienst van DeepSeek V4 Pro is een mix van onafhankelijke metingen en rapportage door de leverancier, en die mix is leerzaam omdat er één getal in zit dat alarmerend lijkt en dat niet is.

• Artificial Analysis Intelligence Index — 36, wat zich op het 72,4e percentiel van gemeten modellen bevindt

• GPQA Diamond — 92,8, wat bijna aan de top van het vakgebied staat

• Humanity's Last Exam — 41, en 41 op MMLU-Pro, 62,51 op de wiskunde-index

• τ²-Bench — 96,20, met IFBench op 76,46 en tau_banking op 39,59

• Recall bij lange context — 80.33

• SciCode en Terminal-Bench — 51 en 78,65 op de tweede versie van Terminal-Bench

Een samengestelde index van 36 naast een GPQA Diamond van 92,8 klinkt als een tegenstrijdigheid, tot je beseft wat een index is. Het is een aggregatie over vele evaluaties, en een model dat in een handvol daarvan uitblinkt en in andere slechts toereikend is, eindigt in de middenmoot op de som terwijl het individuele ranglijsten aanvoert. Wie de 36 alleen aanhaalt om te betogen dat DeepSeek V4 Pro middenklasse is, citeert een gemiddelde alsof het een maximum is. Wie de 92,8 alleen aanhaalt om te betogen dat het het veld aanvoert, citeert een maximum alsof het een gemiddelde is. Beide cijfers zijn afkomstig van Artificial Analysis, en beide zijn waar.

Het record van NV-Reason-CT bevat geen dergelijke mix, en dat is nu juist het echte probleem ermee. De CT-RATE-cijfers — 0,614 F1 en 0,871 AUROC over achttien labels, met een vaste uniforme drempel en een directe ja/nee-prompt zonder classificatiehoofd en zonder taakspecifieke aanpassing — komen uit NVIDIA's eigen paper en nergens anders vandaan. De vergelijkingsset in die paper (VoxelFM op 0,581, Pillar-0 op 0,544, ClinFusion-8B op 0,442, CT-CLIP op 0,398, Merlin op 0,358, MedGemma 1.5 op 0,303) bestaat volledig uit andere beeldvormingsmodellen. Geen enkel algemeen tekstmodel komt erin voor, en geen enkele derde partij heeft ook maar een van de cijfers gereproduceerd.

A generated scoreboard titled 'Two records, two kinds of provenance' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; reproduced, no; throughput, not published; price, self-hosted, no rate card. The right column, headed 'DeepSeek V4 Pro', lists five rows: AA Intelligence 36, GPQA Diamond 92.8, tau-squared Bench 96.20; provenance, Artificial Analysis plus vendor; reproduced, yes, independently measured; throughput, 3,483 ms to first token at 96 tokens per second; price, $0.66 and $1.98 per million tokens. A footer reads 'An index of 36 beside a benchmark of 92.8 is an average beside a maximum, not a contradiction.'

De planningsvraag, helemaal uitgewerkt

De tijdsgebonden prijsstelling van DeepSeek V4 Pro is het meest operationeel bruikbare aspect van beide modellen, dus verdient die een concrete uiteenzetting.

Een realistische tekstgerichte werklast voor een CT-programma is niet glamoureus. Het is het extraheren van gestructureerde velden uit een corpus van historische rapporten zodat je labels hebt om te trainen, het op schaal omzetten van DICOM-directorybomen naar NIfTI, het schrijven en herschrijven van de evaluatieharness, het normaliseren van eenheden en terminologie over vier datasets, en het samenvatten van cohorten. Noem het honderd miljoen inputtokens en tien miljoen outputtokens voor een middelgroot programma, wat een bewust rond getal is dat staat voor "veel tekstwerk".

• Binnen een verdubbeld venster — $1,32 en $3,96 per miljoen, dus $132 plus $39,60 bij die volumes

• Buiten die vensters — $0,66 en $1,98 per miljoen, dus $66 plus $19,80

• Het verschil — ongeveer $86, ofwel 49% van de dalurenfactuur, voor het verplaatsen van een taak die van nature in batches kan worden uitgevoerd

• Cache-leesbewerkingen — $0,022 per miljoen, wat een zestigste van het invoertarief is, dus elke promptprefix die je in het corpus hergebruikt, is bijna gratis.

Dat is geen afrondingsfout, en het is beschikbaar omdat het werk asynchroon is. Het extraheren van rapporten hoeft niet om 14:00 uur te gebeuren. Niets aan een DICOM-conversietaak geeft erom hoe laat het is. De prijsstructuur is een directe uitnodiging om te plannen, en een pipeline die dat negeert, betaalt een premie van 49% voor het voorrecht om te draaien wanneer het maar uitkomt. Cache-leesbewerkingen zijn om dezelfde reden belangrijk: een gedeelde systeemprompt of een vast extractieschema, hergebruikt over duizenden rapporten, zit op een zestigste van het invoertarief.

NV-Reason-CT heeft geen vergelijkbare hendel, want het heeft geen meter. De kosten van het lezen van een scan zijn wat je GPU per uur kost, gedeeld door het aantal scans per uur dat je erdoorheen kunt krijgen, en dat tweede getal is het getal dat niemand heeft gepubliceerd. Als één enkel onderzoek twee seconden duurt, verwerkt één enkele L40S een groot programma met gemak. Als het twintig seconden duurt, verandert de hardware-rekenkunde volledig. NVIDIA heeft getest op H100 en L40S, wat je de klasse van de kaart vertelt, niet de doorvoersnelheid.

De valkuil van de aanname dat ze vervangen kunnen worden

De fout die deze match-up uitlokt, is subtieler dan de gebruikelijke categoriefout, omdat er een variant van bestaat die op een dia redelijk overkomt.

DeepSeek V4 Pro heeft 1.048.576 tokens en genereert er maximaal 384.000. Een CT-volume is, volgens de berekening van het model dat het correct leest, slechts 13.824 tokens. Een tekstmodel met een venster van een miljoen tokens heeft bij dat tokenaantal dus ruimte voor zo'n zeventig CT-onderzoeken. De rekensom klopt, maar de conclusie — dat je CT-gegevens aan een tekstmodel zou kunnen voeren en je de beeldvormingsinfrastructuur zou kunnen besparen — is onjuist, en wel om de reden waarom het getal 13.824 überhaupt bestaat.

Dat getal is geen gecomprimeerde samenvatting van een scan. Het is de scan zelf, met een isotrope resolutie van 2 mm over een kubus van 384 millimeter, opgedeeld in patches van 8 x 8 x 8, aan het taalmodel gegeven zonder ruimtelijke downsampling en zonder samenvoeglaag. Het aantal tokens is juist hoog omdat er niets is weggegooid: de afstand tussen de plakken waardoor een nodule meetbaar wordt, de dichtheidswaarden waardoor een textuur een drempel is in plaats van een bijvoeglijk naamwoord. Een tekstmodel kan die tokens niet als volumes opnemen, net zomin als een document dat kan. Het heeft het budget. Het heeft de interface niet.

De eigen interne vergelijking in het artikel kwantificeert het verschil. MedGemma 1.5, met maximaal 85 axiale coupes — het beste wat een tweedimensionale of slice-gestapelde front-end redelijkerwijs kan doen — scoort 0,303 F1 tegenover 0,614 voor het native volumetrische model. Dat gat is de waarde van de driedimensionale encoder, en geen enkel contextvenster, hoe groot ook, dicht die kloof.

De omgekeerde substitutie faalt om duidelijkere redenen. NV-Reason-CT ondersteunt borst en abdomen, neemt een NIfTI-bestand in plaats van een prompt, heeft geen toolgebruik, en de modelkaart beperkt het tot onderzoek en onderwijs en stelt dat het geen medisch hulpmiddel is en dat uitvoer onjuist kan zijn. Het kan geen velden uit een rapport extraheren, en het kan het script dat je corpus opbouwt niet schrijven.

A generated scoreboard titled 'Where the money actually goes' listing five rows for a worked example of 100 million input and 10 million output tokens on DeepSeek V4 Pro. Row one: inside the doubled UTC windows, $132 input and $39.60 output. Row two: outside those windows, $66 input and $19.80 output. Row three: difference, about $86, or 49% of the off-peak bill. Row four: cached reads, $0.022 per million, a sixtieth of the input rate. Row five: the CT side, self-hosted with no published per-study throughput, so the cost per scan has to be measured. A footer reads 'Pricing per the provider rate card; the CT column has no rate card to quote.'

Waar we passen, en waar we bewust niet passen

DeepSeek V4 Pro wordt via OrcaRouter aangeboden als deepseek/deepseek-v4-pro, tegen het lijsttarief van de provider met nul markup, binnen één enkele API die meer dan 200 modellen omvat. De doorrekening is belangrijker dan gewoonlijk voor een model met een prijs die afhangt van het tijdstip van de dag: wanneer een leverancier een tarief of een tijdvenster wijzigt, verandert het tarief aan onze kant dezelfde dag, omdat er geen markuplaag tussen zit die een oude waarde vasthoudt. Automatische failover dekt het geval waarin een provider halverwege een batch degradeert, wat voor een lange onbeheerde extractietaak de storingsmodus is die je daadwerkelijk een nacht kost, en de routing-DSL laat je individuele verzoeken naar het model sturen dat ze zou moeten afhandelen in plaats van alles via één endpoint te laten lopen.

NV-Reason-CT staat niet op ons platform. Geen enkel NVIDIA-model staat erop. De CT-kant van deze architectuur is je eigen hardware met je eigen gedownloade gewichten, en we gaan geen zin schrijven die een lezer de indruk geeft dat het anders is. Aangezien de input patiëntafgeleide volumetrische data betreft en de licentie OpenMDW-1.1 is, zonder enige gekoppelde gehoste service, is lokale uitvoering hoe dan ook waar dat model thuishoort.

Wat de combinatie je eigenlijk vertelt

De twee modellen concurreren niet met elkaar, en het punt van ze te vergelijken is dat ze op verschillende manieren falen. NV-Reason-CT geeft je een capaciteit die niets anders vrij beschikbaar biedt — native driedimensionaal CT-redeneren op de volledige resolutie van de studie — en vraagt je een niet-begrote kostenpost per studie, een niet-gepubliceerde doorvoer en een licentie die klinische inzet verbiedt, te accepteren. DeepSeek V4 Pro geeft je een engine die per gebruik wordt afgerekend, met een gepubliceerde latentie, een gepubliceerd foutpercentage, onafhankelijke metingen en een prijs die je kunt halveren door naar de klok te kijken, en het kan helemaal geen scan zien.

Als je het ding bouwt in plaats van het te kopen, is de vorm die contact overleeft de saaie. Draai de CT-read lokaal, begroot die door te meten in plaats van door te quoten, en laat alles wat tekstueel eromheen zit samenvallen met het off-peakvenster. Het enige schema dat niemand zou moeten kopiëren, is het schema dat honderd miljoen tokens aan extractie om 02:00 UTC draait omdat de batch toen toevallig klaar was.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro, showing the identifier deepseek/deepseek-v4-pro, the description of it as a large mixture-of-experts model with a one-million-token context window, and a side panel listing a 1,048,576-token context window with up to 384,000 output tokens and text input with text output. A stat strip reads $0.66 per million input tokens, $1.98 per million output tokens, a 3.5-second p50 time to first token, and traffic measured in the billions of tokens over seven days.