Ett genererat hero-kort med titeln 'NV-Reason-CT vs DeepSeek V4 Pro' och undertiteln 'Kostnaden för att läsa en skanning, och när man ska köra batchen'. Två motstående kort separeras av ett par blå pilar: det vänstra kortet är märkt 'NV-Reason-CT' med en kroppsskanningsikon och 'en CT-volym - 13 824 visuella tokens - ingen publicerad genomströmning'; det högra kortet är märkt 'DeepSeek V4 Pro' med en chipikon och '1,6T totalt / 49B aktiva MoE - 1M kontext - $0,66 / $1,98 per M, fördubblat i två UTC-fönster'. OrcaRouter-logotypen är sammansatt i det nedre högra hörnet.
Guides & Insights

NV-Reason-CT vs DeepSeek V4 Pro: Kostnaden för att läsa en skanning, och när man ska köra batchen

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Här är ett operativt faktum som formar fler budgetar för kliniska pipelines än något benchmark: DeepSeek V4 Pro kostar 0,66 dollar per miljon indatatoken och 1,98 dollar per miljon utdatatoken, och dessa priser fördubblas under två fönster varje dag, 01:00–04:00 och 06:00–10:00 UTC. Batchjobb som körs utanför dessa fönster kostar hälften så mycket som jobb inom dem. Samtidigt NV-Reason-CT, NVIDIAs 3D-CT-resonerare med 4,69 miljarder parametrar, har ingen prislista alls – den är en uppsättning vikter som du laddar ner och kör, utan någon publicerad genomströmningssiffra för en enskild studie på 13 824 token. En av dessa modeller schemalägger du. Den andra måste du mäta innan du kan budgetera för den.

Den asymmetrin är det användbara sättet in i den här jämförelsen, eftersom de två modellerna befinner sig i motsatta ändar av pipelinen och misslyckas på motsatta sätt ekonomiskt. NV-Reason-CT är ett instrument med fast kostnad: den marginella studien är nästan gratis när hårdvaran väl är köpt, men hårdvarubelutet är stort och latensen per studie är odokumenterad. DeepSeek V4 Pro är en motor med rörlig kostnad: inget att köpa, allt mäts, och mätaren har ett schema som du kan läsa av i kalendern.

Vad var och en är, på en rad vardera

• Jobb — NV-Reason-CT läser en CT-volym av bröstkorg eller buk och genererar strukturerade fynd; DeepSeek V4 Pro läser och skriver text

• Arkitektur — en 3D-visionstransformator som kallas Primus, initierad från COLIPRI, med en språklig ryggrad av Qwen3.5-4B och 3D-fleraxlig roterande positionsinbäddning, vid 4,69 miljarder parametrar, varav 4,35 miljarder är aktiva; mot en blandning av experter med 1,6 biljoner parametrar och 49 miljarder aktiva per token

• Indata — enkanaliga NIfTI-volymer (.nii, .nii.gz) i Hounsfieldenheter, LPS-orienterade, omsamplade till 2 mm isotropisk och beskurna till anatomi; mot text

• Kontext — en enda volym blir 13 824 visuella tokens i ett 24 x 24 x 24-rutnät, utan spatial nedsampling och utan sammanslagningslager; mot 1 048 576 tokens in och 384 000 ut

• Anatomier som stöds — bröstkorg och buk, och inget annat; mot allt som text kan beskriva

• Pris — inget listpris, självhostad, ingen publicerad genomströmning per studie; mot $0.66 / $1.98 per miljon tokens, fördubblas i de två UTC-fönster som nämns ovan, med cachereads till $0.022

• Uppmätt latens — inte publicerad; mot en mediantid till första token på 3 483 millisekunder vid 96,01 utdatatokens per sekund, med en felfrekvens på 0,75 %

Två rader där är värda mer än en rad var. Kontextraden är den uppenbara – en miljon tokens mot 13 824 – men enheterna är inte jämförbara, och det är ett misstag att tolka dem som ett kapacitetsgap i endera riktningen. 13 824 tokens är vad det kostar att representera en CT-undersökning troget. En miljon tokens är hur mycket omgivande text du kan hålla. Den första siffran säger något om upplösning; den andra säger något om minne.

Latensraden är den som hoppas över. DeepSeek V4 Pros median på 3,48 sekunder till första token och 96 token per sekund är uppmätta, publicerade siffror, och de låter dig dimensionera ett textjobb på papper. Att NV-Reason-CT saknar en motsvarande siffra är inte en kritik av modellen; det är anledningen till att en CT-pipeline inte kan kostnadsberäknas innan någon kör den. En modell på 4,69B över 13 824 visuella token är inte en liten beräkning, och tills du har mätt tiden för den på din egen hårdvara gissar du.

Att läsa de två benchmarkposterna utan att lura dig själv

DeepSeek V4 Pros resultat är en blandning av oberoende mätning och leverantörsrapportering, och blandningen är lärorik eftersom den innehåller ett tal som ser alarmerande ut och inte är det.

• Artificial Analysis Intelligence Index — 36, vilket ligger på 72,4:e percentilen av mätta modeller

• GPQA Diamond — 92,8, vilket ligger i toppen av fältet

• Mänsklighetens sista prov — 41, och 41 på MMLU-Pro, 62,51 på matematikindexet

• τ²-Bench — 96,20, med IFBench på 76,46 och tau_banking på 39,59

• Återkallning i lång kontext — 80,33

• SciCode och Terminal-Bench — 51 och 78,65 på den andra versionen av Terminal-Bench

Ett sammansatt index på 36 bredvid en GPQA Diamond på 92,8 låter som en motsägelse tills man inser vad ett index är. Det är ett aggregat över många utvärderingar, och en modell som är utmärkt på en handfull av dem och bara adekvat på andra hamnar i mittenfältet på summan samtidigt som den toppar enskilda resultattavlor. Den som enbart citerar 36:an för att argumentera för att DeepSeek V4 Pro är medelmåttig citerar ett genomsnitt som om det vore ett maximum. Den som enbart citerar 92,8 för att argumentera för att den leder fältet citerar ett maximum som om det vore ett genomsnitt. Båda siffrorna kommer från Artificial Analysis, och båda är sanna.

NV-Reason-CT:s resultat har ingen sådan blandning, och det är det ärliga problemet med det. Dess CT-RATE-siffror — 0,614 F1 och 0,871 AUROC över arton etiketter, med en fast enhetlig tröskel och en direkt ja/nej-prompt utan klassificeringshuvud och utan uppgiftsspecifik anpassning — kommer från NVIDIAs egen artikel och inte från någon annanstans. Jämförelseuppsättningen i den artikeln (VoxelFM vid 0,581, Pillar-0 vid 0,544, ClinFusion-8B vid 0,442, CT-CLIP vid 0,398, Merlin vid 0,358, MedGemma 1.5 vid 0,303) består helt och hållet av andra bildmodeller. Inte en enda generell textmodell förekommer i den, och ingen tredje part har reproducerat någon av siffrorna.

A generated scoreboard titled 'Two records, two kinds of provenance' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; reproduced, no; throughput, not published; price, self-hosted, no rate card. The right column, headed 'DeepSeek V4 Pro', lists five rows: AA Intelligence 36, GPQA Diamond 92.8, tau-squared Bench 96.20; provenance, Artificial Analysis plus vendor; reproduced, yes, independently measured; throughput, 3,483 ms to first token at 96 tokens per second; price, $0.66 and $1.98 per million tokens. A footer reads 'An index of 36 beside a benchmark of 92.8 is an average beside a maximum, not a contradiction.'

Schemaläggningsfrågan, genomarbetad

Tidsstyrd prissättning för DeepSeek V4 Pro är det mest operativt användbara hos någon av modellerna, så den förtjänar en konkret genomgång.

En realistisk textrelaterad arbetsbelastning för ett CT-program är inte glamorös. Den består i att extrahera strukturerade fält från en korpus av historiska rapporter så att du har etiketter att träna mot, konvertera DICOM-katalogträd till NIfTI i stor skala, skriva och skriva om utvärderingsramverket, normalisera enheter och terminologi över fyra datamängder samt sammanfatta kohorter. Säg hundra miljoner indatatokens och tio miljoner utdatatokens för ett medelstort program, vilket är en avsiktligt rund siffra som står för ”en massa textarbete”.

• Inom ett fördubblat fönster — 1,32 $ och 3,96 $ per miljon, alltså 132 $ plus 39,60 $ vid dessa volymer

• Utanför dessa fönster – 0,66 $ och 1,98 $ per miljon, alltså 66 $ plus 19,80 $

• Skillnaden — ungefär 86 dollar, eller 49 % av lågtrafikräkningen, för att flytta ett jobb som till sin natur kan batchas

• Cachade läsningar — $0,022 per miljon, vilket är en sextiondel av priset för indata, så alla promptprefix du återanvänder i korpusen är nästan gratis

Det är inte ett avrundningsfel, och det är tillgängligt eftersom arbetet är asynkront. Rapportextrahering behöver inte ske kl. 14:00. Inget i ett DICOM-konverteringsjobb bryr sig om vilken tid det är. Prissättningsstrukturen är en direkt inbjudan att schemalägga, och en pipeline som ignorerar den betalar en premie på 49 % för privilegiet att köra när den känner för det. Cacheläsningar spelar roll av samma anledning: en delad systemprompt eller ett fast extraheringsschema, som återanvänds över tusentals rapporter, ligger på en sextiondel av indatapriset.

NV-Reason-CT har ingen motsvarande spak, eftersom den inte har någon mätare. Kostnaden för att läsa en skanning är vad din GPU kostar per timme delat med hur många skanningar per timme du kan pressa igenom den, och det andra talet är det som ingen har publicerat. Om en enskild studie tar två sekunder klarar en enda L40S ett stort program med marginal. Om den tar tjugo förändras hårdvaruräkningen helt. NVIDIA testade på H100 och L40S, vilket säger dig vilken klass av kort det rör sig om, inte vilken takt.

Fällan i att anta att de kan ersättas

Misstaget som denna matchning inbjuder till är subtilare än det vanliga kategorimisstaget, eftersom det finns en version av det som ser rimlig ut på en bild.

DeepSeek V4 Pro rymmer 1 048 576 tokens och genererar upp till 384 000. En CT-volym är, enligt den modell som läser den på rätt sätt, bara 13 824 tokens. Så en textmodell med ett fönster på en miljon tokens har plats för drygt sjuttio CT-studier vid det antalet tokens. Aritmetiken är korrekt och slutsatsen – att du skulle kunna mata en textmodell med CT-data och slippa avbildningsinfrastrukturen – är fel, av det skäl som gör att siffran 13 824 över huvud taget finns.

Det numret är inte en komprimerad sammanfattning av en skanning. Det är skanningen, vid 2 mm isotrop upplösning över en 384-millimeterskub, uppdelad i 8 x 8 x 8 patchar, överlämnad till språkmodellen utan rumslig nedsampling och utan sammanslagningslager. Tokenantalet är högt just för att inget kastades bort: skivavståndet som gör en nodul mätbar, densitetsvärdena som gör en textur till ett tröskelvärde snarare än ett adjektiv. En textmodell kan inte ta in dessa tokens som volymer, lika lite som ett dokument kan. Den har budgeten. Den har inte gränssnittet.

Artikelns egen interna jämförelse sätter en siffra på skillnaden. MedGemma 1.5, med upp till 85 axiala snitt — det bästa en tvådimensionell eller snittstaplad front-end rimligen kan åstadkomma — får 0,303 F1 mot 0,614 för den nativa volymetriska modellen. Det gapet är värdet av den tredimensionella encodern, och inget kontextfönster, hur stort det än är, stänger det.

Den omvända substitutionen misslyckas av enklare skäl. NV-Reason-CT stöder bröstkorg och buk, tar en NIfTI-fil i stället för en prompt, saknar verktygsanvändning, och dess modellkort begränsar den till forskning och utbildning samt anger att den inte är en medicinteknisk produkt och att utdata kan vara felaktiga. Den kan inte extrahera fält från en rapport, och den kan inte skriva skriptet som bygger din korpus.

A generated scoreboard titled 'Where the money actually goes' listing five rows for a worked example of 100 million input and 10 million output tokens on DeepSeek V4 Pro. Row one: inside the doubled UTC windows, $132 input and $39.60 output. Row two: outside those windows, $66 input and $19.80 output. Row three: difference, about $86, or 49% of the off-peak bill. Row four: cached reads, $0.022 per million, a sixtieth of the input rate. Row five: the CT side, self-hosted with no published per-study throughput, so the cost per scan has to be measured. A footer reads 'Pricing per the provider rate card; the CT column has no rate card to quote.'

Där vi passar in, och där vi medvetet inte gör det

DeepSeek V4 Pro tillhandahålls via OrcaRouter som deepseek/deepseek-v4-pro, till leverantörens listpris utan påslag, i ett enda API som täcker fler än 200 modeller. Att priset förs vidare oförändrat spelar större roll än vanligt för en modell med tidsberoende pris: när en leverantör ändrar en taxa eller ett tidsfönster ändras priset på vår sida samma dag, eftersom det inte finns något påslagslager emellan som håller kvar en gammal siffra. Automatisk redundansväxling täcker fallet där en leverantör försämras mitt i en batch, vilket för ett långt oövervakat extraheringsjobb är den feltyp som faktiskt kostar dig en natt, och routnings-DSL:en låter dig skicka enskilda förfrågningar till den modell som bör hantera dem i stället för att köra allt via en enda slutpunkt.

NV-Reason-CT finns inte på vår plattform. Ingen NVIDIA-modell finns där. CT-sidan av den här arkitekturen är din egen hårdvara med dina egna nedladdade vikter, och vi kommer inte att skriva en mening som får en läsare att tro något annat. Med tanke på att indata är patienthärledd volymetrisk data och licensen är OpenMDW-1.1 utan någon kopplad värdbaserad tjänst, är lokal exekvering där den modellen hör hemma oavsett.

Vad parkopplingen faktiskt säger dig

De två modellerna konkurrerar inte, och poängen med att jämföra dem är att de misslyckas på olika sätt. NV-Reason-CT ger dig en förmåga som inget annat öppet alternativ erbjuder – inbyggt tredimensionellt CT-resonemang vid undersökningens fulla upplösning – och ber dig acceptera en obudgeterad kostnad per undersökning, en opublicerad genomströmning och en licens som förbjuder klinisk driftsättning. DeepSeek V4 Pro ger dig en motor med mätning, med publicerad latens, publicerad felfrekvens, oberoende mätningar och ett pris du kan halvera genom att titta på en klocka, och den kan inte se en skanning överhuvudtaget.

Om du bygger saken i stället för att köpa den, är formen som överlever kontakt den tråkiga. Kör CT-läsningen lokalt, budgetera den genom att mäta i stället för att citera siffror, och lägg allt textligt runt den på en träff med lågtrafikfönstret. Schemat som ingen bör kopiera är det som kör hundra miljoner tokens av extraktion kl. 02:00 UTC eftersom det var då batchen råkade vara redo.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro, showing the identifier deepseek/deepseek-v4-pro, the description of it as a large mixture-of-experts model with a one-million-token context window, and a side panel listing a 1,048,576-token context window with up to 384,000 output tokens and text input with text output. A stat strip reads $0.66 per million input tokens, $1.98 per million output tokens, a 3.5-second p50 time to first token, and traffic measured in the billions of tokens over seven days.