
NV-Reason-CT vs DeepSeek V4 Pro: Kostnaden för att läsa en skanning, och när man ska köra batchen
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 506 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 183 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Här är ett operativt faktum som formar fler budgetar för kliniska pipelines än något benchmark: DeepSeek V4 Pro kostar 0,66 dollar per miljon indatatoken och 1,98 dollar per miljon utdatatoken, och dessa priser fördubblas under två fönster varje dag, 01:00–04:00 och 06:00–10:00 UTC. Batchjobb som körs utanför dessa fönster kostar hälften så mycket som jobb inom dem. Samtidigt NV-Reason-CT, NVIDIAs 3D-CT-resonerare med 4,69 miljarder parametrar, har ingen prislista alls – den är en uppsättning vikter som du laddar ner och kör, utan någon publicerad genomströmningssiffra för en enskild studie på 13 824 token. En av dessa modeller schemalägger du. Den andra måste du mäta innan du kan budgetera för den.
Den asymmetrin är det användbara sättet in i den här jämförelsen, eftersom de två modellerna befinner sig i motsatta ändar av pipelinen och misslyckas på motsatta sätt ekonomiskt. NV-Reason-CT är ett instrument med fast kostnad: den marginella studien är nästan gratis när hårdvaran väl är köpt, men hårdvarubelutet är stort och latensen per studie är odokumenterad. DeepSeek V4 Pro är en motor med rörlig kostnad: inget att köpa, allt mäts, och mätaren har ett schema som du kan läsa av i kalendern.
Vad var och en är, på en rad vardera
• Jobb — NV-Reason-CT läser en CT-volym av bröstkorg eller buk och genererar strukturerade fynd; DeepSeek V4 Pro läser och skriver text
• Arkitektur — en 3D-visionstransformator som kallas Primus, initierad från COLIPRI, med en språklig ryggrad av Qwen3.5-4B och 3D-fleraxlig roterande positionsinbäddning, vid 4,69 miljarder parametrar, varav 4,35 miljarder är aktiva; mot en blandning av experter med 1,6 biljoner parametrar och 49 miljarder aktiva per token
• Indata — enkanaliga NIfTI-volymer (.nii, .nii.gz) i Hounsfieldenheter, LPS-orienterade, omsamplade till 2 mm isotropisk och beskurna till anatomi; mot text
• Kontext — en enda volym blir 13 824 visuella tokens i ett 24 x 24 x 24-rutnät, utan spatial nedsampling och utan sammanslagningslager; mot 1 048 576 tokens in och 384 000 ut
• Anatomier som stöds — bröstkorg och buk, och inget annat; mot allt som text kan beskriva
• Pris — inget listpris, självhostad, ingen publicerad genomströmning per studie; mot $0.66 / $1.98 per miljon tokens, fördubblas i de två UTC-fönster som nämns ovan, med cachereads till $0.022
• Uppmätt latens — inte publicerad; mot en mediantid till första token på 3 483 millisekunder vid 96,01 utdatatokens per sekund, med en felfrekvens på 0,75 %
Två rader där är värda mer än en rad var. Kontextraden är den uppenbara – en miljon tokens mot 13 824 – men enheterna är inte jämförbara, och det är ett misstag att tolka dem som ett kapacitetsgap i endera riktningen. 13 824 tokens är vad det kostar att representera en CT-undersökning troget. En miljon tokens är hur mycket omgivande text du kan hålla. Den första siffran säger något om upplösning; den andra säger något om minne.
Latensraden är den som hoppas över. DeepSeek V4 Pros median på 3,48 sekunder till första token och 96 token per sekund är uppmätta, publicerade siffror, och de låter dig dimensionera ett textjobb på papper. Att NV-Reason-CT saknar en motsvarande siffra är inte en kritik av modellen; det är anledningen till att en CT-pipeline inte kan kostnadsberäknas innan någon kör den. En modell på 4,69B över 13 824 visuella token är inte en liten beräkning, och tills du har mätt tiden för den på din egen hårdvara gissar du.
Att läsa de två benchmarkposterna utan att lura dig själv
DeepSeek V4 Pros resultat är en blandning av oberoende mätning och leverantörsrapportering, och blandningen är lärorik eftersom den innehåller ett tal som ser alarmerande ut och inte är det.
• Artificial Analysis Intelligence Index — 36, vilket ligger på 72,4:e percentilen av mätta modeller
• GPQA Diamond — 92,8, vilket ligger i toppen av fältet
• Mänsklighetens sista prov — 41, och 41 på MMLU-Pro, 62,51 på matematikindexet
• τ²-Bench — 96,20, med IFBench på 76,46 och tau_banking på 39,59
• Återkallning i lång kontext — 80,33
• SciCode och Terminal-Bench — 51 och 78,65 på den andra versionen av Terminal-Bench
Ett sammansatt index på 36 bredvid en GPQA Diamond på 92,8 låter som en motsägelse tills man inser vad ett index är. Det är ett aggregat över många utvärderingar, och en modell som är utmärkt på en handfull av dem och bara adekvat på andra hamnar i mittenfältet på summan samtidigt som den toppar enskilda resultattavlor. Den som enbart citerar 36:an för att argumentera för att DeepSeek V4 Pro är medelmåttig citerar ett genomsnitt som om det vore ett maximum. Den som enbart citerar 92,8 för att argumentera för att den leder fältet citerar ett maximum som om det vore ett genomsnitt. Båda siffrorna kommer från Artificial Analysis, och båda är sanna.
NV-Reason-CT:s resultat har ingen sådan blandning, och det är det ärliga problemet med det. Dess CT-RATE-siffror — 0,614 F1 och 0,871 AUROC över arton etiketter, med en fast enhetlig tröskel och en direkt ja/nej-prompt utan klassificeringshuvud och utan uppgiftsspecifik anpassning — kommer från NVIDIAs egen artikel och inte från någon annanstans. Jämförelseuppsättningen i den artikeln (VoxelFM vid 0,581, Pillar-0 vid 0,544, ClinFusion-8B vid 0,442, CT-CLIP vid 0,398, Merlin vid 0,358, MedGemma 1.5 vid 0,303) består helt och hållet av andra bildmodeller. Inte en enda generell textmodell förekommer i den, och ingen tredje part har reproducerat någon av siffrorna.

Schemaläggningsfrågan, genomarbetad
Tidsstyrd prissättning för DeepSeek V4 Pro är det mest operativt användbara hos någon av modellerna, så den förtjänar en konkret genomgång.
En realistisk textrelaterad arbetsbelastning för ett CT-program är inte glamorös. Den består i att extrahera strukturerade fält från en korpus av historiska rapporter så att du har etiketter att träna mot, konvertera DICOM-katalogträd till NIfTI i stor skala, skriva och skriva om utvärderingsramverket, normalisera enheter och terminologi över fyra datamängder samt sammanfatta kohorter. Säg hundra miljoner indatatokens och tio miljoner utdatatokens för ett medelstort program, vilket är en avsiktligt rund siffra som står för ”en massa textarbete”.
• Inom ett fördubblat fönster — 1,32 $ och 3,96 $ per miljon, alltså 132 $ plus 39,60 $ vid dessa volymer
• Utanför dessa fönster – 0,66 $ och 1,98 $ per miljon, alltså 66 $ plus 19,80 $
• Skillnaden — ungefär 86 dollar, eller 49 % av lågtrafikräkningen, för att flytta ett jobb som till sin natur kan batchas
• Cachade läsningar — $0,022 per miljon, vilket är en sextiondel av priset för indata, så alla promptprefix du återanvänder i korpusen är nästan gratis
Det är inte ett avrundningsfel, och det är tillgängligt eftersom arbetet är asynkront. Rapportextrahering behöver inte ske kl. 14:00. Inget i ett DICOM-konverteringsjobb bryr sig om vilken tid det är. Prissättningsstrukturen är en direkt inbjudan att schemalägga, och en pipeline som ignorerar den betalar en premie på 49 % för privilegiet att köra när den känner för det. Cacheläsningar spelar roll av samma anledning: en delad systemprompt eller ett fast extraheringsschema, som återanvänds över tusentals rapporter, ligger på en sextiondel av indatapriset.
NV-Reason-CT har ingen motsvarande spak, eftersom den inte har någon mätare. Kostnaden för att läsa en skanning är vad din GPU kostar per timme delat med hur många skanningar per timme du kan pressa igenom den, och det andra talet är det som ingen har publicerat. Om en enskild studie tar två sekunder klarar en enda L40S ett stort program med marginal. Om den tar tjugo förändras hårdvaruräkningen helt. NVIDIA testade på H100 och L40S, vilket säger dig vilken klass av kort det rör sig om, inte vilken takt.
Fällan i att anta att de kan ersättas
Misstaget som denna matchning inbjuder till är subtilare än det vanliga kategorimisstaget, eftersom det finns en version av det som ser rimlig ut på en bild.
DeepSeek V4 Pro rymmer 1 048 576 tokens och genererar upp till 384 000. En CT-volym är, enligt den modell som läser den på rätt sätt, bara 13 824 tokens. Så en textmodell med ett fönster på en miljon tokens har plats för drygt sjuttio CT-studier vid det antalet tokens. Aritmetiken är korrekt och slutsatsen – att du skulle kunna mata en textmodell med CT-data och slippa avbildningsinfrastrukturen – är fel, av det skäl som gör att siffran 13 824 över huvud taget finns.
Det numret är inte en komprimerad sammanfattning av en skanning. Det är skanningen, vid 2 mm isotrop upplösning över en 384-millimeterskub, uppdelad i 8 x 8 x 8 patchar, överlämnad till språkmodellen utan rumslig nedsampling och utan sammanslagningslager. Tokenantalet är högt just för att inget kastades bort: skivavståndet som gör en nodul mätbar, densitetsvärdena som gör en textur till ett tröskelvärde snarare än ett adjektiv. En textmodell kan inte ta in dessa tokens som volymer, lika lite som ett dokument kan. Den har budgeten. Den har inte gränssnittet.
Artikelns egen interna jämförelse sätter en siffra på skillnaden. MedGemma 1.5, med upp till 85 axiala snitt — det bästa en tvådimensionell eller snittstaplad front-end rimligen kan åstadkomma — får 0,303 F1 mot 0,614 för den nativa volymetriska modellen. Det gapet är värdet av den tredimensionella encodern, och inget kontextfönster, hur stort det än är, stänger det.
Den omvända substitutionen misslyckas av enklare skäl. NV-Reason-CT stöder bröstkorg och buk, tar en NIfTI-fil i stället för en prompt, saknar verktygsanvändning, och dess modellkort begränsar den till forskning och utbildning samt anger att den inte är en medicinteknisk produkt och att utdata kan vara felaktiga. Den kan inte extrahera fält från en rapport, och den kan inte skriva skriptet som bygger din korpus.

Där vi passar in, och där vi medvetet inte gör det
DeepSeek V4 Pro tillhandahålls via OrcaRouter som deepseek/deepseek-v4-pro, till leverantörens listpris utan påslag, i ett enda API som täcker fler än 200 modeller. Att priset förs vidare oförändrat spelar större roll än vanligt för en modell med tidsberoende pris: när en leverantör ändrar en taxa eller ett tidsfönster ändras priset på vår sida samma dag, eftersom det inte finns något påslagslager emellan som håller kvar en gammal siffra. Automatisk redundansväxling täcker fallet där en leverantör försämras mitt i en batch, vilket för ett långt oövervakat extraheringsjobb är den feltyp som faktiskt kostar dig en natt, och routnings-DSL:en låter dig skicka enskilda förfrågningar till den modell som bör hantera dem i stället för att köra allt via en enda slutpunkt.
NV-Reason-CT finns inte på vår plattform. Ingen NVIDIA-modell finns där. CT-sidan av den här arkitekturen är din egen hårdvara med dina egna nedladdade vikter, och vi kommer inte att skriva en mening som får en läsare att tro något annat. Med tanke på att indata är patienthärledd volymetrisk data och licensen är OpenMDW-1.1 utan någon kopplad värdbaserad tjänst, är lokal exekvering där den modellen hör hemma oavsett.
Vad parkopplingen faktiskt säger dig
De två modellerna konkurrerar inte, och poängen med att jämföra dem är att de misslyckas på olika sätt. NV-Reason-CT ger dig en förmåga som inget annat öppet alternativ erbjuder – inbyggt tredimensionellt CT-resonemang vid undersökningens fulla upplösning – och ber dig acceptera en obudgeterad kostnad per undersökning, en opublicerad genomströmning och en licens som förbjuder klinisk driftsättning. DeepSeek V4 Pro ger dig en motor med mätning, med publicerad latens, publicerad felfrekvens, oberoende mätningar och ett pris du kan halvera genom att titta på en klocka, och den kan inte se en skanning överhuvudtaget.
Om du bygger saken i stället för att köpa den, är formen som överlever kontakt den tråkiga. Kör CT-läsningen lokalt, budgetera den genom att mäta i stället för att citera siffror, och lägg allt textligt runt den på en träff med lågtrafikfönstret. Schemat som ingen bör kopiera är det som kör hundra miljoner tokens av extraktion kl. 02:00 UTC eftersom det var då batchen råkade vara redo.

