Een gegenereerde hero-kaart met de titel 'NV-Reason-CT vs Claude Opus 5' en de ondertitel 'Een categorieftout die serieus genomen moet worden'. Twee tegenover elkaar staande kaarten worden gescheiden door een paar blauwe pijlen: de linkerkaart is gelabeld 'NV-Reason-CT' met een lichaamsscanpictogram en '4,69B parameters - 13.824 tokens per CT-volume - geen medisch hulpmiddel'; de rechterkaart is gelabeld 'Claude Opus 5' met een chippictogram en '1M context - 128K output - $5 / $25 per miljoen tokens'. Het OrcaRouter-logo is gecompositeerd in de rechteronderhoek.
Guides & Insights

NV-Reason-CT vs Claude Opus 5: Een categoriefout die serieus moet worden genomen

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het plaatsen van NV-Reason-CT en Claude Opus 5 in dezelfde zin is een categoriefout, en toch is het de moeite waard om het te doen, want de fout is leerzaam. NV-Reason-CT is een native 3D-visie-taalmodel van NVIDIA met 4,69 miljard parameters dat een CT-volume van de borstkas of de buik in Hounsfield-eenheden als invoer neemt en een gestructureerd verslag per bevinding oplevert. Het is geen medisch hulpmiddel en dat staat ook zo op de eigen modelkaart. Claude Opus 5 is het algemene frontier-tekst- en visiemodel van de leverancier, uitgebracht op 24 juli 2026, met een contextvenster van een miljoen tokens, een uitvoerplafond van 128.000 tokens en een gepubliceerd tarief van vijf dollar per miljoen invoertokens en vijfentwintig per miljoen uitvoertokens. Een van deze twee leest een CT. De andere leest al het overige.

De reden dat de vergelijking steeds weer wordt gemaakt — en dat zal gebeuren, elke keer dat iemand een nieuw medisch VLM ziet en naar een vertrouwde maatstaf grijpt — is dat beide proza over een afbeelding produceren. Die oppervlakkige gelijkenis berokkent echte schade aan de manier waarop mensen over de twee redeneren, dus het is de moeite waard om die in detail te ontrafelen.

De werkelijke as die ze delen, en degene die ze niet delen

Ze overlappen elkaar op precies één plek, en die is nauwer dan het lijkt.

• Modaliteit in — NV-Reason-CT neemt éénkanaals NIfTI-volumes in Hounsfield-eenheden via een toegewijde driedimensionale processor; Claude Opus 5 neemt tekst, afbeeldingen en bestanden, wat een interface van de tweede generatie voor beelden is en een volumetrische CT-studie niet native kan inlezen

• Wat er terugkomt — een bevindingenlijst georganiseerd per anatomische regio van NV-Reason-CT, tegenover algemene proza, gestructureerde JSON of tool-aanroepen van Claude Opus 5

• Werkeenheden — één CT-volume, geresampleerd naar 2 mm isotroop, bijgesneden tot de anatomie, opgedeeld in patches van 8 x 8 x 8; afgezet tegen wat je ook maar in een tokenbudget stopt

• Context — NV-Reason-CT heeft helemaal geen chatvenster; één enkel volume wordt 13.824 visuele tokens zonder downsampling. Claude Opus 5 houdt 1.000.000 tokens vast en geeft er tot 128.000 uit

• Licentie — OpenMDW-1.1, een downloadbaar model dat je op je eigen hardware draait; tegenover een gehoste API

• Aangegeven gebruik — uitsluitend voor onderzoek en onderwijs, expliciet geen medisch hulpmiddel, voor NV-Reason-CT; tegen algemene ondersteuning voor Claude Opus 5

• Prijs — geen lijstprijs, want er valt niets te kopen, alleen gewichten om te draaien; tegenover $5 en $25 per miljoen tokens, met gecachte reads aan $0,50

De rij "invoermodaliteit" is waar de categoriefout ontstaat. Beide accepteren een afbeelding, dus lijken beide op beeldmodellen, en een lezer vraagt zich terecht af welke beter is met afbeeldingen. Maar een CT-onderzoek is geen afbeelding. Het is een volumetrische array met een fysieke schaal in millimeters, een gekalibreerde dichtheidseenheid, en anatomie die alleen in drie dimensies betekenis heeft. Claude Opus 5 is echt bekwaam in visuele taken en zal een röntgenfoto of een pathologiedia verstandig bespreken. Dat is een andere taak dan het integreren van een 384 millimeter grote kubus van Hounsfield-waarden met een resolutie van 2 mm en het rapporteren over de lobulatie van een nodule.

Wat de cijfers aan elke kant daadwerkelijk meten

De twee modellen hebben benchmarkrecords die elkaar nooit raken, en als je ze naast elkaar leest zonder dat op te merken, is dat hoe slechte inkoopbeslissingen worden genomen.

NV-Reason-CT rapporteert zijn resultaten op de openbare CT-RATE-benchmark voor borst-CT, over achttien labels, met een vaste uniforme drempel en een directe ja/nee-prompt, zonder classificatiehoofd en zonder taakspecifieke aanpassing. Het noteert 0,614 F1 en 0,871 AUROC, beter dan VoxelFM met 0,581 en 0,870, Pillar-0 met 0,544 en 0,861, ClinFusion-8B met 0,442 F1, CT-CLIP met 0,398 en 0,733, Merlin met 0,358 en 0,662, en MedGemma 1.5 met 0,303 F1 wanneer het tot 85 axiale slices krijgt. Daarnaast is er een uit het rapport afgeleide macro-F1 van 0,592. Al die cijfers komen uit NVIDIA's eigen paper. Geen enkele daarvan is door iemand anders gereproduceerd, en het model is al een paar weken downloadbaar.

De resultaten van Claude Opus 5 zijn algemeen van aard en grotendeels onafhankelijk. Artificial Analysis meet het op 50,8 op zijn Intelligence Index, 78 op zijn Coding Index, 93,2 op GPQA Diamond en 54,9 op Humanity's Last Exam, met een long-context recall-score van 79,33. Dat zijn cijfers van derden voor algemene redeneer-, code- en kennistaken. Er zit geen klinische beeldvormingsbenchmark in die set, en er is nergens een CT-RATE-regel in de gepubliceerde resultaten van Claude Opus 5.

De eerlijke bewering is dus niet dat het ene model vooroploopt. Het is dat de twee modellen zijn nooit door iemand op dezelfde taak gemeten. Elke zin van de vorm "NV-Reason-CT is beter dan Claude Opus 5 bij medische beeldvorming" is niet falsifieerbaar zoals die er staat, omdat niemand het experiment heeft uitgevoerd. NVIDIA's eigen vergelijkingstabel bevat geen algemeen frontiermodel.

A generated scoreboard titled 'NV-Reason-CT vs Claude Opus 5 - what each number measures' with two columns. The left column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI volumes in Hounsfield units; output, structured findings by anatomical region; benchmark, CT-RATE 0.614 F1 and 0.871 AUROC over 18 labels; provenance, authors' own paper, unreproduced; licence, OpenMDW-1.1, self-hosted; use, research and education, not a medical device. The right column, headed 'Claude Opus 5', lists six rows: input, text, images, files; output, general prose, JSON, tool calls; benchmark, AA Intelligence 50.8, GPQA Diamond 93.2, HLE 54.9; provenance, independent, Artificial Analysis; licence, hosted API; use, general purpose. A footer reads 'The two benchmark sets share no task, so neither column can be subtracted from the other.'

Waar mensen de interfacevraag verkeerd begrijpen

De enige echt interessante technische overlap is degene waar niemand over discussieert: hoe een interface tussen een CT-model en een tekstmodel eruit zou moeten zien.

Een redelijk instinct is om Claude Opus 5 een set CT-beelden of een gedownsampled volume te geven en het te vragen te redeneren. Bij 1.000.000 tokens context klinkt dat ruim, en tegenover een onderzoek van slechts 13.824 visuele tokens klinkt het als ruim voldoende ruimte. De ruimte is niet het probleem. De vision-pijplijn van Claude Opus 5 behandelt een afbeelding als een tweedimensionaal plaatje met een pixelschaal. Een thorax-CT die zo wordt gepresenteerd, verliest de inter-slice-afstand die een laesie meetbaar maakt en de dichtheidkalibratie die van "ground-glass" een drempelwaarde maakt in plaats van een beschrijving. Je kunt het een montage van axiale coupes geven en een coherent klinkende alinea terugkrijgen. Wat je niet kunt krijgen, is een meting.

Dat is precies waarop het ontwerp van NV-Reason-CT zijn rekenkracht richt. Het raster van 24 x 24 x 24 uit een volume van 384 millimeter wordt in volledige resolutie aan het taalmodel gegeven, zonder ruimtelijke downsampling en zonder samenvoeglaag, en daarom telt het actieve pad 4,35 miljard parameters in plaats van iets veel kleiners. De architectuur is een gok dat het behouden van ruimtelijk detail de tokenkosten waard is. Het is een gok over representatie, niet over taalvermogen, en Claude Opus 5 is er geen deelnemer aan.

Het productieve patroon is het saaie: gebruik het CT-model voor de volumetrische beoordeling, en gebruik een tekstmodel voor alles eromheen. Rapportgeneratie en normalisatie, cohortsamenvattingen, evaluatieharnassen, het op schaal converteren van DICOM-archieven naar NIfTI, het bepalen welke onderzoeken een mens eerst moet bekijken. Dat is werk met lange documenten en code, en dat is waar een 1M-contextmodel zijn prijs waard is.

Kosten, in twee eenheden die niet converteerbaar zijn

Claude Opus 5 werkt met een tarief per gebruik. Vijf dollar per miljoen inputtokens en vijfentwintig per miljoen output, cachereads voor vijftig cent, cachewrites voor tien dollar. Voor een pijplijn die een corpus van rapporten normaliseert of evaluatiecode schrijft en herschrijft, levert dat een prognose op die je kunt opstellen: tokens in, tokens uit, cachereads, en een veel lagere rekening als je het cachen goed aanpakt.

NV-Reason-CT heeft geen prijs. Je downloadt 4,69 miljard parameters en betaalt in elektriciteit, GPU-uren en engineeringtijd. Er is geen gepubliceerd doorvoercijfer voor een volledige studie van 13.824 tokens, en er is geen gequantiseerde variant beschikbaar, dus de kosten per studie om het te draaien zijn een getal dat je zelf zou moeten meten. Dat is normaal voor onderzoeksgewichten en het is ook het grootste praktische verschil tussen de twee: de een heeft een tariefkaart, de ander heeft een rekening die je pas ziet als je die al hebt betaald.

De vergelijking die er echt toe doet, is per onderzoek, niet per token. Een CT-beoordeling is één werkeenheid. Een rapportnormalisatieronde over dezelfde casus is een tekstklus die in duizenden tokens wordt gemeten. Het eerste van een dollarbedrag voorzien betekent dat je je hardware kent; het tweede is rekenwerk.

De valkuil in het midden van de vergelijking

Er is een specifieke fout die het benoemen waard is, omdat het degene is die deze vergelijking uitlokt. Het is NV-Reason-CT behandelen als een gespecialiseerde fine-tune van een algemeen model, en daarom aannemen dat het algemene model in de meeste gevallen goed genoeg zal zijn en veel flexibeler.

Het is geen fine-tune. Het is een 3D-visiontransformer genaamd Primus, geïnitialiseerd vanuit COLIPRI, vastgeschroefd aan een Qwen3.5-4B-taalbackbone met 3D multi-axis rotary position embedding, getraind op ongeveer 550.000 gestructureerde vraag-en-antwoordvoorbeelden uit 70.111 CT-volumes afkomstig van CT-RATE, CancerVerse en een interne NIH-collectie, en vervolgens bijgesteld met GRPO tegen een beloning die abnormality-set-F1 weegt op 2,0, een regiospecifieke rapportstructuurscore op 0,5 en een zachte lengtepenalty op 1,0. De driedimensionale encoder is waar het bij dit model om draait. Een tweedimensionale of op slice gebaseerde front-end is een ander instrument, en de eigen vergelijking in de paper laat zien wat dat verschil waard is: MedGemma 1.5 op 0,303 F1 wanneer het tot 85 axiale slices krijgt, tegenover 0,614 voor het native volumetrische model.

De omgekeerde fout komt net zo vaak voor en is net zo kostbaar: aannemen dat je, omdat NV-Reason-CT gespecialiseerd is, het voor alles klinisch zou moeten gebruiken. Het ondersteunt borst en buik en verder niets, de aanroep ervan is een NIfTI-bestand in plaats van een chatbericht, en de licentievoorwaarden zeggen alleen onderzoek en onderwijs. Het leest geen pathologiedia, beantwoordt geen vraag over een richtlijn en schrijft niet de code die je DICOM-conversie in batches verwerkt. Naar een CT-model grijpen om tekstwerk te doen is dezelfde categoriefout als naar een tekstmodel grijpen om volumetrie te doen, alleen dan precies de andere kant op.

A generated scoreboard titled 'The two models, at a glance' listing six paired rows. Row one: parameters, 4.69B total and 4.35B active, against undisclosed. Row two: context, 13,824 visual tokens per volume against 1,000,000 input and 128,000 output tokens. Row three: input, one-channel NIfTI in Hounsfield units against text, images and files. Row four: availability, weights downloadable on Hugging Face against hosted API. Row five: price, self-hosted with no rate card against $5 and $25 per million tokens. Row six: status, unannounced research release against generally available. A footer reads 'NV-Reason-CT figures per the authors paper and model card; Claude Opus 5 figures per the provider rate card and Artificial Analysis.'

Hoe de twee helften in één systeem passen

Geen van beide modellen vervangt het andere, en de verstandige architectuur bevat beide — wat de praktische vraag oproept hoe je ze aanroept.

Claude Opus 5 wordt via OrcaRouter aangeboden als anthropic/claude-opus-5 tegen het provider-listtarief van Anthropic zonder markup, binnen één enkele API die meer dan 200 modellen ondersteunt. Dat maakt voor één enkele aanroep minder uit dan voor de omliggende pijplijn: wanneer de teksthelft van een klinische build één van meerdere kandidaatmodellen is, betekent het feit dat ze allemaal achter één sleutel zitten dat je ze op je eigen corpus kunt vergelijken zonder een tweede contract of een codewijziging, en met de routing-DSL kun je afzonderlijke verzoeken sturen naar het model dat ze zou moeten afhandelen, terwijl automatische failover je opvangt wanneer een provider degradeert.

NV-Reason-CT staat niet op ons platform, en geen enkel NVIDIA-model ook. Het zijn gewichten die je downloadt en op je eigen hardware draait, wat precies is wat de licentie je toestaat en, aangezien de input volumetrische data van patiënten is, waarschijnlijk toch is wat je wilt. We gaan niet suggereren dat we een model routeren dat we niet hosten. De tekstkant van de build is waar wij nuttig zijn; de volumetrische kant is waar je er alleen voor staat met een 4,69B-model en een GPU.

A screenshot of the OrcaRouter model page for Claude Opus 5, showing the identifier anthropic/claude-opus-5, the description of it as Anthropic's most capable model for complex reasoning and long-horizon agentic work, a side panel listing a 1,000,000-token context window and 128,000 maximum output tokens with text, image and file input and text output, and a stat strip reading $5.00 per million input tokens, $25.00 per million output tokens, and a p50 time to first token under four seconds.

Het vonnis dat de toets der kritiek doorstaat

Als je een CT-volume wilt laten omzetten naar gestructureerde bevindingen, is daar een model voor; het komt uit de onderzoeksgroep van NVIDIA en het is een download in plaats van een API-aanroep. Als je een corpus van rapporten genormaliseerd wilt hebben, een evaluatieharnas wilt laten schrijven, een DICOM-conversietaak wilt laten scripten, of een cohort wilt samenvatten, is daar ook een model voor, en het heeft een tariefkaart.

Wat we moeten vasthouden, is dat van geen van beide is aangetoond dat de een op welk gebied dan ook beter is dan de ander, omdat het experiment niet is uitgevoerd. Wat wél is aangetoond, is dat een native driedimensionale interface een op slices gebaseerde interface verslaat op een openbare thorax-CT-benchmark, met een marge die de auteurs op ongeveer drie F1-punten stellen, en dat een algemeen frontiermodel onafhankelijk aan de top van het veld wordt gemeten op het gebied van redeneren, code en werk met lange context. Dat zijn twee uitspraken over twee verschillende taken. Ze als een ranglijst lezen is de categoriefout, en die houdt stand tot het moment dat iemand de rechtstreekse vergelijking publiceert die nog niemand heeft gepubliceerd.