Ett genererat hero-kort med titeln 'NV-Reason-CT vs Claude Opus 5' och underrubriken 'Ett kategorimisstag som är värt att ta på allvar'. Två kort som står mot varandra åtskils av ett par blå pilar: det vänstra kortet är märkt 'NV-Reason-CT' med en kroppsskanningsikon och '4,69B parametrar – 13 824 tokens per CT-volym – inte en medicinteknisk produkt'; det högra kortet är märkt 'Claude Opus 5' med en chippikon och '1M kontext – 128K utdata – $5 / $25 per miljon tokens'. OrcaRouter-logotypen är inkomponerad i det nedre högra hörnet.
Guides & Insights

NV-Reason-CT vs Claude Opus 5: Ett kategorifel värt att ta på allvar

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Att sätta NV-Reason-CT och Claude Opus 5 i samma mening är ett kategorifel, och det är ändå värt att göra, eftersom felet är lärorikt. NV-Reason-CT är en nativ 3D-synspråkmodell från NVIDIA med 4,69 miljarder parametrar som tar emot en CT-volym av bröstkorg eller buk i Hounsfield-enheter och producerar en strukturerad fynd-för-fynd-redogörelse. Det är inte en medicinteknisk produkt, och dess eget modellkort säger det. Claude Opus 5 är leverantörens allmänna frontier-modell för text och vision, släppt den 24 juli 2026, med ett kontextfönster på en miljon tokens, ett utdatatak på 128 000 tokens och en publicerad taxa på fem dollar per miljon indatatokens och tjugofem per miljon utdata. En av dessa läser en CT. Den andra läser allt annat.

Anledningen till att jämförelsen ständigt görs – och det kommer den att göra, varje gång någon ser en ny medicinsk VLM och griper efter en välbekant måttstock – är att båda producerar prosa om en bild. Den ytliga likheten gör verklig skada på hur människor resonerar om de två, så det är värt att reda ut i detalj.

Den faktiska axeln de delar, och den de inte delar.

De överlappar på exakt ett ställe, och det är smalare än det verkar.

• Modalitet i — NV-Reason-CT tar enkanaliga NIfTI-volymer i Hounsfield-enheter genom en dedikerad tredimensionell processor; Claude Opus 5 tar text, bilder och filer, vilket är ett andra generationens gränssnitt för bilder och inte kan ta in en volymetrisk CT-undersökning nativt

• Vad som kommer tillbaka — en fyndlista organiserad efter anatomisk region från NV-Reason-CT, jämfört med allmän prosa, strukturerad JSON eller verktygsanrop från Claude Opus 5

• Arbetsenheter — en CT-volym, omsamplad till 2 mm isotrop, beskuren till anatomi, styckad i 8 x 8 x 8-patchar; mot vad du än lägger i en tokenbudget

• Kontext — NV-Reason-CT har inget chattfönster alls; en enda volym blir 13 824 visuella token utan nedsampling. Claude Opus 5 rymmer 1 000 000 token som indata och avger upp till 128 000

• Licens — OpenMDW-1.1, en nedladdningsbar modell som du kör på din egen hårdvara; mot ett hostat API

• Angiven användning — endast forskning och utbildning, uttryckligen inte en medicinteknisk produkt, för NV-Reason-CT; mot allmän assistans för Claude Opus 5

• Pris — inget listpris, eftersom det inte finns något att köpa, bara vikter att köra; mot $5 och $25 per miljon tokens, med cachade läsningar på $0.50

Raden "modality in" är där kategorimisstaget föds. Båda tar emot en bild, så båda ser ut som bildmodeller, och en läsare frågar rimligtvis vilken som är bättre på bilder. Men en CT-undersökning är inte en bild. Det är en volymetrisk array med en fysisk skala i millimeter, en kalibrerad densitetsenhet och anatomi som bara betyder något i tre dimensioner. Claude Opus 5:s bildseende är verkligen kapabelt, och den kommer att diskutera en röntgenbild eller ett patologisnitt på ett förnuftigt sätt. Det är en annan uppgift än att integrera en 384-millimeterskub av Hounsfieldvärden med 2 mm upplösning och rapportera om en noduls lobulering.

Vad siffrorna på varje sida faktiskt mäter

De två modellerna har benchmarkresultat som aldrig möts, och att läsa dem sida vid sida utan att lägga märke till det är så dåliga upphandlingsbeslut fattas.

NV-Reason-CT rapporterar sina resultat på CT-RATE:s offentliga thorax-CT-benchmark, över arton etiketter, med en fast enhetlig tröskel och en direkt ja/nej-prompt utan klassificeringshuvud och utan uppgiftsspecifik anpassning. Den uppnår 0,614 F1 och 0,871 AUROC, före VoxelFM på 0,581 och 0,870, Pillar-0 på 0,544 och 0,861, ClinFusion-8B på 0,442 F1, CT-CLIP på 0,398 och 0,733, Merlin på 0,358 och 0,662, samt MedGemma 1.5 på 0,303 F1 när den ges upp till 85 axiella snitt. Det finns också en rapporthärledd macro-F1 på 0,592. Var och en av dessa siffror kommer från NVIDIAs egen artikel. Ingen av dem har reproducerats av någon annan, och modellen har varit nedladdningsbar i några veckor.

Claude Opus 5:s resultat är av allmän karaktär och i stort sett oberoende. Artificial Analysis mäter det till 50,8 på sitt Intelligence Index, 78 på sitt Coding Index, 93,2 på GPQA Diamond och 54,9 på Humanity's Last Exam, med en long-context recall-poäng på 79,33. Det är tredjepartssiffror för allmänna resonemangs-, kod- och kunskapsuppgifter. Det finns inget benchmark för klinisk bildgivning i den uppsättningen, och det finns ingen CT-RATE-rad någonstans i Claude Opus 5:s publicerade resultat.

Så det ärliga påståendet är inte att den ena ligger före. Det är att de två modellerna har aldrig mätts på samma uppgift av någon. Varje mening av formen "NV-Reason-CT är bättre än Claude Opus 5 på medicinsk avbildning" är ofalsifierbar som den står, eftersom ingen har utfört experimentet. NVIDIAs egen jämförelsetabell innehåller ingen generell frontier-modell.

A generated scoreboard titled 'NV-Reason-CT vs Claude Opus 5 - what each number measures' with two columns. The left column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI volumes in Hounsfield units; output, structured findings by anatomical region; benchmark, CT-RATE 0.614 F1 and 0.871 AUROC over 18 labels; provenance, authors' own paper, unreproduced; licence, OpenMDW-1.1, self-hosted; use, research and education, not a medical device. The right column, headed 'Claude Opus 5', lists six rows: input, text, images, files; output, general prose, JSON, tool calls; benchmark, AA Intelligence 50.8, GPQA Diamond 93.2, HLE 54.9; provenance, independent, Artificial Analysis; licence, hosted API; use, general purpose. A footer reads 'The two benchmark sets share no task, so neither column can be subtracted from the other.'

Där människor har fel om gränssnittsfrågan

Den enda genuint intressanta tekniska överlappningen är den som ingen tvistar om: hur ett gränssnitt mellan en CT-modell och en textmodell bör se ut.

En rimlig instinkt är att mata Claude Opus 5 med en uppsättning CT-bilder eller en nedskalad volym och be den resonera. Med 1 000 000 tokens kontext låter det generöst, och jämfört med en studie som bara är 13 824 visuella tokens låter det som gott om utrymme. Utrymmet är inte problemet. Claude Opus 5:s visionspipeline behandlar en bild som en tvådimensionell bild med en pixelskala. En CT av bröstkorgen som presenteras på det sättet förlorar skiktavståndet som gör en lesion mätbar och densitetskalibreringen som gör ”matglas” till ett tröskelvärde snarare än en beskrivning. Du kan ge den ett montage av axiala skivor och få ett stycke som låter sammanhängande. Det du inte kan få är en mätning.

Det är just vad NV-Reason-CT:s design spenderar sin beräkningskraft på. Rutnätet på 24 x 24 x 24 från en volym på 384 millimeter överlämnas till språkmodellen i full upplösning, utan rumslig nedsampling och utan sammanslagningslager, vilket är anledningen till att den aktiva vägen har 4,35B parametrar i stället för något mycket mindre. Arkitekturen är en satsning på att det är värt tokenkostnaden att behålla rumslig detalj. Det är en satsning på representation, inte på språkförmåga, och Claude Opus 5 är inte en deltagare i den.

Det produktiva mönstret är det tråkiga: använd CT-modellen för den volymetriska läsningen och använd en textmodell för allt runtomkring. Rapportgenerering och normalisering, kohortsammanfattningar, utvärderingsramverk, konvertering av DICOM-arkiv till NIfTI i stor skala, prioritering av vilka undersökningar en människa bör titta på först. Det är arbete med långa dokument och kod, och det är där en 1M-kontextmodell förtjänar sin kostnad.

Kostnad, i två enheter som inte omvandlas

Claude Opus 5 är avgiftsbelagd per användning. Fem dollar per miljon indatatoken och tjugofem per miljon utdatatoken, cacheläsningar för femtio cent, cacheskrivningar för tio dollar. För en pipeline som normaliserar en korpus av rapporter eller skriver och skriver om utvärderingskod ger det en prognos du kan ställa upp: token in, token ut, cacheläsningar och en mycket billigare räkning om du får cachelagringen rätt.

NV-Reason-CT har inget pris. Du laddar ner 4,69 miljarder parametrar och betalar i el, GPU-timmar och ingenjörstid. Det finns ingen publicerad genomströmningssiffra för en full studie på 13 824 tokens, och ingen kvantiserad variant erbjuds, så kostnaden per studie för att köra den är en siffra du själv skulle behöva mäta. Det är normalt för forskningsvikter och det är också den enskilt största praktiska skillnaden mellan de två: den ena har en prislista, den andra har en räkning du inte kan se förrän du redan har betalat den.

Den jämförelse som faktiskt spelar roll är per undersökning, inte per token. En CT-läsning är en arbetsenhet. En rapportnormalisering av samma fall är ett textjobb som mäts i tusentals token. Att sätta en dollarsiffra på den första innebär att känna till din hårdvara; att sätta en på den andra är aritmetik.

Fällan i mitten av jämförelsen

Det finns ett specifikt misstag som är värt att sätta namn på, eftersom det är just det som den här matchningen lockar fram. Det är att behandla NV-Reason-CT som en specialiserad finjustering av en generell modell, och därför anta att den generella modellen kommer att vara tillräckligt nära i de flesta fall och mycket mer flexibel.

Det är inte en finjustering. Det är en 3D-visionstransformerare som heter Primus, initialiserad från COLIPRI, fastbultad på en Qwen3.5-4B-språkryggrad med 3D-fleraxlig roterande positionsinbäddning, tränad på ungefär 550 000 strukturerade fråge-svarsexempel hämtade från 70 111 CT-volymer i CT-RATE, CancerVerse och en intern NIH-samling, och därefter tränad med GRPO mot en belöning som viktar F1 för abnormitetsset till 2,0, en regionsspecifik poäng för rapportstruktur till 0,5 och ett mjukt längdstraff till 1,0. Den tredimensionella kodaren är själva poängen med modellen. En tvådimensionell eller snittbaserad front-end är ett annat instrument, och artikelns egen jämförelse visar vad den skillnaden är värd: MedGemma 1.5 med 0,303 F1 när den matas med upp till 85 axiella snitt, mot 0,614 för den nativa volymetriska modellen.

Det omvända misstaget är lika vanligt och lika kostsamt: att anta att du, eftersom NV-Reason-CT är specialiserat, bör använda det till allt kliniskt. Det stöder bröstkorg och buk och inget annat, dess anrop är en NIfTI-fil snarare än ett chattmeddelande, och dess licensvillkor säger endast forskning och utbildning. Det kommer inte att läsa ett patologiskt objektglas, svara på en fråga om en riktlinje eller skriva koden som batchar din DICOM-konvertering. Att ta till en CT-modell för att göra textarbete är samma kategorimisstag som att ta till en textmodell för att göra volumetri, bara i motsatt riktning.

A generated scoreboard titled 'The two models, at a glance' listing six paired rows. Row one: parameters, 4.69B total and 4.35B active, against undisclosed. Row two: context, 13,824 visual tokens per volume against 1,000,000 input and 128,000 output tokens. Row three: input, one-channel NIfTI in Hounsfield units against text, images and files. Row four: availability, weights downloadable on Hugging Face against hosted API. Row five: price, self-hosted with no rate card against $5 and $25 per million tokens. Row six: status, unannounced research release against generally available. A footer reads 'NV-Reason-CT figures per the authors paper and model card; Claude Opus 5 figures per the provider rate card and Artificial Analysis.'

Hur de två halvorna passar in i ett system

Ingen av modellerna ersätter den andra, och den förnuftiga arkitekturen innehåller båda – vilket väcker den praktiska frågan om hur man anropar dem.

Claude Opus 5 tillhandahålls via OrcaRouter som anthropic/claude-opus-5 till Anthropics leverantörslistpris utan påslag, inuti ett enda API som täcker fler än 200 modeller. Det spelar mindre roll för ett enskilt anrop än för den omgivande pipelinen: när textdelen av en klinisk build är en modell bland flera kandidater, innebär det att ha dem alla bakom en enda nyckel att du kan jämföra dem på din egen korpus utan ett andra avtal eller en kodändring, och routnings-DSL:en låter dig skicka enskilda förfrågningar till den modell som bör hantera dem medan automatisk failover täcker dig när en leverantör försämras.

NV-Reason-CT finns inte på vår plattform, och det gör ingen NVIDIA-modell heller. Det är vikter du laddar ner och kör på din egen hårdvara, vilket är precis vad licensen tillåter dig att göra och, med tanke på att indata är volymetriska data härledda från patienter, förmodligen vad du vill ändå. Vi kommer inte att antyda att vi routar en modell som vi inte hostar. Textsidan av bygget är där vi är användbara; den volymetriska sidan är där du är på egen hand med en 4,69B-modell och en GPU.

A screenshot of the OrcaRouter model page for Claude Opus 5, showing the identifier anthropic/claude-opus-5, the description of it as Anthropic's most capable model for complex reasoning and long-horizon agentic work, a side panel listing a 1,000,000-token context window and 128,000 maximum output tokens with text, image and file input and text output, and a stat strip reading $5.00 per million input tokens, $25.00 per million output tokens, and a p50 time to first token under four seconds.

Domen som står sig under granskning

Om du behöver en CT-volym tolkad till strukturerade fynd finns det en modell för det, den kom från NVIDIAs forskargrupp, och den är en nedladdning snarare än ett API-anrop. Om du behöver ett korpus av rapporter normaliserade, en utvärderingsram skriven, ett DICOM-konverteringsjobb skriptat eller en kohort sammanfattad finns det en modell för det också, och den har en prislista.

Det man måste hålla fast vid är att ingen av dem har visats vara bättre än den andra på någonting, eftersom experimentet inte har utförts. Det som har visats är att ett nativt tredimensionellt gränssnitt slår ett skivbaserat sådant i ett offentligt thorax-CT-benchmark med en marginal som författarna anger till omkring tre F1-poäng, och att en generell frontiermodell oberoende mäts i toppen av fältet inom resonemang, kod och arbete med lång kontext. Det är två påståenden om två olika uppgifter. Att läsa dem som en rangordning är kategorimisstaget, och det består ända tills någon publicerar den direktjämförelse som ingen ännu har publicerat.