
NV-Reason-CT vs Grok 4.6: Vem läser skanningen, och vem läser rapporten
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 45 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 182 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Det finns två sätt att sätta en AI på en CT-pipeline, och bara ett av dem handlar om bilden. NV-Reason-CT är det första: en 3D-modell för vision och språk med 4,69 miljarder parametrar som läser NIfTI-volymer direkt och publicerades på Hugging Face den 8 september 2026 utan ett lanseringsinlägg från NVIDIA. Grok 4.6 är det andra: en text- och bildmodell med 500 000 tokens som släpptes den 12 augusti 2026, kostar 2,00 USD per miljon indatatokens och är mycket bra på den del av arbetet som sker efter att någon redan har skrivit ned fyndet. Ställer man dem mot varandra visar sig den vanliga frågan – vilken är bättre – vara felställd. De konkurrerar inte om samma plats i pipelinen. De konkurrerar om samma budgetpost.
Vad som faktiskt levererades på vardera sidan
NV-Reason-CT kom som ett repository, en artikel och en demo-Space, inte som en produkt. GitHub-repositoriet under NVIDIA-Medtech skapades den 2 september 2026; Hugging Face-vikterna följde den 8 september; arXiv-förhandstrycket, NV-Reason-CT: 3D-visuell språkmodell för CT-analys, publicerades den 23 september med sexton författare från NVIDIA, NIH och Zürichs universitet. NVIDIAs nyhetsrum innehåller inget om det. Modellkortet beskriver version 0.1 och begränsar användningen till forskning och utbildning.
Grok 4.6 är den motsatta typen av lansering. Det är en förstklassig kommersiell slutpunkt, listad som "Senaste" i leverantörens utvecklardokumentation, prissatt enligt ett publicerat prisblad och tillgänglig som en OpenAI-kompatibel modell som befintliga integrationer tar i bruk genom att ändra en bas-URL. Den efterträdde Grok 4.5 med samma kontextfönster, samma indatayta och samma basprissättning.
Den asymmetrin är hela historien i den här jämförelsen. Den ena är en forskningsartefakt som råkar gå att ladda ner. Den andra är infrastruktur. Att läsa dem mot varandra säger dig var gränsen mellan "forskningsartefakt" och "infrastruktur" för närvarande går inom medicinsk avbildning – och den går inte där man skulle gissa.
Arbetsdelningen, i insatsvaror och produkter
• Volumetrisk inmatning — NV-Reason-CT läser .nii/.nii.gz NIfTI-volymer i Hounsfield-enheter, endast bröstkorg eller buk vs Grok 4.6 läser text, bilder och filer, ingen volymetrisk väg • Spatial hantering — NV-Reason-CT omvandlar en 384×384×384-mm volym till ett 24×24×24 rutnät av 13 824 token med 3D MRoPE, ingen nedskalning vs Grok 4.6 behandlar en bild som en 2D-bild • Kontext — NV-Reason-CT en volym är ett fast prefix, inget kontextfönster i vanlig bemärkelse vs Grok 4.6 500 000 token • Utdata — NV-Reason-CT strukturerad rapport, svar eller resonemangsspår med avaktiverbart tänkande vs Grok 4.6 text med strukturerade utdata och verktygsanrop • Licens — NV-Reason-CT OpenMDW-1.1, 10,6 GB BF16-vikter vs Grok 4.6 proprietär, endast API • Pris — NV-Reason-CT GPU-kapacitetsinvestering, ingen per-token-avgift vs Grok 4.6 $2,00 / $6,00 per miljon, dubbelt över 200K indata

Paret framstår som en naturlig överlämning. NV-Reason-CT producerar fyndet från volymen; Grok 4.6 är modellen som du skulle lämna över tusen av dessa fynd till, i ett enda kontextfönster, för att leta efter mönster i en kohort. Ingen har publicerat den pipelinen. Det är den uppenbara arkitekturen, och det är värt att säga rakt ut att den är otestad.
Grok 4.6:s siffror, och vems de är
Två värden för Grok 4.6 cirkulerar tillsammans och de är inte av samma slag. GPQA Diamond-poängen på 94,9 mäts av Artificial Analysis, inte rapporteras av leverantören – vilket är den mer tillförlitliga av de två kategorierna, just för att en tredje part genomförde den. Poängen 44 på Artificial Analysis Intelligence Index, i indexrevision v4.3.2, placerar Grok 4.6 på plats 28 av 211 i sin klass. Artificial Analysis registrerar också modellen som proprietär: vikterna är inte offentligt tillgängliga.
På samma resultattavla mäter AA Terminal-Bench 2.1 till 88,4, SciCode till 56,5, Humanity's Last Exam till 42,9, 𝜏²-banking till 50,7 och long-context recall till 80,3. Det är instrument för allmän resonemangsförmåga. Inte ett enda av dem kan köras på en 3D-CT-volym, och det är inte en känga åt Grok 4.6 – det är ett konstaterande om vad benchmarksviten mäter.
CT-sidan har exakt en tabell, och den tillhör författarna.
NV-Reason-CT:s hela offentliga evidensbas är en enda klassificeringstabell över CT-RATE:s 18 etiketter, vid en fast enhetlig tröskel, med en direkt ja/nej-prompt utan klassificeringshuvud. Den rapporterar Macro-F1 0,614 och Macro-AUROC 0,871, mot VoxelFM på 0,581/0,870, Pillar-0 på 0,544/0,861, ClinFusion-8B på 0,442, CT-CLIP på 0,398/0,733, Merlin på 0,358/0,662 och MedGemma 1.5 på 0,303.
Dessa är leverantörsrapporterade, från modellkortet, och jag märker dem som sådana eftersom ingen oberoende part har reproducerat dem ännu. Två saker är värda att lägga märke till i tabellen. F1-marginalen gentemot VoxelFM är 0,033, vilket är ett verkligt gap på 18 etiketter med en fast tröskel. AUROC-marginalen gentemot samma modell är 0,001, vilket är oavgjort. Båda siffrorna finns i samma rad i samma tabell, och bara en av dem bär ett påstående.
Det andra som tabellen säger dig handlar om artikelns egen inramning. Jämförelsemodellerna är 3D-kontrastiva förträningssystem, en fusionerad generativ 2D/3D-MLLM och en skivbaserad frontier-modell. Författarna valde att benchmarka mot system som tar in volymer, eftersom det enda meningsfulla påståendet här är att en generativ 3D-modell kan slå diskriminativa 3D-modeller vid klassificering utan ett huvud. Det säger ingenting om hur NV-Reason-CT står sig mot en generell frontier-modell i något avseende, eftersom den jämförelsen inte finns på den här axeln.

Vart pengarna går, och varför nivågränsen spelar roll
Grok 4.6:s prislista har en detalj som i tysthet avgör en hel del arkitektur: prompter över 200K indatatokens debiteras till dubbla baspriset — $4.00 in, $12.00 ut, medan cache-läsningspriset stiger från $0.50 till $1.00. Ett kohortgranskningsjobb som ackumulerar fynd i en enda lång kontext är precis den arbetsbelastning som passerar den gränsen. Under den gränsen är cache-läsningspriset på $0.50 per miljon en fjärdedel av indatapriset, vilket är det som gör att loopa ett stort fast prefix över tusentals rapporter överkomligt snarare än bara möjligt.
Genom OrcaRouter serveras Grok 4.6 till den leverantörens listpris utan påslag, så nivåaritmetiken ovan är den aritmetik du faktiskt betalar, och eventuella framtida justeringar av den når din faktura samma dag i stället för vid nästa förnyelse. Anledningen till att rutta ett jobb som detta i stället för att hårdkoda en enda slutpunkt är att halvan med kohortgranskning i en klinisk pipeline är där du kommer att vilja prova tre olika modeller innan du bestämmer dig — och med en enda OpenAI-kompatibel nyckel med automatisk failover mellan leverantörer kostar det experimentet bara ett byte av modellnamn.
CT-delen av pipelinen har inget sådant alternativ. NV-Reason-CT finns inte hos OrcaRouter — det är en checkpoint på 10,6 GB med anpassad modellkod som du kör själv, på Ampere-, Hopper- eller Lovelace-hårdvara, med trust_remote_code=True. Vi kommer inte att antyda något annat. Om du bygger den här pipelinen köper du GPU:er för den ena halvan och tokens för den andra, och att båda halvorna åtminstone kan hanteras från en och samma konsol är det enda integrationspåstående som är värt att göra.

Vad en andra läsare egentligen är värd
NV-Reason-CT-artikeln innehåller en preliminär studie av expertradiologer som rapporterar "gynnsamma konfidensbedömningar för AI-assisterad granskning" och en 50-procentig minskning av den genomsnittliga rapporterade tolknings- och rapporteringstiden. Det är starka siffror, och de kommer med ett förbehåll som artikeln själv anger: preliminär, och författarnas egen studiedesign. Det finns ingen publicerad oberoende replikering, och en 50-procentig tidsminskning i en kontrollerad lässtudie är precis den typ av resultat som krymper vid replikering. Det är värt att följa. Det är inte värt att citera som etablerat.
Läst mot det är Grok 4.6:s bidrag till ett radiologiskt arbetsflöde inte diagnos över huvud taget. Det är lagret som läser rapporterna – triagekön, uppföljningsbrevet, kodningen, paketet för förhandstillstånd. Det arbetet är text, det har stor volym, det är billigt per enhet, och felmoden när det blir fel är administrativ snarare än klinisk. Det är också där ett 500K-kontextfönster och en cacheläsning för $0.50 verkligen förtjänar sin plats.
Så uppdelningen som den här jämförelsen landar i är krass: NV-Reason-CT har en riktig 3D-bana och ingen distribution, inget pris och ingen oberoende verifiering. Grok 4.6 har distribution, ett pris, oberoende benchmarktäckning och ingen volumetrisk bana alls. Om du behöver få skanningen läst kan bara en av dessa göra det. Om du behöver få pappersarbetet kring skanningen hanterat är det bara den andra som är en produkt.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
