
NV-Reason-CT vs Grok 4.6: Wie leest de scan, en wie leest het rapport
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 45 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 182 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Er zijn twee manieren om een AI op een CT-pijplijn te zetten, en slechts één daarvan gaat over het beeld. NV-Reason-CT is de eerste: een 3D vision-language-model met 4,69 miljard parameters dat NIfTI-volumes rechtstreeks leest en op 8 september 2026 op Hugging Face werd gepubliceerd zonder aankondigingsbericht van NVIDIA. Grok 4.6 is de tweede: een tekst-en-beeldmodel met 500.000 tokens dat op 12 augustus 2026 verscheen, $2,00 per miljoen invoertokens kost en zeer goed is in het deel van het werk dat plaatsvindt nadat iemand de bevinding al heeft opgeschreven. Zet ze in een vergelijking en de gebruikelijke vraag — welke is beter — blijkt verkeerd gesteld. Ze concurreren niet om dezelfde plek in de pijplijn. Ze concurreren om dezelfde begrotingspost.
Wat daadwerkelijk aan elke kant werd geleverd
NV-Reason-CT verscheen als een repository, een paper en een demo Space, niet als een product. De GitHub-repository onder NVIDIA-Medtech werd op 2 september 2026 aangemaakt; de Hugging Face-gewichten volgden op 8 september; de arXiv-preprint, NV-Reason-CT: 3D-visueel taalmodel voor CT-analyse, verscheen op 23 september met zestien auteurs van NVIDIA, de NIH en de Universiteit van Zürich. De nieuwsredactie van NVIDIA meldt er niets over. De modelkaart beschrijft versie 0.1 en beperkt het gebruik tot onderzoek en onderwijs.
Grok 4.6 is het tegenovergestelde soort release. Het is een eersteklas commercieel endpoint, vermeld als "Latest" in de ontwikkelaarsdocumentatie van de leverancier, geprijsd volgens een gepubliceerde tariefkaart, en beschikbaar als een OpenAI-compatibel model dat bestaande integraties overnemen door een basis-URL te wijzigen. Het volgde Grok 4.5 op met hetzelfde contextvenster, hetzelfde invoeroppervlak en dezelfde basisprijsstelling.
Die asymmetrie is het hele verhaal van deze vergelijking. Het ene is een onderzoeksartefact dat toevallig downloadbaar is. Het andere is infrastructuur. Ze tegen elkaar aflezen vertelt je waar de grens tussen "onderzoeksartefact" en "infrastructuur" momenteel ligt in medische beeldvorming — en die ligt niet waar je zou denken.
De arbeidsdeling, in inputs en outputs
• Volumetrische invoer — NV-Reason-CT leest .nii/.nii.gz NIfTI-volumes in Hounsfield-eenheden, alleen thorax of abdomen, tegenover Grok 4.6 die tekst, afbeeldingen en bestanden leest, zonder volumetrische route • Ruimtelijke verwerking — NV-Reason-CT converteert een volume van 384×384×384 mm naar een 24×24×24-raster van 13.824 tokens met 3D MRoPE, zonder downsampling, tegenover Grok 4.6 die een afbeelding als een 2D-afbeelding behandelt • Context — NV-Reason-CT: één volume is één vaste prefix, geen contextvenster in de gebruikelijke zin, tegenover Grok 4.6 met 500.000 tokens • Uitvoer — NV-Reason-CT: gestructureerd rapport, antwoord of redeneerspoor waarbij denken uitschakelbaar is, tegenover Grok 4.6: tekst met gestructureerde uitvoer en toolaanroepen • Licentie — NV-Reason-CT: OpenMDW-1.1, 10,6 GB BF16-gewichten, tegenover Grok 4.6: propriëtair, alleen API • Prijs — NV-Reason-CT: GPU-capex, geen tarief per token, tegenover Grok 4.6: $2,00 / $6,00 per miljoen, verdubbeld boven 200K invoer

Het paar komt over als een natuurlijke overdracht. NV-Reason-CT produceert de bevinding uit het volume; Grok 4.6 is het model waaraan je duizend van die bevindingen zou toevertrouwen, in één contextvenster, om patronen over een cohort heen te zoeken. Niemand heeft die pijplijn gepubliceerd. Het is de voor de hand liggende architectuur, en het is de moeite waard om ronduit te zeggen dat die ongetest is.
De cijfers van Grok 4.6, en van wie ze zijn
Twee cijfers voor Grok 4.6 circuleren samen, en het zijn niet hetzelfde soort gegeven. De GPQA Diamond-score van 94,9 is gemeten door Artificial Analysis, niet gerapporteerd door de leverancier — wat de betrouwbaardere van de twee categorieën is, juist omdat een derde partij de meting heeft uitgevoerd. De score van 44 op de Artificial Analysis Intelligence Index, op indexrevisie v4.3.2, plaatst Grok 4.6 op rang 28 van 211 in zijn klasse. Artificial Analysis registreert het model ook als propriëtair: de gewichten zijn niet openbaar beschikbaar.
Op hetzelfde bord meet AA Terminal-Bench 2.1 op 88,4, SciCode op 56,5, Humanity's Last Exam op 42,9, 𝜏²-banking op 50,7 en long-context recall op 80,3. Dat zijn instrumenten voor algemeen redeneren. Geen enkele ervan kan op een 3D-CT-volume worden uitgevoerd, en dat is geen kritiek op Grok 4.6 — het is een uitspraak over wat de benchmarksuite meet.
De CT-zijde heeft precies één tabel, en die is van de auteurs.
De volledige publieke bewijsbasis van NV-Reason-CT is één classificatietabel op de 18 labels van CT-RATE, bij een vaste uniforme drempel, met een directe Ja/Nee-prompt zonder classificatiehoofd. Het rapporteert Macro-F1 0,614 en Macro-AUROC 0,871, tegenover VoxelFM met 0,581/0,870, Pillar-0 met 0,544/0,861, ClinFusion-8B met 0,442, CT-CLIP met 0,398/0,733, Merlin met 0,358/0,662, en MedGemma 1.5 met 0,303.
Dit zijn door de leverancier gerapporteerde cijfers, afkomstig van de modelkaart, en ik label ze als zodanig omdat nog geen enkele onafhankelijke partij ze heeft gereproduceerd. Twee dingen vallen op in de tabel. De F1-marge ten opzichte van VoxelFM is 0,033, wat een reëel verschil is op 18 labels met een vaste drempel. De AUROC-marge ten opzichte van hetzelfde model is 0,001, wat een gelijkspel is. Beide getallen staan in dezelfde rij van dezelfde tabel, en slechts één ervan draagt een claim.
Het andere dat de tabel je vertelt, gaat over de eigen framing van de paper. De vergelijkingsmodellen zijn 3D-contrastieve pretrainingssystemen, een gefuseerd generatief 2D/3D-MLLM en een op slices gebaseerd frontiermodel. De auteurs kozen ervoor te benchmarken tegen systemen die volumes verwerken, omdat de enige betekenisvolle claim hier is dat een generatief 3D-model discriminatieve 3D-modellen kan verslaan bij classificatie zonder een head. Het zegt niets over hoe NV-Reason-CT zich op welk gebied dan ook verhoudt tot een algemeen frontiermodel, omdat die vergelijking op deze as niet bestaat.

Waar het geld naartoe gaat, en waarom de tiergrens van belang is
De tariefkaart van Grok 4.6 bevat een detail dat op stille wijze een groot deel van de architectuur bepaalt: prompts boven 200K invoertokens worden tegen het dubbele basistarief gefactureerd — $4,00 in, $12,00 uit, waarbij het tarief voor cache-lezen stijgt van $0,50 naar $1,00. Een cohortbeoordelingstaak die bevindingen in één lange context verzamelt, is precies de workload die die grens overschrijdt. Daaronder is het tarief voor cache-lezen van $0,50 per miljoen een kwart van de invoerprijs, en dat is wat het betaalbaar maakt in plaats van slechts mogelijk om een grote vaste prefix over duizenden rapporten te herhalen.
Via OrcaRouter wordt Grok 4.6 tegen de lijstprijs van die provider geleverd, zonder markup, dus de bovenstaande tier-berekening is de berekening die u daadwerkelijk betaalt, en elke toekomstige aanpassing daaraan bereikt uw factuur dezelfde dag in plaats van bij de volgende verlenging. De reden om een taak als deze te routeren in plaats van één endpoint hard te coderen, is dat het cohortbeoordelingsdeel van een klinische pijplijn precies is waar u drie verschillende modellen wilt uitproberen voordat u een keuze maakt — en met één OpenAI-compatibele sleutel met automatische failover tussen providers kost dat experiment alleen een wijziging van de modelnaam.
De CT-helft van de pipeline heeft die optie niet. NV-Reason-CT wordt niet gehost op OrcaRouter — het is een checkpoint van 10,6 GB met aangepaste modelcode die je zelf draait, op Ampere-, Hopper- of Lovelace-silicon, met trust_remote_code=True. We gaan niet anders suggereren. Als je deze pipeline bouwt, koop je GPU's voor de ene helft en tokens voor de andere, en het feit dat beide helften op zijn minst vanuit één console kunnen worden beheerd, is de enige integratieclaim die de moeite waard is.

Wat een tweede lezer werkelijk waard is
Het NV-Reason-CT-artikel bevat een voorlopige studie met expert-radiologen die "gunstige vertrouwensscores voor AI-ondersteunde beoordeling" rapporteert en een vermindering van 50% in de gemiddeld gerapporteerde interpretatie- en rapportagetijd. Dat zijn sterke cijfers, en ze gaan gepaard met een voorbehoud dat het artikel zelf vermeldt: voorlopig, en het eigen studiedesign van de auteurs. Er is geen gepubliceerde onafhankelijke replicatie, en een tijdsreductie van 50% in een gecontroleerde leesstudie is precies het soort resultaat dat krimpt bij replicatie. Het is de moeite waard om te volgen. Het is niet de moeite waard om het als vaststaand te citeren.
Daartegen afgezet is de bijdrage van Grok 4.6 aan een radiologie-workflow helemaal geen diagnose. Het is de laag die de verslagen leest — de triagewachtrij, de follow-upbrief, de codering, het pakket voor voorafgaande machtiging. Dat werk is tekst, het gaat om grote volumes, het is goedkoop per eenheid, en de manier waarop het misgaat is administratief in plaats van klinisch. Het is ook waar een contextvenster van 500K en een cacheread van $0,50 echt hun plaats verdienen.
De tweedeling waar deze vergelijking op uitkomt is bot: NV-Reason-CT heeft een echt 3D-traject en geen distributie, geen prijs en geen onafhankelijke verificatie. Grok 4.6 heeft distributie, een prijs, onafhankelijke benchmarkdekking en helemaal geen volumetrisch traject. Als je de scan wilt laten lezen, kan slechts één van deze dat doen. Als je het papierwerk rond de scan wilt laten afhandelen, is alleen de andere een product.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
