
NV-Reason-CT vs GPT-5.6 Sol: 13.824 visuele tokens voordat je een woord typt
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 45 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 182 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Elke afzonderlijke chest-CT die je naar NV-Reason-CT stuurt, kost 13.824 visuele tokens voordat de prompt begint. Dat is geen eigenaardigheid of een afstemmingskeuze — het is het hele ontwerp. De native 3D-vision-encoder van het model neemt een volume van 384×384×384 mm en verandert dat in een raster van 24×24×24, en de modelkaart zegt expliciet dat alle 13.824 tokens en hun driedimensionale coördinaten het taalmodel bereiken "zonder ruimtelijke downsampling". Vergelijk dat met wat je waarschijnlijk al betaalt. GPT-5.6 Sol accepteert tekst, afbeeldingen en bestanden, en een afbeelding die ernaartoe wordt gestuurd is een 2D-plaatje — een slice, een screenshot van een DICOM-viewer, een radiologische afbeelding die uit een pdf is geplakt. Een van deze modellen heeft een volumetrische route. Het andere heeft een contextvenster. De meeste vergelijkingen tussen beide lopen stuk op dat onderscheid, en dat uiteenlopen is het interessante deel.
De release die niemand aankondigde
NVIDIA heeft geen woord over NV-Reason-CT gepubliceerd in zijn nieuwsruimte. Er is geen lanceringsbericht, geen keynoteslide, geen persbericht. Wat er wel is: een Hugging Face-repository die op 8 september 2026 is aangemaakt, een GitHub-repository onder de NVIDIA-Medtech-organisatie die op 2 september is aangemaakt, een Gradio-demo-Space, en een arXiv-preprint — NV-Reason-CT: 3D Visueel Taalmodel voor CT-analyse — ingediend op 23 september 2026 door een team van zestien auteurs van NVIDIA, met coauteurs bij de NIH en de Universiteit van Zürich.
Dat is een echt patroon, en het is de moeite waard om het precies te benoemen in plaats van het als een mysterie te behandelen. NVIDIA's groep voor medische beeldvorming brengt gewichten stil uit en laat de paper en de repository het aankondigen. De voorganger, NV-Reason-CXR-3B, verscheen in oktober 2025 op dezelfde manier. Het verschil hier is de schaal: dit is de eerste keer dat die groep het recept heeft uitgebreid van 2D-röntgenfoto's naar native 3D-volumes, en de paper is twee dagen oud.
Wat uit de repository valt te weten: architectuur, licentie, trainingsdata, de benchmarktabel. Wat nog niet bevestigd is: of NVIDIA dit bedoelt als een ondersteunde productlijn, of er meer checkpoints volgen, en hoe het standhoudt onder evaluatie door wie dan ook anders dan de auteurs. De repository is versie 0.1 en omschrijft zichzelf als uitsluitend voor onderzoek en onderwijs.
Wat elk model daadwerkelijk accepteert
Dit is waar een directe vergelijking snel eerlijk wordt. De twee modellen delen geen invoeroppervlak.
NV-Reason-CT leest NIfTI-volumes — .nii of .nii.gz — met voxelintensiteiten in Hounsfield-eenheden. Het snijdt automatisch bij tot de borstkas of het abdomen met behulp van long-Hounsfield-eenheden en een 3D-morfologieheuristiek, herbemonstert naar een isotrope resolutie van 2 mm en accepteert alleen "chest" of "abdomen" als anatomiewaarden. Het geeft tekst als uitvoer: een gestructureerd rapport, een antwoord of een stapsgewijze redeneertracering, met een schakelaar om de redenering uit te schakelen voor korte antwoorden.
GPT-5.6 Sol leest tekst, afbeeldingen en bestanden, met een contextvenster van 1.050.000 tokens en tot 128.000 uitvoertokens in één enkel antwoord. Het heeft geen volumetrische encoder. Voer je er een CT in, dan moet je eerst beslissen hoe je een driehonderdtal slices plat slaat tot iets dat een 2D-beeldencoder accepteert — een montage, een handvol sleutelslices, een gerenderde maximumintensiteitsprojectie. Elk van die keuzes gooit de ruimtelijke relaties weg die het 3D-pad moest behouden.
Dus de eerlijke framing is niet "welk model is slimmer". Het is dat het beeldpad van Sol en het 3D-pad van NV-Reason-CT verschillende vragen beantwoorden. Sol kan redeneren over de beschrijving die een radioloog van een scan geeft. NV-Reason-CT kan redeneren over de scan.
Er bestaat één benchmark, en slechts één ervan heeft een nummer erop.
NV-Reason-CT rapporteert een Macro-F1 van 0,614 en een Macro-AUROC van 0,871 op de 18-labelclassificatietaak van CT-RATE, met een directe ja/nee-prompt zonder classificatiehoofd en zonder taakspecifieke adaptatie. Dat zijn de eigen cijfers van de auteurs uit de modelkaart, en de vergelijkingsrij is het nuttige onderdeel: VoxelFM met een Macro-F1 van 0,581, Pillar-0 met 0,544, ClinFusion-8B met 0,442, CT-CLIP met 0,398, Merlin met 0,358, MedGemma 1.5 met 0,303. Bij dezelfde vaste uniforme drempel verslaat een generatief 3D-model de 3D-contrastieve pretrainingsbaselines en het op slices gebaseerde frontier-model.
Eén getal in die tabel verdient scepsis in plaats van herhaling: het AUROC-verschil. NV-Reason-CT rapporteert 0,871 tegenover 0,870 van VoxelFM. Een duizendste van een punt, in een evaluatie die door de leverancier is uitgevoerd, is geen overwinning — het is een gelijkspel binnen de ruis die de evaluatie ook met zich meebrengt. Het Macro-F1-verschil van 0,033 is de onderbouwde bewering.
GPT-5.6 Sol heeft geen CT-RATE-getal, omdat CT-RATE geen benchmark is waarop het kan worden gedraaid. Het heeft een Artificial Analysis Intelligence Index van 47, een door AA gemeten GPQA Diamond-score van 94,1 en een Humanity's Last Exam-score van 49,5 — allemaal instrumenten voor algemeen redeneervermogen. 0,614 Macro-F1 naast 47 op de AA Index zetten zou rekenen met twee verschillende meetlatten zijn. Dat ga ik niet doen, en je zou iedereen moeten wantrouwen die dat wel doet.
Redeneersporen, twee verschillende producten
Beide modellen genereren redeneringen. Dat is de enige echte filosofische overlap, en het verschil is leerzaam.
GPT-5.6 Sol biedt een configureerbare redeneerinspanning, dus je weegt per verzoek latentie en kosten af tegen diepgang, en je kunt de redenering terugvragen via include_reasoning. Het is een algemene capaciteit die wordt toegepast op alles wat je ernaartoe stuurt.
De redenering van NV-Reason-CT is bewust beperkt. Het trainingscorpus omvat ongeveer 550.000 gestructureerde QA-voorbeelden uit 70.111 unieke CT-volumes, en een deel ervan bestaat uit door radiologen opgestelde redeneringen die zijn verzameld uit opgenomen en getranscribeerde expertinterpretaties. De GRPO-fase die op SFT volgt, gebruikt verifieerbare beloningen voor sets van borst- en buikafwijkingen — wat betekent dat het beloningssignaal is gebaseerd op of een vermelde bevinding daadwerkelijk in het volume aanwezig is, en niet op of het proza goed leest. De modelkaart beschrijft de uitvoer als 'controleerbare observaties, differentiaaldiagnoses en onzekerheid', en bevat een expliciete waarschuwing dat gegenereerde redeneringen 'niet gegarandeerd de interne berekening van het model weerspiegelen'. Die waarschuwing doet echt werk. Het is het verschil tussen een spoor dat je tegen de data kunt controleren en een spoor dat je alleen maar kunt bewonderen.
De grootte en de licentie, in één keer
• Parameters — NV-Reason-CT 4,69 mld. totaal / 4,35 mld. actief in het CT-pad, op basis van een Qwen3.5-4B-backbone plus een Primus 3D ViT vs GPT-5.6 Sol niet bekendgemaakt • Checkpointgrootte — NV-Reason-CT ~10,6 GB BF16-safetensors, draait op Ampere/Hopper/Lovelace vs GPT-5.6 Sol alleen via API • Invoer — 3D NIfTI-CT-volumes in Hounsfield-eenheden vs tekst, afbeelding, bestand • Context — NV-Reason-CT niet van toepassing, één volume is één vaste prefix van 13.824 tokens vs Sol 1.050.000 tokens in, 128.000 uit • Licentie — OpenMDW-1.1, gewichten te downloaden vs propriëtair, alleen API-toegang • Beschikbaarheid — repository van de leverancier en eigen gewichten vs via OrcaRouter gerouteerd tegen $4,00 / $20,00 per miljoen, waarbij het tarief van Sol boven 272K invoertokens verdubbelt naar $8,00 / $30,00

Wat de split je eigenlijk kost
De kostenvergelijking is alleen zinvol als je eenmaal accepteert dat de workloads verschillen, dus hier is de versie die wél zinvol is.
Sol wordt per token gefactureerd en de prijs kent een tariefklif: $4,00 per miljoen inputtokens en $20,00 per miljoen outputtokens tot 272K tokens aan prompt, daarna $8,00 en $30,00. Op OrcaRouter wordt het aangeboden tegen de eigen lijstprijs van OpenAI, zonder opslag, wat meer uitmaakt dan het klinkt: het tarief dat je ziet, is het tarief dat OpenAI publiceert, zodat elke prijswijziging dezelfde dag nog op je factuur terechtkomt in plaats van bij de volgende contractverlenging. Het cache-leestarief is $0,40 per miljoen, een tiende van de inputprijs, wat lange agentische loops met een grote vaste prefix rekenkundig levensvatbaar maakt.
NV-Reason-CT heeft helemaal geen prijs per token. Je downloadt 10,6 GB en betaalt voor de GPU. Dat is een kwestie van capex versus opex, en daar is maar één antwoord op: bij een voldoende hoog volume wint het zelf hosten van een model met 4,35 miljard actieve parameters op kosten. Onder dat volume is dat niet het geval, en het omslagpunt hangt volledig af van je GPU-benutting. Niemand buiten NVIDIA heeft nog een doorvoercijfer voor deze checkpoint gepubliceerd, dus iedereen die je een omslagpunt noemt, gokt.

Waar een router hierbij helpt, is het deel van de workflow dat niet de scan is. Een productiepijplijn voor klinisch onderzoek is zelden één model — het is extractie, een redeneerstap, een samenvattingsstap, soms een second opinion. OrcaRouter biedt 200+ modellen achter één OpenAI-compatibel eindpunt met automatische failover tussen providers, zodat het deel van die pijplijn voor algemene doeleinden kan worden omgewisseld of omgeleid zonder een tweede contract. NV-Reason-CT is niet een van de modellen die wij routeren; het is een checkpoint dat u zelf draait. De twee helften van de pijplijn kunnen nog steeds achter één sleutel zitten.

De open vraag
NV-Reason-CT is twee dagen oud als paper en zeventien dagen oud als repository, en het vakgebied waartoe het behoort is klein genoeg dat het volgende datapunt informatief zal zijn. Let op drie dingen: een onafhankelijke reproductie van CT-RATE, een tweede checkpoint in de familie, en elk teken dat de medische groep van NVIDIA dit als een productlijn behandelt in plaats van als een paper. Tot die tijd is het verdedigbare standpunt smal en duidelijk — dit is het sterkste native-3D CT-redeneercheckpoint dat momenteel te downloaden is, beoordeeld op de eigen tabel van de auteurs, en het is geen vervanging voor een algemeen frontiermodel, behalve bij het lezen van een CT.
