Een gegenereerde hero-kaart met de titel 'NV-Reason-CT vs Gemini 3.1 Pro' en de ondertitel 'Het breedste invoeroppervlak, en nog steeds geen CT-lezer'. Twee tegenover elkaar staande kaarten worden gescheiden door een paar blauwe pijlen: de linkerkkaart is gelabeld 'NV-Reason-CT' met een body-scan-pictogram en 'alleen borst en buik - 13.824 visuele tokens per volume - OpenMDW-1.1'; de rechterkaart is gelabeld 'Gemini 3.1 Pro' met een chip-pictogram en 'audio, video, afbeelding, bestand, tekst in - 1M context - preview-tier'. Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Guides & Insights

NV-Reason-CT vs Gemini 3.1 Pro: Het breedste invoeroppervlak, en nog steeds geen CT-lezer

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Vierennegentig procent. Dat is het foutpercentage dat onze eigen catalogus momenteel registreert voor één route die Gemini 3.1 Pro bedient — 93,93%, samen met een mediane tijd tot de eerste token die leest als een plafond van tien seconden en een doorvoercijfer van 978 tokens per seconde. Lees dat als een uitspraak over het model en je trekt precies de verkeerde conclusie. Lees het als een uitspraak over een preview-laag onder belasting en het wordt het nuttigste op de pagina, want het is wat een klinische pijplijn daadwerkelijk ervaart wanneer die afhankelijk is van een route die niet is geprovisioneerd voor productieverkeer.

Het model aan de andere kant van deze vergelijking heeft dat probleem niet en een dergelijke meting evenmin. NV-Reason-CT is de native 3D-CT-redeneerder van NVIDIA met 4,69 miljard parameters, downloadbaar onder OpenMDW-1.1, zonder enig gepubliceerd doorvoercijfer en zonder hosting, waar dan ook. Dus de ene kant van deze confrontatie geeft je het breedste invoeroppervlak in het veld, met een beschikbaarheidsprofiel waarmee je bij je ontwerp rekening moet houden; de andere geeft je één beperkte capaciteit met een latentie die je zelf moet meten. Geen van beide heeft een monitoringdashboard dat je vanaf dag één kunt vertrouwen, en dat om tegenovergestelde redenen.

Twee modellen, twee definities van "multimodaal"

Het woord doet veel werk in beide productbeschrijvingen, en bijna niets daarvan wordt gedeeld.

• Geaccepteerde invoer — Gemini 3.1 Pro accepteert tekst, afbeeldingen, audio, video en bestanden; NV-Reason-CT accepteert een enkelkanaals NIfTI-volume in Hounsfield-eenheden, en niets anders

• Wat "3D" betekent — NV-Reason-CT herbemonstert naar 2 mm isotroop over een kubus van 384 millimeter en verdeelt deze in 8 x 8 x 8 patches voor een raster van 24 x 24 x 24; de video-invoer van Gemini 3.1 Pro is een reeks tweedimensionale frames met een tijdlijn

• Context — 1.048.576 tokens in en 65.536 uit voor Gemini 3.1 Pro; één volume is 13.824 visuele tokens voor NV-Reason-CT, zonder downsampling en zonder samenvoeglaag, en er is geen chatvenster eromheen

• Release — 19 februari 2026 voor Gemini 3.1 Pro, op een preview-slug; een onaangekondigde onderzoeksrelease voor NV-Reason-CT, met repository-activiteit gedateerd van 2 tot 25 september 2026

• Prijs — $2 en $12 per miljoen tokens tot 200.000 tokens, daarna $4 en $18, met cache-leesbewerkingen tegen $0,20 en cache-schrijfbewerkingen tegen $0,375; tegenover zelfgehoste gewichten zonder tariefkaart

• Mogelijkheden — beeld, audio, toolgebruik, JSON-uitvoer en redeneren voor Gemini 3.1 Pro; gestructureerde bevindingen per anatomische regio voor NV-Reason-CT, zonder tools

• Licentie en status — een gehoste preview-API; op OpenMDW-1.1-gewichten waarvan de modelkaart zegt uitsluitend voor onderzoek en onderwijs, en duidelijk vermeldt dat het geen medisch hulpmiddel is

Een video-input en een volumetrische CT-input lijken van een afstand op elkaar en liggen van dichtbij zo ver uiteen als maar mogelijk is. Video bestaat uit frames in de tijd. Een CT-studie is één statisch volume met drie ruimtelijke assen, een fysieke schaal in millimeters en een gekalibreerde dichtheidseenheid, waarbij het gemetene de dichtheid is van een structuur waarvan de grootte ertoe doet. Gemini 3.1 Pro zal een chirurgische opname bekijken en beschrijven wat er is gebeurd. Het zal geen nodule meten. Dat is geen beperking die Google heeft verzuimd aan te pakken; het is een ander probleem dat niemand met een algemeen model heeft opgelost.

Wat de twee benchmarkrecords omvatten, en wat ze weglaten

Gemini 3.1 Pro heeft een onafhankelijk trackrecord en het is een goed trackrecord op de assen die het meet.

• GPQA Diamond — 94,1, het hoogste cijfer in deze hele reeks artikelen

• Humanity's Last Exam — 47, met een langcontext-recallscore van 82, opnieuw de hoogste in deze vergelijking

• IFBench en SciCode — 77,14 en 58,7

• τ²-Bench — 95,61, met tau_banking op 21,44 en Terminal-Bench Hard op 53,79

• Artificial Analysis Intelligentie en Coding — 29,7 en 68,8

• Gemeten latentie — een mediaan van tien seconden tot het eerste token, wat eerder een plafond dan een echte mediaan lijkt te zijn, bij 978 tokens per seconde en een foutpercentage van 93,93%

Let op de vorm daarvan: een kennis- en long-contextprofiel bovenaan de vergelijking, een intelligentie-index in het lagere midden, en een beschikbaarheidsmeting die onbruikbaar is. Alle drie beschrijven ze hetzelfde model op dezelfde route. Een hoge GPQA Diamond betekent dat het heel veel weet. Een samengestelde score van 29,7 betekent dat het niet op alles vooroploopt. Een foutpercentage van 93,93% betekent dat op dit specifieke pad de meeste van je verzoeken niet zullen worden voltooid — en dat is vrijwel zeker een kwestie van capaciteit en provisioning bij een preview-endpoint, en niet een eigenschap van de gewichten. We kunnen van buitenaf niet bewijzen welke van de twee het is. Wat we wel kunnen zeggen, is dat geen van die drie getallen een typefout is, en dat elke architectuur die alleen het eerste getal leest, een slechte week krijgt.

De prestatie van NV-Reason-CT is beperkter en kent een ander voorbehoud. De 0,614 F1 en 0,871 AUROC op CT-RATE, over achttien labels met een vaste uniforme drempel en een directe ja/nee-prompt en zonder classificatiehoofd of taakspecifieke aanpassing, zijn NVIDIA's eigen cijfers uit NVIDIA's eigen paper. De vergelijkingsset erachter — VoxelFM met 0,581, Pillar-0 met 0,544, ClinFusion-8B met 0,442, CT-CLIP met 0,398, Merlin met 0,358, MedGemma 1.5 met 0,303 — bevat alleen beeldvormingsmodellen. Er komt geen algemeen multimodaal model in voor, wat betekent dat de vraag "hoe zou Gemini 3.1 Pro presteren op CT-RATE" niet is gesteld, laat staan beantwoord.

A generated scoreboard titled 'Breadth on one side, depth on the other' with two columns. The left column, headed 'Gemini 3.1 Pro', lists six rows: inputs, text, image, audio, video, file; context, 1,048,576 in and 65,536 out; GPQA Diamond 94.1; AA Intelligence 29.7; route reliability, 93.93% measured error rate; price, $2 and $12 per million tokens, doubling past 200k. The right column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI in Hounsfield units; context, 13,824 visual tokens per volume, no chat window; CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; route reliability, not applicable, self-hosted; price, no rate card, no published throughput. A footer reads 'The 93.93% error rate describes a preview route under load, not the quality of the weights.'

Het preview-tier-probleem, correct geformuleerd

Dit is het deel van de vergelijking dat niets met CT te maken heeft en alles met het runnen van welke klinische activiteit dan ook.

Een foutpercentage van 93,93% is geen subtiele verslechtering. Het is een route waarop de overgrote meerderheid van de aanroepen mislukt. De natuurlijke reactie is om het model onbruikbaar te verklaren, en die reactie is om twee redenen onjuist. Ten eerste weerspiegelt een foutpercentage dat op een preview-endpoint is gemeten capaciteit, quota en regionale routering, niet het vermogen van het model. De preview-tiers van Google staan erom bekend dat ze voor evaluatie zijn ingericht in plaats van voor productie, en een slug die naar een preview is vernoemd, is een slug die zonder kennisgeving kan worden afgeknepen. Ten tweede is de meting een momentopname van één pad op één moment. Die zal veranderen. Wat niet zal veranderen, is de les: een afhankelijkheid van een preview-route is een afhankelijkheid van een capaciteitsbeslissing die iemand anders neemt.

De mitigerende maatregelen zijn weinig glamoureus, en ze zijn precies de reden waarom routing bestaat als discipline in plaats van als een gemak.

• Hardcodeer nooit een preview-slug in een productiepad — plaats de functionaliteit achter een interface, zodat het model erachter kan worden vervangen zonder een deployment

• Opnieuw proberen en terugvallen op een andere provider of een ander model — voor een batch-extractietaak is een uitvalpercentage van 94% te overleven als de mislukkingen elders worden afgehandeld, en fataal als dat niet gebeurt

• Meet je eigen foutenpercentage in plaats van er een over te nemen — het cijfer van 93,93% is het getal uit onze catalogus voor één route, en dat van jou hangt af van je regio, je volume en de vorm van je werklast

• Houd een tweede model warm voor alles op een klinische tijdlijn — de faalmodus waartegen je je beschermt is niet een slecht antwoord, het is geen antwoord

Dezelfde discipline geldt in de tegenovergestelde richting aan de CT-kant, waar er helemaal geen route is. Een self-hosted model heeft geen foutpercentage van een provider; het heeft een hardwarefoutpercentage, een onderhoudslast en een capaciteitsplafond dat wordt bepaald door hoeveel GPU's je hebt gekocht. De faalmodus is een wachtrij, en de mitigerende maatregel is planning in plaats van failover. Ander probleem, dezelfde regel: weet van welk getal je daadwerkelijk afhankelijk bent.

Waar een lange context echt helpt, en waar niet

Het tokenvenster van 1.048.576 tokens en de long-context-recallscore van 82 punten van Gemini 3.1 Pro zijn echte voordelen, en het is de moeite waard om ze bewust te benutten in plaats van per ongeluk.

Waar ze in een CT-programma hun waarde bewijzen, is niet de scan. Het is alles eromheen. Eén extractieronde over een lang operatieverslag en de bijbehorende rapporten, waarbij het hele document in context wordt gehouden zodat de velden met elkaar consistent zijn. Een cohortsamenvatting die honderden patiëntverhalen tegelijk moet vasthouden om het patroon tussen al die verhalen te vinden. Een conversietaak waarbij het schema, honderd voorbeeldrecords en het foutenlogboek allemaal in dezelfde call zichtbaar moeten zijn. Dat zijn taken waarbij een lang venster het antwoord verandert, niet alleen het gemak.

De plek waar het niet helpt, is de scan zelf, en de reden is het waard om precies te noemen, omdat het precies de fout is die deze match-up uitlokt. Een thorax-CT die wordt weergegeven zoals NV-Reason-CT die weergeeft, kost 13.824 tokens. Gemini 3.1 Pro zou zeventig van dergelijke studies in zijn venster kunnen houden, met ruimte over. De beperking is niet de ruimte. Het is dat het visiepad van Gemini 3.1 Pro een afbeelding behandelt als een plaatje met een pixelschaal, zodat een op die manier gepresenteerde studie de tussenplakafstand en de dichtheidscalibratie al kwijt is voordat het eerste token wordt gegenereerd. Je kunt een miljoen tokens uitgeven aan een volume en nog steeds geen volume hebben. De eigen vergelijking van het paper maakt de kosten daarvan concreet: MedGemma 1.5 met 0,303 F1 wanneer het wordt gevoed met maximaal 85 axiale plakken, tegenover 0,614 voor het native volumetrische model, wat een verschil van ongeveer het dubbele is.

Waar we passen, en het enige dat we niet zullen zeggen

Gemini 3.1 Pro wordt via OrcaRouter aangeboden als google/gemini-3.1-pro-preview tegen het lijsttarief van de provider, zonder markup, binnen één enkele API die meer dan 200 modellen dekt. Voor een model dat zich momenteel in een previewfase bevindt, is die combinatie nuttiger dan het klinkt. Nul markup betekent dat een tariefwijziging van de leverancier dezelfde dag nog bij ons terechtkomt, in plaats van te worden opgevangen door een tussenlaag die een oud getal aanhoudt. Automatische failover betekent dat een route die begint te falen niet ook een hele batch onderuit haalt — wat, gezien een gemeten foutpercentage in de negentig op één pad, niet hypothetisch is. En een routing-DSL om individuele verzoeken naar het model te sturen dat ze zou moeten verwerken, laat je het long-contextwerk op het ene model zetten en het goedkope werk met groot volume op het andere, zonder twee integraties te onderhouden.

NV-Reason-CT staat niet op ons platform. Dat geldt voor geen enkel NVIDIA-model. Het zijn gewichten die je zelf downloadt en draait, en de eerlijke voorstelling van zaken is dat de twee helften van deze architectuur zich op volledig verschillende plekken bevinden: de ene achter een API met een tariefkaart en een preview-risico, de andere op je eigen hardware met een OpenMDW-1.1-licentie en een doorvoercijfer dat je zelf moet produceren.

A generated scoreboard titled 'What each side gives you, and what it costs' listing five paired rows. Row one: widest input surface, audio, video, image and file against text only, one modality at a time. Row two: longest context, 1,048,576 tokens in against 13,824 tokens per volume. Row three: highest benchmark, GPQA Diamond 94.1 against CT-RATE F1 0.614. Row four: weakest measured figure, a 93.93% route error rate against no published throughput at all. Row five: dependency, a hosted preview tier against your own GPUs. A footer reads 'Both sides carry a number nobody should build on without measuring it themselves.'A screenshot of the OrcaRouter model page for Gemini 3.1 Pro, showing the identifier google/gemini-3.1-pro-preview with tags for Vision, Audio, Video, Tools, JSON and Reasoning, the description of it as a multimodal model accepting text, image, audio, video and file input, and a side panel listing a 1,048,576-token context window with up to 65,536 output tokens. A stat strip reads $2.00 per million input tokens, $12.00 per million output tokens, a median time to first token, and an error rate of 93.93 percent.

De beslissing die contact met productie overleeft

Als je probleem tekst-, audio-, video- of documentbegrip in een lange context is, staat Gemini 3.1 Pro volgens onafhankelijke metingen aan de top van het vakgebied op het gebied van kennis en recall, en het enige dat tussen Gemini 3.1 Pro en een productiepijplijn staat, is routebetrouwbaarheid — wat een oplosbaar engineeringprobleem is, geen modelprobleem. Zet het achter failover, hardcode de preview-slug niet, en meet je eigen foutpercentage in plaats van dat van wie dan ook te vertrouwen, inclusief het onze.

Als je probleem een CT-volume van de thorax of het abdomen is, is er in deze vergelijking precies één open model dat dit kan aanpakken, het is niet het model met het miljoen-tokenvenster, en het getal dat leidend zou moeten zijn voor je planning is niet zijn F1-score. Het is de latentie per studie die niemand heeft gepubliceerd. Meet die voordat je iemand een doorvoercijfer belooft.

Deze vergelijking is de moeite waard, want ze scheidt twee zaken die voortdurend op één hoop worden gegooid: breedte van invoer en diepte van representatie. Gemini 3.1 Pro heeft het breedste invoeroppervlak dat iemand heeft uitgebracht en de beste lang-context-recall in deze set, en toch kan het een CT-onderzoek niet als een CT-onderzoek lezen. NV-Reason-CT kan er één lezen en verder niets. Een pijplijn heeft beide nodig, heeft ze op verschillende infrastructuur nodig, en moet weten welk van de twee getallen aan elke kant het getal is dat je om drie uur ’s nachts zal oproepen.