Ett genererat hjältekort med titeln "NV-Reason-CT vs Gemini 3.1 Pro" och underrubriken "Den bredaste indataytan, och fortfarande ingen CT-läsare". Två kort som står mot varandra åtskiljs av ett par blå pilar: det vänstra kortet är märkt "NV-Reason-CT" med en kroppsskanningsikon och "endast bröstkorg och buk – 13 824 visuella tokens per volym – OpenMDW-1.1"; det högra kortet är märkt "Gemini 3.1 Pro" med en chipikon och "ljud, video, bild, fil, text in – 1M kontext – förhandsgranskningsnivå". OrcaRouter-logotypen är sammansatt i det nedre högra hörnet.
Guides & Insights

NV-Reason-CT vs Gemini 3.1 Pro: Den bredaste inmatningsytan, och fortfarande inte en CT-läsare

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Nittiofyra procent. Det är felfrekvensen som vår egen katalog för närvarande registrerar för en rutt som betjänar Gemini 3.1 Pro — 93,93 %, tillsammans med en median för tid till första token som framstår som ett tak på tio sekunder och en genomströmning på 978 tokens per sekund. Läs det som ett uttalande om modellen och du kommer att dra precis fel slutsats. Läs det som ett uttalande om en förhandsvisningsnivå under belastning och det blir det mest användbara på sidan, eftersom det är vad en klinisk pipeline faktiskt upplever när den är beroende av en rutt som inte har provisionerats för produktionstrafik.

Modellen på andra sidan av denna jämförelse har inget sådant problem och ingen sådan mätning. NV-Reason-CT är NVIDIAs nativa 3D-CT-resonemangsmodell med 4,69 miljarder parametrar, nedladdningsbar under OpenMDW-1.1, helt utan publicerad genomströmningssiffra och utan värdskap någonstans. Så ena sidan av den här matchningen ger dig den bredaste indataytan på området, med en tillgänglighetsprofil som du måste anpassa designen efter; den andra ger dig en enda snäv förmåga med en latens som du själv måste mäta. Ingen av dem har en övervakningspanel som du kan lita på från dag ett, och det av motsatta skäl.

Två modeller, två definitioner av "multimodal"

Ordet gör ett stort arbete i båda produktbeskrivningarna, och nästan inget av det är gemensamt.

• Indata som accepteras — Gemini 3.1 Pro tar emot text, bilder, ljud, video och filer; NV-Reason-CT tar emot en enkanalig NIfTI-volym i Hounsfieldenheter, och inget annat

• Vad "3D" innebär — NV-Reason-CT omsamplar till 2 mm isotropt över en kub på 384 millimeter och delar upp den i 8 x 8 x 8-patchar för ett 24 x 24 x 24-rutnät; Gemini 3.1 Pro:s videoindata är en sekvens av tvådimensionella bildrutor med en tidslinje

• Kontext — 1 048 576 tokens in och 65 536 ut för Gemini 3.1 Pro; en volym är 13 824 visuella tokens för NV-Reason-CT, utan nedskalning och utan sammanslagningslager, och det finns inget chattfönster runt den

• Släpp — 19 februari 2026 för Gemini 3.1 Pro, på en förhandsvisningsslug; ett oannonserat forskningssläpp för NV-Reason-CT, med repositorieaktivitet daterad 2–25 september 2026

• Pris — $2 och $12 per miljon tokens upp till 200 000 tokens, därefter $4 och $18, med cacheläsningar för $0,20 och cacheskrivningar för $0,375; mot egenhostade vikter utan prislista

• Kapaciteter — vision, ljud, verktygsanvändning, JSON-utdata och resonemang för Gemini 3.1 Pro; strukturerade fynd per anatomisk region för NV-Reason-CT, utan verktyg

• Licens och status — ett hostat förhandsversions-API; mot OpenMDW-1.1-vikter vars modellkort säger att det endast är för forskning och utbildning och klart anger att det inte är en medicinteknisk produkt

En videoindata och en volymetrisk CT-indata ser närliggande ut på avstånd och kan på nära håll inte vara längre ifrån varandra. Video är bildrutor över tid. En CT-undersökning är en enda statisk volym med tre rumsliga axlar, en fysisk skala i millimeter och en kalibrerad densitetsenhet, där det som mäts är densiteten hos en struktur vars storlek har betydelse. Gemini 3.1 Pro kommer att titta på en kirurgisk inspelning och beskriva vad som hände. Den kommer inte att mäta en nodul. Det är inte en begränsning som Google misslyckades med att åtgärda; det är ett annat problem som ingen har löst med en allmän modell.

Vad de två referensposterna omfattar, och vad de utelämnar

Gemini 3.1 Pro har ett oberoende track record, och det är ett bra sådant längs de axlar det mäter.

• GPQA Diamond — 94,1, den högsta siffran i hela den här uppsättningen artiklar

• Humanity's Last Exam — 47, med en poäng på 82 för återkallning i lång kontext, återigen högst i denna jämförelse

• IFBench och SciCode — 77,14 och 58,7

• τ²-Bench — 95,61, med tau_banking på 21,44 och Terminal-Bench Hard på 53,79

• Artificial Analysis Intelligence and Coding — 29,7 och 68,8

• Uppmätt latens — en median på tio sekunder till första token, vilket tycks vara ett tak snarare än en sann median, vid 978 tokens per sekund och en felfrekvens på 93,93 %

Lägg märke till formen på det: en kunskaps- och långkontextprofil högst upp i jämförelsen, ett intelligensindex i nedre mitten, och en tillgänglighetsmätning som är oanvändbar. Alla tre beskriver samma modell på samma rutt. En hög GPQA Diamond betyder att den vet en hel del. Ett sammansatt värde på 29,7 betyder att den inte leder inom allt. En felfrekvens på 93,93 % betyder att, på just den här vägen, kommer de flesta av dina förfrågningar inte att slutföras — och det är nästan säkert ett kapacitets- och provisioneringsfaktum om en förhandsvisningsslutpunkt snarare än en egenskap hos vikterna. Vi kan inte bevisa vilket utifrån. Vad vi kan säga är att ingen av de tre siffrorna är en felskrivning, och varje arkitektur som bara läser den första kommer att få en dålig vecka.

NV-Reason-CT:s resultat är snävare och åtföljs av ett annat förbehåll. Dess 0,614 i F1 och 0,871 i AUROC på CT-RATE, över arton etiketter med en fast enhetlig tröskel och en direkt ja/nej-prompt och utan klassificeringshuvud eller uppgiftsspecifik anpassning, är NVIDIAs egna siffror från NVIDIAs egen artikel. Jämförelseuppsättningen bakom dem – VoxelFM på 0,581, Pillar-0 på 0,544, ClinFusion-8B på 0,442, CT-CLIP på 0,398, Merlin på 0,358, MedGemma 1.5 på 0,303 – innehåller endast avbildningsmodeller. Ingen generell multimodal modell förekommer, vilket innebär att frågan ”hur skulle Gemini 3.1 Pro klara sig på CT-RATE” inte har ställts, än mindre besvarats.

A generated scoreboard titled 'Breadth on one side, depth on the other' with two columns. The left column, headed 'Gemini 3.1 Pro', lists six rows: inputs, text, image, audio, video, file; context, 1,048,576 in and 65,536 out; GPQA Diamond 94.1; AA Intelligence 29.7; route reliability, 93.93% measured error rate; price, $2 and $12 per million tokens, doubling past 200k. The right column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI in Hounsfield units; context, 13,824 visual tokens per volume, no chat window; CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; route reliability, not applicable, self-hosted; price, no rate card, no published throughput. A footer reads 'The 93.93% error rate describes a preview route under load, not the quality of the weights.'

Problemet med förhandsgranskningsnivån, korrekt formulerat

Det här är den del av jämförelsen som inte har något med CT att göra och allt att göra med att bedriva klinisk verksamhet av något slag.

En felfrekvens på 93,93 % är inte en subtil försämring. Det är en rutt där den överväldigande majoriteten av anrop misslyckas. Den naturliga reaktionen är att förklara modellen oanvändbar, och den reaktionen är fel av två skäl. För det första återspeglar en felfrekvens uppmätt på en förhandsgranskningsslutpunkt kapacitet, kvot och regional routning, inte modellens förmåga. Googles förhandsgranskningsnivåer är ökända för att vara dimensionerade för utvärdering snarare än produktion, och en slug som fått namn efter en förhandsgranskning är en slug som kan strypas utan varsel. För det andra är mätningen en ögonblicksbild av en enda väg vid ett enda tillfälle. Den kommer att förändras. Det som inte kommer att förändras är lärdomen: ett beroende av en förhandsgranskningsrutt är ett beroende av ett kapacitetsbeslut som någon annan fattar.

Åtgärderna är oglamorösa, och de är hela anledningen till att routing existerar som en disciplin snarare än som en bekvämlighet.

• Hårdkoda aldrig en förhandsgranskningsslug i en produktionssökväg — lägg funktionaliteten bakom ett gränssnitt så att modellen bakom den kan bytas ut utan en driftsättning

• Försök igen och fall tillbaka på en annan leverantör eller en annan modell — för ett batchjobb för extrahering är en felfrekvens på 94 % hanterbar om felen dirigeras någon annanstans och förödande om de inte gör det

• Mät din egen felfrekvens i stället för att ärva en — siffran 93,93 % är vår katalogs siffra för en rutt, och din kommer att bero på din region, din volym och hur din arbetsbelastning ser ut

• Håll en andra modell varm för allt på en klinisk tidslinje — felläget du skyddar mot är inte ett dåligt svar, det är inget svar

Samma disciplin gäller i motsatt riktning på CT-sidan, där det inte finns någon rutt alls. En självhostad modell har ingen leverantörsfelfrekvens; den har en hårdvarufelfrekvens, en underhållsbörda och ett kapacitetstak som bestäms av hur många GPU:er du köpte. Felmoden är en kö, och åtgärden är schemaläggning snarare än redundansväxling. Annat problem, samma regel: vet vilket tal du faktiskt är beroende av.

Där en lång kontext verkligen hjälper, och där den inte gör det

Gemini 3.1 Pro:s 1 048 576-tokenfönster och poäng på 82 för återkallning i lång kontext är verkliga fördelar och värda att använda medvetet snarare än av misstag.

Det är inte själva skanningen som de ger utdelning i ett CT-program. Det är allt runtomkring. En enda extraktionskörning över en lång operationsanteckning och dess tillhörande rapporter, där hela dokumentet hålls i kontext så att fälten är konsekventa gentemot varandra. En kohortsammanfattning som måste hålla hundratals patientberättelser samtidigt för att hitta mönstret bland dem. Ett konverteringsjobb där schemat, hundra exempelposter och felloggen alla behöver vara synliga i samma anrop. Det är jobb där ett långt fönster förändrar svaret, inte bara bekvämligheten.

Där det inte hjälper är själva skanningen, och anledningen är värd att formulera precist, eftersom det är det misstag som den här matchningen inbjuder till. En CT av bröstkorgen som representeras på det sätt som NV-Reason-CT representerar den kostar 13 824 tokens. Gemini 3.1 Pro skulle kunna rymma sjuttio sådana undersökningar i sitt fönster med plats över. Begränsningen är inte utrymmet. Det är att Gemini 3.1 Pros visionsväg behandlar en bild som en bild med en pixelskala, så en undersökning som presenteras på det sättet har förlorat skiktavståndet och densitetskalibreringen innan den första token har emitterats. Du kan spendera en miljon tokens på en volym och ändå inte ha en volym. Artikelns egen jämförelse gör kostnaden för det konkret: MedGemma 1.5 vid 0,303 F1 när den matas med upp till 85 axiella skivor, mot 0,614 för den nativa volymetriska modellen, vilket är en skillnad på ungefär det dubbla.

Var vi passar in, och det enda vi inte kommer att säga

Gemini 3.1 Pro tillhandahålls via OrcaRouter som google/gemini-3.1-pro-preview till leverantörens listpris utan påslag, i ett enda API som täcker fler än 200 modeller. För en modell som för närvarande ligger på en förhandsversionsnivå är den kombinationen mer användbar än den låter. Noll påslag innebär att en ändring av leverantörens pris når oss samma dag i stället för att absorberas av ett mellanlager som håller kvar en gammal siffra. Automatisk failover innebär att en rutt som börjar misslyckas inte tar ner en batch med sig — vilket, med tanke på en uppmätt felkvot på 90-någonting procent på en väg, inte är hypotetiskt. Och en routing-DSL för att skicka enskilda förfrågningar till den modell som bör hantera dem gör att du kan lägga arbetet med lång kontext på en modell och det billiga arbetet med hög volym på en annan utan att underhålla två integrationer.

NV-Reason-CT finns inte på vår plattform. Inte heller någon NVIDIA-modell. Det är vikter du laddar ner och kör själv, och den ärliga beskrivningen är att de två halvorna av den här arkitekturen lever på helt olika platser: den ena bakom ett API med en prislista och en förhandsversionsrisk, den andra på din egen hårdvara med en OpenMDW-1.1-licens och en genomströmningssiffra som du själv måste ta fram.

A generated scoreboard titled 'What each side gives you, and what it costs' listing five paired rows. Row one: widest input surface, audio, video, image and file against text only, one modality at a time. Row two: longest context, 1,048,576 tokens in against 13,824 tokens per volume. Row three: highest benchmark, GPQA Diamond 94.1 against CT-RATE F1 0.614. Row four: weakest measured figure, a 93.93% route error rate against no published throughput at all. Row five: dependency, a hosted preview tier against your own GPUs. A footer reads 'Both sides carry a number nobody should build on without measuring it themselves.'A screenshot of the OrcaRouter model page for Gemini 3.1 Pro, showing the identifier google/gemini-3.1-pro-preview with tags for Vision, Audio, Video, Tools, JSON and Reasoning, the description of it as a multimodal model accepting text, image, audio, video and file input, and a side panel listing a 1,048,576-token context window with up to 65,536 output tokens. A stat strip reads $2.00 per million input tokens, $12.00 per million output tokens, a median time to first token, and an error rate of 93.93 percent.

Beslutet som överlever kontakten med produktionen

Om ditt problem är förståelse av text, ljud, video eller dokument i lång kontext är Gemini 3.1 Pro oberoende uppmätt i toppen av fältet när det gäller kunskap och recall, och det enda som står mellan den och en produktionspipeline är ruttillförlitlighet – vilket är ett lösbart ingenjörsproblem, inte ett modellproblem. Sätt den bakom failover, hårdkoda inte preview-slugen och mät din egen felkvot i stället för att lita på någon annans, inklusive vår.

Om ditt problem är en CT-volym över bröstkorg eller buk finns det exakt en öppen modell i den här jämförelsen som kan hantera det, det är inte den med fönstret på en miljon token, och siffran som bör styra din planering är inte dess F1-poäng. Det är latensen per undersökning som ingen har publicerat. Mät den innan du lovar någon en genomströmningssiffra.

Jämförelsen är värd att göra eftersom den skiljer på två saker som ständigt blandas ihop: bredd i indata och djup i representation. Gemini 3.1 Pro har den bredaste indataytan någon har levererat och den bästa återkallningen över långa kontexter i den här uppsättningen, och den kan fortfarande inte läsa en CT-undersökning som en CT-undersökning. NV-Reason-CT kan läsa en sådan och inget annat. En pipeline behöver båda, behöver dem på olika infrastrukturer och behöver veta vilket av de två talen på varje sida som är det som kommer att larma dig klockan tre på natten.