
NV-Reason-CT vs GPT-5.6 Sol: 13 824 visuella tokens innan du skriver ett ord
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 45 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 182 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Varje enskild thorax-CT du skickar till NV-Reason-CT kostar 13 824 visuella tokens innan prompten ens börjar. Det är inte en egenhet eller ett justeringsval – det är hela designen. Modellens inbyggda 3D-visionsencoder tar en volym på 384×384×384 mm och gör om den till ett 24×24×24-rutnät, och modellkortet säger uttryckligen att alla 13 824 tokens och deras tredimensionella koordinater når språkmodellen ”utan rumslig nedskalning”. Jämför det med vad du förmodligen redan betalar för. GPT-5.6 Sol tar emot text, bilder och filer, och en bild som skickas till den är en 2D-bild – ett snitt, en skärmdump från en DICOM-visare, en radiologisk figur inklistrad från en PDF. En av dessa modeller har en volymetrisk väg. Den andra har ett kontextfönster. De flesta jämförelser mellan dem kollapsar just på den skillnaden, och kollapsen är det intressanta.
Släppet ingen annonserade
NVIDIA har inte publicerat ett ord om NV-Reason-CT i sitt nyhetsrum. Det finns inget lanseringsinlägg, ingen keynote-bild, inget pressmeddelande. Det som finns är ett Hugging Face-repositorium skapat den 8 september 2026, ett GitHub-repositorium under organisationen NVIDIA-Medtech skapat den 2 september, en Gradio-demo-Space och en arXiv-preprint — NV-Reason-CT: 3D-visuell språkmodell för CT-analys — inlämnad den 23 september 2026 av ett team på sexton författare från NVIDIA med medförfattare vid NIH och University of Zurich.
Det är ett verkligt mönster, och det är värt att namnge det exakt i stället för att behandla det som ett mysterium. NVIDIAs grupp för medicinsk bildbehandling släpper vikter tyst och låter artikeln och repot stå för tillkännagivandet. Föregångaren NV-Reason-CXR-3B släpptes i oktober 2025 på samma sätt. Skillnaden här är skalan: det här är första gången som den gruppen har utökat receptet från 2D-röntgen till nativa 3D-volymer, och artikeln är två dagar gammal.
Vad som går att veta från kodförrådet: arkitektur, licens, träningsdata, benchmarktabellen. Vad som ännu inte är bekräftat: huruvida NVIDIA avser detta som en produktlinje som stöds, huruvida fler checkpoints följer, och hur den står sig vid någon annans utvärdering än författarnas. Kodförrådet har version 0.1 och beskriver sig som endast forskning och utbildning.
Vad varje modell faktiskt accepterar
Det är här en direkt jämförelse snabbt blir ärlig. De två modellerna delar inte en indatayta.
NV-Reason-CT läser NIfTI-volymer — .nii eller .nii.gz — med voxelintensiteter i Hounsfield-enheter. Den beskär automatiskt till bröstkorgen eller buken med hjälp av Hounsfield-enheter för lungor och en 3D-morfologiheuristik, omsamplar till 2 mm isotrop upplösning och accepterar endast "chest" eller "abdomen" som anatomivärden. Den matar ut text: en strukturerad rapport, ett svar eller ett stegvis resonemangsspår, med en växel för att stänga av resonemanget vid korta svar.
GPT-5.6 Sol läser text, bilder och filer, med ett kontextfönster på 1 050 000 token och upp till 128 000 utdatatoken i ett enda svar. Den har ingen volymetrisk kodare. Mata den med en CT och du måste först bestämma hur du ska platta ut drygt trehundra skivor till något som en 2D-bildkodare accepterar – ett montage, en handfull nyckelskivor, en renderad maximalintensitetsprojektion. Vart och ett av dessa val kastar bort de spatiala relationer som 3D-vägen byggdes för att bevara.
Så den ärliga formuleringen är inte "vilken modell som är smartare". Det handlar om att Sols bildväg och NV-Reason-CT:s 3D-väg svarar på olika frågor. Sol kan resonera om en radiologs beskrivning av en skanning. NV-Reason-CT kan resonera om skanningen.
Det finns ett riktmärke, och bara ett av dem har ett nummer på sig.
NV-Reason-CT rapporterar Macro-F1 0,614 och Macro-AUROC 0,871 för CT-RATE:s klassificeringsuppgift med 18 etiketter, med en direkt Ja/Nej-prompt, utan klassificeringshuvud och utan uppgiftsspecifik anpassning. Det är författarnas egna siffror från modellkortet, och jämförelseraden är den användbara delen: VoxelFM på 0,581 Macro-F1, Pillar-0 på 0,544, ClinFusion-8B på 0,442, CT-CLIP på 0,398, Merlin på 0,358, MedGemma 1.5 på 0,303. Vid samma fasta enhetliga tröskel slår en generativ 3D-modell de 3D-kontrastiva förträningsbaslinjerna och den skivbaserade frontiermodellen.
Ett tal i den tabellen förtjänar skepsis snarare än upprepning: AUROC-gapet. NV-Reason-CT rapporterar 0,871 mot VoxelFM:s 0,870. En tusendels poäng, i en utvärdering som körts av leverantören, är inte en vinst — det är ett oavgjort resultat inom ramen för vilket brus som helst som utvärderingen för med sig. Macro-F1-gapet på 0,033 är det underbyggda påståendet.
GPT-5.6 Sol har ingen CT-RATE-siffra eftersom CT-RATE inte är ett benchmark som den kan köras på. Den har ett Artificial Analysis Intelligence Index på 47, en AA-uppmätt GPQA Diamond-poäng på 94,1 och en Humanity's Last Exam-poäng på 49,5 – alla instrument för allmän resonemangsförmåga. Att ställa 0,614 Macro-F1 bredvid 47 på AA-indexet skulle vara aritmetik med två olika måttstockar. Jag tänker inte göra det, och du bör misstro alla som gör det.
Resonemangsspår, två olika produkter
Båda modellerna avger resonemang. Det är den enda genuina filosofiska överlappningen, och skillnaden är lärorik.
GPT-5.6 Sol exponerar konfigurerbar resonemangsansträngning, så du avväger latens och kostnad mot djup per begäran, och du kan begära tillbaka resonemanget via include_reasoning. Det är en generell förmåga som tillämpas på vad du än skickar till den.
NV-Reason-CT:s resonemang är medvetet snävt. Träningskorpusen består av ungefär 550 000 strukturerade QA-exempel hämtade från 70 111 unika CT-volymer, och en del av den utgörs av resonemang skrivna av radiologer, insamlade från inspelade och transkriberade expertbedömningar. GRPO-steget som följer SFT använder verifierbara belöningar över uppsättningar av bröstkorgs- och bukabnormiteter – vilket innebär att belöningssignalen grundas i huruvida ett angivet fynd faktiskt finns i volymen, inte i hur väl prosan läser. Modellkortet beskriver utdata som ”granskningsbara observationer, differentialdiagnoser och osäkerhet”, och det innehåller en uttrycklig varning om att genererat resonemang ”inte garanteras representera modellens interna beräkning”. Den varningen gör faktiskt nytta. Det är skillnaden mellan ett spår som du kan kontrollera mot data och ett spår som du bara kan beundra.
Storleken och licensen, i ett svep
• Parametrar — NV-Reason-CT 4,69B totalt / 4,35B aktiva i CT-banan, från en Qwen3.5-4B-stomme plus en Primus 3D ViT mot GPT-5.6 Sol ej angivet • Checkpoint-storlek — NV-Reason-CT ca 10,6 GB BF16 safetensors, körs på Ampere/Hopper/Lovelace mot GPT-5.6 Sol endast API • Indata — 3D NIfTI CT-volymer i Hounsfield-enheter mot text, bild, fil • Kontext — NV-Reason-CT ej tillämpligt, en volym är ett fast prefix på 13 824 token mot Sol 1 050 000 token in, 128 000 ut • Licens — OpenMDW-1.1, vikter nedladdningsbara mot proprietär, endast API-åtkomst • Tillgänglighet — leverantörens repo och dess egna vikter mot dirigeras via OrcaRouter till $4,00 / $20,00 per miljon, där Sols taxa över 272K indata-token fördubblas till $8,00 / $30,00

Vad uppbrottet faktiskt kostar dig
Kostnadsjämförelsen är bara meningsfull när man accepterar att arbetsbelastningarna skiljer sig åt, så här är den version som faktiskt är meningsfull.
Sol faktureras per token och dess pris har en tröskeleffekt: 4,00 USD per miljon indata och 20,00 USD per miljon utdata upp till 272K tokens i prompt, därefter 8,00 USD och 30,00 USD. På OrcaRouter erbjuds den till OpenAIs eget listpris utan påslag, vilket betyder mer än det låter — taxan du ser är den taxa OpenAI publicerar, så varje prisförändring når din faktura samma dag i stället för vid nästa avtalsförnyelse. Dess pris för cacheläsning är 0,40 USD per miljon, en tiondel av indata, vilket är det som gör långa agentiska loopar med ett stort fast prefix aritmetiskt överlevbara.
NV-Reason-CT har överhuvudtaget inget pris per token. Du laddar ner 10,6 GB och betalar för GPU:n. Det är en fråga om capex kontra opex, och den har bara ett svar: vid tillräckligt hög volym vinner egen hosting av en modell med 4,35B aktiva parametrar kostnadsmässigt. Under den volymen gör den inte det, och brytpunkten beror helt och hållet på din GPU-utnyttjandegrad. Ingen utanför NVIDIA har ännu publicerat en genomströmningssiffra för den här checkpointen, så alla som uppger en brytpunkt för dig gissar.

Det som en router faktiskt hjälper till med här är den del av arbetsflödet som inte är själva skanningen. En produktionspipeline för klinisk forskning är sällan en enda modell – den består av extraktion, ett resonemangssteg, ett sammanfattningssteg, ibland en andra bedömning. OrcaRouter exponerar 200+ modeller bakom en enda OpenAI-kompatibel slutpunkt med automatisk failover mellan leverantörer, så att den generella halvan av den pipelinen kan bytas ut eller dirigeras om utan ett andra avtal. NV-Reason-CT är inte en av modellerna som vi routar; det är en checkpoint som du kör själv. De två halvorna av pipelinen kan fortfarande ligga bakom en enda nyckel.

Den öppna frågan
NV-Reason-CT är två dagar gammal som artikel och sjutton dagar gammal som repositorium, och området den tillhör är litet nog för att nästa datapunkt ska vara informativ. Håll utkik efter tre saker: en oberoende CT-RATE-reproduktion, en andra checkpoint i familjen, och något tecken på att NVIDIAs medicinska grupp behandlar detta som en linje snarare än en artikel. Fram till dess är den försvarbara positionen snäv och tydlig – detta är den starkaste checkpointen för native-3D CT-resonemang som för närvarande går att ladda ner, bedömd utifrån författarnas egen tabell, och den är inte en ersättning för en allmän frontier-modell på något område utom att läsa en CT.
