
NV-Reason-CT vs Qwen3.8 Max: Finjusteringen och familjen den kom från
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 45 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 182 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Första raden i NV-Reason-CT:s modellkort berättar något som de flesta bara skummar förbi. Basmodellen är Qwen/Qwen3.5-4B, listad i repots metadata som en finjusteringsrelation. Så när NVIDIA behövde en språkmodell att fästa en Primus 3D-visionstransformator på, tog de en Qwen. Jämför den checkpointen med Qwen3.8 Max — Alibabas egen flaggskeppsmodell med 1 000 000 tokens, släppt den 3 augusti 2026 — och du tittar på en finjustering och familjeföretaget. Den ena är en 4,69B-specialist som läser CT-volymer av bröstkorg och buk och publicerades på Hugging Face den 8 september 2026 utan något tillkännagivande. Den andra är ett allmänt flaggskepp med text-, bild- och videoinmatning, en publicerad prislista och 37,2 miljoner tokens i uppmätt trafik i vårt nätverk den senaste veckan. Den intressanta frågan är inte vilken som vinner. Det är vad en 4B-finjustering kan göra som dess familjs flaggskepp inte kan, och varför svaret är mer specifikt än man skulle förvänta sig.
Vad finjusteringen gav, konkret
NVIDIAs egen formulering av gapet är ovanligt precis, och det är den mest användbara meningen i repositoriet: de flesta visions-språksystem "antingen arbetar med 2D-bilder eller komprimerar volymetriska särdrag före språkavkodning." Det är en beskrivning av en hel klass av modeller, och den omfattar varje allmänt multimodalt flaggskepp på marknaden.
Lösningen är arkitektonisk snarare än en fråga om skala. En indatavolym på 384×384×384 mm blir ett 24×24×24-rutnät med 13 824 visuella tokens. Dessa tokens och deras tredimensionella koordinater går in i språkmodellen utan någon rumslig nedsampling, och 3D MRoPE bevarar de rumsliga relationerna inuti dekodern. Indatavolymer beskärs anatomimedvetet till bröstkorg eller buk med hjälp av Hounsfield-enheter för lunga och omsamplas sedan till 2 mm isotropisk upplösning.
Läs det mot vad Qwen3.8 Max accepterar. Text, bild och video – och video är det närmaste den här serien kommer en volumetrisk indata, vilket gör den till den ärliga jämförelsepunkten snarare än en retorisk sådan. En video är en stapel 2D-bildrutor ordnade efter tid. En CT-volym är en stapel 2D-snitt ordnade efter fysisk position längs z-axeln, i Hounsfield-enheter, med ett känt avstånd i millimeter. Båda är tredimensionella arrayer. Endast en av dem har ett fysiskt koordinatsystem som en radiologs fynd kan lokaliseras till, och endast en av dem mäts i en enhet som betyder något utanför en bildsensor. En modell som tränats på video lär sig temporal kontinuitet. En modell som tränats på CT-volymer lär sig att en massa i ett snitt är samma massa i nästa snitt åtta millimeter lägre.
Träningskorpusen är den verkliga skillnaden
Det här är punkten där de två modellerna inte längre går att jämföra alls, och det är just den delen som ett datablad döljer.
NV-Reason-CT tränades end-to-end med övervakad finjustering följt av Group Relative Policy Optimization på ungefär 550 000 strukturerade QA-exempel hämtade från 70 111 unika CT-volymer. Källorna är CT-RATE – 47 149 fall från Istanbul Medipol University Mega Hospital med parade radiologirapporter – en intern NIH-uppsättning på 15 991 fall, samt CancerVerses 22 720 fall över fyra kontrastfaser och tretton maligna tumörtyper. Korpusen innehåller standardiserade rapporter, abnormitetsfokuserad QA, flerturndialog och resonemang författade av radiologer, transkriberade från inspelade expertbedömningar. GRPO-steget använder verifierbara belöningar över uppsättningar av bröstkorgs- och bukabnormiteter, vilket innebär att belöningssignalen kontrollerar om ett angivet fynd finns i volymen snarare än om prosan låter klinisk.
Träningskorpusen för Qwen3.8 Max publiceras inte med någon sådan detaljrikedom, och det skulle inte hjälpa ens om den gjorde det, eftersom målkapaciteten är generell. I stället är dess siffror från Artificial Analysis det relevanta beviset: ett Intelligence Index på 45,4 som placerar den på 15:e plats av 145 modeller i vårt API:s ögonblicksbild, AA Coding 76,2 på plats 9, Terminal-Bench 2.1 på 88,8, GPQA Diamond 92,8, Humanity's Last Exam 43,1, SciCode 52,1 och långkontextåterkallning 80,3. Det är tredjepartsmätningar, inte leverantörspåståenden, vilket gör dem till de mest tillförlitliga siffrorna på båda sidor om den här sidan.
Resonemangsutdata, två olika kontrakt
Båda modellerna avger resonemangsspår och båda låter dig stänga av dem. Likheten slutar vid gränssnittet.
Qwen3.8 Max exponerar enable_thinking och reasoning_effort, tillsammans med hela samplingsytan – temperatur, top_p, seed, straff, strukturerade utdata, verktygsanrop. Det är en allmän resonemangsförmåga som du riktar mot vad du än har. Dess tänkande är lika bra som problemet du ger den, och den har inget sätt att verifiera ett påstående mot något annat än texten den fick.
NV-Reason-CT:s resonemang har ett snävare kontrakt med läsaren, och modellkortet anger begränsningen uttryckligen: genererat resonemang är "granskningsbara modellutdata och är inte garanterat att representera modellens interna beräkning". Den varningen gör faktiskt nytta, och det är den typ av mening som bara förekommer när ett team har tänkt på vad en kliniker kommer att göra med ett rimligt klingande spår. Kortet beskriver utdata som granskningsbara observationer, differentialdiagnoser och osäkerhet. Ett spår som du kan kontrollera mot volymen, med andra ord, snarare än ett som du bara kan läsa.
Genomströmning, från den enda plats där vi kan mäta den
Qwen3.8 Max flyttade 37,2 miljoner tokens genom OrcaRouters egen testmiljö under de senaste sju dagarna. Dess median-tid till första token var 1,96 sekunder – med god marginal den snabbaste av modellerna i den här serien – vid 53,3 utdatatokens per sekund. Felfrekvensen under det fönstret var 3,5 %.
Dessa två siffror drar åt olika håll och båda spelar roll. Latensen är utmärkt och gör modellen trevlig att iterera mot. Felkvoten är ungefär sjutton gånger högre än Kimi K3:s 0,21 % under samma fönster, och det är siffran som avgör om du sätter den bakom ett synkront användarvänt anrop eller ett batchjobb med återförsök. Det här är uppmätt beteende i vårt nätverk, inte ett benchmark, och det är den typ av sak som en prislista aldrig berättar för dig.
NV-Reason-CT har ingen motsvarande mätning någonstans. Det är en BF16-checkpoint på 10,6 GB med anpassad modellkod, som laddas med trust_remote_code=True på Ampere-, Hopper- eller Lovelace-hårdvara, testad av NVIDIA på H100 och L40S. Det finns ingen publicerad p50, ingen felkvot och ingen genomströmningssiffra. Den som säger sig känna till den volym där egen hosting av detta blir billigare än att betala per token gissar.
Pris och form, sida vid sida
• Pris — NV-Reason-CT GPU-capex, ingen kostnad per token jämfört med Qwen3.8 Max $2,00 / $6,00 per miljon tokens, $0,25 för cachad läsning, $2,50 för cacheskrivning
• Indata — NV-Reason-CT 3D NIfTI CT-volymer i Hounsfield-enheter, endast bröstkorg eller buk vs Qwen3.8 Max text, bild och video
• Kontext — NV-Reason-CT en volym, ett fast prefix på 13 824 token mot Qwen3.8 Max 1 000 000 token
• Parametrar — NV-Reason-CT 4,69B totalt / 4,35B aktiva i CT-banan jämfört med Qwen3.8 Max, ej offentliggjorda
• Licens — NV-Reason-CT OpenMDW-1.1, vikter publicerade jämfört med Qwen3.8 Max som är proprietär, endast API-åtkomst
• Oberoende poäng — NV-Reason-CT inga vs Qwen3.8 Max AA Intelligence Index 45.4, GPQA Diamond 92.8

Qwen3.8 Maxs cache-ekonomi belönar en specifik form: en cachad läsning för $0.25 mot $2.00 i färsk indata är en åttafaldig rabatt, och cache-skrivningen på $2.50 innebär att ett långt återanvändbart prefix snabbt betalar sig självt. Det är arbetsbelastningen för en systemprompt plus ett protokolldokument som återanvänds över tusentals förfrågningar. NV-Reason-CT har den motsatta kostnadsprofilen – nära noll i marginalkostnad per skanning när GPU:n väl är inköpt, och ett hårt golv på en GPU som hålls på obestämd tid.

Att driva familjen tillsammans
Den naturliga arkitekturen här, och det är värt att säga att ingen har publicerat den, är finjusteringen för volymen och flaggskeppet för allt runt omkring. NV-Reason-CT producerar det strukturerade fyndet; Qwen3.8 Max hanterar remisstexten, protokollmatchningen, kodningen, uppföljningsbrevet — det högvolymiga textarbetet där ett fönster på en miljon token och en åttafaldig cacherabatt faktiskt förtjänar sin plats.
Om det är din pipeline är hälften av den en kontrollpunkt du själv hostar och hälften är tokens du köper, och den andra hälften är där en router gör något som en enda leverantörsändpunkt inte kan. Qwen3.8 Max serveras via OrcaRouter till Alibabas listpris utan påslag, så de 2,00 $ / 6,00 $ ovan är vad du betalar, och en framtida prisändring hamnar på din faktura samma dag i stället för vid förnyelsen. Automatisk failover mellan leverantörer spelar större roll än vanligt när modellens egen uppmätta felfrekvens är 3,5 % – ett nytt försök som går till en annan frisk ändpunkt är skillnaden mellan en tillfällig störning och en misslyckad batch. Och eftersom den allmänna hälften av pipelinen är ett enda modellnamn bakom en OpenAI-kompatibel ändpunkt som täcker över 200 modeller, kostar det att byta in något annat för en veckas experiment bara en ändrad sträng, inte en integration.
För att vara tydlig: NV-Reason-CT finns inte på OrcaRouter och kommer inte att finnas där heller – det är skräddarsydd kod för 3D-inferens som du kör själv. Den ärliga versionen av integrationshistorien är att den självhostade specialisten och den routade generalisten kan ligga under en och samma nyckel, och det är hela påståendet.

Domen som faktiskt håller
Den här kombinationen hamnar under "vilket är bättre", och det borde den inte. Qwen3.8 Max mäts av tredje parter på allmän resonemangsförmåga och slår större delen av fältet; NV-Reason-CT har en enda tabell med sina egna siffror på ett CT-benchmark, och ett parameterantal på 4,69B som inte skulle sticka ut i någon allmän jämförelse. På vilket allmänt benchmark som helst vinner flaggskeppet, och anledningen är att det allmänna benchmarket är vad det byggdes för.
I den enda uppgift som NV-Reason-CT byggdes för – att läsa en CT-volym av bröstkorg eller buk och säga vad den innehåller, med ett spår som någon kan kontrollera – är Qwen3.8 Max ingen svagare konkurrent. Den har ingen volymetrisk encoder, så den kan inte alls köras på indata utan att någon först bestämmer hur en skanning ska plattas ut till bilder. Det beslutet är där den rumsliga informationen går förlorad. Det är hela poängen med en 4B-finjustering med en inbyggd 3D-väg och ett fast prefix på 13 824 token, och det är därför det intressanta med den här modellen är backbonens litenhet snarare än dess storlek.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
