Ett genererat herokort med titeln 'NV-Reason-CT vs Qwen3.8 Max' och undertiteln 'Finjusteringen och familjen den kom ifrån'. Tre chips löper längs nedre kanten: 'Stomme: Qwen/Qwen3.5-4B', '13 824 tokens mot 1 000 000' och '3,5 % mot 0,21 % uppmätt fel'. OrcaRouter-logotypen är komponerad i nedre högra hörnet.
Guides & Insights

NV-Reason-CT vs Qwen3.8 Max: Finjusteringen och familjen den kom från

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Första raden i NV-Reason-CT:s modellkort berättar något som de flesta bara skummar förbi. Basmodellen är Qwen/Qwen3.5-4B, listad i repots metadata som en finjusteringsrelation. Så när NVIDIA behövde en språkmodell att fästa en Primus 3D-visionstransformator på, tog de en Qwen. Jämför den checkpointen med Qwen3.8 Max — Alibabas egen flaggskeppsmodell med 1 000 000 tokens, släppt den 3 augusti 2026 — och du tittar på en finjustering och familjeföretaget. Den ena är en 4,69B-specialist som läser CT-volymer av bröstkorg och buk och publicerades på Hugging Face den 8 september 2026 utan något tillkännagivande. Den andra är ett allmänt flaggskepp med text-, bild- och videoinmatning, en publicerad prislista och 37,2 miljoner tokens i uppmätt trafik i vårt nätverk den senaste veckan. Den intressanta frågan är inte vilken som vinner. Det är vad en 4B-finjustering kan göra som dess familjs flaggskepp inte kan, och varför svaret är mer specifikt än man skulle förvänta sig.

Vad finjusteringen gav, konkret

NVIDIAs egen formulering av gapet är ovanligt precis, och det är den mest användbara meningen i repositoriet: de flesta visions-språksystem "antingen arbetar med 2D-bilder eller komprimerar volymetriska särdrag före språkavkodning." Det är en beskrivning av en hel klass av modeller, och den omfattar varje allmänt multimodalt flaggskepp på marknaden.

Lösningen är arkitektonisk snarare än en fråga om skala. En indatavolym på 384×384×384 mm blir ett 24×24×24-rutnät med 13 824 visuella tokens. Dessa tokens och deras tredimensionella koordinater går in i språkmodellen utan någon rumslig nedsampling, och 3D MRoPE bevarar de rumsliga relationerna inuti dekodern. Indatavolymer beskärs anatomimedvetet till bröstkorg eller buk med hjälp av Hounsfield-enheter för lunga och omsamplas sedan till 2 mm isotropisk upplösning.

Läs det mot vad Qwen3.8 Max accepterar. Text, bild och video – och video är det närmaste den här serien kommer en volumetrisk indata, vilket gör den till den ärliga jämförelsepunkten snarare än en retorisk sådan. En video är en stapel 2D-bildrutor ordnade efter tid. En CT-volym är en stapel 2D-snitt ordnade efter fysisk position längs z-axeln, i Hounsfield-enheter, med ett känt avstånd i millimeter. Båda är tredimensionella arrayer. Endast en av dem har ett fysiskt koordinatsystem som en radiologs fynd kan lokaliseras till, och endast en av dem mäts i en enhet som betyder något utanför en bildsensor. En modell som tränats på video lär sig temporal kontinuitet. En modell som tränats på CT-volymer lär sig att en massa i ett snitt är samma massa i nästa snitt åtta millimeter lägre.

Träningskorpusen är den verkliga skillnaden

Det här är punkten där de två modellerna inte längre går att jämföra alls, och det är just den delen som ett datablad döljer.

NV-Reason-CT tränades end-to-end med övervakad finjustering följt av Group Relative Policy Optimization på ungefär 550 000 strukturerade QA-exempel hämtade från 70 111 unika CT-volymer. Källorna är CT-RATE – 47 149 fall från Istanbul Medipol University Mega Hospital med parade radiologirapporter – en intern NIH-uppsättning på 15 991 fall, samt CancerVerses 22 720 fall över fyra kontrastfaser och tretton maligna tumörtyper. Korpusen innehåller standardiserade rapporter, abnormitetsfokuserad QA, flerturndialog och resonemang författade av radiologer, transkriberade från inspelade expertbedömningar. GRPO-steget använder verifierbara belöningar över uppsättningar av bröstkorgs- och bukabnormiteter, vilket innebär att belöningssignalen kontrollerar om ett angivet fynd finns i volymen snarare än om prosan låter klinisk.

Träningskorpusen för Qwen3.8 Max publiceras inte med någon sådan detaljrikedom, och det skulle inte hjälpa ens om den gjorde det, eftersom målkapaciteten är generell. I stället är dess siffror från Artificial Analysis det relevanta beviset: ett Intelligence Index på 45,4 som placerar den på 15:e plats av 145 modeller i vårt API:s ögonblicksbild, AA Coding 76,2 på plats 9, Terminal-Bench 2.1 på 88,8, GPQA Diamond 92,8, Humanity's Last Exam 43,1, SciCode 52,1 och långkontextåterkallning 80,3. Det är tredjepartsmätningar, inte leverantörspåståenden, vilket gör dem till de mest tillförlitliga siffrorna på båda sidor om den här sidan.

Resonemangsutdata, två olika kontrakt

Båda modellerna avger resonemangsspår och båda låter dig stänga av dem. Likheten slutar vid gränssnittet.

Qwen3.8 Max exponerar enable_thinking och reasoning_effort, tillsammans med hela samplingsytan – temperatur, top_p, seed, straff, strukturerade utdata, verktygsanrop. Det är en allmän resonemangsförmåga som du riktar mot vad du än har. Dess tänkande är lika bra som problemet du ger den, och den har inget sätt att verifiera ett påstående mot något annat än texten den fick.

NV-Reason-CT:s resonemang har ett snävare kontrakt med läsaren, och modellkortet anger begränsningen uttryckligen: genererat resonemang är "granskningsbara modellutdata och är inte garanterat att representera modellens interna beräkning". Den varningen gör faktiskt nytta, och det är den typ av mening som bara förekommer när ett team har tänkt på vad en kliniker kommer att göra med ett rimligt klingande spår. Kortet beskriver utdata som granskningsbara observationer, differentialdiagnoser och osäkerhet. Ett spår som du kan kontrollera mot volymen, med andra ord, snarare än ett som du bara kan läsa.

Genomströmning, från den enda plats där vi kan mäta den

Qwen3.8 Max flyttade 37,2 miljoner tokens genom OrcaRouters egen testmiljö under de senaste sju dagarna. Dess median-tid till första token var 1,96 sekunder – med god marginal den snabbaste av modellerna i den här serien – vid 53,3 utdatatokens per sekund. Felfrekvensen under det fönstret var 3,5 %.

Dessa två siffror drar åt olika håll och båda spelar roll. Latensen är utmärkt och gör modellen trevlig att iterera mot. Felkvoten är ungefär sjutton gånger högre än Kimi K3:s 0,21 % under samma fönster, och det är siffran som avgör om du sätter den bakom ett synkront användarvänt anrop eller ett batchjobb med återförsök. Det här är uppmätt beteende i vårt nätverk, inte ett benchmark, och det är den typ av sak som en prislista aldrig berättar för dig.

NV-Reason-CT har ingen motsvarande mätning någonstans. Det är en BF16-checkpoint på 10,6 GB med anpassad modellkod, som laddas med trust_remote_code=True på Ampere-, Hopper- eller Lovelace-hårdvara, testad av NVIDIA på H100 och L40S. Det finns ingen publicerad p50, ingen felkvot och ingen genomströmningssiffra. Den som säger sig känna till den volym där egen hosting av detta blir billigare än att betala per token gissar.

Pris och form, sida vid sida

• Pris — NV-Reason-CT GPU-capex, ingen kostnad per token jämfört med Qwen3.8 Max $2,00 / $6,00 per miljon tokens, $0,25 för cachad läsning, $2,50 för cacheskrivning

• Indata — NV-Reason-CT 3D NIfTI CT-volymer i Hounsfield-enheter, endast bröstkorg eller buk vs Qwen3.8 Max text, bild och video

• Kontext — NV-Reason-CT en volym, ett fast prefix på 13 824 token mot Qwen3.8 Max 1 000 000 token

• Parametrar — NV-Reason-CT 4,69B totalt / 4,35B aktiva i CT-banan jämfört med Qwen3.8 Max, ej offentliggjorda

• Licens — NV-Reason-CT OpenMDW-1.1, vikter publicerade jämfört med Qwen3.8 Max som är proprietär, endast API-åtkomst

• Oberoende poäng — NV-Reason-CT inga vs Qwen3.8 Max AA Intelligence Index 45.4, GPQA Diamond 92.8

A generated scoreboard titled 'NV-Reason-CT vs Qwen3.8 Max - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex, no per-token rate; Input 3D NIfTI CT, chest or abdomen; Context one volume, 13,824-token prefix; Parameters 4.69B total / 4.35B active; Licence OpenMDW-1.1, weights published; Independent score none published. Right column 'Qwen3.8 Max': Price $2.00 / $6.00, $0.25 cached read; Input text, image and video; Context 1,000,000 tokens; Parameters undisclosed; Licence proprietary, API only; Independent score AA Index 45.4, GPQA Diamond 92.8. A footer reads 'Qwen3.8 Max scores per Artificial Analysis; NV-Reason-CT figures are the authors' own, from the model card.'

Qwen3.8 Maxs cache-ekonomi belönar en specifik form: en cachad läsning för $0.25 mot $2.00 i färsk indata är en åttafaldig rabatt, och cache-skrivningen på $2.50 innebär att ett långt återanvändbart prefix snabbt betalar sig självt. Det är arbetsbelastningen för en systemprompt plus ett protokolldokument som återanvänds över tusentals förfrågningar. NV-Reason-CT har den motsatta kostnadsprofilen – nära noll i marginalkostnad per skanning när GPU:n väl är inköpt, och ett hårt golv på en GPU som hålls på obestämd tid.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Att driva familjen tillsammans

Den naturliga arkitekturen här, och det är värt att säga att ingen har publicerat den, är finjusteringen för volymen och flaggskeppet för allt runt omkring. NV-Reason-CT producerar det strukturerade fyndet; Qwen3.8 Max hanterar remisstexten, protokollmatchningen, kodningen, uppföljningsbrevet — det högvolymiga textarbetet där ett fönster på en miljon token och en åttafaldig cacherabatt faktiskt förtjänar sin plats.

Om det är din pipeline är hälften av den en kontrollpunkt du själv hostar och hälften är tokens du köper, och den andra hälften är där en router gör något som en enda leverantörsändpunkt inte kan. Qwen3.8 Max serveras via OrcaRouter till Alibabas listpris utan påslag, så de 2,00 $ / 6,00 $ ovan är vad du betalar, och en framtida prisändring hamnar på din faktura samma dag i stället för vid förnyelsen. Automatisk failover mellan leverantörer spelar större roll än vanligt när modellens egen uppmätta felfrekvens är 3,5 % – ett nytt försök som går till en annan frisk ändpunkt är skillnaden mellan en tillfällig störning och en misslyckad batch. Och eftersom den allmänna hälften av pipelinen är ett enda modellnamn bakom en OpenAI-kompatibel ändpunkt som täcker över 200 modeller, kostar det att byta in något annat för en veckas experiment bara en ändrad sträng, inte en integration.

För att vara tydlig: NV-Reason-CT finns inte på OrcaRouter och kommer inte att finnas där heller – det är skräddarsydd kod för 3D-inferens som du kör själv. Den ärliga versionen av integrationshistorien är att den självhostade specialisten och den routade generalisten kan ligga under en och samma nyckel, och det är hela påståendet.

A screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the identifier qwen/qwen3.8-max, input text + image + video, output text, the Vision, Tools, JSON and Reasoning badges, a 1,000,000-token context window with a p50 time to first token of 1.96 seconds, the description of it as Alibaba's newest flagship positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $2.00 per million input tokens, $6.00 per million output tokens and 37.2M tokens of seven-day traffic.

Domen som faktiskt håller

Den här kombinationen hamnar under "vilket är bättre", och det borde den inte. Qwen3.8 Max mäts av tredje parter på allmän resonemangsförmåga och slår större delen av fältet; NV-Reason-CT har en enda tabell med sina egna siffror på ett CT-benchmark, och ett parameterantal på 4,69B som inte skulle sticka ut i någon allmän jämförelse. På vilket allmänt benchmark som helst vinner flaggskeppet, och anledningen är att det allmänna benchmarket är vad det byggdes för.

I den enda uppgift som NV-Reason-CT byggdes för – att läsa en CT-volym av bröstkorg eller buk och säga vad den innehåller, med ett spår som någon kan kontrollera – är Qwen3.8 Max ingen svagare konkurrent. Den har ingen volymetrisk encoder, så den kan inte alls köras på indata utan att någon först bestämmer hur en skanning ska plattas ut till bilder. Det beslutet är där den rumsliga informationen går förlorad. Det är hela poängen med en 4B-finjustering med en inbyggd 3D-väg och ett fast prefix på 13 824 token, och det är därför det intressanta med den här modellen är backbonens litenhet snarare än dess storlek.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen