Een gegenereerde hero-kaart 'NV-Reason-CT vs Qwen3.8 Max' met de ondertitel 'De fine-tune en de familie waaruit die voortkwam'. Drie chips staan onderaan: 'Backbone: Qwen/Qwen3.5-4B', '13.824 tokens vs 1.000.000', en '3,5% vs 0,21% gemeten fout'. Het OrcaRouter-logo is rechtsonder gecompositeerd.
Guides & Insights

NV-Reason-CT vs Qwen3.8 Max: de fine-tune en de familie waaruit die voortkwam

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De eerste regel van de NV-Reason-CT-modelkaart vertelt je iets waar de meeste mensen vluchtig overheen lezen. Het basismodel is Qwen/Qwen3.5-4B, vermeld in de metadata van de repository als een fine-tune-relatie. Dus toen NVIDIA een taalmodel nodig had om er een Primus 3D-visiontransformer aan vast te schroeven, nam het een Qwe​n. Vergelijk dat checkpoint met Qwen3.8 Max — Aliba​ba's eigen 1.000.000-token vlaggenschip, uitgebracht op 3 augustus 2026 — en je kijkt naar een fine-tune en het familiebedrijf. De ene is een 4,69B-specialist die CT-volumes van borst en buik leest en op 8 september 2026 zonder aankondiging op Hugging Face werd gepubliceerd. De andere is een algemeen vlaggenschipmodel met tekst-, beeld- en video-invoer, een gepubliceerde tariefkaart en 37,2 miljoen tokens aan gemeten verkeer op ons netwerk in de afgelopen week. De interessante vraag is niet welke wint. Het is wat een 4B-fine-tune kan doen wat het vlaggenschip van zijn familie niet kan, en waarom het antwoord specifieker is dan je zou verwachten.

Wat de fine-tune concreet heeft opgeleverd

NVIDIA's eigen formulering van de kloof is ongewoon precies, en het is de nuttigste zin in de repository: de meeste vision-language-systemen "werken ofwel op 2D-afbeeldingen, ofwel ze comprimeren volumetrische kenmerken voordat de taaldecodering plaatsvindt." Dat is een beschrijving van een hele klasse modellen, en het omvat elk algemeen multimodaal vlaggenschip op de markt.

De oplossing is architectonisch, niet een kwestie van schaal. Een invoervolume van 384×384×384 mm wordt een 24×24×24-raster van 13.824 visuele tokens. Die tokens en hun driedimensionale coördinaten gaan zonder ruimtelijke downsampling het taalmodel in, en 3D MRoPE behoudt de ruimtelijke relaties in de decoder. Invoervolumes worden anatomisch bewust bijgesneden tot de borstkas of het abdomen met behulp van long-Hounsfield-eenheden en vervolgens opnieuw gesampled naar een isotrope resolutie van 2 mm.

Leg dat eens naast wat Qwen3.8 Max accepteert. Tekst, afbeelding en video — en video is in deze reeks het dichtst bij een volumetrische input, waardoor het het eerlijke vergelijkingspunt is in plaats van een retorisch punt. Een video is een stapel 2D-frames die op tijd zijn geordend. Een CT-volume is een stapel 2D-slices die op fysieke positie langs de z-as zijn geordend, in Hounsfield-eenheden, met een bekende millimeterafstand. Beide zijn driedimensionale arrays. Slechts één van beide heeft een fysiek coördinatenstelsel waarin de bevinding van een radioloog kan worden gelokaliseerd, en slechts één ervan wordt gemeten in een eenheid die iets betekent buiten een beeldsensor. Een model dat op video is getraind, leert temporele continuïteit. Een model dat op CT-volumes is getraind, leert dat een massa in de ene slice dezelfde massa is in de volgende slice, acht millimeter lager.

Het trainingscorpus is het echte verschil

Dit is waar de twee modellen helemaal niet meer te vergelijken zijn, en het is precies het deel dat een specificatieblad verbergt.

NV-Reason-CT werd end-to-end getraind met supervised fine-tuning, gevolgd door Group Relative Policy Optimization op ongeveer 550.000 gestructureerde QA-voorbeelden uit 70.111 unieke CT-volumes. De bronnen zijn CT-RATE — 47.149 gevallen van het Istanbul Medipol University Mega Hospital met gekoppelde radiologierapporten — een interne NIH-set van 15.991 gevallen, en de 22.720 gevallen van CancerVerse verdeeld over vier contrastfasen en dertien soorten kwaadaardige tumoren. Het corpus bevat gestandaardiseerde rapporten, QA gericht op afwijkingen, multi-turn dialogen en door radiologen opgestelde redeneringen die zijn getranscribeerd uit opgenomen expertinterpretaties. De GRPO-fase gebruikt verifieerbare beloningen op sets van borst- en buikafwijkingen, wat betekent dat het beloningssignaal controleert of een vermelde bevinding aanwezig is in het volume, in plaats van of de tekst klinisch klinkt.

Het trainingscorpus van Qwen3.8 Max is niet in dat soort detail gepubliceerd, en het zou niet helpen als dat wel zo was, omdat de beoogde capaciteit algemeen is. De cijfers van Artificial Analysis zijn in plaats daarvan het relevante bewijs: een Intelligence Index van 45,4 waarmee het 15e van 145 modellen staat in de snapshot van onze API, AA Coding 76,2 op de 9e plaats, Terminal-Bench 2.1 op 88,8, GPQA Diamond 92,8, Humanity's Last Exam 43,1, SciCode 52,1 en long-context recall 80,3. Dat zijn metingen van derden, geen leveranciersclaims, wat ze de meest betrouwbare cijfers aan weerszijden van deze pagina maakt.

Redeneringsoutput, twee verschillende contracten

Beide modellen produceren redeneersporen en bij beide kun je ze uitschakelen. De gelijkenis houdt op bij de interface.

Qwen3.8 Max biedt enable_thinking en reasoning_effort, samen met het volledige sampling-oppervlak — temperatuur, top_p, seed, penalties, gestructureerde outputs, tool calling. Het is een algemene redeneercapaciteit die je op wat je maar hebt richt. Zijn denkwerk is zo goed als het probleem dat je het voorlegt, en het heeft geen enkele manier om een bewering te verifiëren tegen iets anders dan de tekst die het kreeg.

De redenering van NV-Reason-CT heeft een beperkter contract met de lezer, en de modelkaart formuleert de beperking expliciet: gegenereerde redenering is "beoordeelbare modeloutput en biedt geen garantie dat deze de interne berekening van het model weergeeft." Dat voorbehoud speelt een echte rol, en het is het soort zin dat alleen verschijnt wanneer een team heeft nagedacht over wat een clinicus zal doen met een aannemelijk klinkend spoor. De kaart beschrijft de output als beoordeelbare observaties, differentiaaldiagnoses en onzekerheid. Met andere woorden: een spoor dat je kunt toetsen aan het volume, in plaats van een spoor dat je alleen maar kunt lezen.

Doorvoer, vanaf de enige plek waar we het kunnen meten

Qwen3.8 Max verwerkte in de afgelopen zeven dagen 37,2 miljoen tokens via de eigen playground van OrcaRouter. De mediane tijd tot het eerste token was 1,96 seconden — ruimschoots de snelste van de modellen in deze serie — bij 53,3 outputtokens per seconde. Het foutpercentage in dat venster was 3,5%.

Die twee cijfers wijzen in tegengestelde richtingen en zijn beide van belang. De latentie is uitstekend en maakt het prettig itereren met het model. Het foutpercentage is over hetzelfde venster ongeveer zeventien keer hoger dan de 0,21% van Kimi K3, en dat is het getal dat bepaalt of je het achter een synchrone call richting de gebruiker zet of achter een batchjob met retries. Dit is gemeten gedrag op ons netwerk, geen benchmark, en het is precies het soort ding dat een tariefkaart je nooit vertelt.

Voor NV-Reason-CT bestaat nergens een gelijkwaardige meting. Het is een BF16-checkpoint van 10,6 GB met aangepaste modelcode, geladen met trust_remote_code=True op Ampere-, Hopper- of Lovelace-hardware, getest door NVIDIA op H100 en L40S. Er is geen p50, geen foutpercentage en geen doorvoercijfer gepubliceerd. Iedereen die je vertelt bij welk omslagvolume zelf hosten hiervan voordeliger is dan per token betalen, gokt.

Prijs en vorm, naast elkaar

• Prijs — NV-Reason-CT GPU-capex, geen prijs per token vs. Qwen3.8 Max $2,00 / $6,00 per miljoen tokens, $0,25 voor cache-lezen, $2,50 voor cache-schrijven

• Invoer — NV-Reason-CT 3D NIfTI CT-volumes in Hounsfield-eenheden, alleen thorax of abdomen vs. Qwen3.8 Max tekst, afbeelding en video

• Context — NV-Reason-CT: één volume, een vaste prefix van 13.824 tokens vs. Qwen3.8 Max met 1.000.000 tokens

• Parameters — NV-Reason-CT 4,69B totaal / 4,35B actief in het CT-pad versus Qwen3.8 Max niet bekendgemaakt

• Licentie — NV-Reason-CT OpenMDW-1.1, gewichten gepubliceerd vs Qwen3.8 Max propriëtair, alleen API-toegang

• Onafhankelijke scores — NV-Reason-CT geen vs Qwen3.8 Max AA Intelligence Index 45,4, GPQA Diamond 92,8

A generated scoreboard titled 'NV-Reason-CT vs Qwen3.8 Max - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex, no per-token rate; Input 3D NIfTI CT, chest or abdomen; Context one volume, 13,824-token prefix; Parameters 4.69B total / 4.35B active; Licence OpenMDW-1.1, weights published; Independent score none published. Right column 'Qwen3.8 Max': Price $2.00 / $6.00, $0.25 cached read; Input text, image and video; Context 1,000,000 tokens; Parameters undisclosed; Licence proprietary, API only; Independent score AA Index 45.4, GPQA Diamond 92.8. A footer reads 'Qwen3.8 Max scores per Artificial Analysis; NV-Reason-CT figures are the authors' own, from the model card.'

De cache-economie van Qwen3.8 Max beloont een specifieke vorm: een gecachte read van $0,25 tegenover $2,00 aan nieuwe input is een achtvoudige korting, en de cache-write van $2,50 betekent dat een lange herbruikbare prefix zichzelf snel terugverdient. Dat is de workload van een systeemprompt plus een protocoldocument dat bij duizenden verzoeken opnieuw wordt gebruikt. NV-Reason-CT heeft het tegenovergestelde kostenprofiel — bijna nul marginale kosten per scan zodra de GPU is gekocht, en een harde ondergrens van één GPU die voor onbepaalde tijd wordt aangehouden.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Samen het gezin runnen

De natuurlijke architectuur hier, en het is het vermelden waard dat niemand die heeft gepubliceerd, is de fine-tune voor het volume en het vlaggenschip voor alles eromheen. NV-Reason-CT produceert de gestructureerde bevinding; Qwen3.8 Max verwerkt de verwijzingstekst, de protocolmatching, de codering, de opvolgbrief — het hoogvolume tekstwerk waar een venster van een miljoen tokens en een achtvoudige cachekorting echt hun plek verdienen.

Als dat je pipeline is, is de helft ervan een checkpoint dat je zelf host en de helft tokens die je koopt, en die tweede helft is waar een router iets doet wat een endpoint van één enkele leverancier niet kan. Qwen3.8 Max wordt via OrcaRouter aangeboden tegen de lijstprijs van Aliba​ba zonder enige opslag, dus de $2.00 / $6.00 hierboven is wat je betaalt, en elke toekomstige prijswijziging komt dezelfde dag op je factuur terecht in plaats van bij de verlenging. Automatische failover tussen providers is belangrijker dan gewoonlijk wanneer het eigen gemeten foutpercentage van het model 3.5% is — een nieuwe poging die naar een ander gezond endpoint gaat, is het verschil tussen een tijdelijke hapering en een mislukte batch. En omdat de algemene helft van de pipeline één modelnaam is achter een OpenAI-compatibel endpoint dat meer dan 200 modellen dekt, kost het inwisselen van iets anders voor een experiment van een week alleen een aanpassing van een string, niet een integratie.

NV-Reason-CT staat, voor alle duidelijkheid, niet op OrcaRouter en zal daar ook niet komen — het is custom-code 3D-inferentie die je zelf draait. De eerlijke versie van het integratieverhaal is dat de zelfgehoste specialist en de gerouteerde generalist onder één sleutel kunnen zitten, en dat is alles wat er wordt beweerd.

A screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the identifier qwen/qwen3.8-max, input text + image + video, output text, the Vision, Tools, JSON and Reasoning badges, a 1,000,000-token context window with a p50 time to first token of 1.96 seconds, the description of it as Alibaba's newest flagship positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $2.00 per million input tokens, $6.00 per million output tokens and 37.2M tokens of seven-day traffic.

Het oordeel dat daadwerkelijk standhoudt

Deze combinatie wordt onder "wat is beter" geschaard, en dat zou niet moeten. Qwen3.8 Max wordt door derden gemeten op algemeen redeneervermogen en verslaat het merendeel van het veld; NV-Reason-CT heeft één tabel met eigen cijfers op één CT-benchmark, en een parameteraantal van 4,69 miljard dat in elke algemene vergelijking niets bijzonders zou zijn. Op elke algemene benchmark wint het vlaggenschip, en de reden is dat de algemene benchmark is waarvoor het is gebouwd.

Bij die ene taak waarvoor NV-Reason-CT is gebouwd — het lezen van een CT-volume van de borstkas of de buik en zeggen wat erin zit, met een trace die iemand kan controleren — is Qwen3.8 Max geen zwakkere concurrent. Het heeft geen volumetrische encoder, dus het kan helemaal niet op de input worden uitgevoerd zonder dat iemand eerst besluit hoe een scan tot afbeeldingen wordt platgeslagen. Die beslissing bepaalt waar de ruimtelijke informatie naartoe gaat. Dat is het hele punt van een 4B-finetune met een native 3D-pad en een vaste prefix van 13.824 tokens, en daarom is het interessante aan dit model de kleinheid van zijn backbone en niet zijn omvang.