
Step 5 Preview vs Nemotron 3 Ultra: eenentwintig indexpunten voor twintig cent
- OrcaNIEUWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 mln tokens
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
Een van deze modellen kun je vanmiddag downloaden, en dat is degene die met eenentwintig punten verliest. Step 5 Preview, het gesloten vlaggenschip van StepFun, opende zijn API op 20 september 2026 en heeft geen licentiebestand dat je kunt vasthouden; NVIDIA Nemotron 3 Ultra 550B A55B staat sinds 4 juni 2026 op Hugging Face onder een permissieve licentie, met de trainingsrecepten bijgevoegd. Op de Artificial Analysis Intelligence Index staat het tweetal op 44 tegen 23. Qua outputprijs staat het tweetal op $2,70 tegen $2,50 per miljoen tokens. Eenentwintig punten voor twintig cent is geen vergelijking die zich in welke richting dan ook netjes laat beslechten, en daarom is het de moeite waard om het goed te doen in plaats van de twee opvallende kolommen vluchtig door te nemen en een kant te kiezen.
Geen van beide is deze week een lancering, en dat maakt uit voor hoe je de onderstaande cijfers leest. Beide zijn al maanden aanroepbaar, beide zijn door hetzelfde onafhankelijke harnas gegaan, en geen van beide heeft binnen het venster een wijziging van de tariefkaart. Wat is veranderd, is kleiner en interessanter: de index waarop ze worden beoordeeld, is in september herbouwd, en de twee worden nu afgezet tegen twee verschillende medianen die uit twee verschillende populaties zijn getrokken. Daar wordt deze vergelijking feitelijk beslecht.
Twee heel verschillende soorten product
Lees de specificatiebladen naast elkaar en het eerste dat opvalt, is dat het nauwelijks om dezelfde categorie dingen gaat.
• Parameters — Step 5 Preview heeft volgens StepFuns eigen documentatie een totaal van ongeveer 600 miljard, met 27 miljard actief per token; Nemotron 3 Ultra heeft een totaal van 550 miljard, met 55 miljard actief, volgens het cijfer dat de onafhankelijke raad voor zijn configuratie registreert.
• Architectuur — StepFun publiceert geen beschrijving van de interne werking voor Step 5 Preview. De modelkaart van NVIDIA documenteert een hybride: verweven Mamba-2-lagen, geselecteerde attentionlagen, een LatentMoE-opstelling en Multi-Token Prediction-heads.
• Contextvenster — 1M tokens in de specificatietabel van Step 5 Preview, met een maximale output van 64.000 tokens, ook gedocumenteerd door StepFun. Nemotron 3 Ultra staat bij de evaluator die het heeft uitgevoerd geregistreerd op 262.144 tokens; de leverancierskaart adverteert tot 1M, bereikbaar via een servingconfiguratie in plaats van standaard.
• Invoer — tekst, afbeeldingen en video op Step 5 Preview, maximaal 60 afbeeldingen per aanvraag en MP4-bestanden onder 128MB. Alleen tekst op Nemotron 3 Ultra.
• Redeneerbesturing — een gedocumenteerde instelling voor lage, gemiddelde en hoge inspanning aan de StepFun-zijde; een chat-template-vlag aan de NVIDIA-zijde die het denkspoor in- of uitschakelt.
• Gewichten — niets gepubliceerd voor Step 5 Preview, dat propriëtair is en alleen via API beschikbaar, met een BF16-checkpoint waarvan StepFun heeft gezegd dat het op 15 oktober 2026 zal volgen. Nemotron 3 Ultra wordt geleverd met BF16- en NVFP4-builds en een GenRM-beloningsmodel op Hugging Face onder OpenMDW-1.1.
• Minimale deploymentvereiste — niet van toepassing op het API-model; acht GPU's uit de B200- of GB200-klasse, of zestien H100's, voor de open variant, volgens de minimale specificatie van de leverancier.
• Tariefkaart — $1,00 voor input, $0,10 bij een cachehit en $2,70 voor output voor Step 5 Preview, van de Engelstalige prijzenpagina van StepFun. Ongeveer $0,60 voor input, $0,16 bij een cachehit en $2,50 voor output voor Nemotron 3 Ultra, en let goed op waar dat paar vandaan komt: NVIDIA publiceert geen tariefkaart, dus het is de waargenomen providerprijsstelling die het onafhankelijke panel registreert, niet een cijfer van de leverancier.
De rij die de meeste mensen als doorslaggevend beschouwen, is de eerste, en die is van de acht het minst informatief. De twee totalen liggen binnen negen procent van elkaar, terwijl de actieve parameters met een factor twee verschillen, en actieve parameters zijn bepalend voor de rekenkosten van elk gegenereerd token. Geen van beide cijfers voorspelt een verschil van eenentwintig punten.

De mediaan is een keuze die wordt gemaakt voordat je de score leest.
De onafhankelijke raad scoort modellen niet op één enkel veld. Die verdeelt ze over categorieën — en de categorie waarin een model belandt, verandert de zin die onder zijn score wordt afgedrukt, zonder de score te veranderen.
Step 5 Preview staat in de klasse algemeen redeneren, die de ranglijst op 227 modellen telt, en de mediaan van vergelijkbare modellen is 26. Nemotron 3 Ultra staat in de open-weights-klasse, die de ranglijst op 117 modellen telt, waar de mediaan 18 is. Zo beschrijft dezelfde ranglijst 44 als "ver boven gemiddeld" en 23 als "boven gemiddeld", en beide beschrijvingen zijn juist, want 44 ligt achttien punten boven zijn mediaan en 23 vijf punten boven de zijne.
Dit is geen truc en het is niet zo dat het scorebord oneerlijk is. Dit is de juiste manier om een open model te presenteren — je vergelijkt een downloadbaar checkpoint met andere downloadbare checkpoints, omdat een team dat alleen een download kan gebruiken niet uit de 227 kiest. Maar het betekent wel dat iedereen die "bovengemiddeld" over Nemotron 3 Ultra aanhaalt en "bovengemiddeld" over een 44, twee verschillende zinnen met elkaar vergelijkt. Als je één getal voor het paar wilt, gebruik dan de ruwe index en accepteer het gat van eenentwintig punten; als je de beslissing wilt, gebruik dan de klasse en geef toe dat je je veld al hebt gekozen.

Wat één harnas op beide mat
Leverancierstabellen kunnen niet van elkaar worden afgetrokken, omdat StepFun en NVIDIA op verschillende dagen verschillende suites hebben gedraaid en de materialen van NVIDIA niet elke benchmark bevatten die StepFun rapporteert. De eerlijke basis is de doorsnede: wat één enkele evaluator bij beide heeft gedraaid.
Op de Artificial Analysis Intelligence Index is dat snijpunt 44 tegenover 23. Wat betreft de kosten per voltooide indextaak bedraagt het $1,03 tegenover $0,60. Bij de outputsnelheid keert het beeld om, en fors: 87 tokens per seconde voor Step 5 Preview tegenover 135,6 voor Nemotron 3 Ultra, dus het model dat bijna twee keer zo hoog scoort, is het model dat per token ongeveer een halve seconde generatie langzamer is.
De scherpste afzonderlijke rij is Terminal-Bench 4.0. Step 5 Preview scoort daar 33,3 procent. Nemotron 3 Ultra scoort 0,5 procent. Dat is aan geen van beide kanten een afrondingsartefact en het is geen subtiel verschil — op die specifieke agentic-terminal-suite registreert het open-weight vlaggenschip effectief niet. De valkuil is dat hetzelfde leaderboard hetzelfde model ook vermeldt met 53,9 procent op Terminal-Bench 2.1. Twee benchmarks met bijna dezelfde naam, twee verschillende generaties van dezelfde taakfamilie, en één model dat op de oudere op 53,9 staat en op de nieuwere op 0,5. Als je een Nemotron-getal in de vijftigers tegen je hebt horen noemen, dan komt dat daarvandaan, en dat is niet de huidige suite.
Eén overeenkomst verdient een vermelding, juist omdat ze zeldzaam is. NVIDIA's eigen modelkaart claimt 87,0 procent op GPQA zonder tools; de onafhankelijke run mat 86,7 procent. Een leverancierscijfer en een extern cijfer die drie tienden van een punt uit elkaar liggen: zó ziet een betrouwbare evaluatietabel eruit, en het maakt de 0,5 procent op Terminal-Bench 4.0 makkelijker te accepteren als echt dan als een fout van de beoordelaar.
Waar het geld daadwerkelijk naartoe gaat tijdens een indexrun
Prijzen per token voorspellen heel weinig over wat een workload kost, en dit tweetal illustreert dat punt beter dan de meeste. Het scorebord publiceert de kostenopsplitsing voor de volledige index-run van elk model, en voor beide is de dominante kostenpost niet generatie.
De $1,03 per taak van Step 5 Preview valt uiteen in $0,85 aan input en $0,17 aan output. Binnen het inputbedrag gaat $0,62 naar cache-leesbewerkingen, $0,22 naar cache-schrijfbewerkingen en slechts $0,014 naar nieuwe, niet-gecachte input. Binnen het outputbedrag gaat $0,12 naar de redeneertrace en $0,06 naar het definitieve antwoord.
De $0,60 per taak van Nemotron 3 Ultra valt uiteen in $0,53 aan input en $0,07 aan output, en de samenstelling binnen de inputregel is bijna het spiegelbeeld — $0,48 aan cache-schrijfacties tegenover slechts $0,04 aan cache-leesacties.
Hieruit volgen twee conclusies. De eerste is dat bij een evaluatie over een lange horizon met intensief hergebruik van prefixen, ongeveer tachtig procent van wat je betaalt aan de inputzijde van het grootboek staat, waardoor je cache-hitratio en je contextdiscipline de getallen zijn om te optimaliseren in plaats van je outputlengte. De tweede is dat de twee modellen op verschillende manieren tot hun kosten komen: Step 5 Preview betaalt voor het opnieuw lezen van een grote gedeelde prefix, terwijl Nemotron 3 Ultra betaalt om in de eerste plaats afzonderlijke inhoud naar de cache te schrijven. Vergelijkbare kosten in de kop, twee verschillende facturen — en als je werklast meer op een van die patronen lijkt dan op het andere, kan de volgorde bij $1,03 en $0,60 omslaan.
De uitvoerigheidscijfers verklaren de rest van de outputregel. Step 5 Preview genereerde ongeveer 160 miljoen outputtokens over de indexsuite, tegenover een mediaan van 82 miljoen, wat het bestuur ronduit als zeer uitvoerig omschrijft. Nemotron 3 Ultra genereerde 110 miljoen tegenover een mediaan van 140 miljoen, wat het redelijk beknopt noemt. Het goedkopere model is het summiere, en het is summier in de richting die voor een factuur van belang is.

Wat de download oplevert, en wat het kost om die te behouden
De prijs van Nemotron 3 Ultra is niet $2,50 per miljoen outputtokens als je het checkpoint neemt. Dat is de prijs voor het huren van de deployment van iemand anders. Neem de download en je hebt een andere set kosten en een andere set rechten gekocht.
De rechten zijn concreet en ze zijn het onderdeel dat een model dat alleen via een API beschikbaar is, tegen geen enkele prijs kan evenaren. OpenMDW-1.1 wordt geleverd met de gewichten, en NVIDIA publiceert daarbij de datacollecties voor pre-training en post-training en de trainingsrecepten. Er is een NVFP4-build die voor hetzelfde model ongeveer half zo groot is, en de Ultra-gewichten zijn vooraf getraind met een NVFP4-recept in plaats van achteraf te zijn gekwantiseerd — wat verklaart waarom de kleine build een eersteklas artefact op de kaart is in plaats van een community-experiment. De commerciële positie wordt ronduit vermeld: klaar voor commercieel en niet-commercieel gebruik.
De kosten zijn even concreet. De minimale deployment is acht GPU's van de B200-klasse of zestien H100's, en dat is de ondergrens die de kaart vermeldt, niet een suggestie. Het contextvenster dat je daadwerkelijk krijgt, hangt af van hoe je serving configureert, met 256K als standaard en 1M achter een expliciete instelling. Een team dat geen rack kan vrijmaken, kiest niet tussen deze twee modellen tegen $1,00 en $0,60 input; het kiest tussen één model en een inkooporder.
Er bestaat een versie van deze vergelijking waarin het open model wint op de as waarvan mensen zeggen dat ze erom geven en die zelden wordt beprijsd — afhankelijkheid. Step 5 Preview is een endpoint dat je aanroept en een leverancier die je vertrouwt, met een checkpoint dat belooft wordt in plaats van geleverd. Als StepFun zijn tariefkaart herziet, zijn limieten aanscherpt, het ID deprecieert of een slechte week heeft, is je enige hefboom je eigen foutafhandeling. De gewichten van Nemotron 3 Ultra staan al op schijf in iemands cluster, en dat is iets reëel waard, zelfs terwijl hetzelfde model met eenentwintig indexpunten verliest.
Het is de moeite waard precies te zijn over wat "beloofd" aan de andere kant betekent, want het beeld is rommeliger dan beide kampen toegeven. Meerdere door derden gemaakte mirrorversies van een BF16-build verschenen op 20 september op Hugging Face, de dag dat de API openging, sommige ruim meer dan een terabyte aan safetensors. Dat zijn heruploads uit de community, geen release door de leverancier, en StepFun heeft daarnaast geen aankondiging over open gewichten gepubliceerd. Wat ze aantonen, is dat de gewichten circuleren en dat het beloofde checkpoint van 15 oktober een formalisering zou zijn in plaats van een onthulling.
Een getal dat bewoog terwijl we het lazen
Eén getal in dit stuk veranderde tussen twee keer lezen van dezelfde pagina, en het is de moeite waard het te benoemen, want dat is precies hoe een vergelijking stilletjes verouderd raakt.
De onafhankelijke raad toonde een kostenpost van $0,71 per indextaak voor Step 5 Preview in berichtgeving van 9 oktober 2026. Bij herlezing op 10 oktober staat op dezelfde pagina $1,03. Er is in dat venster niets aan het model veranderd, omdat de gewichten van een model dat alleen via een API beschikbaar is niet van de ene op de andere dag kunnen veranderen. Wat is veranderd, is de evaluatieboekhouding: wanneer de cacheprijs van een leverancier verandert, wanneer de evaluator zijn aannames over cache-reads herziet, of wanneer een run opnieuw wordt doorgerekend met een andere tokenmix, verandert het cijfer per taak en niet de indexscore.
Behandel de kosten per taak dus als een actueel cijfer met een datum erop, in plaats van als een eigenschap van het model. Elk cijfer per taak in dit artikel is de meting van 10 oktober en is als zodanig aangeduid. Als je op basis van deze pagina een budget opstelt, baseer het dan op een cijfer dat je zelf ophaalt op de dag dat je je vastlegt — en als je twee verslagen uit verschillende weken vergelijkt, controleer dan de vastlegdatums voordat je concludeert dat een model goedkoper is geworden.
Welke je eigenlijk zou bellen
Zeg eerst het ongemakkelijke deel: OrcaRouter routeert geen van deze twee modellen. Step 5 Preview is bereikbaar via de eigen API van StepFun en een handvol platforms van derden, en Nemotron 3 Ultra wordt aangeboden via de eigen endpoints van NVIDIA en door meerdere aanbieders, en je kunt beide beweringen controleren aan de hand van onze catalogus in dezelfde minuut dat je ze leest.
Wat dat overlaat is de vorm van de afhankelijkheid in plaats van de modelkeuze, en het is de enige plek waar een routeringslaag hier zijn geld waard is. Een preview die alleen via API beschikbaar is op één leverancierspad, is precies de opzet waarbij een slechte middag bij de provider jouw storing wordt, en de goedkope verzekering is een control plane die een verzoek kan doorschakelen naar een gekwalificeerde fallback zodra een leverancierspad verslechtert. Dat is waar automatische failover voor dient: niet als vervanging van Step 5 Preview, maar als hetgeen je vóór de modellen zet die je daadwerkelijk kunt aanroepen, zodat een leveranciersspecifiek endpoint nooit de enige route naar productie is. Dezelfde catalogus die dat doet, bevat meer dan 200 modellen achter één sleutel en één factuur, met de lijstprijs van de provider doorgegeven tegen 0 procent markup — wat de andere helft van het argument is, want een wijziging in de tariefkaart ergens stroomopwaarts is dezelfde dag live aan onze kant in plaats van pas bij de volgende contractverlenging.
Als geen van beide modellen het model is dat je zult aanroepen, luidt de korte versie als volgt. Kies Step 5 Preview als je de score, de video- en beeldinvoer en de 90 procent cachekorting wilt, en accepteer dat je een preview huurt zonder licentie op de gewichten en met een oktober-checkpoint dat je nog niet hebt gezien. Kies Nemotron 3 Ultra als de gewichten meer uitmaken dan de score — voor on-premisebeperkingen, voor fine-tuning, voor een licentie die je kunt lezen — en begroot het rack voordat je de tokens begroot, want bij $0,60 per miljoen inputtokens is een deployment met 550 miljard parameters alleen goedkoop als iemand anders al voor de GPU's betaalt.
Het punt om in de gaten te houden is 15 oktober. Als StepFun het BF16-checkpoint publiceert dat het heeft beloofd, is de centrale asymmetrie van dit artikel — dat slechts één van deze twee een download is — niet langer waar, en worden de eenentwintig indexpunten aanzienlijk moeilijker weg te redeneren. Als de datum wordt uitgesteld, wordt het pleidooi voor het open-weightmodel automatisch sterker, wat een vreemde manier is waarop een capaciteitskloof zich dicht, en een heel gangbare.
