Genererat titelkort för Step 5 Preview mot NVIDIA Nemotron 3 Ultra 550B A55B med texten ”tjugoen indexpoäng för tjugo cent”, med tre statistikchips: Artificial Analysis Intelligence Index 44 mot 23, utdatapris $2,70 mot $2,50 per miljon tokens, och kostnad per indexuppgift $1,03 mot $0,60. OrcaRouter-logotypen sitter i en vit remsa längst ned till höger.
Guides & Insights

Step 5 Preview vs Nemotron 3 Ultra: Tjugoen indexpoäng för tjugo cent

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

En av dessa modeller kan du ladda ner redan i eftermiddag, och det är den som förlorar tjugoen poäng. Step 5 Preview, StepFuns flaggskepp, öppnade sitt API den 20 september 2026 och har ingen licensfil du kan; NVIDIA Nemotron 3 Ultra 550B A55Bfinns på Hugging Face sedan 4 juni 2026 under en tillåtande licens med sina träningsrecept bifogade. På Artificial Analysis Index står paret på 44 mot 0. I outputpris står det $2,70 mot $2,50 per miljon tokens. Tjugoen poäng för tjugo cent är ingen jämförelse som faller ut entydigt i någon riktning, vilket är anledningen till att det är värt att göra ordentligt i stället för att skumma igenom de två rubrikkolumnerna och välja sida.

Ingen av dessa är en lansering den här veckan, och det spelar roll för hur du ska tolka siffrorna nedan. Båda har varit anropbara i månader, båda har gått igenom samma oberoende testramverk, och ingen av dem har någon ändring i prislistan under fönstret. Det som har ändrats är mindre och mer intressant: indexet de poängsätts mot byggdes om i september, och de två bedöms nu mot två olika medianer hämtade från två olika populationer. Det är där den här jämförelsen faktiskt avgörs.

Två väldigt olika typer av produkt

Läs specifikationsbladen sida vid sida, och det första man lägger märke till är att de knappt tillhör samma kategori.

• Parametrar – Step 5 Preview är enligt StepFuns egen dokumentation cirka 600 miljarder totalt med 27 miljarder aktiva per token; Nemotron 3 Ultra är 550 miljarder totalt med 55 miljarder aktiva, enligt den siffra som den oberoende styrelsen registrerar för dess konfiguration.

• Arkitektur — StepFun publicerar ingen beskrivning av interna delar för Step 5 Preview. NVIDIA:s kort dokumenterar en hybrid: interfolierade Mamba-2-lager, utvalda uppmärksamhetslager, ett LatentMoE-arrangemang och Multi-Token Prediction-huvuden.

• Kontextfönster — 1M tokens i specifikationstabellen för Step 5 Preview, med en maximal utdata på 64 000 tokens, även dokumenterat av StepFun. Nemotron 3 Ultra registreras vid 262 144 tokens av utvärderaren som körde den; leverantörskortet annonserar upp till 1M, nåbart genom en serveringskonfiguration snarare än som standard.

• Indata — text, bilder och video i Step 5 Preview, upp till 60 bilder per begäran och MP4-filer under 128 MB. Endast text på Nemotron 3 Ultra.

• Resonemangsstyrning — en dokumenterad inställning för låg, medel och hög ansträngning på StepFuns sida; en flagga i chattmallen på NVIDIAs sida som aktiverar eller inaktiverar tankespåret.

• Vikter – inga publicerade för Step 5 Preview, som är proprietär och endast tillgänglig via API, med en BF16-checkpoint som StepFun har uppgett kommer att följa den 15 oktober 2026. Nemotron 3 Ultra levereras i BF16- och NVFP4-versioner samt en GenRM-belöningsmodell på Hugging Face under OpenMDW-1.1.

• Driftsättningsminimum – ej tillämpligt för API-modellen; åtta GPU:er av B200-klass eller GB200-klass, eller sexton H100, på den öppna, enligt leverantörens miniminivå.

• Prislista — 1,00 USD för indata, 0,10 USD vid cacheträff och 2,70 USD för utdata för Step 5 Preview, från StepFuns engelska prissida. Cirka 0,60 USD för indata, 0,16 USD vid cacheträff och 2,50 USD för utdata för Nemotron 3 Ultra, och notera noga varifrån det paret kommer: NVIDIA publicerar ingen prislista, så det är den observerade leverantörsprissättningen som den oberoende nämnden registrerar, inte en siffra från leverantören.

Raden som de flesta behandlar som avgörande är den första, och den är den minst informativa av de åtta. De två totalerna ligger inom nio procent av varandra, medan de aktiva parametrarna skiljer sig med en faktor två, och det är de aktiva parametrarna som styr beräkningskostnaden för varje genererad token. Ingendera siffran förutsäger en skillnad på tjugoen punkter.

Generated two-column comparison scoreboard for Step 5 Preview and NVIDIA Nemotron 3 Ultra 550B A55B across six shared rows: Artificial Analysis Intelligence Index 44 against 23; output price $2.70 against $2.50 per million tokens; cost per index task $1.03 against $0.60; output speed 87 against 135.6 tokens per second; weights, 'none, BF16 checkpoint promised 15 October' against 'BF16 and NVFP4 on Hugging Face today'; and input, 'text, image and video' against 'text only'. A footer reads that index, speed and cost-per-task figures are per Artificial Analysis and that the Nemotron rate is the recorded provider listing rather than a vendor rate card. The OrcaRouter logo sits in a white strip at the bottom right.

Medianen är ett val som görs innan du läser resultatet

Den oberoende nämnden poängsätter inte modeller mot ett enda fält. Den delar in dem i fack – och vilket fack en modell hamnar i ändrar meningen som skrivs ut under dess poäng, utan att ändra poängen.

Step 5 Preview placeras i klassen för allmänt resonemang, som tavlan räknar till 227 modeller, och dess median för jämförbara modeller är 26. Nemotron 3 Ultra placeras i klassen för öppna vikter, som räknas till 117 modeller, där medianen är 18. Så samma tavla beskriver 44 som ”väl över genomsnittet” och 23 som ”över genomsnittet”, och båda beskrivningarna är sanna, eftersom 44 ligger arton punkter över sin median och 23 ligger fem punkter över sin egen.

Det här är inte ett trick, och det är inte så att resultattavlan är orättvis. Det är det korrekta sättet att presentera en öppen modell – man jämför en nedladdningsbar checkpoint mot andra nedladdningsbara checkpoints, eftersom ett team som bara kan utgå från en nedladdning inte väljer bland de 227. Men det innebär att den som citerar ”över genomsnittet” om Nemotron 3 Ultra och ”över genomsnittet” om en 44 jämför två olika meningar med varandra. Om du vill ha ett enda nummer för paret, använd det råa indexet och acceptera gapet på tjugoen punkter; om du vill ha beslutet, använd klassen och erkänn att du redan har valt ditt fält.

Screenshot of the Artificial Analysis model page for Nemotron 3 Ultra 550B A55B (Reasoning), showing an Intelligence Index of 23 in a class of 117 open-weights models with a comparable-model median of 18, pricing of $0.60 per million input tokens and $2.50 per million output tokens with a 73 percent cache discount, an average cost of $0.60 per index task, 110 million output tokens generated during the run against a 140 million median, 135.6 output tokens per second, and a 262,144-token context window.

Vad en testrigg mätte på båda

Leverantörstabeller kan inte subtraheras från varandra, eftersom StepFun och NVIDIA körde olika testsviter olika dagar och NVIDIAs material inte innehåller alla benchmarks som StepFun rapporterar. Den ärliga grunden är skärningspunkten: vad en och samma utvärderare körde mot båda.

På Artificial Analysis Intelligence Index är den skärningspunkten 44 mot 23. När det gäller kostnaden per slutförd indexuppgift är den 1,03 USD mot 0,60 USD. När det gäller utdatahastigheten är det omvänt, och kraftigt: 87 tokens per sekund för Step 5 Preview mot 135,6 för Nemotron 3 Ultra, så modellen som får nästan dubbelt så högt resultat är den som svarar med en generering som är ungefär en halv sekund långsammare per token.

Den mest slående enskilda raden är Terminal-Bench 4.0. Step 5 Preview får 33,3 procent där. Nemotron 3 Ultra får 0,5 procent. Det är inte en avrundningsartefakt på någon av sidorna och det är inte en subtil skillnad – i den specifika agentiska terminalsviten registreras flaggskeppsmodellen med öppna vikter i praktiken inte alls. Fällan är att samma resultattavla också listar samma modell med 53,9 procent på Terminal-Bench 2.1. Två benchmarks med nästan samma namn, två olika generationer av samma uppgiftsfamilj, och en modell som ligger på 53,9 på den äldre och 0,5 på den nyare. Om du har fått en Nemotron-siffra i femtiointervallet citerad för dig, är det därifrån den kommer, och det är inte den aktuella sviten.

En överensstämmelse förtjänar att nämnas just för att den är sällsynt. NVIDIA:s eget kort uppger 87,0 procent på GPQA utan verktyg; den oberoende körningen uppmätte 86,7 procent. Att en siffra från leverantören och en från oberoende håll hamnar tre tiondels procentenheter ifrån varandra är precis så en trovärdig utvärderingstabell ser ut, och det gör 0,5 procent på Terminal-Bench 4.0 lättare att acceptera som verkligt snarare än som ett utvärderingsfel.

Vart pengarna faktiskt tar vägen vid en indexkörning

Priser per token förutsäger väldigt lite om vad en arbetsbelastning kostar, och det här paret illustrerar poängen bättre än de flesta. Tavlan publicerar kostnadsuppdelningen för varje modells fullständiga indexkörning, och för båda dessa är den dominerande posten inte generering.

För Step 5 Preview delas $1.03 per uppgift upp i $0.85 indata och $0.17 utdata. I indatabeloppet är $0.62 cacheläsningar, $0.22 cacheskrivningar och endast $0.014 färsk, icke-cachad indata. I utdatabeloppet är $0.12 resonemangsspåret och $0.06 det slutliga svaret.

Nemotron 3 Ultras $0,60 per uppgift delas upp i $0,53 för indata och $0,07 för utdata, och sammansättningen inuti indataraden är nästan en spegelbild — $0,48 i cacheskrivningar mot bara $0,04 i cacheläsningar.

Två slutsatser framträder. Den första är att i en utvärdering över lång horisont med omfattande prefixåteranvändning ligger ungefär åttio procent av det du betalar på inputsidan i räkenskaperna, vilket gör din cacheträffrekvens och din kontextdisciplin till siffrorna du bör optimera i stället för din utdatalängd. Den andra är att de två modellerna kommer fram till sina räkningar på olika sätt: Step 5 Preview betalar för att läsa om ett stort delat prefix, medan Nemotron 3 Ultra betalar för att från början skriva in separat innehåll i cachen. Liknande kostnad på papperet, två olika fakturor – och om din arbetsbelastning liknar ett av dessa mönster mer än det andra, kan ordningen mellan $1.03 och $0.60 vändas.

Ordrikhetssiffrorna förklarar resten av utdatalinjen. Step 5 Preview genererade omkring 160 miljoner utdatatokens i indexsviten, mot en median på 82 miljoner, vilket styrelsen krasst beskriver som mycket ordrikt. Nemotron 3 Ultra genererade 110 miljoner mot en median på 140 miljoner, vilket den kallar ganska koncist. Den billigare modellen är den fåordiga, och den är fåordig i den riktning som spelar roll för en faktura.

Screenshot of StepFun's English documentation page for Step 5 Preview showing the specification table - model ID step-5-preview, a 1M-token context window, text, image and video input with text output, a 1M maximum input and a 64k maximum output - together with the input and video format notes listing JPG, JPEG, PNG, WebP and static GIF at up to 60 images per request and MP4, QuickTime and Matroska video under 128MB per file.

Vad nedladdningen ger, och vad det kostar att behålla

Priset för Nemotron 3 Ultra är inte 2,50 USD per miljon utdatatokens om du tar checkpointen. Det är priset för att hyra någon annans driftsättning av den. Tar du nedladdningen har du köpt en annan uppsättning kostnader och en annan uppsättning rättigheter.

Rättigheterna är konkreta och de är den del som en API-only-modell inte kan matcha till något pris. OpenMDW-1.1 levereras med vikterna, och NVIDIA publicerar datainsamlingarna för förträning och efterträning samt träningsrecepten tillsammans med dem. Det finns en NVFP4-byggversion som är ungefär hälften så stor för samma modell, och Ultra-vikterna förtränades med ett NVFP4-recept i stället för att kvantiseras i efterhand – vilket är anledningen till att den lilla byggversionen är en förstklassig artefakt på kortet snarare än ett community-experiment. Den kommersiella positionen uttrycks tydligt: redo för kommersiell och icke-kommersiell användning.

Kostnaderna är lika konkreta. Minimikonfigurationen är åtta GPU:er av B200-klass eller sexton H100, och det är den lägstanivå som kortet anger snarare än ett förslag. Det kontextfönster du faktiskt får beror på hur du konfigurerar serveringen, där 256K är standard och 1M ligger bakom en uttrycklig inställning. Ett team som inte kan avsätta ett rack väljer inte mellan dessa två modeller till $1,00 och $0,60 i indata; det väljer mellan en modell och en inköpsorder.

Det finns en version av den här jämförelsen där den öppna modellen vinner på den axel folk säger sig bry sig om och sällan prissätter — beroende. Step 5 Preview är en slutpunkt du anropar och en leverantör du litar på, med en checkpoint som utlovas snarare än levereras. Om StepFun reviderar sin prislista, stramar åt sina gränser, avvecklar ID:t eller har en dålig vecka, är din enda hävstång din egen felhantering. Nemotron 3 Ultras vikter ligger redan på disk i någons kluster, och det är värt något verkligt även när samma modell förlorar med tjugoen indexpoäng.

Det är värt att vara precis om vad "utlovade" betyder på andra sidan, eftersom bilden är rörigare än något av lägren medger. Flera speglar från tredje part av ett BF16-bygge dök upp på Hugging Face den 20 september, dagen då API:et öppnades, några av dem långt över en terabyte safetensors. Det är återuppladdningar från communityn, inte en leverantörsrelease, och StepFun har inte publicerat något tillkännagivande om öppna vikter tillsammans med dem. Vad de visar är att vikterna cirkulerar och att den utlovade checkpunkten den 15 oktober skulle vara en formalisering snarare än ett avslöjande.

Ett nummer som rörde sig medan vi läste det

En siffra i den här texten ändrades mellan två läsningar av samma sida, och den är värd att nämna eftersom det är precis så en jämförelse tyst blir inaktuell.

Den oberoende nämnden visade en kostnad på 0,71 USD per indexuppgift för Step 5 Preview i täckning daterad 9 oktober 2026. Vid en ny läsning den 10 oktober anger samma sida 1,03 USD. Ingenting förändrades med modellen under det fönstret, eftersom ingenting kan förändras med vikterna för en API-only-modell över en natt. Det som förändrades är utvärderingsredovisningen: när en leverantörs cachepris rör sig, när utvärderaren reviderar sina antaganden om cacheläsning, eller när en körning räknas om mot en annan tokenmix, ändras siffran per uppgift medan indexpoängen inte gör det.

Betrakta kostnad per uppgift som ett levande tal med ett datum stämplat på sig, inte som en egenskap hos modellen. Varje siffra per uppgift i den här artikeln är avläsningen den 10 oktober och är märkt som en sådan. Om du bygger en budget utifrån den här sidan bör du bygga den utifrån en siffra som du själv hämtar den dag du fattar ditt beslut – och om du jämför två texter från olika veckor bör du kontrollera insamlingsdatumen innan du drar slutsatsen att en modell har blivit billigare.

Vilken skulle du faktiskt ringa?

Säg det obekväma först: OrcaRouter dirigerar ingen av dessa två modeller. Step 5 Preview går att nå via StepFuns eget API och en handfull tredjepartsplattformar, och Nemotron 3 Ultra serveras från NVIDIAs egna slutpunkter och av flera leverantörer, och du kan kontrollera båda påståendena mot vår katalog i samma minut som du läser dem.

Det som återstår är beroendets form snarare än valet av modell, och det är den enda platsen där ett routinglager förtjänar sin plats här. En förhandsvisning som bara finns via API på en enda leverantörsväg är precis det upplägg där en dålig eftermiddag hos leverantören blir ditt avbrott, och den billiga försäkringen är ett kontrollplan som kan flytta över en begäran till en kvalificerad reservlösning i samma stund som en leverantörsväg försämras. Det är vad automatisk failover är till för: inte som en ersättning för Step 5 Preview, utan som det du sätter framför de modeller du faktiskt kan anropa, så att en leverantörsspecifik endpoint aldrig är den enda vägen in i produktion. Samma katalog som gör det bär över 200 modeller bakom en enda nyckel och en enda faktura, med leverantörens listpris vidarebefordrat med 0 procents påslag – vilket är den andra halvan av argumentet, eftersom en ändring i prislistan någonstans uppströms är live hos oss samma dag i stället för vid nästa avtalsförnyelse.

Om ingen av modellerna är den du kommer att anropa, ser kortversionen ut så här. Välj Step 5 Preview när du vill ha poängen, video- och bildinmatningen och 90 procents cacherabatt, och acceptera att du hyr en förhandsversion utan licens till vikterna och en oktober-checkpoint du ännu inte har sett. Välj Nemotron 3 Ultra när vikterna betyder mer än poängen — för on-premise-begränsningar, för finjustering, för en licens du kan läsa — och budgetera racket innan du budgeterar tokens, eftersom vid $0,60 per miljon indata-tokens är en distribution med 550 miljarder parametrar bara billig om någon annan redan betalar för GPU:erna.

Det man bör hålla ögonen på är den 15 oktober. Om StepFun publicerar den BF16-checkpoint som företaget har utlovat, upphör den här artikelns centrala asymmetri – att endast en av dessa två är en nedladdning – att gälla, och de tjugoen indexpoängen blir betydligt svårare att avfärda. Om datumet skjuts upp förstärks argumenten för open-weight-modellen per automatik, vilket är ett märkligt sätt för ett förmågegap att slutas – och ett mycket vanligt sådant.