為 Step 5 Preview 對比 NVIDIA Nemotron 3 Ultra 550B A55B 生成的標題卡,寫著「二十美分換二十一點指數分數」,並有三個數據標籤:Artificial Analysis Intelligence Index 44 對 23、輸出價格每百萬個 token 2.70 美元對 2.50 美元,以及每項指數任務成本 1.03 美元對 0.60 美元。OrcaRouter 標誌位於右下角的白色區塊中。
Guides & Insights

Step 5 Preview 對決 Nemotron 3 Ultra:二十分錢換二十一個指數點

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

這些模型當中,有一款你今天下午就能下載,而它正是那個輸了二十一分的一款。Step 5 Preview是 StepFun 的封閉旗艦模型,於 2026 年 9 月 20 日開放 API,而且沒有任何你能拿在手上的授權檔案;NVIDIA Nemotron 3 Ultra 550B A55B自 2026 年 6 月 4 日起就一直在 Hugging Face 上,採用寬鬆授權,並附上其訓練配方。在 Artificial Analysis 智慧指數上,兩者分別是 44 對 23。在輸出價格上,則是每百萬個詞元 2.70 美元對 2.50 美元。二十分錢換二十一分,不是一個能乾淨俐落往任一方向解決的比較,這正是為什麼值得好好做這件事,而不是只掃過兩個頭條欄位就選邊站。

這兩者本週都不是新發布,而這對你如何解讀下方的數字很重要。兩者都已經可供呼叫數個月,兩者都經過相同的獨立測試框架,而且兩者在該期間內都沒有費率表變更。真正改變的事情更小,也更有趣:它們被評分所依據的指標在九月重建了,而現在它們是對照著從兩個不同母體抽出的兩個不同中位數來評判。這才是這個比較真正被決定的地方。

兩種截然不同的產品

把規格表並排閱讀,首先會注意到的是,它們幾乎算不上同一類東西。

• 參數 — 根據 StepFun 自家文件,Step 5 Preview 總參數約為 6,000 億,每個 token 有 270 億活躍參數;根據獨立委員會對其配置所記錄的數字,Nemotron 3 Ultra 總參數為 5,500 億,有 550 億活躍參數。

• 架構 — StepFun 並未發布 Step 5 Preview 的內部描述。NVIDIA 的模型卡記載了一種混合架構:交錯的 Mamba-2 層、選定的注意力層、LatentMoE 配置,以及 Multi-Token Prediction 頭。

• 上下文視窗 — 在 Step 5 Preview 的規格表中為 1M 個 token,最大輸出為 64,000 個 token,StepFun 亦有記載。Nemotron 3 Ultra 由執行它的評估器記錄為 262,144 個 token;廠商規格卡宣稱最高可達 1M,可透過服務配置達成,而非預設值。

• 輸入 — Step 5 Preview 支援文字、圖片與影片,每次請求最多 60 張圖片,以及 128MB 以下的 MP4 檔案。Nemotron 3 Ultra 則僅支援文字。

• 推理控制 —— StepFun 端有文件記載的低、中、高投入程度設定;NVIDIA 端則是一個聊天範本旗標,可開啟或關閉思考軌跡。

• 權重——Step 5 Preview 未公布任何權重,該模型為專有且僅提供 API,StepFun 表示將於 2026 年 10 月 15 日跟進發布 BF16 檢查點。Nemotron 3 Ultra 在 Hugging Face 上以 OpenMDW-1.1 發布 BF16 與 NVFP4 版本及 GenRM 獎勵模型。

• 部署門檻——不適用於 API 模型;在開放版本上,依廠商的最低規格,需八張 B200 等級或 GB200 等級 GPU,或十六張 H100。

• 費率表 — Step 5 Preview 為 $1.00 輸入、快取命中時 $0.10,以及 $2.70 輸出,資料來自 StepFun 的英文定價頁面。Nemotron 3 Ultra 則約為 $0.60 輸入、快取命中時 $0.16,以及 $2.50 輸出;請務必留意這組數字的來源:NVIDIA 並未公布費率表,因此這是獨立委員會所記錄、實際觀察到的供應商定價,而非供應商提供的數字。

大多數人視為決定性的那一列是第一列,而它是這八列中資訊量最少的。兩個總計彼此相差不到百分之九,但活躍參數卻相差兩倍,而活躍參數正是決定每個生成符元運算成本的因素。這兩個數字都無法預測出二十一分的差距。

Generated two-column comparison scoreboard for Step 5 Preview and NVIDIA Nemotron 3 Ultra 550B A55B across six shared rows: Artificial Analysis Intelligence Index 44 against 23; output price $2.70 against $2.50 per million tokens; cost per index task $1.03 against $0.60; output speed 87 against 135.6 tokens per second; weights, 'none, BF16 checkpoint promised 15 October' against 'BF16 and NVFP4 on Hugging Face today'; and input, 'text, image and video' against 'text only'. A footer reads that index, speed and cost-per-task figures are per Artificial Analysis and that the Nemotron rate is the recorded provider listing rather than a vendor rate card. The OrcaRouter logo sits in a white strip at the bottom right.

中位數是在你看到分數之前就已做出的選擇。

這個獨立委員會並不是按單一領域來為模型評分。它會把模型分桶歸類——而模型落入哪個桶,會改變印在其分數底下的那句話,卻不會改變分數本身。

Step 5 Preview 被歸入一般推理類別,該類別在排行榜上計有 227 個模型,而其可比模型的中位數為 26。Nemotron 3 Ultra 被歸入開放權重類別,計有 117 個模型,其中位數為 18。因此,同一個排行榜將 44 描述為「遠高於平均」,並將 23 描述為「高於平均」,而這兩種描述都成立,因為 44 比其中位數高出 18 分,23 也比自身的中位數高出 5 分。

這不是什麼陷阱,也不是排行榜不公平。這是呈現開放模型的正確方式——你拿一個可下載的檢查點和其他可下載的檢查點比較;一個只能取得下載檔的團隊,並不是從這 227 個之中做選擇。但這確實意味著,任何引用 Nemotron 3 Ultra「高於平均」以及某個 44「高於平均」的人,都是在把兩個不同的句子互相比較。如果你想要這對模型的一個數字,就用原始指標,並接受那二十一分的差距;如果你想要的是決策,就用類別,並承認你已經這麼做了。

Screenshot of the Artificial Analysis model page for Nemotron 3 Ultra 550B A55B (Reasoning), showing an Intelligence Index of 23 in a class of 117 open-weights models with a comparable-model median of 18, pricing of $0.60 per million input tokens and $2.50 per million output tokens with a 73 percent cache discount, an average cost of $0.60 per index task, 110 million output tokens generated during the run against a 140 million median, 135.6 output tokens per second, and a 262,144-token context window.

一個測試框架在兩者上測量了什麼

廠商表格不能彼此相減,因為 StepFun 和 NVIDIA 是在不同日子跑了不同的測試套件,而且 NVIDIA 的資料並未涵蓋 StepFun 報告的每一項基準。誠實的比較基礎是交集:同一個評估者對雙方都執行過的測試。

在 Artificial Analysis Intelligence Index 上,該交會點是 44 對 23。在每完成一項 index 任務的成本上,則是 1.03 美元對 0.60 美元。在輸出速度上則反轉,而且幅度很大:Step 5 Preview 為每秒 87 個 token,對上 Nemotron 3 Ultra 的 135.6,因此得分幾乎高出兩倍的模型,正是每個 token 生成速度慢約半秒的那一個。

最刺眼的一列是 Terminal-Bench 4.0。Step 5 Preview 在那裡拿下 33.3%。Nemotron 3 Ultra 拿下 0.5%。這不是任何一方的四捨五入假象,也不是什麼細微差距——在那個特定的代理式終端測試套件上,這款開放權重旗艦實質上等於沒有留下成績。陷阱在於,同一個排行榜也把同一個模型列在 Terminal-Bench 2.1 的 53.9%。兩個名稱幾乎相同的基準、同一任務家族的不同世代,而同一個模型在較舊的那個上坐擁 53.9,在較新的那個上卻是 0.5。如果你曾看到有人拿五十幾的 Nemotron 數字來跟你說,那就是它的出處,而且那並不是目前的套件。

有一項結果特別值得一提,正因為它極為罕見。NVIDIA 自家宣稱在無工具輔助下於 GPQA 達到 87.0%;而獨立測試測得 86.7%。廠商數字與外部數字僅差零點三個百分點,這正是值得信賴的評測表應有的樣貌,也讓 Terminal-Bench 4.0 上的 0.5% 更容易被視為真實結果,而非評估者的失誤。

在指數執行過程中,資金實際上流向何處

每 Token 的價格對於工作負載的成本幾乎沒有預測力,而這一對比大多數例子更能說明這一點。該排行榜會公布每個模型完整索引執行的成本分解,而對這兩者而言,佔比最高的項目並不是生成。

Step 5 Preview 每項任務的 $1.03 拆分為 $0.85 的輸入與 $0.17 的輸出。在輸入部分中,$0.62 是快取讀取,$0.22 是快取寫入,只有 $0.014 是全新、未快取的輸入。在輸出部分中,$0.12 是推理過程,$0.06 是最終答案。

Nemotron 3 Ultra 每項任務的 0.60 美元,拆分為 0.53 美元的輸入與 0.07 美元的輸出,而輸入那一行的組成幾乎是完全相反的鏡像——0.48 美元的快取寫入,對比僅 0.04 美元的快取讀取。

有兩個結論隨之浮現。第一個是,在大量重用前綴的長時程評估中,你所支付的成本大約有八成落在帳本的輸入端,這使得你的快取命中率與上下文紀律才是該最佳化的數字,而不是你的輸出長度。第二個是,這兩個模型產生帳單的方式不同:Step 5 Preview 是在為重新讀取一大段共享前綴付費,而 Nemotron 3 Ultra 則是在一開始就為把相異內容寫入快取付費。表面成本相近,卻是兩張不同的帳單——而且如果你的工作負載看起來更像其中一種模式而非另一種,$1.03 與 $0.60 的排序就可能翻轉。

冗長度數字說明了該輸出行其餘的部分。Step 5 Preview 在整個索引套件中產生了約 1.6 億個輸出 token,而中位數為 8,200 萬,該排行榜直白地形容為非常冗長。Nemotron 3 Ultra 產生了 1.1 億個,而中位數為 1.4 億,並稱之為相當精簡。較便宜的模型才是簡短的那個,而且它的簡短,正是對帳單會在意的那種方向。

Screenshot of StepFun's English documentation page for Step 5 Preview showing the specification table - model ID step-5-preview, a 1M-token context window, text, image and video input with text output, a 1M maximum input and a 64k maximum output - together with the input and video format notes listing JPG, JPEG, PNG, WebP and static GIF at up to 60 images per request and MP4, QuickTime and Matroska video under 128MB per file.

下載帶來什麼,保存又需付出什麼

若你取用的是檢查點,Nemotron 3 Ultra 的價格並不是每百萬個輸出詞元 2.50 美元。那是租用別人部署的 Nemotron 3 Ultra 的價格。選擇下載,你買到的就是一組不同的成本,以及一組不同的權利。

權利是具體的,而這正是僅提供 API 的模型無論出價多高都無法比擬的部分。OpenMDW-1.1 隨附權重,而 NVIDIA 也一併發布了預訓練與後訓練的資料集,以及伴隨這些資料集的訓練配方。針對同一個模型,有一個 NVFP4 版本,大小約只有一半,而且 Ultra 權重是以 NVFP4 配方預訓練而成,而非事後量化——這就是為什麼這個小版本是該顯卡上的一級產物,而不是社群實驗。其商用立場說得很明白:可供商用與非商用。

成本也同樣具體。最低部署需求是 B200 等級的 GPU,或十六張 H100,而這是該卡所載明的最低門檻,並非建議。你實際取得的上下文視窗取決於你如何設定服務,預設為 256K,1M 則需要明確設定才能啟用。一個無法投入一整座機櫃的團隊,並不是在以 $1.00 與 $0.60 的輸入價格之間二選一;它是在一個模型與一張採購單之間做選擇。

這個比較有一個版本,是開源模型在人們口口聲聲說在意、卻鮮少為其定價的軸線上勝出——依賴性。Step 5 Preview 是你呼叫的端點和你信任的供應商,附帶的是一個被承諾而非已交付的檢查點。如果 StepFun 修改其價目表、收緊限制、棄用該 ID,或某週表現不佳,你唯一的槓桿就是你自己的錯誤處理。Nemotron 3 Ultra 的權重已經在某人的叢集磁碟上,而這具有實實在在的價值,即使同一個模型正以二十一個指數點之差落敗。

值得精確釐清另一方所謂「承諾」究竟是什麼意思,因為實際情況比兩邊陣營所願意承認的都更加混亂。BF16 版本的多個第三方鏡像在 9 月 20 日、也就是 API 開放當天,出現在 Hugging Face 上,其中有些 safetensors 檔案的容量遠遠超過 1 TB。那些是社群自行重新上傳的產物,並非廠商發布,而 StepFun 也沒有隨之發表任何開放權重的公告。它們所證實的是:權重正在流通,而所承諾的 10 月 15 日檢查點將只是一種正式化,而非一項揭露。

一個在我們閱讀它時移動了的數字

這篇文章裡有一個數字,在同一頁的兩次讀取之間出現了變化;這點值得特別點明,因為那正是比較悄悄失效的方式。

獨立評測委員會在 2026 年 10 月 9 日的報導中指出,Step 5 Preview 每項索引任務的成本為 $0.71。10 月 10 日再次閱讀,同一頁面顯示 $1.03。在那段期間,模型本身沒有任何改變,因為僅供 API 存取的模型權重不可能一夜之間產生變化。改變的是評估的計算方式:當供應商的快取價格變動、當評測者修訂其快取讀取假設,或當某次執行改以不同的 token 組合重新計算時,每項任務的數字會變動,而指數分數不會。

因此,請把每項任務成本視為帶有日期戳記的即時數字,而不是模型的固有屬性。本文中每個單項任務數字都是 10 月 10 日的讀數,並已標示為此。如果你要依據本頁建立預算,請以你在承諾當天自行取得的數字來建立——而如果你要比較不同週次的兩份報告,請先檢查擷取日期,再下結論說某個模型變便宜了。

你實際上會打給哪一個?

先說讓人不舒服的部分:OrcaRouter 並不路由這兩個模型中的任何一個。Step 5 Preview 可透過 StepFun 自家的 API 以及少數幾個第三方平台取得,而 Nemotron 3 Ultra 則由 NVIDIA 自家端點提供,並由多家供應商提供服務;你可以在讀到這兩項說法的同一分鐘內,對照我們的目錄加以查證。

這留下來的是依賴關係的形態,而不是模型的選擇,而這正是路由層在此發揮價值的地方。單一供應商路徑上的純 API 預覽,恰恰是那種供應商一個不順的下午就會變成你服務中斷的配置,而便宜的保險就是一個控制平面,能在供應商路徑一劣化時,立刻把請求切換到合格的備援路徑。這正是自動容錯移轉的用途:不是用來取代 Step 5 Preview,而是放在你真正能呼叫的模型前面,讓特定供應商的端點永遠不會是通往正式環境的唯一道路。做到這件事的同一個目錄,還承載了一把金鑰、一張帳單背後的 200 多個模型,並以 0% 加價轉嫁供應商的標價——這是論點的另一半,因為上游任何地方的價目表變動,在我們這邊當天就會生效,而不是等到下一次合約續約。

如果這兩個模型都不是你會呼叫的那一個,簡短版是這樣。當你想要分數、影片與圖像輸入,以及 90% 快取折扣時,就選 Step 5 Preview,並接受你租的是一個預覽版,既沒有權重授權,也帶著一個你還沒見過的十月檢查點。當權重比分數更重要時——因為地端部署限制、因為微調、因為一份你讀得懂的授權——就選 Nemotron 3 Ultra,並在編列 token 預算之前先編列機架預算,因為以每百萬輸入 token $0.60 來說,5500 億參數的部署只有在別人已經在幫你付 GPU 錢時才稱得上便宜。

要留意的是10月15日。如果 StepFun 發布了它承諾的 BF16 檢查點,本文的核心不對稱——這兩者當中只有一個能下載——就不再成立,而那二十一個指數點也會變得明顯更難被辯解掉。如果這個日期延後,開放權重模型的理由就會自動增強,這是一種很奇怪的能力差距縮小方式,卻也非常常見。