
Step 5 Preview 對決 Nemotron 3 Ultra:二十分錢換二十一個指數點
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百萬 tokens
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
這些模型當中,有一款你今天下午就能下載,而它正是那個輸了二十一分的一款。Step 5 Preview是 StepFun 的封閉旗艦模型,於 2026 年 9 月 20 日開放 API,而且沒有任何你能拿在手上的授權檔案;NVIDIA Nemotron 3 Ultra 550B A55B自 2026 年 6 月 4 日起就一直在 Hugging Face 上,採用寬鬆授權,並附上其訓練配方。在 Artificial Analysis 智慧指數上,兩者分別是 44 對 23。在輸出價格上,則是每百萬個詞元 2.70 美元對 2.50 美元。二十分錢換二十一分,不是一個能乾淨俐落往任一方向解決的比較,這正是為什麼值得好好做這件事,而不是只掃過兩個頭條欄位就選邊站。
這兩者本週都不是新發布,而這對你如何解讀下方的數字很重要。兩者都已經可供呼叫數個月,兩者都經過相同的獨立測試框架,而且兩者在該期間內都沒有費率表變更。真正改變的事情更小,也更有趣:它們被評分所依據的指標在九月重建了,而現在它們是對照著從兩個不同母體抽出的兩個不同中位數來評判。這才是這個比較真正被決定的地方。
兩種截然不同的產品
把規格表並排閱讀,首先會注意到的是,它們幾乎算不上同一類東西。
• 參數 — 根據 StepFun 自家文件,Step 5 Preview 總參數約為 6,000 億,每個 token 有 270 億活躍參數;根據獨立委員會對其配置所記錄的數字,Nemotron 3 Ultra 總參數為 5,500 億,有 550 億活躍參數。
• 架構 — StepFun 並未發布 Step 5 Preview 的內部描述。NVIDIA 的模型卡記載了一種混合架構:交錯的 Mamba-2 層、選定的注意力層、LatentMoE 配置,以及 Multi-Token Prediction 頭。
• 上下文視窗 — 在 Step 5 Preview 的規格表中為 1M 個 token,最大輸出為 64,000 個 token,StepFun 亦有記載。Nemotron 3 Ultra 由執行它的評估器記錄為 262,144 個 token;廠商規格卡宣稱最高可達 1M,可透過服務配置達成,而非預設值。
• 輸入 — Step 5 Preview 支援文字、圖片與影片,每次請求最多 60 張圖片,以及 128MB 以下的 MP4 檔案。Nemotron 3 Ultra 則僅支援文字。
• 推理控制 —— StepFun 端有文件記載的低、中、高投入程度設定;NVIDIA 端則是一個聊天範本旗標,可開啟或關閉思考軌跡。
• 權重——Step 5 Preview 未公布任何權重,該模型為專有且僅提供 API,StepFun 表示將於 2026 年 10 月 15 日跟進發布 BF16 檢查點。Nemotron 3 Ultra 在 Hugging Face 上以 OpenMDW-1.1 發布 BF16 與 NVFP4 版本及 GenRM 獎勵模型。
• 部署門檻——不適用於 API 模型;在開放版本上,依廠商的最低規格,需八張 B200 等級或 GB200 等級 GPU,或十六張 H100。
• 費率表 — Step 5 Preview 為 $1.00 輸入、快取命中時 $0.10,以及 $2.70 輸出,資料來自 StepFun 的英文定價頁面。Nemotron 3 Ultra 則約為 $0.60 輸入、快取命中時 $0.16,以及 $2.50 輸出;請務必留意這組數字的來源:NVIDIA 並未公布費率表,因此這是獨立委員會所記錄、實際觀察到的供應商定價,而非供應商提供的數字。
大多數人視為決定性的那一列是第一列,而它是這八列中資訊量最少的。兩個總計彼此相差不到百分之九,但活躍參數卻相差兩倍,而活躍參數正是決定每個生成符元運算成本的因素。這兩個數字都無法預測出二十一分的差距。

中位數是在你看到分數之前就已做出的選擇。
這個獨立委員會並不是按單一領域來為模型評分。它會把模型分桶歸類——而模型落入哪個桶,會改變印在其分數底下的那句話,卻不會改變分數本身。
Step 5 Preview 被歸入一般推理類別,該類別在排行榜上計有 227 個模型,而其可比模型的中位數為 26。Nemotron 3 Ultra 被歸入開放權重類別,計有 117 個模型,其中位數為 18。因此,同一個排行榜將 44 描述為「遠高於平均」,並將 23 描述為「高於平均」,而這兩種描述都成立,因為 44 比其中位數高出 18 分,23 也比自身的中位數高出 5 分。
這不是什麼陷阱,也不是排行榜不公平。這是呈現開放模型的正確方式——你拿一個可下載的檢查點和其他可下載的檢查點比較;一個只能取得下載檔的團隊,並不是從這 227 個之中做選擇。但這確實意味著,任何引用 Nemotron 3 Ultra「高於平均」以及某個 44「高於平均」的人,都是在把兩個不同的句子互相比較。如果你想要這對模型的一個數字,就用原始指標,並接受那二十一分的差距;如果你想要的是決策,就用類別,並承認你已經這麼做了。

一個測試框架在兩者上測量了什麼
廠商表格不能彼此相減,因為 StepFun 和 NVIDIA 是在不同日子跑了不同的測試套件,而且 NVIDIA 的資料並未涵蓋 StepFun 報告的每一項基準。誠實的比較基礎是交集:同一個評估者對雙方都執行過的測試。
在 Artificial Analysis Intelligence Index 上,該交會點是 44 對 23。在每完成一項 index 任務的成本上,則是 1.03 美元對 0.60 美元。在輸出速度上則反轉,而且幅度很大:Step 5 Preview 為每秒 87 個 token,對上 Nemotron 3 Ultra 的 135.6,因此得分幾乎高出兩倍的模型,正是每個 token 生成速度慢約半秒的那一個。
最刺眼的一列是 Terminal-Bench 4.0。Step 5 Preview 在那裡拿下 33.3%。Nemotron 3 Ultra 拿下 0.5%。這不是任何一方的四捨五入假象,也不是什麼細微差距——在那個特定的代理式終端測試套件上,這款開放權重旗艦實質上等於沒有留下成績。陷阱在於,同一個排行榜也把同一個模型列在 Terminal-Bench 2.1 的 53.9%。兩個名稱幾乎相同的基準、同一任務家族的不同世代,而同一個模型在較舊的那個上坐擁 53.9,在較新的那個上卻是 0.5。如果你曾看到有人拿五十幾的 Nemotron 數字來跟你說,那就是它的出處,而且那並不是目前的套件。
有一項結果特別值得一提,正因為它極為罕見。NVIDIA 自家宣稱在無工具輔助下於 GPQA 達到 87.0%;而獨立測試測得 86.7%。廠商數字與外部數字僅差零點三個百分點,這正是值得信賴的評測表應有的樣貌,也讓 Terminal-Bench 4.0 上的 0.5% 更容易被視為真實結果,而非評估者的失誤。
在指數執行過程中,資金實際上流向何處
每 Token 的價格對於工作負載的成本幾乎沒有預測力,而這一對比大多數例子更能說明這一點。該排行榜會公布每個模型完整索引執行的成本分解,而對這兩者而言,佔比最高的項目並不是生成。
Step 5 Preview 每項任務的 $1.03 拆分為 $0.85 的輸入與 $0.17 的輸出。在輸入部分中,$0.62 是快取讀取,$0.22 是快取寫入,只有 $0.014 是全新、未快取的輸入。在輸出部分中,$0.12 是推理過程,$0.06 是最終答案。
Nemotron 3 Ultra 每項任務的 0.60 美元,拆分為 0.53 美元的輸入與 0.07 美元的輸出,而輸入那一行的組成幾乎是完全相反的鏡像——0.48 美元的快取寫入,對比僅 0.04 美元的快取讀取。
有兩個結論隨之浮現。第一個是,在大量重用前綴的長時程評估中,你所支付的成本大約有八成落在帳本的輸入端,這使得你的快取命中率與上下文紀律才是該最佳化的數字,而不是你的輸出長度。第二個是,這兩個模型產生帳單的方式不同:Step 5 Preview 是在為重新讀取一大段共享前綴付費,而 Nemotron 3 Ultra 則是在一開始就為把相異內容寫入快取付費。表面成本相近,卻是兩張不同的帳單——而且如果你的工作負載看起來更像其中一種模式而非另一種,$1.03 與 $0.60 的排序就可能翻轉。
冗長度數字說明了該輸出行其餘的部分。Step 5 Preview 在整個索引套件中產生了約 1.6 億個輸出 token,而中位數為 8,200 萬,該排行榜直白地形容為非常冗長。Nemotron 3 Ultra 產生了 1.1 億個,而中位數為 1.4 億,並稱之為相當精簡。較便宜的模型才是簡短的那個,而且它的簡短,正是對帳單會在意的那種方向。

下載帶來什麼,保存又需付出什麼
若你取用的是檢查點,Nemotron 3 Ultra 的價格並不是每百萬個輸出詞元 2.50 美元。那是租用別人部署的 Nemotron 3 Ultra 的價格。選擇下載,你買到的就是一組不同的成本,以及一組不同的權利。
權利是具體的,而這正是僅提供 API 的模型無論出價多高都無法比擬的部分。OpenMDW-1.1 隨附權重,而 NVIDIA 也一併發布了預訓練與後訓練的資料集,以及伴隨這些資料集的訓練配方。針對同一個模型,有一個 NVFP4 版本,大小約只有一半,而且 Ultra 權重是以 NVFP4 配方預訓練而成,而非事後量化——這就是為什麼這個小版本是該顯卡上的一級產物,而不是社群實驗。其商用立場說得很明白:可供商用與非商用。
成本也同樣具體。最低部署需求是 B200 等級的 GPU,或十六張 H100,而這是該卡所載明的最低門檻,並非建議。你實際取得的上下文視窗取決於你如何設定服務,預設為 256K,1M 則需要明確設定才能啟用。一個無法投入一整座機櫃的團隊,並不是在以 $1.00 與 $0.60 的輸入價格之間二選一;它是在一個模型與一張採購單之間做選擇。
這個比較有一個版本,是開源模型在人們口口聲聲說在意、卻鮮少為其定價的軸線上勝出——依賴性。Step 5 Preview 是你呼叫的端點和你信任的供應商,附帶的是一個被承諾而非已交付的檢查點。如果 StepFun 修改其價目表、收緊限制、棄用該 ID,或某週表現不佳,你唯一的槓桿就是你自己的錯誤處理。Nemotron 3 Ultra 的權重已經在某人的叢集磁碟上,而這具有實實在在的價值,即使同一個模型正以二十一個指數點之差落敗。
值得精確釐清另一方所謂「承諾」究竟是什麼意思,因為實際情況比兩邊陣營所願意承認的都更加混亂。BF16 版本的多個第三方鏡像在 9 月 20 日、也就是 API 開放當天,出現在 Hugging Face 上,其中有些 safetensors 檔案的容量遠遠超過 1 TB。那些是社群自行重新上傳的產物,並非廠商發布,而 StepFun 也沒有隨之發表任何開放權重的公告。它們所證實的是:權重正在流通,而所承諾的 10 月 15 日檢查點將只是一種正式化,而非一項揭露。
一個在我們閱讀它時移動了的數字
這篇文章裡有一個數字,在同一頁的兩次讀取之間出現了變化;這點值得特別點明,因為那正是比較悄悄失效的方式。
獨立評測委員會在 2026 年 10 月 9 日的報導中指出,Step 5 Preview 每項索引任務的成本為 $0.71。10 月 10 日再次閱讀,同一頁面顯示 $1.03。在那段期間,模型本身沒有任何改變,因為僅供 API 存取的模型權重不可能一夜之間產生變化。改變的是評估的計算方式:當供應商的快取價格變動、當評測者修訂其快取讀取假設,或當某次執行改以不同的 token 組合重新計算時,每項任務的數字會變動,而指數分數不會。
因此,請把每項任務成本視為帶有日期戳記的即時數字,而不是模型的固有屬性。本文中每個單項任務數字都是 10 月 10 日的讀數,並已標示為此。如果你要依據本頁建立預算,請以你在承諾當天自行取得的數字來建立——而如果你要比較不同週次的兩份報告,請先檢查擷取日期,再下結論說某個模型變便宜了。
你實際上會打給哪一個?
先說讓人不舒服的部分:OrcaRouter 並不路由這兩個模型中的任何一個。Step 5 Preview 可透過 StepFun 自家的 API 以及少數幾個第三方平台取得,而 Nemotron 3 Ultra 則由 NVIDIA 自家端點提供,並由多家供應商提供服務;你可以在讀到這兩項說法的同一分鐘內,對照我們的目錄加以查證。
這留下來的是依賴關係的形態,而不是模型的選擇,而這正是路由層在此發揮價值的地方。單一供應商路徑上的純 API 預覽,恰恰是那種供應商一個不順的下午就會變成你服務中斷的配置,而便宜的保險就是一個控制平面,能在供應商路徑一劣化時,立刻把請求切換到合格的備援路徑。這正是自動容錯移轉的用途:不是用來取代 Step 5 Preview,而是放在你真正能呼叫的模型前面,讓特定供應商的端點永遠不會是通往正式環境的唯一道路。做到這件事的同一個目錄,還承載了一把金鑰、一張帳單背後的 200 多個模型,並以 0% 加價轉嫁供應商的標價——這是論點的另一半,因為上游任何地方的價目表變動,在我們這邊當天就會生效,而不是等到下一次合約續約。
如果這兩個模型都不是你會呼叫的那一個,簡短版是這樣。當你想要分數、影片與圖像輸入,以及 90% 快取折扣時,就選 Step 5 Preview,並接受你租的是一個預覽版,既沒有權重授權,也帶著一個你還沒見過的十月檢查點。當權重比分數更重要時——因為地端部署限制、因為微調、因為一份你讀得懂的授權——就選 Nemotron 3 Ultra,並在編列 token 預算之前先編列機架預算,因為以每百萬輸入 token $0.60 來說,5500 億參數的部署只有在別人已經在幫你付 GPU 錢時才稱得上便宜。
要留意的是10月15日。如果 StepFun 發布了它承諾的 BF16 檢查點,本文的核心不對稱——這兩者當中只有一個能下載——就不再成立,而那二十一個指數點也會變得明顯更難被辯解掉。如果這個日期延後,開放權重模型的理由就會自動增強,這是一種很奇怪的能力差距縮小方式,卻也非常常見。
