標題卡比較 Step 5 Preview 與 MiniMax M3 在每項 Artificial Analysis Intelligence Index 任務上的成本,顯示 Step 5 Preview 為 $0.71、指數 44,而 MiniMax M3 為 $0.51、指數 29。
Guides & Insights

Step 5 Preview 對比 MiniMax M3:每 Token 更便宜,每分數更貴

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

單價方面,MiniMax M3 以懸殊差距勝出。這家廠商的 428B 稀疏模型每百萬輸入收費 $0.30、每百萬輸出收費 $1.20,在兩端都不到 Step 5 Preview 的 $1.00 與 $2.70 的一半。但對一個用來回答問題的模型來說,單價是錯誤的分母,而一旦你除以每個模型實際交付的成果,排名就會翻轉。Step 5 Preview 在得分 44 的情況下,每項 Intelligence Index 任務成本為 $0.71。MiniMax M3 在得分 29 的情況下,每項指數任務成本為 $0.51。換算成每一分實測能力,標價較高的那個模型反而更便宜——原因在於十五點的指數差距,再多的折扣也無法彌補。

兩種截然不同的「可用」

MiniMax M3 自2026 年 6 月 1 日起已全面開放使用,當時 MiniMax 透過 MiniMax Code、其 Token Plan 與 API 開放它——發布時完全沒有預覽標籤。權重則在6 月 12 日,也就是十一天後,如期釋出。該儲存庫MiniMaxAI/MiniMax-M3擁有約 4,280 億總參數,每個 token 約有 230 億啟用參數,建構於 MiniMax Sparse Attention 之上,另有獨立的 MXFP8 量化版本。

Step 5 Preview 於 2026 年 9 月 20 日開放其 API。它的權重尚未發布——Hugging Face 儲存庫 stepfun-ai/Step-5-Preview-BF16只是個空殼——而 StepFun 已承諾的日期為 2026 年 10 月 15 日。因此,實際上的差別在於:M3 是一個你可以下載、自行託管並檢視的模型,而 Step 5 Preview 則是一個已公布意圖的託管端點。

值得提出的一點是:MiniMax 自家的模型頁面仍寫著 M3「即將全面開源」,這與它在六月發布的儲存庫相互矛盾。應將其視為過時的廠商頁面,而非權重缺失的證據。

價格的故事不是成本的故事

Artificial Analysis 會讓每個模型跑同一組評估集,再把詞元的花費加總起來,藉此計算出每項指標任務的成本數字。就固定工作量而言,這是該領域最接近總持有成本的數字,而且它還納入了詞元價格所隱藏的兩項效應:模型有多囉唆,以及它思考得有多深。

Step 5 Preview 的價格為每項索引任務 $0.71,索引執行總成本為 $922.84。MiniMax M3 則為$0.51,總執行成本為 $537.98。就任務的原始吞吐量而言,M3 便宜約 28%。再除以索引分數——44 對 29——Step 5 Preview 每索引點約為1.6 美分,而 M3 為 1.8 美分

這裡得先加個但書:每個模型只跑一次索引,而單次索引只是個小樣本。逐點運算只是對每項任務數據的合理性檢查,本身算不上是一項基準測試。不過其方向與每項任務的數字一致,而那些數字正是兩家廠商自家的價目表無法呈現的。

Intelligence Index — Step 5 Preview 44(200 個中排名第 24)對比 MiniMax M3 29(113 個中排名第 15),兩者皆採用當前版本的指數

輸入價格 — 每百萬 $1.00 對比每百萬 $0.30

輸出價格 — 每百萬 $2.70,相較於每百萬 $1.20

每個索引任務的成本 — $0.71 對比 $0.51

活躍參數 — 27B 對 23B

上下文視窗 — 1M tokens 對比 1M tokens

輸出速度 — 99.8 tokens/s 對比 210.4 tokens/s

權重 — 承諾於 2026 年 10 月 15 日,對比自 2026 年 6 月 12 日起已可供應

A comparison scoreboard for Step 5 Preview and MiniMax M3 covering Intelligence Index, output price, cost per index task, output speed, weight availability, and licensing terms.

讓這變得令人困惑的索引版本陷阱

閱讀 M3 的數字時,確實存在一個真實的風險,而這值得用一段來說明,因為它幾乎讓每個第三方比較頁面都栽跟頭。Artificial Analysis 已重新校準其 Intelligence Index,時間是 2026年9月7日,而這次重新校準全面壓縮了分數。在現行量表下,M3 得分為 29。在九月前的量表下,它的得分為 44 到 45——而且不少追蹤網站仍為它公布 44.4 或 45.4。

這種衝突在這裡比平常更加重要,因為 Step 5 Preview 的目前分數也是 44。若某個頁面把過時的 M3 數據與目前的 Step 5 Preview 數據並列,看起來會顯示兩個模型同分,但目前差距其實是十五分。本文中的這兩個數據都來自當前指數版本,且彼此可相互比較;任何在 9月7日之前發布的內容則不然。

MiniMax M3 真正難以超越的地方

關於 M3,有兩點差距並不小。第一點是速度:每秒 210.4 個輸出詞元,在 Artificial Analysis 追蹤的 113 個模型中排名第四快,而中位數為 76.3。Step 5 Preview 的每秒 99.8 個詞元算是不錯,卻還不到它的一半。M3 產生首個詞元所需的時間為1.01 秒,同樣是較快的數字,相較之下為 2.96 秒。

第二個是輸入模態。M3 接受文字、圖像與影片並回傳文字,而 MiniMax 則說明了桌面與電腦操作(computer-use)的運作方式。步驟 5 的 Preview 接受文字與圖像。如果你的流程把螢幕錄影或影片畫面餵進模型,那並非偏好問題——而是能力上的差異。

價格差距同時強化了這兩者。在 $0.30 與 $1.20 的價格下,搭配永久 50% 折扣套用於 $0.60 與 $2.40 的定價,再加上 80% 的快取折扣,讓快取讀取降至每百萬 $0.06,M3 是讓大量 token 流經高效能模型最便宜的途徑之一。請留意分層計價:超過 512K token 的輸入會使整筆請求的費用加倍,而優先服務層級則要價 1.5 倍。

它分崩離析之處

MiniMax 自家針對 M3 的評估數據集表現強勁,但應以廠商自行回報的角度來解讀:SWE-bench Verified 為 80.5%、SWE-bench Pro 為 59.0%、Terminal-Bench 2.1 為 66.0%、MCP Atlas 為 74.2%、BrowseComp 為 83.5,而 OSWorld-Verified 則為 70.06%。MiniMax 是在自家基礎架構上執行這些測試,並以 Claude Code 作為鷹架(scaffolding),取四次執行的平均值,而且評分設定並未公開——因此在目前情況下,第三方無法重現這些結果。

獨立測得的結果對代理式工作嚴苛得多。Artificial Analysis 記錄到Terminal-Bench 4.0 為 2%,對象為 M3——這是與供應商 Terminal-Bench 2.1 數據不同的基準版本,兩者無法相提並論,但無論如何都極為嚴峻。SciCode 為 47%,AutomationBench-AA 為 21%,CritPt 為 4%。M3 最強的獨立表現在長上下文與知識型工作上:AA-LCR v1.1 達 83%,Humanity's Last Exam 為 39%。

Step 5 Preview 則反轉了這樣的表現輪廓。在與 M3 的 2% 相同的測試框架下,Terminal-Bench 4.0 達到 33.3%;SciCode 則是 59% 對上 47%。如果工作屬於代理型或程式碼導向,這根本不是一場勢均力敵的比較,而價格優勢也無法彌補這一點。

The Hugging Face repository page for stepfun-ai Step-5-Preview-BF16, showing an empty repository with no model card and no files, indicating the weights have not been published.

大多數比較都會略過的授權條款

MiniMax M3 是開放權重,但並非 OSI 定義下的開源,而且其條款比「開放權重」這個說法所暗示的更為嚴格。該儲存庫採用 MiniMax 社群授權條款:非商業用途免費,商業用途則以顯著標示「Built with MiniMax M3」為條件——而年營收超過 2,000 萬美元的任何產品,均須事先取得 MiniMax 的書面授權。它既不是 MIT,也不是 Apache,更不是法律團隊會直接放行的那種授權條款。

Step 5 Preview 目前完全無法從這個面向進行評估,因為尚無授權條款可供閱讀。StepFun 已承諾於 10 月 15 日發布權重,但尚未公布將規範該發布的條款。任何打算以它為基礎進行開發的人,都應將授權條款視為未定之數,而不應假設它會類似 Moonshot 或 DeepSeek 的條款。

這是兩者之間誠實的不對稱:M3 的條款具限制性但已知;Step 5 Preview 的條款則未知。你能事先規劃因應的限制性授權,勝過你無法事先規劃因應的未公布授權。

打電話給他們其中一個

MiniMax M3 已在我們的目錄中:/models/minimax/minimax-m3,可透過與我們所路由的 200 多個模型相同的金鑰與請求格式存取,供應商定價以 0% 加成原樣傳遞——因此 MiniMax 所提供的永久 50% 折扣就是您看到的價格,且會隨著 MiniMax 調整而當日變動。自動容錯移轉則是另一半關鍵:M3 每秒 210 個 token 的表現對高流量工作極具吸引力,而高流量工作正是單一效能下降的端點傷害最大的地方。

Step 5 Preview 不在我們的目錄中。StepFun 的文字模型並不在我們所提供的服務之列,因此可透過 StepFun 自家的 API 及數個第三方平台使用——而你用於 M3 的金鑰無法存取它。

OrcaRouter model page for MiniMax M3, showing the model in the catalogue with its provider, context window and per-million-token pricing.

裁決

當使用量、延遲或影片輸入是限制條件時,當你想要一個今天就能下載的模型時,以及當你能接受社群授權條款——包括 2,000 萬美元的營收門檻——就選擇 MiniMax M3。同時也要接受:獨立的代理能力評分顯示它落後一大截,而且它的廠商基準測試從未在 MiniMax 自家基礎設施之外獲得重現。

當工作屬於代理式或高度偏重程式碼時,當你想要的是每塊錢能買到的能力、而非每塊錢能買到的 token 時,以及當你能接受成為一個託管端點的早期客戶、而其權重下個月才會到來時,就採用 Step 5 Preview。接受你在建置之前無法檢查授權條款,也接受 2% 對上 33.3% 的 Terminal-Bench 4.0 差距,正是那種足以決定專案成敗的落差。

折扣是真的。只是它不是正在被購買的那個東西。

MiniMax M3 是我們以0% 加成路由的模型之一,並具備自動容錯移轉,因此供應商一旦調整價格,當天就會在同一把金鑰上生效。