生成的標題卡顯示 GPT-6 Sol vs MiniMax M3:八倍的輸出價格買不到什麼,數據卡顯示輸出價格每百萬 $10.00 vs $1.20、智慧指數 47.6 vs 29.2,以及權重封閉 vs 開放,頁尾寫著指數依 Artificial Analysis v4.3.2;MiniMax M3 的費率依 MiniMax,GPT-6 Sol 的費率依 OpenAI 的費率表。
Guides & Insights

GPT-6 Sol 對上 MiniMax M3:八倍輸出價格依然買不到的東西

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

首先要說的是,關於GPT-6 Sol對上MiniMax M3,價格差距不小,分數差距也不小,而且兩者指向相反的方向。MiniMax M3 是開放權重模型,你可以自行下載執行,定價為每百萬輸入 token 0.30 美元、每百萬輸出 token 1.20 美元;GPT-6 Sol 則是 2026 年 9 月 22 日發布的 GPT-6 世代中階版本,同樣單位的價格為 2.00 美元與 10.00 美元。那比輸出費率高出八倍多一點。MiniMax M3 也接受影片作為輸入模態,而 GPT-6 Sol 並不接受——Sol 模型接受文字、圖像與檔案。M3 所沒有的,是任何接近 Sol 的分數:在 Artificial Analysis 的 Intelligence Index 上,同一修訂版 v4.3.2 榜單中,29.2 對 47.6。

那種不對稱正是全貌,而且它比單純的價格與品質取捨更有意思,因為開放權重的那一欄得以保留封閉那一欄無論出價多高都賣不了的東西:M3 的檢查點在 Hugging Face 上,而且模型可以在網路邊界內運行。如果你要在這兩者之間做選擇,有用的問題不是哪一個比較好,而是你所買的四項各自獨立的東西——價格、吞吐量、控制權或能力——之中,哪一項是你負擔得起失去的。

四個維度,而它們的排名方式並不相同

• 輸出價格 — GPT-6 Sol 每百萬 $10.00 對比 MiniMax M3 每百萬 $1.20
• 輸入價格 — GPT-6 Sol 每百萬 $2.00 對比 MiniMax M3 每百萬 $0.30
• 快取輸入 — GPT-6 Sol 每百萬 $0.20 對比 MiniMax M3 每百萬 $0.06
• 權重 — GPT-6 Sol 封閉、僅供 API 對比 MiniMax M3 開放權重且可自行託管
• 輸入模態 — GPT-6 Sol 文字、圖像與檔案 對比 MiniMax M3 文字、圖像與影片
• 上下文視窗 — GPT-6 Sol 1,050,000 個 token 對比 MiniMax M3 1,048,576 個 token
• 最大輸出 — GPT-6 Sol 128,000 個 token 對比 MiniMax M3 512,000 個 token
• 智慧指數 — GPT-6 Sol 47.6 對比 MiniMax M3 29.2
• 程式碼指數 — GPT-6 Sol 此版本未公布 對比 MiniMax M3 58.6
• 長請求級距 — GPT-6 Sol 輸入超過 272,000 個 token 時會對整個請求重新計價 對比 MiniMax M3 其價目表上沒有級距

其中有兩行不只值得用一列帶過。最大輸出上限的方向與其他一切相反:M3 在單一回應中最多可輸出 512,000 個 token,是 GPT-6 Sol 的 128,000 的四倍。對於要在單次呼叫中產生整個檔案或長篇報告的工作負載,這是結構性優勢,不是捨入誤差。而長請求級距是 GPT-6 Sol 實實在在的成本,M3 完全沒有這項成本——一旦輸入超過 272,000 個 token,Sol 會把整個請求重新計價為 $4.00 / $15.00,而 M3 的計價表則沒有對等條款。在 300,000 個 token 的提示詞上,輸出費率的比較不是八倍,而是十二點五倍。

所以,誠實的排名完全取決於工作負載。對於大量分類或擷取,錯誤答案的代價很低,而緩慢答案的代價卻不然,在這種情況下,M3 以 $0.30 / $1.20 且沒有長上下文懲罰,是合理的預設選擇,而 Sol 則是燒錢。對於第一個答案就必須正確的任務——遷移計畫、安全審查、一段將由會據此行動的人閱讀的推理——在輸出價格高出八倍的情況下,18.4 點的指數差距是多數團隊會接受的取捨,因為替代方案是付錢請人來修正它。

Generated comparison scoreboard titled GPT-6 Sol vs MiniMax M3, the scoreboard, with six matched rows. GPT-6 Sol: input $2.00 per million, output $10.00 per million, weights closed, Intelligence Index 47.6, context window 1,050,000 tokens, reprices above 272K input tokens. MiniMax M3: input $0.30 per million, output $1.20 per million, weights open and downloadable, Intelligence Index 29.2, context window 1,048,576 tokens, no long-request step. A footer reads MiniMax M3 figures per Artificial Analysis v4.3.2 and MiniMax; GPT-6 Sol figures per Artificial Analysis v4.3.2 and OpenAI.

M3 公布的數據在哪些方面異常優異,以及哪些方面顯得單薄

MiniMax M3 最強的獨立數據,並不在你會預期這個價位模型出現的地方。長上下文召回率落在 83.0,比 GPT-6 Sol 的 83.7 低 0.7,實際上可視為平手——在百萬詞元的上下文視窗上,輸入價格僅為六分之一。GPQA Diamond 拿下 92.9,與前沿區間夠接近,差距落在你會預期由推理投入設定造成、而非能力差異的範圍內。這兩項數據,正是 M3 值得認真看待,而非被歸入「便宜」一類的原因。

薄弱之處同樣清楚,應該直接說明,而非含糊帶過。零售式工具使用表現很差:在 tau-banking 上,M3 得分 15.3,而在較新的 Terminal-Bench 4.0 修訂版上,得分為 2.0。這兩者都是第三方測量,且都顯示出一個基準平均分掩蓋了在模擬服務上進行代理式工具呼叫時特定且重大的弱點。廠商自行報告的數字則描繪出好得多的景象——SWE-Bench Pro 59、BrowseComp 83.5、MCP Atlas 74.2、Terminal-Bench 2.1 為 66——而這些是廠商在其自家測試框架上的數字,屬於宣稱而非測量。任何取決於工具使用的部署,都應把這組數字放在一起看,並直接測試。

關於基準比較本身,還有一個次要的要点。GPT-6 Sol 在我們目錄中的基準測試集比 M3 小——只有五個分數,而 M3 有二十三個——因為廠商公布的較少,第三方對它執行的測試也較少。一個有二十三個已公布數字的模型,永遠會顯得比只有五個的模型受到更徹底的評估,而差異在於文件記錄,不在於能力。

除了更低的帳單之外,開放權重實際還能帶給你什麼

自行託管 M3 是 GPT-6 Sol 無法匹敵的選項,而它的價值主要不在財務層面。在 $0.30 / $1.20 的價格下,API 比大多數團隊運行硬體的成本還便宜,因此下載它的理由是某種限制,而不是試算表:無法離開某個邊界的資料、沒有可接受外部依賴的工作負載、微調,或是共享端點無法滿足的延遲預算。開放權重是這四者中,閉源模型唯一能回答的一項,而它是藉由不提供來回答。GPT-6 Sol 的答案是:你不需要運行它——這是不同的論點,而且對不同的一群團隊而言成立。

吞吐量值得獨立成行,因為那是 demo 永遠不會展示的數字。在我們滾動七日的量測中,MiniMax M3 達到每秒 495 個 token,而 GPT-6 Sol 則約在該水準。M3 在這項比較中不僅僅是個模型,它在我們的路由上還快了大約兩倍,這會改變批次工作所耗費的實際時間與金錢成本。但需注意的是,這些是在共享測試場域上的滾動窗口,並非受控基準測試,而且它們會變動。

OrcaRouter model page for MiniMax M3 (minimax/minimax-m3) by MiniMax, dated 2026-05-31, tagged Vision, Tools, JSON and Reasoning, describing it as MiniMax's flagship open-weight foundation model with a 1M-token context window and text, image and video input, listing $0.30 per million input and $1.20 per million output, with a model-page note that it is available through OrcaRouter under the model id minimax/minimax-m3.

將兩者作為單一系統運行

兩個模型都位於單一 OrcaRouter 金鑰之後,與其他 200 多個模型並列,這使得這裡有趣的配置是一種「先廉後貴」的串接,而非單純的取捨。把大量請求導向 MiniMax M3,將 GPT-6 Sol 留在其後,專門處理未通過檢查或觸發難度訊號的請求,混合成本就會遠遠更接近開放權重模型的費率,而不是 Sol 的費率,同時困難的請求仍由得分 47.6 的模型接手。OrcaRouter 的路由 DSL 正是表達這種組合的地方——一次呼叫可以指名多個模型以及它們之間的條件,而不必為每個任務硬編碼單一端點。

對於真正無法做出決定的團隊來說,模型融合是同一概念的粗暴版本:由一組模型共同回答,再將回應合併。它不適合大量作業,卻相當適合極少執行、高風險的提示,此時 29.2 與 47.6 回答之間的差異,就是頁面上唯一重要的東西。

比起封閉模型,開放權重模型的容錯移轉更形重要,原因很具體:M3 由不只一家基礎設施供應商提供服務,而各端點並不相同。事先配置好的第二條路由,意味著當某台主機變慢或效能衰退時,那只是一次重試,而不是一次服務中斷。而且,由於我們的型錄是以不加價的方式直接反映供應商牌價,供應商調整費率當天就會在我們這邊生效——這在每百萬詞元 1.20 美元的輸出項目上尤其要緊,因為供應商只要更動單一快取輸入費率,帳單就會明顯改變。

Artificial Analysis model page for MiniMax-M3, described as an open-weights model released June 2026, showing an Intelligence rank of 18 of 117 with an Intelligence Index of 29 on a comparable-model median of 18, an output speed rating above average, a 1M-token context window, and support for text, image and video input with text output.

你實際上應該打給哪一個

若要處理大量請求,就選 MiniMax M3;凡是需要影片輸入的、凡是必須在單一回應中輸出超過 128,000 個 token 的,以及任何得在你自己的安全邊界內運行的,也都選它。若請求的答案本身就是產品,就選 GPT-6 Sol;在工具密集的代理式迴圈中,M3 的 tau-banking 與 Terminal-Bench 4.0 分數是警訊而非附註,也選 GPT-6 Sol;而任何對你來說,18 點的指數差距值得用八倍輸出速率來換的情況,同樣選 GPT-6 Sol。如果這兩者都無法描述你的全部流量,那就兩者都用,讓路由器來決定。

在考慮兩者之前,有一件事要先確認,而這正是本部落格一再提到的同一個檢查點:M3 自 2026 年 5 月起一直是 M 系列產品線的旗艦,且仍是我們產品目錄中最新的 M 系列型號,所以它確實仍是最新機種——但 GPT-6 Sol 已被 GPT-6.1 Sol 取代,兩者短上下文費率相同,而 GPT-6.1 Sol 的快取輸入更便宜,且 GPT-6 Sol 自己的頁面也帶有指向它的指引。如果你在這裡關注 Sol 是因為能力,而不是因為那個八天前才推出的整合,請先看後繼型號。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新