
GPT-6.1 Sol 對決 MiniMax M3:較便宜的費率表在帳單上輸了
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
MiniMax M3的收費只是GPT-6.1 Sol索價的一小部分——每百萬輸入詞元 0.30 美元對上 2.00 美元,每百萬輸出詞元 1.20 美元對上 10.00 美元——而按真正在跑的計價標準,它更便宜:在 Artificial Analysis 的 v4.3.2 評測中,每項任務 0.508 美元對上 0.724 美元。這是實實在在的一場勝利,而這也就是整個論點的全部,因為同一項測量既把較低的帳單交給 M3,也把 22.6 點的指數領先交給 GPT-6.1 Sol,而用來衡量模型能否完成代理式工作、而非只是描述這些工作的那套基準,則把這道差距變成一堵高牆。該廠商於 2026 年 9 月 29 日推出 GPT-6.1 Sol。該公司於 2026 年 5 月 31 日發布 M3,這是其 4280 億參數的開放權重模型。
兩者都已上線,兩者都已定價,兩者也都不過一次 API 呼叫之遙。接下來要談的,是決定該選哪一邊的算術,以及算術並非全貌的兩個地方。
每個模型實際上是什麼
GPT-6.1 Sol 是 OpenAI 目前專攻推論與軟體工程的旗艦模型——一款閉源模型,於其所取代的 GPT-6 Sol 推出僅一週後問世,並以與前代相同的 2.00 美元 / 10.00 美元定價販售。其快取輸入費率為 0.10 美元,是 GPT-6 Sol 快取命中收費的一半,而當 OpenAI 談論代理式編碼而非聊天時,所指的正是這款模型。
MiniMax M3 是一款混合專家模型,總參數量達 4280 億,每個 token 啟用 230 億參數,以 MiniMax 社群授權條款發布——這是一款開放權重的發布,採用帶有非商業色彩的自訂授權,並非 OSI 認可的授權。它由廣泛領域的推論服務供應商提供服務:Artificial Analysis 記錄到 M3 有十五家代管服務商,而 GPT-6.1 Sol 則有八家。這種廣泛程度是開放權重的實際優勢,也是 M3 的價格競爭比封閉模型更快速的原因。
費率表,以及凌駕其上的計量表

把兩份已公布的價目表並排一比,差距可說天差地遠。
• 輸入 — GPT-6.1 Sol 每 100 萬 $2.00 對比 MiniMax M3 每 100 萬 $0.30;M3 便宜 85%
• 輸出 — 每 100 萬 $10.00 對比每 100 萬 $1.20;M3 便宜 88%
• 快取輸入 — 每 100 萬 $0.10 對比每 100 萬 $0.06
• 每項 AA 任務成本 — $0.724 對比 $0.508;M3 便宜 30%,而非 85%
• 每項任務輸出 token 數 — 38,128 對比 48,192;M3 多寫 26%
• 每項任務時間 — 640 秒 對比 486 秒
• 上下文視窗 — 1,050,000 對比 1,048,576 個 token;實際上勢均力敵
• 最大輸出 — 128,000 個 token 對比 512,000;M3 會寫出一則非常長的回答
• 接受的輸入類型 — 文字、圖片與檔案 對比 文字、圖片與影片
• 索引排名 — GPT-6.1 Sol 在 147 個模型中排名第 10 對比 MiniMax M3 排名第 62
最上方那兩行便宜的項目,是採購表會看到的那兩行。第三行才是真正買單的那一行,而它說明了:85–88% 的價目表優勢,會變成 30% 的現實世界優勢,因為 M3 每項任務會產生更多 token,也因為一項任務並非固定份量的工作。價目表以 token 定價;工作則以任務定價。任何只比較前兩行的比較,都是在比較錯誤的數字、錯誤的單位。
當百分之三十不再重要時
任務成本已接近到,只要不是大量文字處理,勝負就取決於指數差距。Artificial Analysis 給出的成績是 GPT-6.1 Sol 51.83、MiniMax M3 29.22——相差 22.6 分,而且這差距並非平均分佈於整套評測之中。在那些要求模型操作終端機、編輯儲存庫並驗證自身工作的評測上,這兩個模型根本不在同一個級別:
• Terminal-Bench 4.0 — GPT-6.1 Sol 0.5606 對比 MiniMax M3 0.0202
• Terminal-Bench Science — 0.5810 對比 0.0048
• AA-Omniscience — 41.53 對比 1.35
• MMLU-Pro — 0.8595 對比 0.7856
• AutomationBench — 0.6487 對比 0.2125
• τ²-bench — 本次執行未公布 GPT-6.1 Sol 的數據,M3 為 0.8889
• GPQA Diamond — 本次執行未公布 GPT-6.1 Sol 的數據,M3 為 0.9293
• CritPT — 0.3171 對比 0.0371
仔細讀一下,因為這並非全面性的壓倒性勝利,而例外之處才是有趣的部分。MiniMax M3 在 τ²-bench(工具使用與客服對話評測)上得分 0.8889,在 GPQA Diamond 上得分 0.9293——這是研究所程度的科學分數,超越本次特定測試中公布的所有 OpenAI 數據。M3 是個稱職的推理者,也是個出色的對話式工具使用者。在 Terminal-Bench 4.0 上,它得分 0.0202。這不是「更差」;這是一個根本無法把多步驟的儲存庫任務整合完成的模型,而無論 token 再怎麼打折,模型失敗的任務都不會比模型完成的任務更便宜。
每項任務的數字背後,還藏著一項二階成本。M3 每項任務記錄到 48,192 個輸出 token,首次作答時間為 23.0 秒,相較之下 GPT-6.1 Sol 為 332.0 秒——這個小模型幾乎立刻開始說話,然後長時間推理。如果你的工作負載對延遲敏感但層次較淺,這一點對 M3 有利。如果工作負載具代理性,token 數量就是你付出的代價,而終端分數就是你得到的成果。
我們自己的 GPT-6.1 Sol 模型卡,以你實際路由時會用到的形式承載著相同的數字:$2.00 / $10.00 的費率、1,050,000 個 token 的上下文視窗、4.54 秒的 p50 首字延遲,以及與人工分析指數和基準測試區塊並列於同一頁面。

開放權重在這裡的價值是什麼
M3 可下載這件事,本身就是支持它的最強理由,而值得精確說明這能換來什麼。它換來的是授權條款,讓你能在自己的邊界內執行模型——當資料不能離開邊界時很有用;它也換來由十五家獨立主機所帶來的價格競爭。它並不會讓你換來便宜的部署:4280 億參數、其中 230 億為活躍參數,仍然需要認真的推論硬體,而且 MiniMax Community License 是附帶條件的自訂授權,並非無限制授權。對大多數團隊而言,「開放權重」意味著託管推論有更好的價格,而不是機架裡多一台機器。
MiniMax M3 的 OrcaRouter 卡片列出了實際提供的數據:$0.30 / $1.20 的費率、1,048,576 個 token 的上下文視窗、512,000 個 token 的最大輸出、文字/圖像/影片輸入,以及由路由它的供應商所帶來、七天累計 5,640 萬個 token 的用量。

兩者綁定於一個按鍵
這項比較之所以在實務上只是改個設定、而非一次遷移,是因為這兩個模型都能從同一個 OrcaRouter 端點取用——一個 API 就涵蓋 200 多個模型,並以 0% 加成直接轉嫁供應商的定價表價格,這意味著 MiniMax 的費率若有變動,會在廠商公布的同一天就反映到你的帳單上,而不是等到某個轉售商重新議價的時候。這一點對 M3 來說比對它的對手更重要:會想導向開放權重模型的根本理由,就在於它的價格和主機清單都還在變動,而只有直通式計價才是能追著移動目標跑的那一種。
自動容錯移轉是另一半。M3 由眾多可靠性不一的供應商提供服務,而路由層可以在某個主機效能下降時,將請求移到另一個主機,呼叫端無須知道它最後落在哪個主機上。這才是採用一個 Terminal-Bench 分數顯示「不適合關鍵路徑」的模型時,誠實的做法——把它放在重試成本低廉的地方。
如果今天非得選一個,你會選哪個?
如果工作內容是大量文字——擷取、摘要、分類、對話,任何產出是文字、而失敗模式是寫錯一句話而非建置失敗的任務——MiniMax M3 就是正確的預設選擇,而那三成是實實在在的錢。用 GPQA 和 τ²-bench 的數字當作你的證據:這是一個能力強、剛好又便宜的模型。
如果工作是代理式的——儲存庫、終端機、工具鏈,任何帶有驗證步驟的東西——那麼 Terminal-Bench 4.0 上的 0.0202 就直接不合格,而 GPT-6.1 Sol 以每項任務 $0.724 拿到 0.5606,即使每 token 貴 85%,仍是更划算的交易。你買的從來就不是費率表。
有用的答案是,你不必一次就選定。把淺層層級路由到 M3,把代理式層級路由到 GPT-6.1 Sol,並讓兩者都置於同一組憑證之後——當一項任務從擷取開始、後來轉為修復工作時,路由 DSL 會將兩者組合成單一次呼叫。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
