
MiniMax M3.1 Flash Preview 對比 MiniMax M3:當較新的模型反而風險更高
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 468 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 192 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
供應商自家的文件現在把 MiniMax-M3.1-Flash-Preview 列在 MiniMax-M3 之上,而這個排序本身就發揮了很大的說服效果。它是該系列最新的文字模型,擁有相同的百萬 token 上下文視窗,還新增了舊款模型所沒有的思考深度控制。這張表沒有顯示的是,兩者之中只有舊款模型可以下載、按 token 計價、拿來與任何對象做基準比較,或在沒有訂閱的情況下呼叫——而且新款還拿掉了 MiniMax-M3 原本提供的一項切換選項。
這不是一個關於模型被取代的故事。這是一個關於廠商把自家產品線拆成按用量計費的主力產品,以及需訂閱才能取用的預覽版,而這兩者無論朝哪個方向都不能互換。以下是它們實際上各自是什麼。
這兩份規格表,並排對照
先從廠商自家頁面對這兩者所陳述的內容開始,因為差異的樣貌會在這裡顯現,而不是在基準測試表中。
• 發布 — MiniMax-M3 於 2026 年 6 月 1 日發布,附有架構說明、基準測試表與價目表;MiniMax-M3.1-Flash-Preview 於 2026 年 9 月 27 日發布,附有文件條目與 MiniMax 代理帳號上的一篇文章 • 上下文視窗 — 兩者皆為 1,000,000 個 token,依據 MiniMax 自家的模型表格 • 最大輸出 — 在我們的目錄條目中,MiniMax-M3 為 512,000 個 token,此數字 MiniMax 本身並未公布;MiniMax-M3.1-Flash-Preview 則在任何地方都未公布 • 輸入模態 — 兩者皆支援文字、圖像與影片輸入,文字輸出 • 思考控制 — 一個 MiniMax-M3 可被指示略過的 thinking 參數,且可透過 reasoning_details 欄位,藉由 reasoning_split 加以分離;在 MiniMax-M3.1-Flash-Preview 上,thinking 為強制啟用,且 reasoning_split 無法關閉 • 思考深度 — MiniMax-M3 不提供;一個 effort 階梯,包含 low、medium、high、xhigh 與 max,預設為 max,在 MiniMax-M3.1-Flash-Preview 上 • 已公布的輸出速度 — MiniMax-M3 約為每秒 100+ 個 token,依據 MiniMax 自家的模型表格;MiniMax-M3.1-Flash-Preview 則未公布任何資訊 • 權重 — MiniMax-M3 為開放權重,並有公開儲存庫;MiniMax-M3.1-Flash-Preview 則無 • 定價 — 依供應商費率,MiniMax-M3 為每百萬輸入 token $0.30、每百萬輸出 token $1.20;MiniMax-M3.1-Flash-Preview 則無按 token 計價的費率 • 存取 — MiniMax-M3 可隨用隨付與使用 Token Plan,並可透過第三方平台路由;MiniMax-M3.1-Flash-Preview 僅能使用 Token Plan 與 MiniMax Code
那裡有兩列與其餘列屬於不同類別。公佈的輸出速度只是舊款機型的廠商數字,因此新款機型在未附上數字的情況下,被當成速度快的那一款來販售。而思考控制的發展方向與行銷說法相反:新款機型對它思考多少提供更精細的控制,卻移除了你徹底阻止它思考的能力。
MiniMax 拿走的那個開關
這是最可能造成問題的細節,而且它是被記錄下來的,而非隱藏起來。使用 MiniMax-M3 時,傳送 thinking: {"type": "disabled"} 到 OpenAI 相容端點時,會跳過思考並直接回傳答案;在 Anthropic 相容端點上,思考預設為關閉,並可啟用:adaptive。在 MiniMax-M3.1-Flash-Preview 上,相同的請求會回傳 HTTP 400,訊息為 需要自適應思考。沒有受支援的方法可以取得非推理回應。
實際上,這代表一個使用 MiniMax-M3 作為低成本、快速分類器或路由器的工作負載——輸入簡短提示、輸出簡短結構化答案、沒有思維鏈——沒有可直接替換升級至較新模型的路徑。你可以降低努力程度至低,而 MiniMax 的指引明確指出,降低努力程度是減少思考延遲與 token 的預期方式,而不是停用它。但 token 與延遲不會降到零,而且對於每次呼叫寫入四個欄位的高流量擷取工作,「總是先思考」與「要求時才思考」是不同的成本型態。

每個實際上測量的是什麼?
這個比較的一邊有數字,另一邊則是空白欄位,而值得精確釐清哪些數字分別是誰的。
MiniMax-M3 的獨立紀錄是真的:Artificial Analysis 將其置於 Intelligence Index 的 29.2 分——145 個模型中的第 60 名——在 Coding Index 上為 58.6,Math index 為 59.18,同一指數體系下的 GPQA Diamond 為 92.9%,長脈絡召回率 83%,IFBench 為 82.9%。這些都是第三方評測,任何人皆可下載該模型並重新執行。MiniMax 自家公布的 M3 上線數據——BrowseComp 為 83.5%、SWE-Bench Pro 為 59.0%、Terminal-Bench 2.1 為 66.0%、MCP Atlas 為 74.2%、OSWorld-Verified 為 70%——屬於廠商數字,我們尚未見到有人重現。
MiniMax-M3.1-Flash-Preview 兩者皆無。MiniMax 並未發布基準測試表,而該模型在 Artificial Analysis 的指數中也沒有條目,因此沒有獨立分數、沒有程式設計指數、沒有長上下文召回數據,也沒有幻覺量測。流通中的每一種對它的描述——「快速」、「可靠」、「為日常開發而打造」——都是廠商在發布文章中自己用的形容詞。這個缺失值得直白指出,因為它是一把雙面刃:沒有任何東西被證明更差,也沒有任何東西被證明更好。
那種不對稱就是整個決策的關鍵。你今天下午就能下載 MiniMax-M3 或呼叫它來進行評估,並且可以將該評估結果與公開排行榜比較。至於 MiniMax-M3.1-Flash-Preview,你只能使用它,並自行形成私下的看法。
較新的模型真正勝出之處
很容易把上述內容解讀成主張忽略這個新模型,但那也不是正確的結論。有三件事是真實的,而且專屬於它。
努力階梯是真正的能力,而非切換開關。五個等級——低 到 最大——讓單一模型能以不同的運算成本,同時處理例行重新命名與整座儲存庫的重構,而且文件記載僅對 MiniMax-M3.1-Flash-Preview 有效。在 MiniMax-M3 上,你的選擇只有二選一。如果你的問題是無法預測每項任務的延遲,可調深度正是你想要的控管。
這是該廠商目前產品線中的旗艦模型,這表示它繼承了 M 系列自六月以來所學到的一切,而 MiniMax 明確指出,這是用於代理式推理、工具使用、程式編寫與長脈絡任務的最新模型。M3 所引進的交錯思考工具使用機制也沿襲下來,包括必須將完整回應——包含思考區塊等全部內容——附加回訊息歷史的要求。
而且它支援影片輸入,價格落在 Flash 等級,且包含在訂閱方案內。MiniMax-M3 同樣支援,但採按詞元(token)計價。如果你已經在支付 Token Plan 席位費用,而唯一阻礙你使用影片輸入的因素是每次呼叫的邊際成本,那麼 M3.1-Flash-Preview 已移除了這道障礙。
在較舊型號依然是首選的地方
三個案例,全都關於可預測性而非品質。
當你需要估算成本時。MiniMax-M3 有一份價目表:每百萬輸入 token 為 $0.30,每百萬輸出為 $1.20,而在我們的價目表上,快取讀取費率為每百萬 $0.06。你可以在實際執行之前,就把某個工作負載的每月帳單估算到分毫不差。MiniMax-M3.1-Flash-Preview 在 MiniMax 的任何頁面上都沒有按 token 計價的費率,所以它的成本等於你的訂閱費除以你實際用掉多少——對固定預算來說沒問題,對單位經濟效益則毫無用處。
當你需要模型就是模型本身的時候。MiniMax-M3 是開放權重的:你可以下載它、在自己的硬體上執行它,並且確知六個月後回應你呼叫的產物,與今天回應你的是同一個。MiniMax-M3.1-Flash-Preview 沒有檢查點,而預覽級的存取意味著服務堆疊、配額組成與可用性全都由廠商控制,且明確可能變更。
當你需要非推理型的答案時。如上所述——這是比較中唯一的能力退步,也正是最令人意外的一點,因為較新的模型做不到較舊模型能做的事,並不是任何人會預先設想的情況。

從同一個地方呼叫兩者
這裡的彆扭之處在於,這兩個模型的購買方式不同——一個按用量計費,一個採訂閱制——而直覺反應往往是選邊站。更有用的做法是依任務型態在兩者之間分流,而這只有在按用量計費的那一方能從與其他一切相同的地方觸及時才行得通。
OrcaRouter 上的 MiniMax-M3採用 MiniMax 的定價,加成 0%,因此價目表上的 $0.30 與 $1.20 就是一次呼叫的實際費用,平台不額外抽成。它與 MiniMax M2.7 位於同一個 OpenAI 相容端點——同樣在 200,000 個 token 的視窗上標示 $0.30/$1.20,同樣是開放權重——也與其他 200 多個模型並列,只需一把 API 金鑰,並具備跨供應商的自動容錯移轉,能在某個端點不穩時接手。對照我們自家的遙測數據——這與供應商提供的數字是不同性質的數據:過去七天內,M3 在 OrcaRouter playground 上測得約每秒 238 個輸出 token,首個 token 的 p50 約為 4.1 秒,錯誤率接近 0.15%。如果你想讓 MiniMax-M3 擔任管線中可靠的那一半,並把 MiniMax-M3.1-Flash-Preview 當作實驗性的那一半,那麼這個可靠的一半只需一行設定,而不必再建立第二個供應商關係。MiniMax-M3.1-Flash-Preview 本身並不在我們的目錄中;通往它的途徑是該供應商自家的 Token Plan 與 coding 產品。
會改變這篇文章的,是具體而容易留意的動向。一份已公布的 MiniMax-M3.1-Flash-Preview 價目表,會瓦解在經濟考量上偏好 M3 的主要理由。一組獨立評分會以可比較的內容取代那個空白欄位。一個可下載的檢查點會消除可重現性的質疑。在至少其中一項出現之前,MiniMax-M3 仍是這對模型中你能夠要求負責的那一個——而較新的那一個,仍是更快、控制更好、未經衡量的預覽版;MiniMax 已決定對它按月收費,而不是按 token 收費。

