
Qwen 4 Max 與 Claude Opus 5:在兩者腳下移動的基準測試
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen 4 Max 於 2026 年 9 月 22 日在杭州雲棲大會上首度亮相——它是 Qwen 4 四款機型系列中的旗艦級別,該系列已發表但尚未推出,沒有價格、沒有上下文視窗,也沒有公布任何評分。Claude Opus 5 自 2026 年 7 月 24 日起已全面開放使用,每百萬輸入 token 收費 5.00 美元、每百萬輸出 token 收費 25.00 美元,而自 Qwen3.8-Max 發布以來,每一款旗艦機型所瞄準的目標都是它。寫這篇比較最顯而易見的做法,是做一張有一欄空白的規格表。真正有用的做法,則是注意到在 2026 年 9 月 19 日、也就是發表前三天,Artificial Analysis 重新計算了其 Intelligence Index 的分數,而 Claude Opus 5 不再位居榜首。光是這一個變化,就重新定義了 Qwen 4 Max 必須超越的對象。
9月19日有什麼改變?
Artificial Analysis 於 2026 年 9 月 19 日發布了指數修訂版 v4.3.2。在目前修訂版下,Claude Opus 5 在最高推理努力程度時,於 Intelligence Index 得分為 51——xhigh 為 50、high 為 48、medium 為 45、low 為 39——並落後於 Claude Fable 5.1 與 GPT-6 Astra,兩者皆為 53。在該指數上的每項任務成本為 5.86 美元。
如果這讀起來像是降級,事實並非如此。模型沒有改變,改變的是指數。我們自己在七月與八月的報導中,引用 Claude Opus 5 為 61 到 63,並位居榜首,而那些數字在當時生效的修訂版本下是正確的。任何仍引用這些數字卻未註明修訂日期的人,引用的是已退役的數字,而這是本月撰寫的比較中最常見的單一錯誤。實際後果是,諸如「Claude Opus 5 是現有得分最高的模型」這類說法已不再成立,而建立在此之上的比較也會隨之瓦解。
對 Qwen 一方而言,後果更加嚴峻。一個於 2026 年 9 月發表的旗艦層級,正瞄準一個已在 2026 年 9 月被重新定義的目標。無論阿里巴巴最終為 Qwen 4 Max 發布什麼,都會被拿來對照一個排行榜,而在那裡,要超越的數字是 53,不是 63。

坦白說出的比較
這張表有一邊是完整的,另一邊是空白的,而若假裝不是如此,就會落入這篇文章的整體失敗模式。以下是實際上已知的內容:
• 狀態 — Claude Opus 5 自 2026 年 7 月 24 日起全面開放使用,而 Qwen 4 Max 於 2026 年 9 月 22 日宣布,但尚未公布發布日期
• 輸入價格 — Claude Opus 5 每 100 萬個 token 為 $5.00,而 Qwen 4 Max 則未公布
輸出價格 — Claude Opus 5 為每 100 萬個 token 25.00 美元,而 Qwen 4 Max 則未公布
• 快取輸入 — Claude Opus 5 的快取讀取為每 100 萬個 token $0.50,相較之下 Qwen 4 Max 未公布
• 脈絡 — Claude Opus 5 的 1M tokens 為預設值與上限,相較之下 Qwen 4 Max 未公布
• 輸出上限 — Claude Opus 5 同步為 128K tokens,在 Batches API 上搭配 beta 標頭則為 300K,而 Qwen 4 Max 則未公布
• 模態 — Claude Opus 5 支援文字、圖像與檔案輸入並輸出文字,相較之下 Qwen 4 Max 尚未公布
• 長脈絡定價 — Claude Opus 5 不收取額外費用,因此 900,000 個 token 的請求與 9,000 個 token 的請求按相同的每 token 費率計費,而 Qwen 4 Max 則未公布
• 獨立評分 — Claude Opus 5 在 Artificial Analysis Intelligence Index v4.3.2 中以最高推理強度獲得 51 分,而 Qwen 4 Max 則不存在任何獨立評測
• 廠商回報的分數 — Claude Opus 5 在 SWE-bench Verified 拿下 96.0%、SWE-bench Pro 79.2%、OSWorld 2.0 70.6%,Terminal-Bench 2.1 則依測試框架不同,約落在 85 分上下;相較之下,Qwen 4 Max 未回報任何數據
• 推理控制 — Claude Opus 5 預設啟用自適應思考,並具備五級努力程度階梯;相較之下,Qwen 4 Max 則未公布
十行「未發布」不是修辭手法。這就是證據的狀態,而從中得出的誠實結論是:迄今任何人都還無法對這兩個模型進行能力比較。
差距中無法彌合的部分
定價與相關脈絡最終都會公布。有一項差異在發布後仍會存在,而這件事值得現在就決定,而不是等到 Qwen 4 Max 出貨的那一週:這兩款模型的設計,就是要以不同的方式被購買。
Claude Opus 5 是單一供應商推出的單一閉源模型,只有一種價格,並公開承諾在 2027 年 7 月 24 日之前不會退役。對容量規劃而言,這是一個穩定的目標。Qwen 4 Max 是阿里巴巴一再推出、價格帶寬廣許多的系列中的旗艦——Qwen 3.8 這一代涵蓋了輸入價格 2.00 美元的前沿旗艦,以及遠低於此的 Flash 層級——而 Qwen 產品線的旗艦層級,向來是在更便宜的層級追平它之前,有效壽命最短的那一個。
另一個差異是開放權重,而這一點指向相反的方向。Qwen 3.8 世代以自訂的 Qwen 授權條款,公開了其最大模型的權重,而這正是微調、量化與自行架設得以實現的根本原因。Claude Opus 5 並未釋出權重,未來也不會有。如果你的工作負載需要一個能在自家防護範圍內運行、或可供修改的模型,那是阿里巴巴一項結構性的優勢,任何基準測試的修訂都無法奪走——而這也是我們該在意這項特定比較、而非把它當成一個旗艦模型對上另一個旗艦模型來看待的最強理由。

今天如何執行這項比較
Claude Opus 5 現已推出,OrcaRouter 以 anthropic/claude-opus-5 的形式轉送它,價格為 Anthropic 的定價、0% 加價——供應商的費率原封不動地傳遞,因此上方 $5.00 與 $25.00 的數字就是你實際被收取的費用,而非加價後的等值金額。對這個價位帶的模型來說,這點比平常更為重要:$25.00 輸出費率上的 10% 平台利潤是每百萬 token $2.50,這比大多數開放權重替代方案的整體輸入成本還高。除此之外,該目錄在單一 OpenAI 相容端點上提供近 200 個模型,當供應商路徑劣化時會自動容錯移轉,並提供路由 DSL,讓你能明確表達政策,而不必把模型名稱硬編碼進應用程式中。
OrcaRouter 並未收錄的,是 Qwen 4 Max,或任何 Qwen 4 層級。目錄中這個系列沒有任何條目,而這正是對於一個已宣布但尚未推出的模型會預期的情況。等這些層級真正上線時,它們會出現在同一個位置,而在那之前,值得拿來與 Claude Opus 5 相比的 Qwen 模型,是你實際能呼叫的那一個:Qwen3.8-Max,自 2026 年 8 月 3 日起正式全面供應,每百萬個 token 輸入 $2.00、輸出 $6.00,權重已公開,且有紀錄的獨立智慧評分為 56,每項任務 $1.14 —— 這個數字是在較早的指數修訂版本下取得的,因此若要與 Claude Opus 5 的 51 相比,唯有附帶這項但書才成立。
在模型卡存在之前,該如何處理這個?
這裡沒有什麼結論可下,因為這兩個模型中,有一個並非真實存在的產品。能說的是,這場比較在 2026 年 9 月 19 日改變了樣貌,而兩家廠商都沒有做任何事:Claude Opus 5 不再是大多數比較所倚賴的那份獨立排行榜上得分最高的模型,如今它落後另外兩個模型兩分。Qwen 4 Max 推出後,將落在這份榜單上,而不是七月的版本。
所以接下來幾個月的抉擇,並不是 Qwen 4 Max 對上 Claude Opus 5,而是 Claude Opus 5 對上那款已經推出的 Qwen 模型——一款以五分之一輸入價格提供旗艦級表現、且權重公開的模型——而這個比較現在就能做,雙方都有真實數據。等阿里巴巴發布模型卡時再重新檢視,在那之前看到的任何 Qwen 4 Max 基準測試表,都應視為未經證實。

本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
