Hero 卡片標題為 Claude Sonnet 5.5 對 Qwen3.8 Max,副標題為「六週、兩個層級、一個成本定論」,標籤顯示輸入 $2(兩者相同)、輸出 $10 對 $6,以及 Index 56 對 45,頁尾引用 Artificial Analysis v4.3.2 與供應商定價。
Guides & Insights

Claude Sonnet 5.5 對決 Qwen3.8 Max:六週、兩種層級、一個成本定論

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

只要拿三個提示來算一算,還沒碰到基準測試,比較結果就大致底定了。一個簡短的客服回覆呼叫:2,000 個輸入 token、500 個輸出。在 Qwen3.8 Max 上,每百萬輸入 $2、每百萬輸出 $6,這樣是 0.4 美分;在 Claude Sonnet 5.5 上,每百萬輸入 $2、每百萬輸出 $10,則是 0.9 美分。一次儲存庫重構:輸入 400,000、輸出 30,000——43 美分對上 83 美分。一場真正會把預算花完的長時間代理式工作階段:輸入 200 萬個 token、輸出 20 萬個,所以當數字大到足以讓輸入端占據主導地位時,就是 $5.20 對上 $6.30。

起初在輸出價格上呈現 2.25 倍差距的缺口,到了代理式規模下會縮小到約 1.2 倍,而這種規模化並非什麼稀奇之事。Qwen3.8 Max 與 Claude Sonnet 5.5 都是具備高輸出上限的 1M token 模型,輸入價格皆為每百萬 $2,且兩者相隔八週內先後發布——該廠商的模型於 2026 年 8 月 3 日推出,並在 9 月 2 日進行一次標註日期的更新,Anthropic 的則於 9 月 28 日發布。兩者之間的差異不在價目表上,而在於各自為了完成任務所花費的成本。

發布了什麼,以及何時發布

Qwen3.8 Max 是阿里巴巴迄今能力最強的層級。阿里巴巴在其自家的遷移指南中,直接將其與 GPT-5.5、Claude Opus 4.7 和 Gemini 3.1 Pro 對標,並建議在任何需要最強可用推理能力的任務中使用它。它具備 100 萬個 token 的上下文視窗,接受文字、圖像和視訊輸入,並輸出文字——視訊輸入這項介面是這裡唯一 Claude Sonnet 5.5 所不具備的能力。定價為每百萬輸入 token 2 美元、每百萬輸出 token 6 美元,快取讀取為 0.25 美元,快取寫入為 2.50 美元。我們目錄中 8 月 3 日的項目之外,還加入了 9 月 2 日的更新版本,列名為 Qwen3.8 Max (0902),它採用相同的主要費率,以及 131K 的輸出上限。

Two-column scoreboard for Claude Sonnet 5.5 and Qwen3.8 Max across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, text and image input, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column Qwen3.8 Max: input $2.00 per million, output $6.00 per million, text image and video input, AA Intelligence Index 45, cost per Index task $5.41, September 2 2026 refresh. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 是 Anthropic 5.5 世代中的第二個模型,於 2026 年 9 月 28 日發布,比 Claude Opus 5.5 晚六天。它是以 claude-sonnet-5-5 的形式在 Claude API 以及 Amazon Bedrock、Google Cloud 和 Microsoft Foundry 上提供,具備 100 萬 token 視窗、128K 同步輸出上限,且在 Message Batches API 上可透過 output-300k-2026-03-24 標頭延伸至 300K,並完全維持 Claude Sonnet 5 的費率:輸入 $2、輸出 $10、快取讀取 $0.20、快取寫入 $2.50。自推出起即零資料保留,退役時間不早於 2027 年 9 月 28 日。

所以,輸入費率完全相同,上下文視窗大小也一樣,而兩家供應商更是在相隔一個月內先後更新。兩者之間的所有差異,不是在帳單的輸出端,就是在基準測試裡。

基準測試:廠商資料表與獨立指數對比

這裡存在兩種證據,而它們不可互換。

Anthropic 的發布表格由供應商報告、未經任何第三方重現,且涵蓋八項評估。重要的行

• Terminal-Bench 4.0 — Claude Sonnet 5.5 達 70.6%,相較於 Claude Sonnet 5 的 10.3%

• CursorBench 4.0 — 55.5%,相較於 Claude Sonnet 5 的 34.1%

• GDPval-AA v2.1 — 1844,相較於 Claude Sonnet 5 的 1449、Claude Opus 5.5 的 1846,以及 GPT-6 Sol 的 1487

• Humanity's Last Exam,使用工具時 — 64.5% 對 54.9%;Claude Opus 5.5 則為 67.7%

• OSWorld 2.1,部分 — 80.1% 對 57.0%

• 圖表繪製,無工具 — 61.6% 對 15.6%

Alibaba 並未發布可直接對應的四欄表格,因此唯一能放在同一座標軸上的數字,只有獨立來源的數字。Artificial Analysis,v4.3.2 修訂版

• 綜合智能指數 — Claude Sonnet 5.5 56,在 216 個中排名第 3;Qwen3.8 Max 45,排名第 27

• 每個 Intelligence Index 任務的成本 — $7.60 對比 $5.41

• 輸出速度 — Anthropic 的模型對照 Claude Sonnet 5 基準,測得每秒 78.7 個 token;Qwen3.8 Max 測得 39.1

• 冗長度 — Index 上有 410M 輸出 token,相較之下為 190M

Qwen3.8 Max 自身的各項評測分數相當可觀,而非只是勉強過關:GPQA Diamond 上達 92.8%,Terminal-Bench 2.1 上達 88.8%,長上下文召回率 80.3%,tau-banking 47.8%。它在綜合評分上落居下風,因為它沒有任何項目取得決定性勝利,而較新的 Anthropic 級別則在好幾項上直接勝出。另請注意,Qwen3.8 Max 的獨立頁面載明發布日期為 2026 年 9 月 2 日,以及 984K 的上下文讀數——它描述的是 (0902) 更新版,而非 8 月版本,若將兩者的數據混為一談,會是一項錯誤。

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

兩欄中缺少的內容,和其中已有的內容同樣重要。沒有人獨立重現過 Anthropic 的 OSWorld 或 Terminal-Bench 數據。沒有人發表過 Qwen3.8 Max 的 Chartography 或 CursorBench 數字。綜合分數是唯一以相同方式在兩個模型上測得的數字,這正是它下方的每任務成本數字會如此舉足輕重的原因。

決定這一切的那個數字,而且它不在任何一張費率表上

Artificial Analysis 對這兩個模型的計費方式相同:執行 Index 中的十項評估,計算 token 數量,再乘以定價。Claude Sonnet 5.5 每項任務為 7.60 美元,Qwen3.8 Max 為 5.41 美元,Anthropic 模型儘管綜合分數較高,仍有 40% 的溢價。冗長度讀數說明了方向——410M tokens 對上 190M——而速度讀數則說明了其餘部分:一個輸出較少 token、且每個 token 耗時更長的模型,並不是以兩倍費率支付輸出費用的一方。

Anthropic 自家的效率主張與同一套說法相符,而非與之相互矛盾。該公司表示,Claude Sonnet 5.5 產生輸出比 Claude Sonnet 5 快 30% 以上,且在相同價格下,「每項任務的成本最多低 30%」——這是關於每項任務 token 用量的主張,而非關於費率的主張。面對一個用量不到一半 token 的模型,這項主張是否仍站得住腳,正是 7.60 美元這個數字所要追問的,而單一次獨立測試也只是一個資料點。

實際後果是:$6 對 $10 的輸出費率,是採購部門會看的數字,而它也是本文中最不具預測力的數字。真正有預測力的是在你自己的提示上,每項任務所用的詞元數,而兩家供應商都不會把這個數字交給你。

輸入、影片,以及遷移陷阱

最立即顯現的能力差異在於模態。Qwen3.8 Max 除了文字與圖像外,還接受影片;Claude Sonnet 5.5 則接受文字與圖像。對於螢幕錄影分析、會議影片處理流程,或任何把影片視為一等輸入的應用而言,這不是基準測試上的差距——而是二元式的資格問題,而這些模型中只有一個能通過。

OrcaRouter model page for qwen/qwen3.8-max, attributed to Qwen and dated 2026-08-03, showing a 1M-token context window, text, image and video input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 2.25 seconds, and 53.0M tokens of traffic in the last seven days.

一週後才顯現的差異是行為上的。Claude Sonnet 5.5 對在 Claude Sonnet 5 上執行的程式碼做出五項破壞性變更。非預設的 temperature、top_p或top_k現在會傳回 400。傳送 thinking: {"type": "disabled"}會傳回 400,並指向 between_tools,這是新的最低思考設定,在 low、medium 和 high effort 下接受,在 xhigh 或 max 下拒絕。強制工具使用——tool_choice為 "any"或具名工具——會直接傳回 400。較舊的 computer_20251124 電腦使用工具在 Claude API 和 Google Cloud 上會被拒絕。而且思考區塊會綁定到產生它們的模型和帳戶,因此推理可以從 Claude Sonnet 5 延續,但不能延續到另一個家族,而且經過編輯的對話前綴可能會讓重播變成錯誤。

Qwen3.8 Max 完全不需要那些。它是一個 OpenAI 格式的模型,具備傳統的請求介面,而從其他 Qwen 層級轉換到它,只是變更模型字串而已。

誠實權衡這兩項成本。選擇 Qwen 模型,代價是那十一分的綜合差距,以及你反正無法獨立驗證的 Anthropic 廠商數據。選擇 Anthropic 模型,代價是影片輸入,以及一份四項 API 變更的清單——這些變更第一次被觸發時,每一項都會以 400 大聲失敗;這是好的那種失敗,但無論如何都得花上一天工作。

OrcaRouter 適合放在哪裡

之所以要進行路由而非直接選擇,是因為關鍵數字——以你的流量計算的每項任務成本——無法從任一供應商的說明文件推算出來。

OrcaRouter 是一個單一且與 OpenAI 相容的端點,涵蓋 200 多個模型,並以供應商定價原價傳遞、不加價,因此任何一方的降價或方案層級變更,在宣布當天就會生效。兩個 Qwen3.8 Max 版本都在目錄中,價格為阿里巴巴自家的 $2 / $6 — 八月版與 (0902) 更新版 — 以及 Claude Sonnet 5,這仍是大多數 Claude API 流量所運行的模型,自 6 月 30 日起可路由,價格為 Anthropic 的 $2 / $10,實測每秒 150 個輸出 token。Claude Sonnet 5.5 本身尚未在我們的目錄中;在此情況下,取得它的誠實途徑是供應商自家的 API 以及 Anthropic 列出的三家雲端,而要在不搬移工作負載的情況下試用它,方法是將一部分流量置於自動容錯移轉之後導向 Claude Sonnet 5 或 Qwen3.8 Max。

哪一個,用於哪項工作

Qwen3.8 Max 在視訊輸入、輸出率、每項索引任務的實測成本,以及整合投入上都勝出。對於量大且規格明確的工作而言,它是正確的預設選擇,因為十二分的綜合差距並不會反映在輸出品質上。

Claude Sonnet 5.5 在獨立綜合評比中勝出,在代理式程式設計評估上也勝出——Anthropic 自家公布的數據顯示,它在 Terminal-Bench 4.0 上比自家前代躍升了 60 分;此外,它在 30 萬筆批次輸出上限上勝出,也在一個計費價目表無法做出的、貼近實際工作情境的決定上勝出:當任務難到「正確」比「便宜」更重要時,它就是該選的模型。

對兩者來說,會改變答案的是同一件事,而且不是新的基準測試發布。那是在你自己的提示詞、你自己的 effort 設定下,針對這兩個模型計算出的每項任務 token 數量。Anthropic 的 effort 參數和 Qwen 的輸出上限,都是影響那個數字的槓桿,而且兩者都是由你設定,而不是由供應商的價目表決定。

這項比較真正確定的一點是:在每百萬輸入 token 收費 2 美元的情況下,帳單的輸入端已不再是中國旗艦模型與 Anthropic 中階模型之間的差異化因素。那場競爭早在幾個月前就已轉移到輸出端和 token 數量上。

本文中的比較3

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新