
Claude Sonnet 5.5 對決 Qwen 4 Max:一個模型有張卡,另一個則有個名字
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 931 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 192 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
這個標題的兩半並不是同一類物件,而這是讀者首先必須知道的。Claude Sonnet 5.5已於 2026 年 9 月 28 日正式推出:它有 API 識別碼、價目表、上下文視窗、已公布的退役底線,以及獨立排行榜上的一席之地。Qwen 4 Max則是在 2026 年 9 月 22 日於杭州雲棲大會上預覽亮相,作為已宣布的四款模型 Qwen 4 產品線的旗艦——而截至今日,它沒有價格、沒有上下文視窗、沒有公布的分數、沒有模型卡,在 Artificial Analysis 上也沒有任何頁面可打開。這不是什麼醜聞;一個層級就是這樣被宣布的。但它改變了「有用的比較」該長什麼樣子。真正值得做的比較,是最新發布的 Sonnet 與你今天真的能呼叫的 Qwen 模型之間的比較,也就是 Qwen3.8 Max——因為它有價目表,而那份價目表很能說明問題。
Alibaba 實際上端出了什麼?
Qwen 4 Max 只是以名稱出現在產品陣容中,並非以產品之姿亮相。該會議預覽介紹了 Qwen 4 系列的分層結構,而此後關於它的任何內容都未被轉化成開發者能據以規劃的規格:沒有每百萬 token 的價格、沒有視窗大小、沒有最大輸出、沒有基準測試表、沒有 Hugging Face 儲存庫,也沒有列在廠商自家的模型清單中。它究竟會以封閉 API 層級、開放權重,或兩者兼具的形式推出,在廠商已公開的任何地方都未說明。當一個層級還處於如此早期的階段,文章對其規格唯一能誠實說的就是:根本沒有規格——而現在任何提供 Qwen 4 Max 規格表的頁面,都只是在印一份推測。

這份公告唯一真正有用之處,在於確立了方向。阿里巴巴最新出貨的旗艦模型 Qwen3.8 Max,在該廠商自家的遷移指南中,被直接與 GPT-5.5、Claude Opus 4.7 和 Gemini 3.1 Pro 對標,而它正是 Qwen 4 Max 被打造來取代的那個層級。因此,即便接班者的數字還不明朗,其目標仍清晰可辨;而它在價格上必須擊敗的,正是目前已在販售的那一款。
今天就能呼叫的 Qwen,定價對標全新的 Sonnet
Qwen3.8 Max 自 2026 年 8 月 3 日起全面推出。它是阿里巴巴迄今能力最高的層級:原生多模態,支援文字、圖像與影片輸入並輸出文字,具備 1,000,000 個 token 的視窗、思考模式、函式呼叫、內建工具與結構化輸出,並透過相容於 OpenAI、相容於 Anthropic 以及原生 DashScope 端點提供服務。阿里巴巴將它定位於與該廠商為 Claude Sonnet 5.5 所定位的相同高要求多步驟分析與代理式工作,而兩者幾乎落在完全相同的頭條費率上——這正是比較變得有趣之處。
• 輸入價格 — Claude Sonnet 5.5 每百萬 $2.00 對比 Qwen3.8 Max 每百萬 $2.00,完全相同
• 輸出價格 — Claude Sonnet 5.5 每百萬 $10.00 美元,對比 Qwen3.8 Max 每百萬 $6.00 美元
• 快取讀取 — Claude Sonnet 5.5 每百萬 $0.20 對比 Qwen3.8 Max 每百萬 $0.25
• 快取寫入 — Claude Sonnet 5.5 每百萬 $2.50,對比 Qwen3.8 Max 每百萬 $2.50
• 上下文 — 依廠商規格表,Claude Sonnet 5.5 為 1,000,000 個詞元,Qwen3.8 Max 為 1,000,000 個詞元;Artificial Analysis 記錄其測得的快照為 983,616
• 最大輸出 — Claude Sonnet 5.5 同步為 128,000,Batches 上為 300,000,對比 Qwen3.8 Max 則未由供應商公布
• 輸入模態 — Claude Sonnet 5.5 文字、圖像與檔案,對比 Qwen3.8 Max 文字、圖像與影片
相同的輸入費率,加上便宜 40% 的輸出費率,確實是極具優勢的價格定位,而這也是 Qwen3.8 Max 不斷出現在與前沿模型比較之中的原因。但當你轉而查看獨立實測數據時,這項優勢卻完全轉移到了別的地方。
獨立數據對價格優勢有何說法
兩款模型都納入同一份 Artificial Analysis Intelligence Index(修訂版 v4.3.2),而且兩者都是經過實測,而非估算得出。
• 智慧指數 — 在 Max Effort 模式下,Claude Sonnet 5.5 為 56,相較於 9 月 2 日快照中 Qwen3.8 Max 的 45
• 每個 Index 任務的成本 — Claude Sonnet 5.5 $7.60,對比 Qwen3.8 Max $5.41
• 輸出速度 — Claude Sonnet 5.5 每秒 138.7 個 token,對比 Qwen3.8 Max 每秒 38.2 個 token
• 首個 chunk 的時間 — Claude Sonnet 5.5 在 Max Effort 下為 370.8 秒,對比 Qwen3.8 Max 的 3.0 秒
• 在該指數中生成的輸出 token —— Claude Sonnet 5.5 410M 對比 Qwen3.8 Max 190M,董事會將其標記為相較於中位數 88M 極為冗長
• GPQA Diamond — Claude Sonnet 5.5 未公佈於目前排行榜,對比 Qwen3.8 Max 的 92.8%
• 人類最後的考試 — Claude Sonnet 5.5 55.0% 對上 Qwen3.8 Max 43.1%
• 長上下文回憶 — Claude Sonnet 5.5 82.7% 對比 Qwen3.8 Max 80.3%
有兩點格外突出,而這兩點都不是價格。第一點是,一旦把 token 數量納入考量,便宜 40% 的輸出費率就會壓縮成便宜 30% 的任務——Qwen3.8 Max 在整個索引中共輸出 1.9 億個 token,而 Claude Sonnet 5.5 為 4.1 億個,前者確實更精簡,但精簡程度還不足以保住完整的費率差距。第二點是速度,而在這裡方向出現大幅反轉:Claude Sonnet 5.5 產生輸出的速度是 Qwen3.8 Max 的 3.6 倍,每秒 138.7 個 token 對上 38.2 個。在長時間生成中,這是一分鐘與數分鐘之別,而這不是任何每 token 折扣所能彌補的差距。
首個詞元的數字則呈現相反的情況,值得把它的附帶說明講清楚。370.8 秒是 Claude Sonnet 5.5 在 Max Effort 搭配預設回退下的數據,這是一種在回答前花費極大思考預算的推理組態;若呼叫方設定較低的 effort,首個詞元會在幾秒內出現。Qwen3.8 Max 的 3.0 秒則是在思考行為不同的模型上測得。這項比較確實成立,但它是組態之間的比較,而非廠商之間的比較。

缺失的 Sonnet 遷移成本最終落在何處
有一項運作上的差異並未出現在上方任何一列中,而對任何手上已有程式碼在跑的人來說,它比價格差距更重要。Claude Sonnet 5.5 相較於 Claude Sonnet 5 改變了六項行為,其中五項會破壞現有整合:非預設的 temperature、top_p 與 top_k 現在會回傳 400;thinking: {"type": "disabled"} 會回傳 400,必須改成 between_tools,且 effort 僅限於 low、medium 或 high;強制指定工具為 "any" 或具名工具會被拒絕,因此迴圈必須改用 auto 並搭配嚴格工具使用或結構化輸出;computer_20251124 這項電腦操作工具在 Claude API 與 Google Cloud 上會被拒絕;而思考區塊現在綁定於產生它的模型與帳號,因此推理可從 Sonnet 5 延續,但無法帶往另一個模型家族。第六項變更不會造成任何失敗,因此正是最容易帶著錯誤上線的那一項:工具呼叫之間的文字現在會回傳在思考區塊內,因此串流應用程式在兩次呼叫之間會一片沉寂,直到它設定顯示值或事先停用思考功能。
Qwen3.8 Max 對 Qwen 呼叫方完全不要求這些——它是 OpenAI 相容端點,具備完整的取樣介面與標準的工具呼叫形式——而其 Anthropic 相容端點之所以存在,正是為了讓針對 Claude 撰寫的程式碼只要更改 base URL 就能指向它。對已經使用 Sonnet 5 的團隊來說,移轉到 Sonnet 5.5 是一天的遷移工作,外加一份五個檢查項目的清單;移轉到 Qwen3.8 Max 則是設定變更,伴隨一組不同的風險,主要圍繞行為漂移,而非 API 形態。
把可觸及的那個放到同一個按鍵上
在 2026 年 9 月下旬,一條真實的管線不會只挑其中一個。它會為代理式路徑跑 Claude 模型,並在影片輸入或價格至關重要之處跑 Qwen 模型,而這種安排的成本通常是兩份合約、兩把金鑰、兩套速率限制介面,以及兩個請求可能失敗的地方。OrcaRouter 把它收攏成單一一個與 OpenAI 相容的端點,涵蓋 200 多個模型,供應商定價原樣傳遞、不額外加價,因此任一方供應商的價格變動當天就會在此生效,而不是等到下一次續約;此外還提供上游供應商之間的自動容錯移轉,以及用來以多個模型組合呼叫的路由 DSL。
Qwen3.8 Max 今日已可在此路由,代號為 qwen/qwen3.8-max,採用 Alibaba 每百萬 token 輸入 $2.00、輸出 $6.00 的價格,涵蓋完整的 1,000,000 token 窗口;而Artificial Analysis 所測量的 9 月 2 日快照則可透過 qwen/qwen3.8-max-0902 存取,當你需要分數所依據的確切修訂版本時。無論是 Qwen 4 Max 或任何其他 Qwen 4 層級,都不在我們的目錄中,而且在 Alibaba 發布可供路由的版本之前,也不會有任何 Qwen 4 層級。Claude Sonnet 5.5 同樣不在目錄中——它才問世一天,通往它的路徑是 Anthropic 自家的 API;於此同時,Claude Sonnet 5 可在此以 Anthropic 的 $2.00 與 $10.00 價格取得,作為故障轉移目標。Qwen3.8 Max 每週透過此目錄承載 5,200 萬 token 的流量,而 Claude Sonnet 5 則承載 790 萬,這正是上述論點的實務版本:Qwen 層級並非只是名義上的備援。

已公告層級的規則
把已宣布的等級當成排程輸入,而不是採購選項。Qwen 4 Max 值得追蹤,因為它會告訴你阿里巴巴的旗艦正朝哪裡走,也因為它終將在產品線頂端取代 Qwen3.8 Max。但它不值得拿來做規劃依據,因為根本沒有東西可以規劃:沒有識別碼、沒有價格、沒有時間窗、沒有權重、沒有實測分數。能讓它成真、且具體又容易辨認的證據是——阿里巴巴自家模型清單中的一筆條目、一列價格、一個已公布的上下文視窗、若權重開放則有一個 Hugging Face 儲存庫,以及在 Artificial Analysis 上的一個頁面,因為一個沒有人量測過的模型,不是你能拿來比較的模型。
在那之前,這個決定是在兩個都已存在的模型之間做選擇。如果你的工作是代理式的,那十七點 Index 分數與 3.6× 的輸出速度就是你花錢買到的東西,而 Claude Sonnet 5.5 較高的每項任務成本就是換取這些的代價。如果你的工作需要影片輸入、需要在 Qwen 的帳單上使用 Anthropic 相容的端點,或單純無法合理化 10 美元的輸出費率,Qwen3.8 Max 現在就以相同的輸入價格提供服務,輸出便宜 40%,而且首個 token 幾秒內就到——而誠實的提醒是,一旦開始生成,你會覺得它很慢,這正是較低費率所換來的取捨。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
