
Qwen 3.8 對決 Claude Fable 5:0902 版本在程式編寫上取得領先
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
當阿里巴巴於2026年7月19日在上海預覽Qwen3.8-Max時,它發出的宣稱比任何其他都響亮:這款2.4萬億參數的模型接近前沿水準,且僅次於Claude Fable 5。當時這是不可能評估的。沒有價目表、沒有基準表、也沒有授權——只是一個定位聲明。
2026年8月3日,Qwen3.8-Max正式全面上市——一份實實在在的定價表,每百萬token收費2美元/6美元;一張寫滿數字的基準測試表;以及一個同時相容OpenAI與DashScope的端點。9月2日,阿里巴巴在沒有變更版本號的情況下推出了下一步:Qwen3.8-Max-0902,這是一次針對程式設計與智慧體工作所做的後訓練更新,以1,691 Elo在Code Arena: WebDev排行榜上首度登頂。而阿里巴巴整個七月都在把自己直接定位其後的Claude Fable 5,同一張榜上則為1,628 Elo。七月的問題如今更加尖銳:Qwen 3.8是否仍「僅次於Fable 5」,抑或在程式設計這條軸線上已經翻轉?
給開發者的一點提醒——要解決這類爭議,最快的方法是自行使用提示詞來執行兩種模型。OrcaRouter 在單一 OpenAI 相容端點後方提供 200 多個模型,讓你能在同一任務上讓 Qwen 3.8 Max 對決 Fable 5,而無需串接兩套 SDK。
TL;DR 結論。Qwen3.8-Max-0902 是阿里巴巴 2.4T 旗艦迄今最強的版本,而其主張中新增的部分已不再只是自我宣稱:它以 1,691 Elo 首度登上獨立的 Code Arena: WebDev 排行榜第 1 名,勝過該榜上第 8 名的 Claude Fable 5(1,628 Elo)。價格不變,依然是決定性因素——以每 1M tokens 均一價 $2 / $6 計算,Qwen 在輸入端比 Fable 5 的 $10 / $50 便宜約 5 倍,輸出端則便宜約 8 倍。尚未縮小的是通用能力的差距:Artificial Analysis 的 Intelligence Index 將 Qwen3.8-Max 評為 56 分,Claude Fable 5 則為 62 分;在綜合 Arena 排行榜最新公布的一週(8 月 24–30 日),Fable 5 仍居第 1(1,508 Elo),Qwen3.8-Max 則排第 20(1,479)。因此有兩個結論:在程式開發方面,Qwen 的 0902 新版如今有裁判認證,也拿下勝績;在廣泛且經稽核的推理評測方面,Claude Fable 5——以及 Anthropic 較新的 Claude Fable 5.1(以 66 分在 AA Index 居首)——依然守住陣地。
關鍵要點
• Qwen3.8-Max 已於 2026 年 8 月 3 日正式發布(GA),其 0902 更新版於 9 月 2 日緊接推出——版本號未變,同樣維持 $2 / $6 計價與 100 萬 token 的上下文長度。
• 價格差距巨大:Qwen 每 1M 個 token 的價格為 $2 / $6,而 Fable 5 為 $10 / $50。這意味著輸入費用約為 5 倍,輸出費用約為 8 倍;而且 Qwen 的費率在整個 1M token 上下文範圍內保持不變,沒有長提示詞附加費。
• 兩者現在都有獨立的分數——而且它們指向不同的方向。Qwen3.8-Max 在 Artificial Analysis Intelligence Index 上測得 56 分(Claude Fable 5:62 分),而其 0902 版本以 1,691 Elo 在 Code Arena: WebDev 中領先 Fable 5 的 1,628。
• Qwen 自家的基準測試成績依然亮眼,也仍然是由廠商自行發布的。GPQA Diamond 92.6、PaperBench 93.0、Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1 — 但 9 月 2 日的此次更新,是第一個被獨立競技場排名第一的 Qwen 結果。
• 規格表中的架構資訊缺口已補上。Qwen3.8-2.4T-A95B 在總共 2.4T 參數中約有 95B 活躍參數,橫跨 512 個專家——此資訊隨 8 月 12 日開放權重發布一同揭露。Fable 5 的架構仍未公開。
• 開放權重已經發布,並非只是承諾。Qwen3.8-2.4T-A95B(BF16 與 FP8)已於 8月12日以自訂的 Qwen3.8-Max 授權登上 Hugging Face 和 ModelScope;Qwen3.8-27B 則於 8月14日以 Apache 2.0 授權接續推出。Fable 5 永久封閉,僅供 API 使用。
準確性說明:阿里巴巴自家基準測試表中的數據仍屬供應商自行報告,且未經獨立重現。此處的獨立數據均為第三方提供並附有時間戳記:Artificial Analysis Intelligence Index(Qwen3.8-Max 56、Claude Fable 5 62、Claude Fable 5.1 66)、Code Arena:WebDev Elo 榜單,以及一般 Arena 的每週排行榜——Arena 的分數會隨票數累積而漂移,0902 版本的第 1 名是依據阿里巴巴公告的某一時間點榜單。Fable 5 的 95.0% SWE-bench Verified 成績為 Anthropic 所報告;Qwen 的定價則以阿里巴巴 Model Studio 的 GA 價目表為準。
規格與價格,並列呈現
以下是確切的數據,每一項數字皆註明其來源。
• 製造商/狀態 — Qwen3.8-Max:Alibaba;GA 於 2026年8月3日;0902 更新版於 2026年9月2日。Claude Fable 5:Anthropic;GA 旗艦款。
• 架構 — Qwen3.8-Max:總計 2.4T / 約 95B 活躍參數,稀疏 MoE,512 個專家(8 月 12 日披露);Fable 5:未披露
• 上下文視窗 — Qwen3.8-Max:1M tokens(含思考過程為 983,616;最大輸出 131,072);Fable 5:長上下文旗艦
• AA Intelligence Index — Qwen3.8-Max:56;Claude Fable 5:62;Claude Fable 5.1(9月1日):66,領先
• SWE-bench Verified — Qwen3.8-Max:未報告(阿里巴巴改為報告 FrontierSWE 73.5);Fable 5:95.0%(Anthropic / buildfastwithai)
獨立 + 廠商回報的優勢 — Qwen3.8-Max:Code Arena WebDev 第一名,得分 1,691(0902,獨立測試);廠商表格:GPQA Diamond 92.6、PaperBench 93.0、Terminal-Bench 2.1 86.6。Claude Fable 5:AA 62;SWE-bench Verified 95.0%
• 定價(輸入/輸出)— Qwen3.8-Max: $2.00 / $6.00 每 1M,在 1M 上下文內統一費率;快取輸入 $0.25;Fable 5: $10 / $50 每 1M
• 開放權重 — Qwen3.8-Max:於 2026 年 8 月 12 日發布(自訂授權,非 Apache);Qwen3.8-27B 於 8 月 14 日以 Apache 2.0 授權發布。Fable 5:否 — 封閉 / 僅限 API
• 多模態 — Qwen3.8-Max:文字、圖片、影片輸入 → 文字輸出;Fable 5:多模態旗艦
有兩件事為整個比較提供了框架。第一件在8月3日發生變化,至今仍然成立;第二件在9月2日又發生了變化。
首先,價格欄位現在是頁面上最搶眼的部分。七月時,Qwen 的成本優勢是一張折扣券——信用額度打一折,暫時性的,沒有可供規劃的每 token 費率。現在它變成了一張費率表,而這個差距是結構性的,而非促銷性的。以 $6 的輸出價格對比 Fable 的 $50,你可以用一次 Fable 呼叫的價格執行大約八次 Qwen 呼叫。對於任何按量付費而非為單一最難答案付費的工作負載,這個比率會改變你所建構的架構。
其次,基準測試這一欄已經不再是一面倒。八月的大多數時間,誠實的解讀相當狹窄:阿里巴巴公布了 FrontierSWE 73.5 和一張自跑數據表,Anthropic 公布了經第三方驗證的 95.0% SWE-bench Verified,而沒有任何獨立評測機構為 Qwen 打過分。0902 版本終結了這種局面。Code Arena: WebDev 是一個盲測的成對人工投票競技場——也就是先前名為 WebDev Arena 的計畫,並非由阿里巴巴的任何人營運——而 Qwen3.8-Max-0902 以 1,691 Elo 進入該榜並位居第 1,高於 Claude Opus 5(1,688)、Kimi K3(1,674)和 Claude Fable 5(1,628,第 8 名)。有兩點保留讓這種說法保持誠實:這只是一張榜單,衡量的是代理式前端開發而非通用能力;而且「以第 1 名之姿登場」是阿里巴巴對某一時點排名的公告。但「Qwen 完全沒有裁判」的說法已不再成立,而這件事對比較結果的影響,超過榜上任何單一數字。

價格差距實際上買到的是什麼
抽象的多重說明不如一個具體實作範例有用,所以這裡提供一個。以一個程式碼審查代理為例,每次呼叫會發送 150,000 個 token 的儲存庫上下文,並產生 6,000 個 token 的審查內容。
• Qwen3.8-Max:0.15M × $2 = $0.30,加上 0.006M × $6 = $0.036。≈ 每次調用 $0.34。
• Claude Fable 5:0.15M × $10 = $1.50,加上 0.006M × $50 = $0.30。≈ 每次呼叫 $1.80。
• 以每天2,000次呼叫計算:Qwen ≈ $672/天;Fable ≈ $3,600/天。一個月下來,大約是$20,000對比$108,000。
• 在穩定的 repo 上下文環境中啟用 prompt caching 後,Qwen 的快取輸入價格為 $0.25/1M,能將輸入端成本從 $0.30 降至 $0.04 以下,使每次呼叫成本降至 ≈ $0.08——每次呼叫約比 Fable 便宜 22 倍。
這不是一筆邊際性的節省;而是在每個 pull request 上都執行審查器,與僅在風險較高的請求上執行之間的差別。而 Qwen 的固定費率上下文讓此效果在提示詞增長時更加顯著:由於阿里巴巴不收取長提示詞附加費,傳送 900,000 個 token 的上下文與傳送 5,000 個 token 的上下文,每個 token 的成本相同。
誠實的反向考量是,每個 token 的價格並不等於每個已解決任務的價格。如果 Fable 5 能一次通過就解決問題,而較便宜的模型需要三次嘗試加上人工修正,那麼較便宜的模型總計起來可能花費更高——而在最困難的推理工作上,Fable 經審計的 #1 排名是現有最好的證據,證明它確實能一次通過解決更多問題。支持 Qwen 的成本論點在大量、容錯度高的工作負載上最有力,在少量、高風險的工作負載上則最薄弱。
0902 的命名方式:能力躍升了,版本號碼卻沒有
9月2日值得注意的地方,在於阿里巴巴沒有做的事:發布 Qwen 3.9。這項改進是以同一個模型名稱下一個標註日期的檢查點形式推出——Qwen3.8-Max-0902——API 也以相同的名稱和相同的價格提供服務。這正是整個產業正在漂移的方向:當能力躍升不再保證帶來新的版本號時,「我該用哪個模型」就變成了一個關於建置與日期的問題,而不只是關於系列名稱。
這也意味著,附在「Qwen3.8-Max」上的基準分數有保存期限:針對七月或八月版本測出的分數,可能無法描述 API 今天回傳的模型。請檢查你實際呼叫的端點上的建置識別碼——0902 這個數字,就是一個在 Code Arena: WebDev 上落後 Claude Fable 5 的模型,與一個領先它的模型之間的差異。
證明,以及它為何仍能決定這場對局的勝負
Qwen3.8-Max 最常被引用的實測證據來自一篇預覽期評測(thomas-wiegold.com),該評測讓模型執行了四個真實建置專案。結果確實令人驚豔:Qwen 一次就完成了 Go 語言撲克模擬——是史上第三個僅用一次就通過該提示詞測試的模型,與 Fable 5 和 Grok 4.5 並列——而在咖啡烘焙機網站提示詞的測試中,它產生了評測者在這項測試中見過的最佳輸出,甚至出於極致的周全,主動加入了未被要求的購物車、批發區塊和 Instagram 整合功能。
問題出在速度上:網站上耗時 30 多分鐘,撲克模擬耗時 1 小時 20 分鐘,使它成為該評測者用過最慢的模型。這項發現如今需要一個七月時並不需要的但書。 該測試是在預覽基礎設施上進行的,由一位評測者針對異常長的代理式(agentic)執行任務所量得。GA 服務是另一套系統。姑且一提,OrcaRouter 自己的 7 天遙測數據目前顯示 p50 首次 token 延遲(time-to-first-token)為 1.64 秒,適用於 Qwen3.8-Max——這是第一方測量結果;不過,TTFT 與長達一小時的建置任務上的端到端吞吐量,是兩種不同的量。持平而論,預覽版速度慢的這項發現應重新測試,而非當作當前事實來轉述。
What survives the 0902 update is that the strongest evidence on each side still comes from different places. Qwen3.8-Max-0902’s #1 on Code Arena: WebDev is an independent, blind-vote result, but it measures one board, and Alibaba’s own benchmark table remains a vendor artifact — labs choose which benchmarks to report, and Alibaba’s weakest reported number (IFBench 82.8, instruction-following) still lines up with the preview complaint that the model over-delivers and ignores scope. Claude Fable 5’s evidence is broader and mostly third-party: 62 on the AA Intelligence Index, #1 on the general Arena board, 95.0% SWE-bench Verified — and Anthropic’s own newer Claude Fable 5.1 has led the AA index at 66 since September 1. On “which model will handle work I cannot afford to get wrong,” the general-purpose answer is unchanged. On “which model ships the best front-end at a tenth of the price,” the answer flipped on September 2. 在0902更新之後不變的是,雙方最有力的證據仍然來自不同地方。Qwen3.8-Max-0902在Code Arena: WebDev拿下第一名,是獨立的盲選投票結果,但它只衡量單一看板,而阿里巴巴自家的基準測試表仍是廠商自製的產物——實驗室自行決定要公布哪些基準,且阿里巴巴公布的最低分(IFBench 82.8,指令跟隨)仍與先前預覽版的抱怨吻合:模型過度發揮而忽略範圍限制。Claude Fable 5的證據更廣泛,且多半來自第三方:AA Intelligence Index 62分、一般Arena看板第一名、SWE-bench Verified 95.0%——而Anthropic自家較新的Claude Fable 5.1自9月1日起便以66分領先AA指數。就「哪個模型能處理我承擔不起出錯的工作」而言,通用型答案不變。就「哪個模型能以十分之一的價格做出最好的前端」而言,答案在9月2日翻轉了。

開放性:Qwen 已經贏得的軸線
Fable 5 永遠無法自行託管。Qwen3.8-Max 已經可以做到:8月12日,Qwen3.8-2.4T-A95B 的權重——包括 BF16 和官方 FP8 變體——已發布在 Hugging Face 和 ModelScope 上,使它成為首款任何人都能下載的 Max 級 Qwen。兩點注意事項同樣值得重視。
第一個是合法的。該版本採用自訂的「Qwen3.8-Max」授權,而非 Apache 2.0:提供模型即服務(model-as-a-service)或 AI 工作助理業務、且過去收入超過 5,000 萬美元的廠商,必須與 Qwen 另行協商授權;而商業產品若每月活躍用戶超過 1 億,或每月營收超過 2,000 萬美元,則必須顯示模型名稱。對內部使用和新創公司而言,這些門檻很少構成限制——但這並非毫無規範的情況。
第二是物理層面的限制。一個總計2.4T參數的MoE模型,以BF16格式約需4.9TB儲存空間(官方FP8檢查點約為其一半),而每張H200的記憶體僅約141GB。因此,要自行託管這款旗艦模型,在產生任何token之前,你就需要一整機架的加速器。已揭露的約950億活躍參數,至少能讓你估算那組機架能帶來多少效益。對幾乎所有團隊而言,採用每次$2/$6的託管API,才是更切實可行的路徑。
這就是為什麼 Qwen3.8-27B 至今仍是實務上最重要的自架釋出版本——其 Apache-2.0 權重隨後於 8 月 14 日釋出,據稱僅需約 17GB 的 VRAM 即可運行。如果你偏好 Qwen 而非 Fable 5 的理由是資料落地或地端控制,而非純粹的效能表現,那麼 27B 才是真正能滿足此需求的模型——而且就雙方而言,開放性的比較已經不再只是理論。
常見問題
Qwen 3.8 是否比 Claude Fable 5 更好?
現在取決於衡量標準,這是相較於八月的一項實質變化。在編碼方面,Qwen3.8-Max-0902 領先:在 Code Arena: WebDev 中排名第一,Elo 1,691,而 Claude Fable 5 為 1,628;價格為 $2 / $6,而 Fable 5 為 $10 / $50。在廣泛且經審核的品質方面,Fable 5 仍然領先:在 AA Intelligence Index 上得分 62,Qwen 為 56;SWE-bench Verified 達 95.0%;並且在一般 Arena 排行榜上排名第一。對於錯誤答案代價高昂的工作,Fable 5 是文件更完善的選擇;而對於大量編碼和代理型網路工作,最新的 Qwen 既更便宜,競技場排名也更靠前。
“仅次于 Fable 5”的说法是真的吗?
阿里巴巴的這一定位說法提出時並無獨立數據佐證,而 0902 版本此後已改變了局面。Qwen3.8-Max-0902 在 Code Arena: WebDev 上領先 Claude Fable 5(1,691 對 1,628),但在 AA Intelligence Index(56 對 62)及綜合 Arena 排行榜上均落後於它(Qwen 以 Elo 1,479 排名第 20;Fable 5 以 1,508 排名第 1)。因此,「僅次於 Fable 5」已經變成「在這次更新鎖定的程式碼排行榜上領先 Fable 5,但在廣泛的通用型排行榜上落後於它」。
Qwen 3.8 比 Fable 5 便宜多少?
基本上,現在這是實際價格而非折扣。Qwen3.8-Max 每 1M tokens 收費 $2 / $6,相比之下 Fable 5 為 $10 / $50——輸入約便宜 5 倍,輸出便宜 8 倍。Qwen 的費率在整個 1M 上下文範圍內也是統一的,而 $0.25/1M 的緩存輸入讓重複上下文的工作負載更加便宜。
Qwen 3.8 Max 是否已退出預覽?
是的。該模型已於2026年8月3日正式全面上市,並公布了定價表,且提供與OpenAI和DashScope相容的端點。7月間流傳的Qoder積分活動與90%折扣預覽宣傳,已不再反映該模型的實際銷售方式。
Qwen 3.8 仍然是最慢的模型嗎,如同早期評測所說的那樣?
該發現來自一位審查者,在預覽基礎設施上執行長達一小時的代理式建置,應針對正式發布(GA)服務重新測試,而非將其視為當前的事實。OrcaRouter 的 7 天遙測資料顯示,首次輸出 token 的時間(time-to-first-token)p50 為 1.64 秒,不過這衡量的是首次輸出延遲,而非長時間建置的吞吐量。
我可以自行架設 Qwen 3.8 而不是付費使用 Fable 5 嗎?
針對 Qwen,答案是肯定的,但有附帶條件。{{1}}Qwen3.8-2.4T-A95B 自 8 月 12 日起在客製化授權(而非 Apache 2.0)下提供下載,Qwen3.8-27B 則自 8 月 14 日起以 Apache 2.0 授權提供下載。{{/1}}實際障礙在於硬體:總參數量 2.4T 的 MoE 模型在 BF16 下約需 4.9TB 記憶體——相當於一整機架的加速器——因此大多數團隊仍會以 $2 / $6 呼叫託管 API,而不是自行部署旗艦模型。{{2}}Fable 5 已永久關閉。{{/2}}
我今天該用哪一個?
對於一般工作而言,若答錯的代價高昂——例如嚴謹推理、高風險的生產流程——Claude Fable 5 仍是文件較完善的選擇,而 Anthropic 的 Claude Fable 5.1 更延續了這項優勢。至於大量編碼與代理式網頁開發,Qwen3.8-Max-0902 目前在獨立競技場上佔有優勢,輸出價格也大約便宜 8 倍:適用於批次程式碼審查、前端生成、長文件分析。許多團隊應同時運行兩者,並依任務分流。
底線
Qwen 3.8 與 Claude Fable 5 的比較,和一個月前已不可同日而語,與一週前相比又有了新的變化。Qwen3.8-Max 是正式公開供應的模型,其定價表在輸入端較 Fable 5 便宜 5 倍、輸出端便宜 8 倍,且百萬 token 均一價——自 9 月 2 日起,同名模型搭載 0902 版本,目前已有獨立競技場將其評為代理式網頁開發第一名,在該榜單上超越 Fable 5。
如今,沒有任何一款模型能全面主導整體比較。Claude Fable 5——以及 Anthropic 的 Claude Fable 5.1(自 9 月 1 日以來以 66 分領先 AA Intelligence Index)——佔據了廣泛、經審計的通用領域,而阿里巴巴自家的基準測試表仍只是廠商的產物。但 7 月時這場對決之所以如此懸殊的原因——當時 Qwen 完全沒有獨立裁判——已於 9 月 2 日失效:Qwen3.8-Max-0902 已成為 Code Arena: WebDev 上排名第一的模型。合理的答案仍然是要依風險和任務來區分——Fable 5 用於一般推理(出錯代價高昂),Qwen3.8-Max 用於大量編碼(價格差距與競技場優勢均對其有利)——並在您自己的提示詞上測試兩者。

本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
