
Qwen 3.8 對決 Claude Fable 5:阿里巴巴 2.4T 旗艦終於定價了
- qwen新Qwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 每百萬 tokens · 54 tok/s
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3150智能69程式
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 206 tok/s
- orca新OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropic新Anthropic: Claude Opus 52026-07-2461智能78程式
- google新Google: Gemini 3.6 Flash2026-07-2150智能69程式
- google新Google: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1651智能71程式
- kimiMoonshotAI: Kimi K32026-07-1557智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0951智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0955智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0959智能77程式
- grokxAI: Grok 4.52026-07-0854智能72程式
- tencentTencent: Hy32026-07-0641智能59程式
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42程式
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39程式
- anthropicAnthropic: Claude Sonnet 52026-06-3053智能72程式
- klingKling: Kling 3.0 Turbo2026-06-1757智能52程式57數學
- z-aiZ.ai: GLM 5.22026-06-1651智能69程式60數學
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242智能61程式61數學
當阿里巴巴於2026年7月19日在上海預覽Qwen3.8-Max時,它發出的宣稱比任何其他都響亮:這款2.4萬億參數的模型接近前沿水準,且僅次於Claude Fable 5。當時這是不可能評估的。沒有價目表、沒有基準表、也沒有授權——只是一個定位聲明。
在 2026年8月3日,Qwen3.8-Max 正式全面可用,而這場比較終於在兩邊都有了實質內容。Alibaba 公布了每百萬 tokens 2美元/6美元的定價,以及一份附有真實數據的基準測試表。Fable 5 仍以經審計的 SWE-bench Verified 95.0% 位居獨立的 Artificial Analysis Intelligence Index 榜首。因此問題更尖銳了:既然 Qwen 已經亮出數字,「僅次於 Fable 5」這個說法還站得住腳嗎?
給開發者的一點提醒——要解決這類爭議,最快的方法是自行使用提示詞來執行兩種模型。OrcaRouter 在單一 OpenAI 相容端點後方提供 200 多個模型,讓你能在同一任務上讓 Qwen 3.8 Max 對決 Fable 5,而無需串接兩套 SDK。
TL;DR 結論。Qwen3.8-Max 在 GA 版本中展現的競爭力遠超預覽版所暗示的——而且價格大幅降低。以 每 100 萬 token 統一收費 $2 / $6的價格,它比 Fable 5 的 $10 / $50在輸入端便宜約 5 倍、在輸出端便宜約 8 倍;其自行公布的數據也具備前沿模型水準(GPQA Diamond 92.6、Terminal-Bench 2.1 86.6、FrontierSWE 73.5,對比前代模型的 40.7)。但 Fable 5 仍因一個自 7 月以來不曾改變的理由而穩坐冠軍寶座:它是兩者中唯一有裁判的一方。Fable 的約 60 智慧指數與 95.0% SWE-bench 均經第三方稽核;Qwen 的每一項數據都是阿里巴巴自行發布的,且 Artificial Analysis 與 LMArena 均尚未公布 Qwen3.8-Max 的分數。Fable 5 在實證上勝出;Qwen 3.8 則在價格上取得決定性勝利,一旦權重釋出,在開放性上同樣勝出。
關鍵要點
• Qwen3.8-Max 已於 2026 年 8 月 3 日正式全面上市(GA) — 不再是預覽版。已發布費率表、相容 OpenAI 與 DashScope 的 API、廠商基準測試表。
• 價格差距巨大:Qwen 每 1M 個 token 的價格為 $2 / $6,而 Fable 5 為 $10 / $50。這意味著輸入費用約為 5 倍,輸出費用約為 8 倍;而且 Qwen 的費率在整個 1M token 上下文範圍內保持不變,沒有長提示詞附加費。
• Fable 5 仍然是唯一經過審計的一方。 在 Artificial Analysis Intelligence Index 上約為 60(#1),SWE-bench Verified 達 95.0%,而 Qwen3.8-Max 仍未獲得任何獨立評估者的評分。
• Qwen 自報的數據確實很強: GPQA Diamond 92.6、PaperBench 93.0、Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1——但這些數據是廠商自行產出的,而且各家實驗室只會公布自己勝出的基準測試。
• 阿里巴巴從未公布有效參數數量,因此 2.4T 的標題數字對實際服務成本幾乎沒有參考價值。Fable 5 的架構同樣未公開——就透明度而言,雙方都不乾淨。
• 官方承諾本週內發布開放權重,外加一款Qwen3.8-27B據報導可在約 17GB 的 VRAM 中運行。Fable 5 是封閉的,僅限 API 使用,且永遠如此。
準確性說明:所有 Qwen3.8-Max 的品質數據均由 Alibaba 自行報告,尚未經獨立複製驗證。Fable 5 的數據來自 Artificial Analysis 和 Anthropic,在不同追蹤器之間可能存在差異。Qwen 的定價採用 Alibaba Model Studio 的 GA 價格表,不再沿用七月份的臨時預覽折扣。
規格與價格,並列呈現
以下是確切的數據,每一項數字皆註明其來源。
• 製造商/狀態 — Qwen3.8-Max:阿里巴巴;正式發布(2026年8月3日);Claude Fable 5:Anthropic;旗艦正式發布
• 架構 — Qwen3.8-Max:總參數約 2.4T,稀疏 MoE(活躍參數量仍未公開);Fable 5:封閉;架構未公開
• 上下文視窗 — Qwen3.8-Max:1M tokens(含思考過程為 983,616;最大輸出 131,072);Fable 5:長上下文旗艦
• AA Intelligence Index — Qwen3.8-Max:尚未評分;Fable 5:~60 — #1(Artificial Analysis)
• SWE-bench Verified — Qwen3.8-Max:未報告(阿里巴巴改為報告 FrontierSWE 73.5);Fable 5:95.0%(Anthropic / buildfastwithai)
• 廠商宣稱的優勢 — Qwen3.8-Max:GPQA Diamond 92.6、Terminal-Bench 2.1 86.6、PaperBench 93.0、OSWorld-Verified 86.1(均由阿里巴巴報告);Fable 5:經審計整體排名第一
• 定價(輸入/輸出)— Qwen3.8-Max: $2.00 / $6.00 每 1M,在 1M 上下文內統一費率;快取輸入 $0.25;Fable 5: $10 / $50 每 1M
• 開放權重 — Qwen3.8-Max:承諾本週內發布(尚未有授權);Fable 5:否 — 封閉 / 僅限 API
• 多模態 — Qwen3.8-Max:文字、圖片、影片輸入 → 文字輸出;Fable 5:多模態旗艦
有兩件事為整個比較提供了框架,而這兩件事都在8月3日發生了改變。
首先,價格欄位現在是頁面上最搶眼的部分。七月時,Qwen 的成本優勢是一張折扣券——信用額度打一折,暫時性的,沒有可供規劃的每 token 費率。現在它變成了一張費率表,而這個差距是結構性的,而非促銷性的。以 $6 的輸出價格對比 Fable 的 $50,你可以用一次 Fable 呼叫的價格執行大約八次 Qwen 呼叫。對於任何按量付費而非為單一最難答案付費的工作負載,這個比率會改變你所建構的架構。
第二,基準欄位不再空白——但它也不具可比性。 這正是最關鍵的微妙之處。Alibaba 報告的是 FrontierSWE 73.5;Anthropic 報告的是 SWE-bench Verified 95.0%。這些是不同的基準,擁有不同的難度曲線,把 73.5 拿來和 95.0 並列,彷彿它們衡量的是同一件事,無疑會造成誤導。我們能說的範圍更窄,也更誠實:Fable 5 的分數是由第三方在他人可檢視的條件下測得,而 Qwen 的分數則是由 Alibaba 在沒有其他人執行過的評測框架上測得的。在 Artificial Analysis 或 LMArena 公佈 Qwen3.8-Max 的分數之前,正確的解讀依然與 7 月相同——看似接近,但仍未經證實。

價格差距實際上買到的是什麼
抽象的多重說明不如一個具體實作範例有用,所以這裡提供一個。以一個程式碼審查代理為例,每次呼叫會發送 150,000 個 token 的儲存庫上下文,並產生 6,000 個 token 的審查內容。
• Qwen3.8-Max:0.15M × $2 = $0.30,加上 0.006M × $6 = $0.036。≈ 每次調用 $0.34。
• Claude Fable 5:0.15M × $10 = $1.50,加上 0.006M × $50 = $0.30。≈ 每次呼叫 $1.80。
• 以每天2,000次呼叫計算:Qwen ≈ $672/天;Fable ≈ $3,600/天。一個月下來,大約是$20,000對比$108,000。
• 在穩定的 repo 上下文環境中啟用 prompt caching 後,Qwen 的快取輸入價格為 $0.25/1M,能將輸入端成本從 $0.30 降至 $0.04 以下,使每次呼叫成本降至 ≈ $0.08——每次呼叫約比 Fable 便宜 22 倍。
這不是一筆邊際性的節省;而是在每個 pull request 上都執行審查器,與僅在風險較高的請求上執行之間的差別。而 Qwen 的固定費率上下文讓此效果在提示詞增長時更加顯著:由於阿里巴巴不收取長提示詞附加費,傳送 900,000 個 token 的上下文與傳送 5,000 個 token 的上下文,每個 token 的成本相同。
誠實的反向考量是,每個 token 的價格並不等於每個已解決任務的價格。如果 Fable 5 能一次通過就解決問題,而較便宜的模型需要三次嘗試加上人工修正,那麼較便宜的模型總計起來可能花費更高——而在最困難的推理工作上,Fable 經審計的 #1 排名是現有最好的證據,證明它確實能一次通過解決更多問題。支持 Qwen 的成本論點在大量、容錯度高的工作負載上最有力,在少量、高風險的工作負載上則最薄弱。
證明,以及它為何仍能決定這場對局的勝負
Qwen3.8-Max 最常被引用的實測證據來自一篇預覽期評測(thomas-wiegold.com),該評測讓模型執行了四個真實建置專案。結果確實令人驚豔:Qwen 一次就完成了 Go 語言撲克模擬——是史上第三個僅用一次就通過該提示詞測試的模型,與 Fable 5 和 Grok 4.5 並列——而在咖啡烘焙機網站提示詞的測試中,它產生了評測者在這項測試中見過的最佳輸出,甚至出於極致的周全,主動加入了未被要求的購物車、批發區塊和 Instagram 整合功能。
問題出在速度上:網站上耗時 30 多分鐘,撲克模擬耗時 1 小時 20 分鐘,使它成為該評測者用過最慢的模型。這項發現如今需要一個七月時並不需要的但書。 該測試是在預覽基礎設施上進行的,由一位評測者針對異常長的代理式(agentic)執行任務所量得。GA 服務是另一套系統。姑且一提,OrcaRouter 自己的 7 天遙測數據目前顯示 p50 首次 token 延遲(time-to-first-token)為 1.64 秒,適用於 Qwen3.8-Max——這是第一方測量結果;不過,TTFT 與長達一小時的建置任務上的端到端吞吐量,是兩種不同的量。持平而論,預覽版速度慢的這項發現應重新測試,而非當作當前事實來轉述。
未改變的是證據的不對稱性。阿里巴巴的 GA 基準測試表相較於完全不公布確實是一項實質改進,但它仍是廠商的產物:實驗室自行選擇要報告哪些基準,而阿里巴巴自己最弱的一項報告數據——IFBench 82.8,指令遵循——恰好與預覽版抱怨模型過度交付、無視範圍限制的說法完全吻合。相比之下,Fable 5 是由與結果無利害關係的評估者評分的。對於「哪個模型能處理我無法承擔出錯的工作」這個問題,這種差異並非技術細節,而是選擇的全部依據。

開放性:Qwen 可能永久勝出的軸線
Fable 5 永遠無法自行託管。Qwen3.8-Max 或許可以,而阿里巴巴現在表示權重將在本週內釋出。但有兩項注意事項值得同等重視。
第一種情況是合法的:仍然沒有授權條款文字,也沒有模型卡。「開放權重即將推出」在尚未有可供閱讀的文件之前,並不構成商業權利的授予,而且最終是否能在產品中使用該釋出版本,將取決於授權條款的內容。
第二個是物理層面的限制。一個 2.4T 模型在 4-bit 量化下約需 1.2TB,而每張 H200 僅約 141GB——在服務第一個 token 之前,就需要八顆或更多頂級加速器。而且由於阿里巴巴仍未公開激活參數的數量,你甚至無法估算這筆開銷能換來多少吞吐量。對幾乎所有團隊來說,自行託管這款旗艦模型並非真正可行的選項。
這使得Qwen3.8-27B——與之同期發布、同樣開放權重,據稱可在約17GB的VRAM中運行——成為更具實際重要性的發布。如果你偏好Qwen而非Fable 5的原因是資料駐留或本地部署控制,而非原始效能,那麼27B才是真正實現這一點的模型。將2.4T旗艦與Fable 5在開放性上相比,多半是理論性的;而將27B在開放性上相比,則是具體的。
常見問題
Qwen 3.8 是否比 Claude Fable 5 更好?
不是基於現有的證據。阿里巴巴的 GA 基準測試表數據強勁(GPQA Diamond 92.6、Terminal-Bench 2.1 86.6),但每個數字都是自行申報的,沒有獨立評估機構對該模型進行過評分。Fable 5 持有經審計的約 60 智慧指數(#1)和 95.0% SWE-bench Verified。Fable 5 在證明方面領先;Qwen 3.8 在價格方面壓倒性領先。
“仅次于 Fable 5”的说法是真的吗?
这仍然是阿里自己的定位。GA带来了基准表,但没有第三方验证——Artificial Analysis和LMArena都仍然没有评分。作为参考,前代Qwen3.7-Max在AA智能指数上得了46分,而Fable 5约为60分,因此若要字面上成立,这一说法需要非常大的代际跃升。
Qwen 3.8 比 Fable 5 便宜多少?
基本上,現在這是實際價格而非折扣。Qwen3.8-Max 每 1M tokens 收費 $2 / $6,相比之下 Fable 5 為 $10 / $50——輸入約便宜 5 倍,輸出便宜 8 倍。Qwen 的費率在整個 1M 上下文範圍內也是統一的,而 $0.25/1M 的緩存輸入讓重複上下文的工作負載更加便宜。
Qwen 3.8 Max 是否已退出預覽?
是的。該模型已於2026年8月3日正式全面上市,並公布了定價表,且提供與OpenAI和DashScope相容的端點。7月間流傳的Qoder積分活動與90%折扣預覽宣傳,已不再反映該模型的實際銷售方式。
Qwen 3.8 仍然是最慢的模型嗎,如同早期評測所說的那樣?
該發現來自一位審查者,在預覽基礎設施上執行長達一小時的代理式建置,應針對正式發布(GA)服務重新測試,而非將其視為當前的事實。OrcaRouter 的 7 天遙測資料顯示,首次輸出 token 的時間(time-to-first-token)p50 為 1.64 秒,不過這衡量的是首次輸出延遲,而非長時間建置的吞吐量。
我可以自行架設 Qwen 3.8 而不是付費使用 Fable 5 嗎?
還沒有,而且可能不是旗艦型號。權重承諾在本週內發布,但仍未有許可證;而且在4位元下約1.2TB的規模,你需要八塊或更多H200級別的GPU。同時公布的Qwen3.8-27B,據稱約需17GB顯存,是現實可行的自托管路徑。Fable 5已永久關閉。
我今天該用哪一個?
Fable 5 適用於答案錯誤代價高昂、需要可稽核可靠性的工作——艱深推理、高風險的生產路徑。Qwen3.8-Max 適用於大量高產量的工作,其 8 倍輸出價格優勢能產生複利效應:批量程式碼審查、長文檔分析,以及任何可以容忍驗證的工作。許多團隊應同時運行這兩者,並依任務價值分流。
底線
Qwen 3.8 對比 Claude Fable 5與兩週前相比,這是一個本質上不同的比較。Qwen3.8-Max 不再是有優惠券的預覽版,而是正式上市的模型,其定價在輸入端比 Fable 5 便宜 5 倍、在輸出端便宜 8 倍,百萬 token 均一價,自報的數據看起來已具前沿水準,相較前代的程式編寫能力躍進,若能複現將令人矚目。
但 Fable 5 仍穩坐王位,而且理由與七月時完全相同:它是擁有裁判的一方。經審核的 #1 Intelligence Index 與 95.0% SWE-bench Verified,是別人查證過的說法。阿里巴巴的榜單無論多強,終究是阿里巴巴自己的。留意兩件事:Qwen3.8-Max 第一次獨立的 Intelligence Index 分數,以及附帶授權的權重正式發布。如果兩者都對 Qwen 有利,「僅次於 Fable 5」就不再只是行銷話術。在那之前,明智的作法不是選邊站,而是按風險分配——Fable 用在不能出錯的地方,Qwen 用在無法承擔昂貴成本的地方——並用你自己的提示詞同時測試兩者。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
