Qwen 3.8 vs GPT-5.6:既然兩者都已定價,誰更勝一籌?
Guides & Insights

Qwen 3.8 vs GPT-5.6:既然兩者都已定價,誰更勝一籌?

作者

jinhao song

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

當阿里巴巴預覽Qwen3.8-Max時(2026年7月19日於上海),社群反應立即湧現:這個擁有2.4兆參數的模型「據稱領先GPT-5.6,僅略遜於Fable 5。」OpenAI的GPT-5.6在其旗艦Sol配置下,在獨立的Artificial Analysis Intelligence Index中排名第二,僅比Fable 5低一分。因此,在沒有公布任何數據的情況下,這是一個相當大的宣稱。

自那以來,有兩件事已經改變。Qwen3.8-Max 於2026年8月3日正式全面推出,並附有真實的費率表與真實的基準測試表。而7月31日,OpenAI調降了GPT-5.6系列的價格——Terra降至$2 / $12,Luna降至$0.20 / $1.20,Sol則維持高階等級不變。因此,這場對決不再只是對抗排行榜的宣稱,而是兩個已定價、有文件記錄、確實可以相互比較的模型。

給開發者的一則提示——要驗證這類說法,最快的方式就是用你自己的提示詞同時跑兩者。OrcaRouter 在單一 OpenAI 相容端點背後提供 200 多個模型,讓你能在同一任務上讓 Qwen 3.8 Max 對上 GPT-5.6,而不必另外整合兩套 SDK。

TL;DR 結論。Qwen3.8-Max 在正式發布(GA)時定價極具侵略性——每 100 萬 token 收費 $2 / $6,於 100 萬 token 內價格均一——這使其輸入價格與 GPT-5.6 Terra 相同,但輸出成本僅為 Terra 的一半,也遠低於 Sol。其自行公布的數據表現強勁(GPQA Diamond 92.6、Terminal-Bench 2.1 86.6)。但 GPT-5.6 Sol 仍在決定生產應用的兩項關鍵上勝出:它是經審計認證的第 2 名(Artificial Analysis Intelligence Index 約 59),而且它速度極快——在 Cerebras 硬體上每秒可達 750 個 token。Qwen3.8-Max 至今仍未被任何獨立評測機構評分。因此 Qwen 在單次生成品質上確實可能與 GPT-5.6 匹敵,且在輸出價格上明顯勝過 Terra;但 GPT-5.6 在經獨立評審的實證與吞吐量上勝出,而吞吐量往往就是決勝關鍵。

關鍵要點

Qwen3.8-Max 自2026年8月3日起正式全面上市(GA),公布的定價為$2 / $6(每100萬個Token),且在完整的100萬Token上下文中維持相同價格。

對比 GPT-5.6 Terra(OpenAI 於 7 月 31 日降價後為 $2 / $12),Qwen 輸入價格持平,輸出價格則減半。 對比 Sol,Qwen 便宜得多。

GPT-5.6 Sol 在 AA 智能指數(約 59)中排名第二,且已通過稽核;Artificial Analysis 指出它在最困難的 STEM 問題上表現領先。Qwen3.8-Max 則尚未獲得評分,AA 與 LMArena 均未對其評測。

速度是最鮮明的對比。GPT-5.6 的速度最高可達每秒 750 tokens(在 Cerebras 上)。Qwen 在預覽版的實機測試中是最慢的模型——這項發現早於 GA 服務,需要重新測試。

Qwen 的供應商數據表可信但未經同行評審: GPQA Diamond 92.6、PaperBench 93.0、Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1、FrontierSWE 73.5(較前代的 40.7 有所提升)。

開放程度使它們徹底分化: Qwen 承諾本週內開放權重,並推出約 17GB VRAM 的 Qwen3.8-27B;GPT-5.6 則為封閉式且僅提供 API。

準確性說明:所有 Qwen3.8-Max 的品質數據皆由阿里巴巴自行報告,未經第三方驗證。GPT-5.6 的數據來自 Artificial Analysis,可能與 OpenAI 自身的報告有所差異。GPT-5.6 系列定價反映 OpenAI 於 2026 年 7 月 31 日實施的降價。Qwen 定價採用 GA 定價表,取代 7 月的預覽折扣。

規格與價格,並列呈現

以下是確切的數據,每一項數字皆註明其來源。

• 製造商 / 狀態 — Qwen3.8-Max:阿里巴巴; 正式發布(2026年8月3日);GPT-5.6 Sol:OpenAI;閉源旗艦(變體:Sol / Terra / Luna)

• 架構 — Qwen3.8-Max:總參數約 2.4T,稀疏 MoE(活躍參數仍未公開);GPT-5.6 Sol:封閉;架構未公開

• 上下文視窗 — Qwen3.8-Max:1M tokens(含思考為 983,616;最大輸出 131,072);GPT-5.6 Sol:長上下文旗艦

• AA Intelligence Index — Qwen3.8-Max:尚未評分;GPT-5.6 Sol:~59 — 第2名(Artificial Analysis)

• 經審計的優勢 — Qwen3.8-Max:無第三方審計;GPT-5.6 Sol:在最困難的STEM問題上領先 (Artificial Analysis)

• 供應商回報的優勢 — Qwen3.8-Max: GPQA Diamond 92.6、Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1(Alibaba 回報);GPT-5.6 Sol:n/a

• 速度 — Qwen3.8-Max:p50 TTFT 1.64秒(OrcaRouter 7天遙測);預覽實機測試中最慢的模型;GPT-5.6 Sol:在Cerebras上高達750 tok/s(Artificial Analysis)

• 定價(輸入/輸出)— Qwen3.8-Max:$2.00 / $6.00 每 1M,統一費率;快取輸入 $0.25;GPT-5.6:Terra $2 / $12Luna $0.20 / $1.20,Sol premium(約為 Fable 每 AA 成本的 1/3)

• 開放權重 — Qwen3.8-Max:承諾本週內釋出(尚未有授權);GPT-5.6:否 — 封閉/僅限 API

有兩件事為這次比較定下框架,而這兩件事都是七月以來才出現的。

首先,價格的故事真正變得有趣,而不僅僅是便宜。七月時,Qwen的優勢在於一個無法編入預算的折扣。如今,比較變得具體,並按等級區分。與Terra($2 / $12)相比,Qwen的輸入費率完全一致,輸出費率則減半——對於輸出主導花費的推理密集型工作而言,這是一項真正的優勢。與Luna($0.20 / $1.20)相比,Qwen貴了10倍,而Luna才是大量簡單任務的更好選擇。與Sol相比,Qwen便宜得多。所以「哪個更便宜」現在有三種不同的答案,取決於你指的是哪一個GPT-5.6——而誠實的說法是,OpenAI在7月31日的降價大幅縮小了差距。

其次,在速度這個項目上,兩者的分歧依然最大,而且仍然有利於 OpenAI。 Artificial Analysis 在 Cerebras 晶片上測得 GPT-5.6 Sol 的速度高達每秒 750 個 token。阿里巴巴的 GA 資料中沒有任何內容顯示 Qwen3.8-Max 是為了這種吞吐量而設計;預覽時期那位稱其為「他用過最慢模型」的評測者,所測量的正是吞吐量會層層放大的長時間代理型任務。如果你的工作負載是互動式、代理型或高流量的,這個差距在品質還沒進入討論之前,就可能已經決定了勝負。

證明:GA 基準表所能確定與無法確定之事

阿里巴巴在正式版(GA)公佈數字的決定,比起預覽版確實是一大改進;預覽版中社區宣稱「領先GPT-5.6」的說法,完全沒有建立在任何已發佈的內容上。這份成績表非常強勁:GPQA Diamond 92.6在研究生級科學方面,PaperBench 93.0在重現研究成果方面,Terminal-Bench 2.1 86.6在操作真實的 shell 方面,OSWorld-Verified 86.1在操作桌面 GUI 方面。最突出的亮點是跨世代的編程能力躍升——FrontierSWE 73.5相較於前代的 40.7,而DeepSWE 1.1 56.6相較於 21.6。

這張表格並未解決GPT-5.6的比較問題,原因有二。

首先是來源出處。每一項數據都是由阿里巴巴在自己的測試框架上產出的。廠商提供的數據表是挑選出來的,而非隨機抽樣——實驗室只發布表現亮眼的基準測試,其餘則略過不提。相較之下,OpenAI 在 Intelligence Index 中排名第二,則是由一位與結果無利害關係的評估者所評定。值得注意的是,Artificial Analysis 特別肯定 GPT-5.6 Sol 在最困難的STEM 問題中居於領先,而這正是 Qwen 的 GPQA Diamond 92.6 分數想要宣稱的領域。其中一項宣稱已經過查證。

第二點是,Alibaba自身最弱的一項數據很能說明問題。IFBench 82.8——即受約束下的指令遵循——是其表格中最低的分數,這恰好與預覽期間最一致的批評完全吻合:該模型過度輸出、超出範圍,並添加了沒人要求的東西。這在示範時很討喜,但當輸出按每百萬個token 6美元計費、且你需要精確格式時,代價就很高。對於下游步驟需要解析輸出內容的agentic管道而言,指令遵循的紀律比GPQA的一分更重要。

作為基準參照:前代 Qwen3.7-Max 得分為 46,於 AA Intelligence Index 上對照 GPT-5.6 Sol 的約 59 分。一代之間縮小 13 分差距將是非凡的飛躍。有可能——阿里巴巴自家的 FrontierSWE 效能近乎倍增,顯示了實質進展——但在有裁判公布數字之前,「超越 GPT-5.6」仍是未經證實的主張,而非結果。

實際成本:跨各層級的實例演算

設想一個推理代理,每次呼叫發送 100,000 個上下文 token,並生成 10,000 個輸出 token——這是文件分析或多步驟規劃中的典型形態。

Qwen3.8-Max: 0.1M × $2 = $0.20,加上 0.01M × $6 = $0.06。≈ 每次調用 $0.26。

GPT-5.6 Terra: 0.1M × $2 = $0.20,加上 0.01M × $12 = $0.12。≈ 每次呼叫 $0.32。

GPT-5.6 Luna: 0.1M × $0.20 = $0.02,加上 0.01M × $1.20 = $0.012。 ≈ $0.03 每次調用。

• 在每日5,000次呼叫時:Qwen ≈ $1,300,Terra ≈ $1,600,Luna ≈ $160

兩點教訓浮現。相較於 Terra,Qwen 的節省確實存在但幅度有限——在此配置下約為 19%——遠不及 Qwen 對比 Fable 5 或 Sol 等旗艦模型時所享有的數量級優勢。任何曾認為 OpenAI 結構性昂貴的人都應該更新認知:7 月 31 日的降價已大致完成削弱 Qwen 在中階市場的定價優勢。

Qwen 真正大幅領先的地方在於長上下文與快取。由於整個 1M token 視窗內的 $2/$6 費率是固定的,900,000 token 的提示詞每個 token 的費用與短提示詞相同,而許多競爭對手會對長輸入收取額外費用。此外,快取輸入的價格為每 1M $0.25,在重複上下文的任務中可將輸入端成本降低 8 倍:一旦上下文被快取,上述呼叫的費用會從 $0.26 降至約 $0.09。如果你的代理程式每一輪都會重新讀取大致穩定的上下文,持久優勢就在這裡——而不是在標題所示的費率上。

開放性與 27B 兄弟

GPT-5.6 永遠無法自行託管。Qwen3.8-Max 或許可以——阿里巴巴現在表示權重將於本週內釋出——但這款旗艦模型並非實際可行的目標:以 4-bit 量化約 1.2TB 的規模,對比每張 H200 約 141GB 的記憶體,意味著需要八張以上頂級加速卡;而由於活躍參數數量仍未公開,你甚至無法估算這樣的配置能帶來多少吞吐量。此外,目前仍無授權條款文字,這意味著商業使用的合法性在形式上仍未確定。

同時發布的 Qwen3.8-27B 對任何重視 Qwen 控制力而非原始效能的人來說,是更重要的版本。它也採用開放權重,據說僅需約 17GB 的 VRAM——也就是一張高階消費級顯示卡——使其成為真正的本地部署選項,而這是 2.4T 旗艦模型永遠無法提供的。如果你因為需要資料落地而在 Qwen 與 GPT-5.6 之間做權衡,那麼 27B 就是值得評估的模型。

常見問題

Qwen 3.8 是否比 GPT-5.6 更好?

就現有證據而言並非如此。阿里巴巴的 GA 榜單表現強勁(GPQA Diamond 92.6、Terminal-Bench 2.1 86.6),但完全屬於自我申報,且沒有獨立評估機構對該模型進行評分。GPT-5.6 Sol 在 Intelligence Index 上經審計排名第 2(約 59),根據 Artificial Analysis 在最具挑戰性的 STEM 問題上領先,且運行速度高達每秒 750 個 token。GPT-5.6 在實證與速度上勝出。

「Qwen 3.8 領先 GPT-5.6」的說法是否屬實?

它最初只是社群輿論,至今仍未經證實。正式發布時阿里巴巴拿出了自家的基準測試表,但沒有第三方評分——Artificial Analysis 和 LMArena 仍未有成績。前代 Qwen3.7-Max 得分 46,而 Sol 約為 59,因此這個說法要在字面上成立,需要一次極大的跨代飛躍。

哪個比較便宜,Qwen 3.8 還是 GPT-5.6?

這取決於等級,而答案在7月31日OpenAI降價時已經改變。Qwen3.8-Max 是每百萬 token $2 / $6。GPT-5.6 Terra 是 $2 / $12——輸入一樣,但輸出貴一倍,所以 Qwen 在這方面勝出。Luna 是 $0.20 / $1.20,比 Qwen 便宜約10倍。Sol 是高階產品,所以 Qwen 比 Sol 便宜得多。

哪個更快?

GPT-5.6 在吞吐量上表現決定性地領先。Artificial Analysis 報告指出在 Cerebras 硬體上可達每秒 750 tokens。Qwen3.8-Max 在 OrcaRouter 的 7 天遙測中顯示 p50 首 token 延遲為 1.64 秒,但預覽版時代的評測者發現它在長時間的代理式建置中非常緩慢——該發現早於 GA 服務,值得重新測試。

Qwen 3.8 Max 是否已退出預覽?

是的,2026年8月3日。它現在已發布費率表,並提供與OpenAI及DashScope相容的端點,因此7月時以90%折扣推出Qoder積分活動的框架,已不再符合目前的銷售方式。

我可以自行託管 Qwen 3.8 來避免 OpenAI 的定價嗎?

說實話,這稱不上旗艦。權重承諾會在一週內發布,但尚未公布任何授權,而且以4位元約1.2TB的容量來看,你需要八顆或更多H200等級的GPU才能運作。同時發布的Qwen3.8-27B,據報只需約17GB的VRAM,才是實際可行的選擇。

我今天該用哪一個?

GPT-5.6 Sol適用於任何對延遲敏感、互動性或推理要求嚴謹,且需要經審核品質的場景。Luna適用於大量簡單任務,在成本上遙遙領先。Qwen3.8-Max則在長上下文和提示詞快取主導您帳單時表現最佳——其平價的1M token費率和$0.25的快取輸入是其方案中最具競爭力的部分。

底線

Qwen 3.8 對比 GPT-5.6是一場比七月時更公平的對決,價格上的差距也比 Qwen 粉絲預期的要小些。Qwen3.8-Max 在正式發布(GA)時帶來了實際定價、可信的自報基準測試表,以及固定的 100 萬 token 費率與低廉的快取價格,使其在長上下文工作上確實相當吸引人。這些是結構性優勢,而非促銷性優勢。

但OpenAI在7月31日的降價削弱了中階級距的成本論點——Terra現在的輸入價格已與Qwen持平——而GPT-5.6仍保有兩項決定性特性:來自與結果無利害關係的評測者所認證的第二名排名,以及高達每秒750 tokens的吞吐量,Qwen至今未顯示任何接近的證據。請關注兩件事:Qwen3.8-Max首次獨立的Intelligence Index評分,以及模型權重伴隨授權釋出。在那之前,依需求型態來選擇——當速度與實證重要時選GPT-5.6,當上下文長度與快取命中主導費用時選Qwen——並在你自己的提示詞上進行驗證。

本文中的比較4

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube