
GPT-6 Sol 對決 Qwen3.8-Max:封閉模型無法匹敵的那一行
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
幾乎每一項GPT-6 Sol 與 Qwen3.8-Max 之間的比較,最終都會取決於成本,而幾乎每一項比較都會朝同一個方向把成本算錯。Qwen3.8-Max 是該廠商的託管旗艦模型,自 2026 年 8 月 3 日正式推出以來,定價一直是每百萬輸入 token 2.00 美元、每百萬輸出 token 6.00 美元;而帶日期的Qwen3.8-Max-0902 快照則於 9 月 2 日上線。GPT-6 Sol 於 2026 年 9 月 22 日正式推出,價格為輸入 2.00 美元、輸出 10.00 美元。輸入價格完全相同,而且在 Qwen3.8-Max 的價目表上,輸出還便宜 40%——然而在獨立測試框架上,完成一項任務的成本卻大約是五倍。
但還有第二個更明確的差異,被成本論述不斷掩蓋,而正是這個差異真正決定了某些工作負載。Qwen3.8-Max 接受影片。GPT-6 Sol 則不支援。這不是價格項目或基準測試項目;這是其中一個模型具備、而另一個無法企及的能力,也是這場對決中唯一無論投入多少 token 效率優化都無法解決的部分。

兩款旗艦,兩種不同形態
Qwen3.8-Max 是一個擁有 2.4 兆參數的稀疏混合專家模型,每次查詢約有 950 億個參數處於啟用狀態——是僅次於 Kimi K3、第二大的正式上線託管模型。其上下文視窗為一百萬個 token,輸出上限為 131,072 個 token;輸入模態包括文字、圖像與影片,並支援低、中、超高共三種推理強度,以及結構化輸出與工具呼叫。這款託管旗艦版本並非開放權重;同一世代的可下載成品屬於另一個獨立發布版本,有其自身的限制。
GPT-6 Sol 是文字與圖像輸入、文字輸出。其視窗為 1,050,000 個 token,最大輸入為 922,000 個 token,輸出上限為 128,000 個 token,定價為固定 2.00 美元與 10.00 美元,快取讀取為 0.20 美元、快取寫入為 2.50 美元,而當輸入超過 272,000 個 token 時,整筆請求會重新定價為 4.00 美元與 15.00 美元。它是封閉的、單一識別碼,而 OpenAI 已將這些費率描述為永久性而非促銷性。
各視窗數字彼此相差約 7% 以內,輸出上限也落在同一區間。模態清單是唯一的結構性落差——而且是單向的。
逐行
• 輸入 — GPT-6 Sol 每百萬個 token 2.00 美元,對比 Qwen3.8-Max 每百萬個 token 2.00 美元;主要數字完全相同
• 產出 — GPT-6 Sol 每百萬個 token $10.00 美元,對比 Qwen3.8-Max 每百萬個 token $6.00 美元;阿里巴巴的價格低 40%
• 快取輸入 — GPT-6 Sol 每百萬個 token $0.20,而 Qwen3.8-Max 每百萬個 token $0.25(隱式快取讀取),顯式快取讀取為 $0.17,顯式快取寫入為 $2.50
• 上下文視窗 — GPT-6 Sol 1,050,000 詞元 vs Qwen3.8-Max 1,000,000 詞元
• 最大輸出 — GPT-6 Sol 128,000 tokens,對比 Qwen3.8-Max 131,072 tokens
• 輸入模態 — GPT-6 Sol 的文字與圖像 vs Qwen3.8-Max 的文字、圖像與影片
• 長上下文處理 — GPT-6 Sol 對超過 272,000 個輸入 token 的整個請求重新計價,輸入與快取費率為 2 倍、輸出為 1.5 倍;相較之下,Qwen3.8-Max 在整個上下文視窗內採單一固定費率,這是 Qwen 費率表在結構上更優、而不只是略為便宜的唯一之處
• 推理強度 — GPT-6 Sol 無、低、中(預設)、高、極高、最高 vs Qwen3.8-Max 低、中與超高
• 知識截止日期 — GPT-6 Sol 2026 年 4 月 20 日 vs Qwen3.8-Max 未以單一日期公布
• 帶日期標記的快照 — GPT-6 Sol 為單一滾動式識別碼,對比 Qwen3.8-Max-0902 以固定為 2026 年 9 月 2 日的修訂版提供,且價格相同
長上下文這條路線值得比平常獲得更多關注。GPT-6 Sol 的附加費是套用於整個請求的級距,因此一次 900,000 token 的代理程式執行,每個 token 都會以 $4.00 和 $15.00 計費。Qwen3.8-Max 則在整個視窗內只收取單一級距的費用。對於長期運行在 272,000 token 以上的工作負載,這兩張價目表根本無法相提並論——標題上看起來較便宜的模型,實際上貴得多,而差距的方向完全取決於你的上下文落在哪裡。

價目表上說便宜 40%。框架卻說帳單是五倍。
Artificial Analysis 測得 Qwen3.8-Max-0902 的 Intelligence Index 分數為 45,每完成一項 index 任務花費 $5.41,並在整次運行中產生了 1.9 億個輸出 token。其摘要形容該模型「明顯緩慢且極為冗長」。GPT-6 Sol 則以每項任務 $1.06、7,700 萬個輸出 token 的表現獲得 48 分。
把這三組配對放在一起看,對決的輪廓就浮現了。Qwen 落後三個指數點,產生了兩倍半的 token,而且每完成一項任務的成本約高出五倍——還是在其輸出便宜 40% 的價目表上。箇中機制並不微妙。以每百萬輸出 token 6.00 美元計算,1.9 億 token 在每次索引執行中光是輸出就花費 1.14 美元,還沒計入輸入;以每百萬 10.00 美元計算,Sol 的 7,700 萬 token 花費 0.77 美元。較便宜的費率買到的是更多 token,而不是更小的帳單。
這是九月這一批模型普遍可見的相同模式,而它值得被當成一條通則來陳述,而不是只當成這兩個模型的事實:在按 token 計價的價目表上,如果模型輸出的 token 數是兩倍半,那麼輸出打 40% 折扣就毫無價值。每完成一項任務的成本,才是唯一站得住腳的數字。
Alibaba 發布了什麼,以及設定努力程度的問題
阿里巴巴自家的基準測試表是這項比較中最長、也最不具可比性的一份。廠商自行報告的數據顯示,Qwen3.8-Max 在 PaperBench 與 IFBench 上領先,卻在 SWE-bench Pro 與 Humanity's Last Exam 上落後;其推理努力程度量表——低、中、極高——與 OpenAI 的六級量表並無直接對應關係。以極高設定公布的成績,與以中等設定公布的成績並不是同一回事;而且在比較圖表上,兩家廠商都沒有標明某個數字是由哪一級設定產生的。
這就是這裡不該倚賴任一廠商數據表的誠實原因。Alibaba 的數字是在 Alibaba 的測試框架、以 Alibaba 的投入設定下跑出來的;OpenAI 的數字則是在 OpenAI 的環境下跑出來的。Artificial Analysis 的數據之所以存在,正是因為上述兩者都無法用於直接對比,而上面採用的正是它們的數字。
可重現性是一項真正的功能,而它的價格是零
帶日期的快照是這項比較中最被低估的一點。Qwen3.8-Max-0902 是釘選於 2026 年 9 月 2 日的修訂版,阿里云表示它具備與基礎模型相同的能力與定價。將其釘選意味著,你端點背後的模型不會從週二到週四就在你腳下悄悄改變。
GPT-6 Sol 沒有對應版本。它是單一的滾動式識別碼——同一個模型頁面只帶有一個預設快照,沒有標註日期的變體——這意味著你九月做基準測試的對象,不保證會是你十一月呼叫的對象。對大多數團隊來說,這沒問題。但對受監管、必須證明某項輸出是由什麼產生的管線而言,這是實實在在的差異;而這正是 Alibaba 免費提供、OpenAI 卻完全不提供的東西。
視訊線才是決定性的那一條。
以上全部都是比較。這部分不是。如果你的輸入包含影片——螢幕錄影、檢測錄像、課堂錄製,任何資訊存在於動態之中而非靜止畫面裡的內容——Qwen3.8-Max 原生就能接受,而 GPT-6 Sol 完全沒有途徑處理。你無法靠提示詞繞過模態的限制。你也無法把影片預先處理成影像,然後得到同樣的東西,因為時間資訊正是重點所在,而文字基準測試上再多的索引分數,都取代不了你的任務實際所需的輸入。
反向情況也值得一提,因為這正是比較不再一面倒的地方。若你的輸入是文字與圖像,Sol 每項任務更便宜,在中立排行榜上領先四分,快取讀取也更便宜。影片能力並不是對你有利的決勝因素;它只是單純未被使用。
路由一個具有兩個獨立答案的決策

這是一個真正適合採用兩個模型、而非單一模型的架構對決,原因在於拆分依據是輸入模態,而不是難度。一條會接收影片並對文字進行推理的管線,兩者都需要,而路由規則是請求本身的屬性,不是需要主觀判斷的決定。
Qwen3.8-Max 已收錄在 OrcaRouter 的產品目錄中——帶有日期標記的 qwen/qwen3.8-max-0902 快照可供路由,在直通模式下採用阿里巴巴的標價,這意味著阿里巴巴的價格調整當天就會在我們這邊生效,而不必等到經銷商重新議價之後。截至本文撰寫時,GPT-6 Sol 尚未列入我們的目錄,只能透過 OpenAI 自家的 API 存取。路由 DSL 正是切合這個特定情境的那一塊:把帶有影片的請求導向一邊、其餘全部導向另一邊的規則,正是它存在的目的,而自動容錯移轉則意味著模態分支不會成為單點故障。
各自勝出之處
• 影片進、文字出 — Qwen3.8-Max,無須多言,勝負已分。
• 輸入文字與圖像,以每完成一項任務的成本作為指標——GPT-6 Sol,在獨立測試框架上約為五倍。
• 快取前綴作業 — GPT-6 Sol。其快取讀取的費用略低,且其 token 用量不到一半。
• 輸入 token 超過 272,000 的請求 — Qwen3.8-Max。Sol 的整筆請求重新計價是這項比較中最大的單一成本差異,而它在表面費率上完全看不出來。
• 可重現的版本鎖定 — Qwen3.8-Max-0902,無需額外費用,且是兩者中唯一鎖定的修訂版本。
• 如果有人給你看一張圖表,顯示 Qwen 在 SWE-bench Pro 上領先——先查清楚這是誰的測試框架跑出來的,以及是在哪個努力設定下。獨立排行榜在綜合指標上顯示 Qwen 落後三分,而且各家廠商的表格彼此並不在同一個尺度上。
本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
