文章的主視覺標題卡,用於比較 GPT-6 Sol 與 Qwen3.8-Max,標題為「GPT-6 Sol vs Qwen3.8-Max」,副標為「封閉模型唯一無法競爭的那一項」,圖中顯示 GPT-6 Sol 支援文字與圖像輸入,Qwen3.8-Max 則支援文字、圖像與影片輸入。
Guides & Insights

GPT-6 Sol 對決 Qwen3.8-Max:封閉模型無法匹敵的那一行

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

幾乎每一項GPT-6 SolQwen3.8-Max 之間的比較,最終都會取決於成本,而幾乎每一項比較都會朝同一個方向把成本算錯。Qwen3.8-Max 是該廠商的託管旗艦模型,自 2026 年 8 月 3 日正式推出以來,定價一直是每百萬輸入 token 2.00 美元、每百萬輸出 token 6.00 美元;而帶日期的Qwen3.8-Max-0902 快照則於 9 月 2 日上線。GPT-6 Sol 於 2026 年 9 月 22 日正式推出,價格為輸入 2.00 美元、輸出 10.00 美元。輸入價格完全相同,而且在 Qwen3.8-Max 的價目表上,輸出還便宜 40%——然而在獨立測試框架上,完成一項任務的成本卻大約是五倍。

但還有第二個更明確的差異,被成本論述不斷掩蓋,而正是這個差異真正決定了某些工作負載。Qwen3.8-Max 接受影片。GPT-6 Sol 則不支援。這不是價格項目或基準測試項目;這是其中一個模型具備、而另一個無法企及的能力,也是這場對決中唯一無論投入多少 token 效率優化都無法解決的部分。

A six-row scoreboard card titled 'GPT-6 Sol vs Qwen3.8-Max - the scoreboard', comparing the two models on output price, Intelligence Index, cost per task, input modality, maximum output and long-context handling. The left column lists GPT-6 Sol at $10.00 output, an Index of 48, $1.06 per task, text and image input, a 128,000-token maximum output and whole-request repricing above 272K; the right column lists Qwen3.8-Max at $6.00 output, an Index of 45, $5.41 per task, text, image and video input, a 131,072-token maximum output and a flat tier above 272K. A footer reads 'Vendor list rates; Index per Artificial Analysis.'

兩款旗艦,兩種不同形態

Qwen3.8-Max 是一個擁有 2.4 兆參數的稀疏混合專家模型,每次查詢約有 950 億個參數處於啟用狀態——是僅次於 Kimi K3、第二大的正式上線託管模型。其上下文視窗為一百萬個 token,輸出上限為 131,072 個 token;輸入模態包括文字、圖像與影片,並支援低、中、超高共三種推理強度,以及結構化輸出與工具呼叫。這款託管旗艦版本並非開放權重;同一世代的可下載成品屬於另一個獨立發布版本,有其自身的限制。

GPT-6 Sol 是文字與圖像輸入、文字輸出。其視窗為 1,050,000 個 token,最大輸入為 922,000 個 token,輸出上限為 128,000 個 token,定價為固定 2.00 美元與 10.00 美元,快取讀取為 0.20 美元、快取寫入為 2.50 美元,而當輸入超過 272,000 個 token 時,整筆請求會重新定價為 4.00 美元與 15.00 美元。它是封閉的、單一識別碼,而 OpenAI 已將這些費率描述為永久性而非促銷性。

各視窗數字彼此相差約 7% 以內,輸出上限也落在同一區間。模態清單是唯一的結構性落差——而且是單向的。

逐行

• 輸入 — GPT-6 Sol 每百萬個 token 2.00 美元,對比 Qwen3.8-Max 每百萬個 token 2.00 美元;主要數字完全相同

• 產出 — GPT-6 Sol 每百萬個 token $10.00 美元,對比 Qwen3.8-Max 每百萬個 token $6.00 美元;阿里巴巴的價格低 40%

• 快取輸入 — GPT-6 Sol 每百萬個 token $0.20,而 Qwen3.8-Max 每百萬個 token $0.25(隱式快取讀取),顯式快取讀取為 $0.17,顯式快取寫入為 $2.50

• 上下文視窗 — GPT-6 Sol 1,050,000 詞元 vs Qwen3.8-Max 1,000,000 詞元

• 最大輸出 — GPT-6 Sol 128,000 tokens,對比 Qwen3.8-Max 131,072 tokens

• 輸入模態 — GPT-6 Sol 的文字與圖像 vs Qwen3.8-Max 的文字、圖像與影片

• 長上下文處理 — GPT-6 Sol 對超過 272,000 個輸入 token 的整個請求重新計價,輸入與快取費率為 2 倍、輸出為 1.5 倍;相較之下,Qwen3.8-Max 在整個上下文視窗內採單一固定費率,這是 Qwen 費率表在結構上更優、而不只是略為便宜的唯一之處

• 推理強度 — GPT-6 Sol 無、低、中(預設)、高、極高、最高 vs Qwen3.8-Max 低、中與超高

• 知識截止日期 — GPT-6 Sol 2026 年 4 月 20 日 vs Qwen3.8-Max 未以單一日期公布

• 帶日期標記的快照 — GPT-6 Sol 為單一滾動式識別碼,對比 Qwen3.8-Max-0902 以固定為 2026 年 9 月 2 日的修訂版提供,且價格相同

長上下文這條路線值得比平常獲得更多關注。GPT-6 Sol 的附加費是套用於整個請求的級距,因此一次 900,000 token 的代理程式執行,每個 token 都會以 $4.00 和 $15.00 計費。Qwen3.8-Max 則在整個視窗內只收取單一級距的費用。對於長期運行在 272,000 token 以上的工作負載,這兩張價目表根本無法相提並論——標題上看起來較便宜的模型,實際上貴得多,而差距的方向完全取決於你的上下文落在哪裡。

Screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured 23 September 2026, showing an Intelligence Index score of 45, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a cost of $5.41 per Intelligence Index task, 190 million output tokens generated during the index run, a 984,000-token context window and 39.2 output tokens per second.

價目表上說便宜 40%。框架卻說帳單是五倍。

Artificial Analysis 測得 Qwen3.8-Max-0902 的 Intelligence Index 分數為 45,每完成一項 index 任務花費 $5.41,並在整次運行中產生了 1.9 億個輸出 token。其摘要形容該模型「明顯緩慢且極為冗長」。GPT-6 Sol 則以每項任務 $1.06、7,700 萬個輸出 token 的表現獲得 48 分。

把這三組配對放在一起看,對決的輪廓就浮現了。Qwen 落後三個指數點,產生了兩倍半的 token,而且每完成一項任務的成本約高出五倍——還是在其輸出便宜 40% 的價目表上。箇中機制並不微妙。以每百萬輸出 token 6.00 美元計算,1.9 億 token 在每次索引執行中光是輸出就花費 1.14 美元,還沒計入輸入;以每百萬 10.00 美元計算,Sol 的 7,700 萬 token 花費 0.77 美元。較便宜的費率買到的是更多 token,而不是更小的帳單。

這是九月這一批模型普遍可見的相同模式,而它值得被當成一條通則來陳述,而不是只當成這兩個模型的事實:在按 token 計價的價目表上,如果模型輸出的 token 數是兩倍半,那麼輸出打 40% 折扣就毫無價值。每完成一項任務的成本,才是唯一站得住腳的數字。

Alibaba 發布了什麼,以及設定努力程度的問題

阿里巴巴自家的基準測試表是這項比較中最長、也最不具可比性的一份。廠商自行報告的數據顯示,Qwen3.8-Max 在 PaperBench 與 IFBench 上領先,卻在 SWE-bench Pro 與 Humanity's Last Exam 上落後;其推理努力程度量表——低、中、極高——與 OpenAI 的六級量表並無直接對應關係。以極高設定公布的成績,與以中等設定公布的成績並不是同一回事;而且在比較圖表上,兩家廠商都沒有標明某個數字是由哪一級設定產生的。

這就是這裡不該倚賴任一廠商數據表的誠實原因。Alibaba 的數字是在 Alibaba 的測試框架、以 Alibaba 的投入設定下跑出來的;OpenAI 的數字則是在 OpenAI 的環境下跑出來的。Artificial Analysis 的數據之所以存在,正是因為上述兩者都無法用於直接對比,而上面採用的正是它們的數字。

可重現性是一項真正的功能,而它的價格是零

帶日期的快照是這項比較中最被低估的一點。Qwen3.8-Max-0902 是釘選於 2026 年 9 月 2 日的修訂版,阿里云表示它具備與基礎模型相同的能力與定價。將其釘選意味著,你端點背後的模型不會從週二到週四就在你腳下悄悄改變。

GPT-6 Sol 沒有對應版本。它是單一的滾動式識別碼——同一個模型頁面只帶有一個預設快照,沒有標註日期的變體——這意味著你九月做基準測試的對象,不保證會是你十一月呼叫的對象。對大多數團隊來說,這沒問題。但對受監管、必須證明某項輸出是由什麼產生的管線而言,這是實實在在的差異;而這正是 Alibaba 免費提供、OpenAI 卻完全不提供的東西。

視訊線才是決定性的那一條。

以上全部都是比較。這部分不是。如果你的輸入包含影片——螢幕錄影、檢測錄像、課堂錄製,任何資訊存在於動態之中而非靜止畫面裡的內容——Qwen3.8-Max 原生就能接受,而 GPT-6 Sol 完全沒有途徑處理。你無法靠提示詞繞過模態的限制。你也無法把影片預先處理成影像,然後得到同樣的東西,因為時間資訊正是重點所在,而文字基準測試上再多的索引分數,都取代不了你的任務實際所需的輸入。

反向情況也值得一提,因為這正是比較不再一面倒的地方。若你的輸入是文字與圖像,Sol 每項任務更便宜,在中立排行榜上領先四分,快取讀取也更便宜。影片能力並不是對你有利的決勝因素;它只是單純未被使用。

路由一個具有兩個獨立答案的決策

Screenshot of OrcaRouter's model page for Qwen3.8 Max (0902), captured 23 September 2026, showing the model id qwen/qwen3.8-max-0902 from provider Qwen, a 1M-token context window with a 131k-token maximum output, text, image and video input with text output, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, and a p50 time to first token of 3.50 seconds.

這是一個真正適合採用兩個模型、而非單一模型的架構對決,原因在於拆分依據是輸入模態,而不是難度。一條會接收影片並對文字進行推理的管線,兩者都需要,而路由規則是請求本身的屬性,不是需要主觀判斷的決定。

Qwen3.8-Max 已收錄在 OrcaRouter 的產品目錄中——帶有日期標記的 qwen/qwen3.8-max-0902 快照可供路由,在直通模式下採用阿里巴巴的標價,這意味著阿里巴巴的價格調整當天就會在我們這邊生效,而不必等到經銷商重新議價之後。截至本文撰寫時,GPT-6 Sol 尚未列入我們的目錄,只能透過 OpenAI 自家的 API 存取。路由 DSL 正是切合這個特定情境的那一塊:把帶有影片的請求導向一邊、其餘全部導向另一邊的規則,正是它存在的目的,而自動容錯移轉則意味著模態分支不會成為單點故障。

各自勝出之處

• 影片進、文字出 — Qwen3.8-Max,無須多言,勝負已分。

• 輸入文字與圖像,以每完成一項任務的成本作為指標——GPT-6 Sol,在獨立測試框架上約為五倍。

• 快取前綴作業 — GPT-6 Sol。其快取讀取的費用略低,且其 token 用量不到一半。

• 輸入 token 超過 272,000 的請求 — Qwen3.8-Max。Sol 的整筆請求重新計價是這項比較中最大的單一成本差異,而它在表面費率上完全看不出來。

• 可重現的版本鎖定 — Qwen3.8-Max-0902,無需額外費用,且是兩者中唯一鎖定的修訂版本。

• 如果有人給你看一張圖表,顯示 Qwen 在 SWE-bench Pro 上領先——先查清楚這是誰的測試框架跑出來的,以及是在哪個努力設定下。獨立排行榜在綜合指標上顯示 Qwen 落後三分,而且各家廠商的表格彼此並不在同一個尺度上。

本文中的比較3

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新