用於比較 GPT-6 與 Qwen 3.8 Max 的主視覺標題卡。標題寫著「GPT-6 vs Qwen 3.8 Max」。標籤寫著「Qwen3.8 Max:輸入文字 + 圖片 + 影片,1M 上下文,$2.00 / $6.00」。標籤寫著「GPT-6 Sol:輸入文字 + 圖片 + 檔案,1.05M 上下文,$2.00 / $10.00」。頁尾寫著「相同的輸入價格。不同的輸入,不同的輸出上限。」
Guides & Insights

GPT-6 對決 Qwen 3.8 Max:一個處理影片,一個寫得更長

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

GPT-6 Sol 與 Qwen3.8 Max收取相同的輸入費率——兩者都是每百萬個 token 2.00 美元——但隨後在兩個光看價格表不會浮現的軸線上分道揚鑣。 Qwen3.8 Max自 2026 年 8 月 3 日起以正式可用(GA)狀態提供,是兩者中唯一接受影片的模型:其輸入模態為文字、圖像與影片,而 GPT-6 Sol 接受的是文字、圖像與檔案。 GPT-6 Sol由廠商於 2026 年 9 月 22 日推出,是兩者中唯一公布輸出上限者——128,000 個 token——也是唯一背後有面向消費者介面的模型——即 10 月 7 日的 ChatGPT rollout,讓該模型呈現在超過 12 億每週使用者面前。

所以,分類的問題不在於哪個更強,而在於你的輸入是否為影片,以及你的輸出是否很長。

影片是第一個分支

多數模型比較最後都簡化為價格與基準測試,而這次比較有一個硬性的結構差異,使那些都變成次要因素。如果你的流程需要輸入影片——監控錄影、會議錄影、體育或講座素材、產品展示影片——Qwen3.8 Max 可以在請求中直接接收影片片段。它的規格卡將影片列為與文字、圖像並列的輸入模態,最高可達百萬 token 的視窗;對影片而言,這意味著影格取樣加上轉錄文字能在單次呼叫中完成,而不需要另設擷取階段。GPT-6 Sol 則不行。它的模態是文字、圖像與檔案;規格卡上沒有影片輸入,再多的提示工程也無法替代。

那一行決定了影片管線的候選名單,而它不會顯示在價目表上。這兩個模型真正能互換的地方在於文字與圖像工作,而下方價格與基準比較所適用的正是這一點。

關於影片這項說法,有一點必須誠實說明:模態本身有文件記載,但結構定義(schema)並沒有。兩家廠商的型錄條目都沒有明確寫出解析度、影格率或片段長度上限,所以「支援影片」只代表這種輸入類型存在,並不代表任何特定片段都會以你需要的品質被接收處理。在據此打造功能之前,請先用你自己的素材實測。

輸出側則朝反方向運轉。

把請求反過來看,優勢就逆轉了。GPT-6 公布每次回應的最大輸出為 128,000 個詞元。Qwen3.8 Max 的模型卡公布了上下文視窗,卻沒有最大輸出的數字,因此,以硬性輸出上限來編列預算的系統,無法從供應商的資料中直接讀出這個數字——同樣的缺口也出現在好幾家代管平台的模型卡上,值得把它當成未知,而非無限。

已公布的是輸出端的價格不對稱,而這與影片中的說法恰好相反。Qwen3.8 Max 每百萬輸出 token 收費 $6.00,而 GPT-6 Sol 為 $10.00——等於模型所寫的每一個 token 都享有 40% 的折扣。對於以輸出為主的工作負載,例如長篇生成或序列化大型結構化產物,以每單位工作量計算,Qwen3.8 Max 的成本實質上更低;而這一點在輸入價格相同的情況下依然成立。

另請注意,Qwen3.8 Max 的價格卡只列出單一輸入費率,並未記載任何長上下文分級,而 GPT-6 Sol 則在輸入超過 272,000 個 token 時,將整個請求重新計價為輸入 $4.00、輸出 $15.00。OpenAI 的模型頁面明確載明這項規則:超過該門檻的提示,整個請求的輸入與快取費率以 2 倍計,輸出則以 1.5 倍計。對於超過 272,000 個 token 的提示,GPT-6 Sol 的實際輸入費率翻倍至 $4.00,而 Qwen3.8 Max 仍維持在 $2.00——再次扭轉了表面上輸入價格並駕齊驅的局面。

獨立董事會怎麼說

Artificial Analysis 同時收錄這兩款模型,而在綜合指數中 GPT-6 Sol 領先,不過數項個別測試的結果卻相反。以下每一項數據都出自評測者,而非廠商。

• 智慧指數:GPT-6 Sol 47.6、Qwen3.8 Max 45.4 —— GPT-6 Sol 領先約兩分
• 程式指標:Qwen3.8 Max 76.2,排名前十;GPT-6 Sol 的程式表現與之相當,但 Qwen 的排名更強
• GPQA Diamond:Qwen3.8 Max 92.8%,GPT-6 Sol 的數值在同一測試系列中為兩者裡較高者
• Humanity's Last Exam:Qwen3.8 Max 43.1%、GPT-6 Sol 47.9%
• 長上下文召回:Qwen3.8 Max 80.3%、GPT-6 Sol 83.7%
• SciCode:Qwen3.8 Max 52.1%、GPT-6 Sol 57.6%
• 代理工具使用:Qwen3.8 Max 在 terminal-bench v2.1 上達 88.8%,在 tau-banking 上達 47.8%,兩者都相當強勁

這個模式是:GPT-6 Sol 在通用推理綜合項目以及科學與召回測試中勝出,而 Qwen3.8 Max 則是更銳利的程式撰寫與工具使用模型。有兩點但書,而且它們不是裝飾性的。第一,這些指數值是在不同日期評估的,因此兩次修訂之間的兩分差距,仍落在重新執行所產生的變動範圍內,並非已確定的差距。第二,Qwen3.8 Max 公布的分數,是評估者在阿里巴巴端點所服務的模型上執行的結果;此外,供應商也在 2026 年 9 月 2 日發布了標註日期的快照 Qwen3.8 Max (0902),費率同為 $2.00 / $6.00——如果你要固定採用某個快照,在引用分數之前,請先確認你呼叫的是哪一個。

Screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the Qwen Qwen3.8 Max card with a 1,000,000-token context window, text, image and video input, and a flat rate of $2.00 per million input tokens and $6.00 per million output tokens with a $0.25 cached-input rate.

OpenAI 10 月 7 日發布新增了哪些內容

ChatGPT 的發布是發布層面的事實,而非能力層面的事實,但它改變了讀者所說的「GPT-6」所指為何。2026 年 10 月 7 日,OpenAI 開始在 Intelligent UI 功能下將 GPT-6 逐步推送至 ChatGPT;Chat 分頁率先提供給 Plus、Pro、Business 與 Enterprise,Free 與 Go 則從 10 月 8 日起跟進;企業版可用性取決於工作場所管理員設定。驅動 Work 與 Codex 的模型則維持不變。

有兩個細節對這項比較至關重要。ChatGPT 體驗在付費消費者層級是由 GPT-6 Sol 驅動——因此十億多人所接觸到的 GPT-6,就是你透過 API 呼叫的同一個模型,而不是另一個獨立的檢查點。而且 GPT-6 是一個模型家族,不是單一模型:GPT-6 Astra 位於 Sol 之上,價格為 $10.00 / $50.00,而 GPT-6 Luna 位於其下,價格為 $0.10 / $0.50。當一項比較把「GPT-6」與 Qwen3.8 Max 相提並論,卻沒有說明是哪個層級時,通常預設是拿 Sol 來比較,而當它想提出最強論據時,則是拿 Astra 來比較。指明層級,就是公平比較與修辭式比較之間的差別。

成本,以形狀而非比率來衡量

由於輸入費率相同、輸出費率不同,勝出者完全取決於輸入 token 與輸出 token 的比例。若以各廠商公布的費率試算,且不計快取:

• 影片與逐字稿分析(500K 輸入、6K 輸出):Qwen3.8 Max ≈ $1.04,GPT-6 Sol 不適用——不支援影片輸入
• 文件分析(250K 輸入、5K 輸出):Qwen3.8 Max ≈ $0.53,GPT-6 Sol ≈ $0.55(在其 272K 門檻適用之前),而一旦整筆請求重新計價後則會更高
• 長篇生成(40K 輸入、80K 輸出):Qwen3.8 Max ≈ $0.56,GPT-6 Sol ≈ $0.88
• 平衡式代理迴圈(60K 輸入、20K 輸出):Qwen3.8 Max ≈ $0.24,GPT-6 Sol ≈ $0.32

結果的樣貌相當穩定:在相同的 token 組合下,Qwen3.8 Max 是較便宜的模型,因為輸入費率持平,而它的輸出費率較低。GPT-6 Sol 的反駁論點根本不在價格——而在於推理綜合指標、消費端驗證,以及一份有明確記載的輸出上限,讓預算規劃變得簡單明瞭。

有一個值得說明的營運注意事項,因為模型卡並沒有提到。根據 2026 年 10 月第一週在 OrcaRouter 的 playground 測量結果,Qwen3.8 Max 路由的首個 token 延遲中位數約為 5,809 毫秒,輸出速度大約每秒 50 個 token,錯誤率偏低;同一期間的 GPT-6 Sol 路由測得更高的輸送量,但錯誤率明顯更高。這些是共享路由的觀測結果,並非供應商 SLA,而且每週都會變動——這正是應該測量自家流量,而非信任任一模型卡的理由。

讓兩者都在同一組金鑰下執行

對於一邊有影片製作工作、另一邊是推理密集型工作的團隊來說,務實的答案是:兩款模型都不會全面勝出,兩者都該納入技術堆疊。這正是閘道器存在的意義。在 OrcaRouter 上,qwen/qwen3.8-max與 GPT-6 Sol 都是同一個型錄中的正式上線路由,置於單一 OpenAI 相容 API 之後,依供應商定價、零加成提供——因此阿里巴巴或 OpenAI 的價格調整當天就會反映到你身上,而不是等到下次對帳發票時,而且不必為每家供應商分別準備憑證或 SDK 路徑。

這裡有兩項功能各自發揮特定作用。自動容錯移轉能在某家供應商的路由劣化時讓管線持續運作,這點直接攸關重大,因為那兩條路由在同一個量測視窗中的表現差異極大。而路由 DSL 讓請求自行決定:將任何帶有影片輸入的內容送往 Qwen3.8 Max,將長脈絡推理工作送往 GPT-6 Sol,並讓以輸入模態與請求大小為基礎的述詞來做選擇,而不是用得在流量變化時手動更改的硬編碼模型 ID。

A four-row comparison card titled 'GPT-6 Sol vs Qwen3.8 Max'. Rows read 'Input modalities: text/image/file vs text/image/video'; 'Output ceiling: 128K published vs not published'; 'Input price: $2.00 both'; 'Output price: $10.00 vs $6.00'. A footer reads 'Figures per each vendor's published card; GPT-6 Sol reprices the whole request above 272K input tokens, Qwen3.8 Max lists no long-context tier.'

簡短版:如果你的輸入包含影片,Qwen3.8 Max 是兩者中唯一能接收影片的模型,而且一旦取得請求,它在每種 token 組合上都是更便宜的模型。如果你的工作是文字與圖像推理,且需要冗長、有界的輸出,以及經過驗證的消費級預設值,那麼 GPT-6 Sol 在綜合指數上是更強的一張牌,也是具有明文記載輸出上限的那一個。當你兩者都需要時,就進行路由——並讓請求的模態成為路由鍵,而不是發布週期。

Screenshot of the OrcaRouter model page for GPT-6 Sol, showing the OpenAI GPT-6 Sol card with a 1,050,000-token context window, 128,000 maximum output, text/image/file input, and the tiered rate of $2.00 per million input and $10.00 per million output up to 272,000 tokens, stepping to $4.00 and $15.00 above that.

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新