
GPT-6 對決 DeepSeek V4 Pro:一個可以向任何人租用,一個可以帶回家
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
有一件事是 DeepSeek V4 Pro 能做、而 GPT-6 Sol 做不到的:把它帶回家。DeepSeek V4 Pro 是一款以 MIT 授權釋出的混合專家旗艦模型——總參數量 1.6 兆,每 token 啟用 490 億——於 2026 年 8 月 13 日發布,而且權重檢查點可供下載。GPT-6 Sol 則是封閉權重,由 OpenAI 於 2026 年 9 月 22 日推出,而截至 2026 年 10 月 7 日,它也是 ChatGPT 全球推行方案中、支撐付費方案層級的那個模型,該方案涵蓋每週超過 12 億名使用者。
這個比較中,其餘的一切都取決於你看的是哪一把尺。在價目表上,兩者相差四倍。就獨立測試套件產出一個完成答案的實際成本而言,兩者相差 1.55 倍。在 Intelligence Index 上,這些列看起來相差十六點,而根據評估者自己記錄的方法論,這些點數根本不能相減。釐清這三個數字中哪一個應該主導決策,就是全部的工作,而答案會因你是在挑選供應商還是在挑選檔案而有所不同。
每個模型是什麼,各用一段文字說明
GPT-6 Sol 是 OpenAI GPT-6 系列中的中階層級——位於旗艦款 GPT-6 Astra 之下、平價款 GPT-6 Luna 之上——具備 1,050,000 個 token 的上下文視窗、128,000 個 token 的輸出上限,支援文字、圖像與檔案輸入、原生工具呼叫、結構化輸出,以及可從 low 到 max 共五個等級選擇的推理強度。它是 OpenAI 將 ChatGPT Plus、Pro、Business 與 Enterprise 導向的層級,定價為每百萬輸入 token 2.00 美元、每百萬輸出 token 10.00 美元,並設有長上下文層級:一旦提示超過 272,000 個輸入 token,整筆請求將重新計價為 4.00 美元與 15.00 美元。
DeepSeek V4 Pro 是一款純文字的旗艦模型,具備 1,048,576 個詞元(token)的上下文視窗,以及最高 384,000 個詞元的輸出上限——是 GPT-6 Sol 上限的三倍——而且不論價格高低都不支援視覺功能。DeepSeek 自家的 API 文件將其列為高峰時段每百萬輸入詞元 0.66 美元、每百萬輸出詞元 1.98 美元,離峰時段減半為 0.33 美元與 0.99 美元,快取命中在離峰時段則為 0.022 美元。高峰時段為 UTC 週一至週五的 01:00–04:00 與 06:00–10:00;其餘時段,包括週末與中國國定假日,皆屬離峰時段。
那三個儀表
先從最常被引用的那一個開始,因為它正是最常被脫離脈絡引用的那一個。Artificial Analysis 在 Intelligence Index v4.3.2 上,給 DeepSeek V4 Pro 36.0 分、GPT-6 Sol 47.6 分。十一點五分,是那種足以終結比較的差距。
它不應該,而評估者自己也這麼說。Artificial Analysis 只把開放權重模型拿來和同尺寸級別的其他開放權重模型相比,界線訂在 1,500 億個參數;至於專有模型,則是在混合 3:1 輸入輸出比的條件下,於同一價格帶內互相比較。那是兩個不同的同儕群體,產生兩套不同的量表。同一個表格裡相鄰列上的 36 和 47.6 並不是正面對決,而誠實的做法是把這件事說出來,而不是把一個從另一個減掉,然後稱之為能力。

那兩個可互相比較的儀表,說明了更有用的訊息:
• 以 3:1 混合計價——GPT-6 Sol 每 100 萬個 token 為 4.00 美元,對比 DeepSeek V4 Pro 在尖峰費率為 0.99 美元,離峰為 0.50 美元;視執行時機而定,價差達 4 倍至 8 倍
• 每項完成索引任務的成本——GPT-6 Sol 1.04 美元,對比 DeepSeek V4 Pro 0.67 美元;價差 1.55 倍
• 整個套件所產生的輸出 token 數——GPT-6 Sol 7,680 萬,對比 DeepSeek V4 Pro 1.629 億,因此較便宜的模型為了完成相同工作,輸出量是 2.1 倍
• 最大輸出——DeepSeek V4 Pro 384,000 個 token,對比 GPT-6 Sol 128,000;上限為 3 倍
• 多模態輸入——GPT-6 Sol 接受文字、圖像與檔案,對比 DeepSeek V4 Pro 僅限文字
• 權重——DeepSeek V4 Pro 採用 MIT 授權且可下載,對比 GPT-6 Sol 為閉源

第四行與第五行說明了第二行。在實際工作中,4× 的頭條差距縮小到 1.55×,這正是當較便宜的模型同時也是更囉嗦的模型時會發生的情況:在同一組評估資料上,DeepSeek V4 Pro 產出的輸出 token 數是 GPT-6 Sol 的 2.1 倍。囉嗦程度是一種永遠不會出現在價格頁面上的成本乘數,而在這場對決中,它是最常被忽略的數字。
開放模型真正勝出之處
兩個地方,而且兩者都是結構性的,而非邊緣性的。
輸出上限是第一點。384,000 個 token 對上 128,000 個,是 three-fold 的差距,而這決定了整類工作能否進行:在一次呼叫中生成大型結構化產物、不串接就寫出長篇文件、把大規模重構當作單一回應產生。GPT-6 Sol 無論出多少錢都做不到這些,因為這項限制不是計費層級——而是模型本身的上限。
代理式工具使用是第二項,就某一項特定測量而言。DeepSeek V4 Pro 在 τ²-Bench 這個代理式工具使用評估上得分 96.2%,而這正是 DeepSeek 在自己的模型卡上主打的分數。這也是該模型的 OrcaRouter 型錄條目所重複引用的數字,也就是我們自家讀者會遇到的說法版本。GPT-6 Sol 可相比的 τ²-Bench 數字並未公布在同一張榜單上,因此請把這項比較視為僅具方向性:在 DeepSeek 選擇主打的那一項基準測試上,開放模型位居該領域之首,而封閉模型尚未在同一欄中提出數字。
還有關於所有權的那一點,那根本不是什麼基準測試。一個可下載的 MIT 檢查點意味著你可以在自己的硬體上執行模型,讓請求不經過任何人的網路,對它進行微調,鎖定某個版本,並且知道三年後它依然會在那裡。沒有供應商能將它淘汰、重新定價,或把它從價目表中移除。對某一類買家——受監管的產業、任何有資料駐留限制的人、任何曾被模型退役坑過的人——這比十一點指數還更有價值。
GPT-6 Sol 勝出之處,而且不只是那個指數
Terminal-Bench 4.0 是 DeepSeek V4 Pro 規格表上最不體面的一行:14.1%,對比 GPT-6 Sol 的 43.9%。這不是四捨五入的誤差,而是指向一個真實的樣貌——這個開放模型擅長多輪工具編排,卻在現代編碼代理賴以維運的長時程終端機工作上表現疲弱。如果你的工作負載是一個必須讓 shell 工作階段維持二十分鐘不中斷的代理,那麼這項單一評測,比綜合指數更能預測你的實際體驗。
多模態是第二點。DeepSeek V4 Pro 是文字進、文字出。GPT-6 Sol 能接收圖片與檔案,而這不是一個功能勾選項——文件量龐大的專業工作意味著螢幕截圖、掃描頁面、圖表和 PDF,而純文字模型根本無法踏入這個類別。
第三個是本週發生的事。GPT-6 於 10 月 7 日登陸 ChatGPT 的 Chat 分頁,適用於 Plus、Pro、Business 與 Enterprise,Free 與 Go 則從 10 月 8 日起跟進,並帶來一項 OpenAI 稱為 Intelligent UI 的能力——答案會依每個問題組合文字、圖形、圖表、表單與可點按的控制項,而不是預設以文字敘述呈現。那是一層介面,不是 API 功能,也不會更動你整合程式碼的任何一行。它真正改變的是環境預設值:你團隊已經在瀏覽器分頁中開啟的模型現在是 GPT-6,而原型開發工作會逐漸偏向那個不用金鑰就能觸及的模型。由廠商自行報告且未經重現,OpenAI 還聲稱 GPT-6 在 Extra High 下開始回答的速度已與 GPT-5.6 在 Medium 下相同,而且 GPT-6 Instant 在搜尋支援的問題上開始回答的時間提早了 44%。
執行一個,還是兩個都執行
這種特定配對之所以比大多數組合更容易對沖,是因為這兩個模型都位於同一份目錄上。OrcaRouter 將 GPT-6 Sol 與 DeepSeek V4 Pro——連同其他 200 多個模型——全數透過單一金鑰上的一個 OpenAI 相容端點來路由,且僅按供應商定價加收 0% 的費用。正是這種原價直通,讓尖峰/離峰結構清晰可讀,而非神秘難解:DeepSeek 的離峰半價是供應商自家的措施,我們不予干涉;而當供應商調整價格時,這裡當天就同步生效。
這也是尖峰時段決策變成路由決策的地方。DeepSeek V4 Pro 的離峰費率是尖峰費率的一半,而且尖峰時段是固定的 UTC 時段。可移動的批次工作值得配合這些時段來排程,而延遲敏感的路徑則值得避開它們。當兩個模型共用同一組金鑰,這種拆分就是設定,而不是第二份供應商合約:在離峰時段將大量與長輸出的工作路由到 DeepSeek V4 Pro,將多模態與推理密集的流量路由到 GPT-6 Sol,並讓自動容錯移轉涵蓋任一方的速率限制,而不是等到在正式環境中才發現。

我實際上會怎麼做
如果你需要圖像、檔案或前沿推理分數,而且你買的是 API,GPT-6 Sol 就是答案,而那十一項指數分數大多無關緊要——多模態這道門檻在基準測試取得投票權之前就已經定案。如果你需要 384,000 詞元的輸出、可永久持有的授權、地端部署,或市面上每完成一項任務的最低成本,DeepSeek V4 Pro 勝出,而那項指數差距是別人的同儕群體的事。
我不會做的,是把 36 對比 47.6 解讀成能力差距,並據此買進。那些可互相比較的衡量指標——每項任務 $0.67 對 $1.04,以及隱藏在 4 倍標題差距裡的 2.1 倍冗長度差異——所呈現的實情遠比指數列更接近,而它們才是會出現在發票上的數字。
接下來值得觀察的是,DeepSeek 是否會在 V4 Pro 的更新版中縮小 Terminal-Bench 的差距,因為那是這款開放模型唯一一項看起來確實落後、而非評分方式不同的指標。至於 GPT-6,它才剛不再是一個選項,而成了預設值,而預設值是難以撼動的,即使基準測試的結果並非如此。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
