主視覺標題卡寫著「GPT-6 vs DeepSeek V4 Pro」,搭配一個標籤寫著「GPT-6 於 ChatGPT 中向所有人開放 2026-10-07」,兩行價格分別寫著「GPT-6 Sol $2 / $10」與「DeepSeek V4 Pro $0.66 / $1 峰值」,一個標籤寫著「DeepSeek:MIT 權重,384K 最大輸出」,頁腳寫著「由供應商回報的項目已於文字中標示;指數數據依 Artificial Analysis」。OrcaRouter 標誌合成於右下角。
Guides & Insights

GPT-6 對決 DeepSeek V4 Pro:一個可以向任何人租用,一個可以帶回家

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

有一件事是 DeepSeek V4 Pro 能做、而 GPT-6 Sol 做不到的:把它帶回家。DeepSeek V4 Pro 是一款以 MIT 授權釋出的混合專家旗艦模型——總參數量 1.6 兆,每 token 啟用 490 億——於 2026 年 8 月 13 日發布,而且權重檢查點可供下載。GPT-6 Sol 則是封閉權重,由 Ope​nAI 於 2026 年 9 月 22 日推出,而截至 2026 年 10 月 7 日,它也是 ChatGPT 全球推行方案中、支撐付費方案層級的那個模型,該方案涵蓋每週超過 12 億名使用者。

這個比較中,其餘的一切都取決於你看的是哪一把尺。在價目表上,兩者相差四倍。就獨立測試套件產出一個完成答案的實際成本而言,兩者相差 1.55 倍。在 Intelligence Index 上,這些列看起來相差十六點,而根據評估者自己記錄的方法論,這些點數根本不能相減。釐清這三個數字中哪一個應該主導決策,就是全部的工作,而答案會因你是在挑選供應商還是在挑選檔案而有所不同。

每個模型是什麼,各用一段文字說明

GPT-6 Sol 是 OpenAI GPT-6 系列中的中階層級——位於旗艦款 GPT-6 Astra 之下、平價款 GPT-6 Luna 之上——具備 1,050,000 個 token 的上下文視窗、128,000 個 token 的輸出上限,支援文字、圖像與檔案輸入、原生工具呼叫、結構化輸出,以及可從 low 到 max 共五個等級選擇的推理強度。它是 OpenAI 將 ChatGPT Plus、Pro、Business 與 Enterprise 導向的層級,定價為每百萬輸入 token 2.00 美元、每百萬輸出 token 10.00 美元,並設有長上下文層級:一旦提示超過 272,000 個輸入 token,整筆請求將重新計價為 4.00 美元與 15.00 美元。

DeepSeek V4 Pro 是一款純文字的旗艦模型,具備 1,048,576 個詞元(token)的上下文視窗,以及最高 384,000 個詞元的輸出上限——是 GPT-6 Sol 上限的三倍——而且不論價格高低都不支援視覺功能。DeepSeek 自家的 API 文件將其列為高峰時段每百萬輸入詞元 0.66 美元、每百萬輸出詞元 1.98 美元,離峰時段減半為 0.33 美元與 0.99 美元,快取命中在離峰時段則為 0.022 美元。高峰時段為 UTC 週一至週五的 01:00–04:00 與 06:00–10:00;其餘時段,包括週末與中國國定假日,皆屬離峰時段。

那三個儀表

先從最常被引用的那一個開始,因為它正是最常被脫離脈絡引用的那一個。Artificial Analysis 在 Intelligence Index v4.3.2 上,給 DeepSeek V4 Pro 36.0 分、GPT-6 Sol 47.6 分。十一點五分,是那種足以終結比較的差距。

它不應該,而評估者自己也這麼說。Artificial Analysis 只把開放權重模型拿來和同尺寸級別的其他開放權重模型相比,界線訂在 1,500 億個參數;至於專有模型,則是在混合 3:1 輸入輸出比的條件下,於同一價格帶內互相比較。那是兩個不同的同儕群體,產生兩套不同的量表。同一個表格裡相鄰列上的 36 和 47.6 並不是正面對決,而誠實的做法是把這件事說出來,而不是把一個從另一個減掉,然後稱之為能力。

A screenshot of the Artificial Analysis leaderboard showing the rows around DeepSeek V4 Pro, with MiMo-V2.6-Flash at 38 and $0.06 per index task, Claude Haiku 5.5 (high) at 38 and $0.08, and DeepSeek V4 Pro 0813 (max) at 36 and $0.67, each row carrying its creator, index, cost per task, output speed and latency columns.

那兩個可互相比較的儀表,說明了更有用的訊息:

• 以 3:1 混合計價——GPT-6 Sol 每 100 萬個 token 為 4.00 美元,對比 DeepSeek V4 Pro 在尖峰費率為 0.99 美元,離峰為 0.50 美元;視執行時機而定,價差達 4 倍至 8 倍
• 每項完成索引任務的成本——GPT-6 Sol 1.04 美元,對比 DeepSeek V4 Pro 0.67 美元;價差 1.55 倍
• 整個套件所產生的輸出 token 數——GPT-6 Sol 7,680 萬,對比 DeepSeek V4 Pro 1.629 億,因此較便宜的模型為了完成相同工作,輸出量是 2.1 倍
• 最大輸出——DeepSeek V4 Pro 384,000 個 token,對比 GPT-6 Sol 128,000;上限為 3 倍
• 多模態輸入——GPT-6 Sol 接受文字、圖像與檔案,對比 DeepSeek V4 Pro 僅限文字
• 權重——DeepSeek V4 Pro 採用 MIT 授權且可下載,對比 GPT-6 Sol 為閉源

A two-column comparison scoreboard for GPT-6 Sol and DeepSeek V4 Pro, showing GPT-6 Sol at an Intelligence Index of 47.6, $1.04 per index task and a 128,000-token output ceiling, against DeepSeek V4 Pro at 36.0, $0.67 and 384,000 tokens, with input and output prices of $2.00/$10.00 against $0.66/$1.98 and an MIT-weights row. A footer reads "Index figures per Artificial Analysis v4.3.2; row scored in different peer groups, not subtractable."

第四行與第五行說明了第二行。在實際工作中,4× 的頭條差距縮小到 1.55×,這正是當較便宜的模型同時也是更囉嗦的模型時會發生的情況:在同一組評估資料上,DeepSeek V4 Pro 產出的輸出 token 數是 GPT-6 Sol 的 2.1 倍。囉嗦程度是一種永遠不會出現在價格頁面上的成本乘數,而在這場對決中,它是最常被忽略的數字。

開放模型真正勝出之處

兩個地方,而且兩者都是結構性的,而非邊緣性的。

輸出上限是第一點。384,000 個 token 對上 128,000 個,是 three-fold 的差距,而這決定了整類工作能否進行:在一次呼叫中生成大型結構化產物、不串接就寫出長篇文件、把大規模重構當作單一回應產生。GPT-6 Sol 無論出多少錢都做不到這些,因為這項限制不是計費層級——而是模型本身的上限。

代理式工具使用是第二項,就某一項特定測量而言。DeepSeek V4 Pro 在 τ²-Bench 這個代理式工具使用評估上得分 96.2%,而這正是 DeepSeek 在自己的模型卡上主打的分數。這也是該模型的 OrcaRouter 型錄條目所重複引用的數字,也就是我們自家讀者會遇到的說法版本。GPT-6 Sol 可相比的 τ²-Bench 數字並未公布在同一張榜單上,因此請把這項比較視為僅具方向性:在 DeepSeek 選擇主打的那一項基準測試上,開放模型位居該領域之首,而封閉模型尚未在同一欄中提出數字。

還有關於所有權的那一點,那根本不是什麼基準測試。一個可下載的 MIT 檢查點意味著你可以在自己的硬體上執行模型,讓請求不經過任何人的網路,對它進行微調,鎖定某個版本,並且知道三年後它依然會在那裡。沒有供應商能將它淘汰、重新定價,或把它從價目表中移除。對某一類買家——受監管的產業、任何有資料駐留限制的人、任何曾被模型退役坑過的人——這比十一點指數還更有價值。

GPT-6 Sol 勝出之處,而且不只是那個指數

Terminal-Bench 4.0 是 DeepSeek V4 Pro 規格表上最不體面的一行:14.1%,對比 GPT-6 Sol 的 43.9%。這不是四捨五入的誤差,而是指向一個真實的樣貌——這個開放模型擅長多輪工具編排,卻在現代編碼代理賴以維運的長時程終端機工作上表現疲弱。如果你的工作負載是一個必須讓 shell 工作階段維持二十分鐘不中斷的代理,那麼這項單一評測,比綜合指數更能預測你的實際體驗。

多模態是第二點。DeepSeek V4 Pro 是文字進、文字出。GPT-6 Sol 能接收圖片與檔案,而這不是一個功能勾選項——文件量龐大的專業工作意味著螢幕截圖、掃描頁面、圖表和 PDF,而純文字模型根本無法踏入這個類別。

第三個是本週發生的事。GPT-6 於 10 月 7 日登陸 ChatGPT 的 Chat 分頁,適用於 Plus、Pro、Business 與 Enterprise,Free 與 Go 則從 10 月 8 日起跟進,並帶來一項 OpenAI 稱為 Intelligent UI 的能力——答案會依每個問題組合文字、圖形、圖表、表單與可點按的控制項,而不是預設以文字敘述呈現。那是一層介面,不是 API 功能,也不會更動你整合程式碼的任何一行。它真正改變的是環境預設值:你團隊已經在瀏覽器分頁中開啟的模型現在是 GPT-6,而原型開發工作會逐漸偏向那個不用金鑰就能觸及的模型。由廠商自行報告且未經重現,OpenAI 還聲稱 GPT-6 在 Extra High 下開始回答的速度已與 GPT-5.6 在 Medium 下相同,而且 GPT-6 Instant 在搜尋支援的問題上開始回答的時間提早了 44%。

執行一個,還是兩個都執行

這種特定配對之所以比大多數組合更容易對沖,是因為這兩個模型都位於同一份目錄上。OrcaRouter 將 GPT-6 Sol 與 DeepSeek V4 Pro——連同其他 200 多個模型——全數透過單一金鑰上的一個 OpenAI 相容端點來路由,且僅按供應商定價加收 0% 的費用。正是這種原價直通,讓尖峰/離峰結構清晰可讀,而非神秘難解:DeepSeek 的離峰半價是供應商自家的措施,我們不予干涉;而當供應商調整價格時,這裡當天就同步生效。

這也是尖峰時段決策變成路由決策的地方。DeepSeek V4 Pro 的離峰費率是尖峰費率的一半,而且尖峰時段是固定的 UTC 時段。可移動的批次工作值得配合這些時段來排程,而延遲敏感的路徑則值得避開它們。當兩個模型共用同一組金鑰,這種拆分就是設定,而不是第二份供應商合約:在離峰時段將大量與長輸出的工作路由到 DeepSeek V4 Pro,將多模態與推理密集的流量路由到 GPT-6 Sol,並讓自動容錯移轉涵蓋任一方的速率限制,而不是等到在正式環境中才發現。

A screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 release date, a 1.05M-token context window, a 128K-token maximum output, text, image and file input and tool calling, and pricing of $2.00 per million input tokens and $10.00 per million output tokens.

我實際上會怎麼做

如果你需要圖像、檔案或前沿推理分數,而且你買的是 API,GPT-6 Sol 就是答案,而那十一項指數分數大多無關緊要——多模態這道門檻在基準測試取得投票權之前就已經定案。如果你需要 384,000 詞元的輸出、可永久持有的授權、地端部署,或市面上每完成一項任務的最低成本,DeepSeek V4 Pro 勝出,而那項指數差距是別人的同儕群體的事。

我不會做的,是把 36 對比 47.6 解讀成能力差距,並據此買進。那些可互相比較的衡量指標——每項任務 $0.67 對 $1.04,以及隱藏在 4 倍標題差距裡的 2.1 倍冗長度差異——所呈現的實情遠比指數列更接近,而它們才是會出現在發票上的數字。

接下來值得觀察的是,DeepSeek 是否會在 V4 Pro 的更新版中縮小 Terminal-Bench 的差距,因為那是這款開放模型唯一一項看起來確實落後、而非評分方式不同的指標。至於 GPT-6,它才剛不再是一個選項,而成了預設值,而預設值是難以撼動的,即使基準測試的結果並非如此。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新