一張為 GPT-6.1 Sol 對上 DeepSeek V4 Pro 生成的主視覺卡片,標題為「三個儀表,三種不同答案」,內含三張指標卡,分別寫著「混合價格 4 倍」、「每項指數任務成本 1.07 倍」與「智慧指數 16 分」,一行文字寫著「一個是專有模型,能看見圖像。一個是 MIT 授權的開放權重,且僅支援文字。」,頁尾寫著「價格依 OpenAI 與 DeepSeek;指數與每項任務成本數據依 Artificial Analysis,該機構在不同同儕群組中比較開放權重與專有模型。」,右下角則有 OrcaRouter 標誌。
Guides & Insights

GPT-6.1 Sol 對決 DeepSeek V4 Pro:三把量尺,三種不同答案

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

問 GPT-6.1 Sol 與 DeepSeek V4 Pro 相距多遠,而誠實的答案是這取決於你看的是哪一把尺,而這三把尺彼此不一致的程度,比大多數模型比較在所有事情上的分歧都還大。以每百萬 token 的價格來看,按輸入對輸出 3:1 的比例混合計算,兩者是 $4.00 對 $0.99——相差四倍。就實際執行同一套評估測試的成本而言,每項任務是 $0.72 對 $0.67——相差 7%。在 Artificial Analysis Intelligence Index 上,兩者是 51.8 對 36——差 16 分,聽起來很能一槌定音,直到你去看每個數字是跟誰比出來的,因為該評測者自身的方法論把這兩個模型放在不同級別。GPT-6.1 Sol 於 2026 年 9 月 29 日發布,輸入 $2.00、輸出 $10.00,上下文視窗為 1,050,000 個 token。DeepSeek V4 Pro 是一款採用 MIT 授權的混合專家旗艦模型,擁有 1.6 兆參數,其中 490 億為活躍參數,於 2026 年 8 月 13 日發布,價格為 $0.66 與 $1.98,上下文視窗為 1,048,576 個 token。一個是你可以下載的文字模型。另一個則能看圖像。釐清你實際上該以這三把尺中的哪一把為依歸,就是整件事的重點。

索引列並不是它表面上那樣的比較

從最常被引用的數字開始,因為它正是最常被引用錯誤的那一個。

Artificial Analysis 會將其方法論與排行榜一併發布,而其中有兩句話在此至關重要。它指出,開放權重模型只會與同一規模級別的其他開放權重模型比較——微型、小型、中型、大型,並以 1,500 億參數為界。專有模型則改為在同一價格區間內比較,並以 3:1 的輸入輸出比例混合計算。這是兩個不同的同儕群組。DeepSeek V4 Pro 0813 是開放權重——評估者自己的常見問題集如此說明,並指向已公開的權重——而其總參數達 1.6 兆,屬於開放權重的大型級別。GPT-6.1 Sol 是專有模型,會與其自身價格區間內的模型一起評分。

因此,同一個表格中相鄰兩列的 51.8 與 36 並不是一對一的正面對決。它們分別是相對於某一組同儕的得分,以及相對於另一組同儕的得分,這正是為什麼每項任務的成本數字可以互相比較,而原始指數數字卻不能。如果你想知道 DeepSeek V4 Pro 表現是否優異,以可下載模型而言,36 就是回答這個問題的數字。如果你想了解它相對於代管前沿模型的表現如何,指數欄位並不會告訴你,而在這種情況下,誠實的做法就是直接這麼說,而不是拿 51.8 減去 36,然後稱之為差距。

哪些可以乾淨地比較:價格卡、上下文與輸出限制、模態清單,以及執行同一套評估套件的成本——因為最後那個數字是對完全相同工作的核算,而不是分數。

原始儀表顯示什麼

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, credited to DeepSeek and dated 2026-04-24, showing the model identifier, text-only input with tools, JSON and reasoning, a 1M-token context window with a 384K maximum output, and a rate row reading $0.66 input and $1.98 output per million tokens alongside a 1.92-second median latency and a 1030.7M seven-day traffic figure.

• 輸入價格 — 每百萬個 token:GPT-6.1 Sol $2.00 對比 DeepSeek V4 Pro $0.66

• 輸出價格 — GPT-6.1 Sol $10.00,對比 DeepSeek V4 Pro $1.98,於平日的兩個四小時 UTC 時段內逐步調整為 $1.32 與 $3.96

• 快取讀取 — GPT-6.1 Sol 每百萬個 token $0.10,對比 DeepSeek V4 Pro $0.022;兩者皆提供快取,而便宜的一方又再便宜 4.5 倍

• 每個索引任務成本 — GPT-6.1 Sol $0.72 對比 DeepSeek V4 Pro $0.67

• 在索引套件上產生的輸出 token 數 — GPT-6.1 Sol 67M 對比 DeepSeek V4 Pro 160M

• 最大輸出 — DeepSeek V4 Pro 384,000 tokens 對比 GPT-6.1 Sol 128,000 tokens

• 模態 — GPT-6.1 Sol 可接收文字、圖像和檔案;DeepSeek V4 Pro 僅接收文字

第四行和第五行是有趣的一對。DeepSeek V4 Pro 在同一個測試套件上產生的詞元數是 2.4 倍,每項任務的完成成本卻仍便宜 7%,因為它的輸出費率是 GPT-6.1 Sol 的五分之一。當你衡量的是輸出量而不是費率時,價格驅動型模型就是這個樣子:冗長是真的,但這並沒有抹去優勢。時段窗口就是那個星號。平日的兩個四小時時段——一週 168 小時中的 40 小時——會使表定費率加倍至 $1.32 和 $3.96,而這筆附加費就落在同一批詞元上;若不是在這些時段,它們原本會是兩張卡上最便宜的。

較便宜機型做不到的事

三件事,而且每一項都是硬性限制,而非取捨。

它看不見。DeepSeek V4 Pro 是文字輸入、文字輸出。沒有螢幕截圖,沒有掃描的 PDF,沒有圖表判讀,沒有工單中的圖解。電腦操作與文件密集型工作流程——正是 GPT-6.1 Sol 所鎖定的工作負載——無論價格如何都不在考慮範圍內。如果你的流程已經將影像導向視覺模型,這就不是問題;如果沒有,這就是決定性的限制條件。

它沒有可供你事先規劃的發布節奏。「deepseek-v4-pro」這個名稱自從八月以來一直指向 0813 組建,而走到這一步的過程並不平靜:供應商宣布該組建將於 9 月 14 日退役,卻在日期前兩天撤回公告,並繼續以不變的計費提供 API 服務。我們自己的型錄仍將它列為旗艦,具備相同的上下文、輸出上限與併發上限。能在兩天內撤回棄用公告的供應商,也可能選擇不這麼做;營運上的重點不在於該模型不穩定,而在於那個名稱只是個指標,而把行為綁定到組建識別碼,而不是路由名稱,才是便宜的保險。

它並不承載周邊的知識。GPT-6.1 Sol 問世才八天,就已經有一份獨立配置發布;DeepSeek V4 Pro 則有更長的評估歷史,以及規模大得多的實務從業者群體,包括已發布的服務堆疊與第三方吞吐量研究。對於自架部署來說,這批資料比索引列更有價值,因為當模型是在你的硬體上、而不是在基準測試上表現怪異時,你會查閱的正是這些資料。

當便宜四倍的計量器是錯誤的計量器時

如果便宜模型只是各方面都比較差,這會是一篇短文。棘手的事實是,兩者在相同工作上每項任務相差 7%,而為了達到同樣成果,兩者寫出的量卻相差 2.4 倍。這意味著混合 token 計量表——那個顯示 4× 的——衡量的是你大多不會付費的差異,因為它計價的是你可能永遠不會送出的 token 組合。而指數計量表——那個顯示 16 點的——是在兩個同儕群體之間進行衡量,因此不能相減。

所以實務上的分工並不是「困難工作用前沿模型,簡單工作用便宜模型」。而是依模態分工,也依用量分工。任何含有影像的內容都交給 GPT-6.1 Sol;凡是答案簡短、而推理才是昂貴部分的,也一樣交給它——它的五個 effort 等級,從 low 到 max、預設為 medium,讓你買到推理卻不必連長篇文字一起買,而它每 $0.10 的快取輸入,讓反覆出現的長提示詞變得便宜。任何純文字、高用量、且能容忍較長回答的工作——分類、擷取、摘要、對照 384,000-token 輸出預算的大量生成——都交給 DeepSeek V4 Pro,最好避開那兩個 UTC 時段。

兩者都在同一個按鍵上,而拆分則是一行設定。

兩個模型都在 OrcaRouter 上,採用各自供應商公布的價格,沒有任何加成:GPT-6.1 Sol 為 $2.00 / $10.00,提示 token 超過 272,000 時調整為 $4.00 / $15.00;DeepSeek V4 Pro 則為 $0.66 / $1.98,並依所列內容照常適用兩個限時時段。一組金鑰、一份帳單、一個同時支援兩者的 OpenAI 相容端點。

這就是為什麼上述拆分值得寫下來,而不是拿來爭論。模態拆分可以表示為路由規則,因此帶有影像的請求會送往視覺模型,而大量文字則送往便宜的模型,應用程式無須變更;如果某條路由降級,容錯移轉會改送呼叫,而不是讓它失敗。而且因為兩者都位於同一個端點,真正重要的價格比較——你自己的、依你的流量、以你的 token 混合比例——可以從你自己的帳單產生,而不是從基準測試套件的平均值。

A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window, 128,000 max output tokens, an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.A generated scoreboard titled 'GPT-6.1 Sol vs DeepSeek V4 Pro — the scoreboard' showing two columns on six shared rows: input price $2.00 against $0.66 per million tokens; output price $10.00 against $1.98; cache read $0.10 against $0.022; cost per index task $0.72 against $0.67; maximum output 128,000 against 384,000 tokens; modalities text, image and file against text only. A footer reads 'Prices per OpenAI and DeepSeek as listed on OrcaRouter; cost-per-task figures per Artificial Analysis, whose index compares open-weights and proprietary models in different peer groups.'

結論用一句話說:那個「便宜四倍」的讀數才該存疑,而「百分之七」的讀數才該進一步查核。四倍是混合計量器對你可能根本不會送出的 token 混合比例所給出的說法。百分之七則是同一項評估在兩者上的成本,而且還內含 2.4 倍的冗長度差異。那十六個百分點是真的,但它們也橫跨兩個同儕群組;而真正決定這對模型大多數部署方式的限制,根本不是數字:這兩個模型中,有一個能讀懂螢幕截圖,另一個則不行。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新