文章主圖卡片標題為『OpenAI o3 vs DeepSeek V4 Pro』,帶有『模型比較』徽章及副標題『高階推理時代在價格差距拉開之處落幕』;左側顯示高級標籤圖示,右側顯示金幣圖示,右下角為 OrcaRouter 標誌。
Guides & Insights

OpenAI o3 對決 DeepSeek V4 Pro:高端推理時代的終點,正是價差拉開的起點

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Ope​nAI o3 與 DeepSeek V4 Pro 的對決,其實是兩個數字的碰撞。Ope​nAI o3 於 2025 年 4 月 16 日發布,曾是頂級推理的標竿——在錯誤答案的成本高於 token 成本時,你會願意砸錢購買的模型。DeepSeek V4 Pro 在 2026 年 8 月 13 日以 build 0813 正式發布,歷經一個低調的晚間釋出,以及一段包含撤回公告與重新上傳權重的推出過程,讓那種 Premium 看起來像個類別錯誤:獨立指數高於 o3,價格大約只有其五分之一,而且還是開放權重。而這場碰撞帶有時間戳記,因為 Ope​nAI o3 將於 2026 年 8 月 26 日退出 ChatGPT,其 API 快照則於 12 月 11 日跟進;比較的每一週,都對那個不會消失的模型有利。

兩款相隔一年上市的型號,設計哲學卻截然不同

o3 是純推理旗艦:一個封閉模型,經過訓練會在回答前長時間思考,具備 200K 脈絡視窗、最高 100K 輸出,並將圖像輸入納入其思考鏈。根據 Ope​nAI 自己的數據,它設下了 2025 年的標竿——AIME 2024 達 96.7%、GPQA Diamond 達 87.7%、SWE-bench Verified 在無 scaffolding 下達 69.1%、Codeforces Elo 達 2727——而 Ope​nAI 後來把價格從每百萬 token $10/$40 降至 $2/$8,至今維持不變。DeepSeek V4 Pro 則是完全不同的經濟學:這是一個 1.6 兆參數的混合專家模型,每個 token 約有 490 億參數啟動,具備 1 百萬 token 脈絡視窗、384K 最大輸出、純文字輸入,而且——0813 GA 版本新增——重建的後訓練堆疊,加上原生 Responses-API 與 Codex 整合,使其在 DeepSWE 上的代理分數從預覽版的 12.8 躍升至 62.7。它同時也是開放權重:DeepSeek-V4-Pro-0813 檢查點可在 Hugging Face 上以 MIT 授權下載,先前經歷了混亂的頭 24 小時,發布橫幅被撤下、權重一度短暫 404,之後才以更正後的配置重新上架。

實際數字下的成本差距

價目表本身就能替我們完成大部分的論述:

Ope​nAI o3 — 每百萬輸入 token 收費 $2.00,每百萬輸出 token 收費 $8.00,快取輸入 token 收費 $0.50。推理 token 按輸出計費,所以一個困難的問題在回答前就會消耗思考 token。

• DeepSeek V4 Pro — 每百萬次輸入 $0.435(快取未命中),快取命中 $0.003625,每百萬次輸出 $0.87(今日價格)。輸出比 o3 便宜約 4.6 倍,快取命中的輸入實際上等於免費。

• 附帶日期的警告——DeepSeek 預定於 8 月 17 日漲價,將 V4 Pro 的輸出從每百萬 6 元調整為高峰時段 27 元(離峰 13.5 元),快取未命中輸入則從 3 元漲到 9 元。即使按新的高峰費率,輸出價格仍僅是 o3 的 8 美元的一小部分。以今日費率進行建置的時間窗口只有數天,這本身就是遷移決策的一部分。

每個正確答案的經濟學讓這個論點更加鮮明。o3 的隱藏推理 token 意味著,每個困難答案的實際成本是其輸出費率的數倍。DeepSeek V4 Pro 也會推理,其思考過程同樣以輸出計費,但以 0.87 美元的絕對花費,相對於一次思考一分半鐘的 o3 會話,不過是四捨五入的誤差。DeepSeek 在推出時使用的智能體成本框架——與封閉前沿相比,每任務價格差距約 45 倍——針對 o3 而言有所誇大,但方向並無爭議:實際成本的差距是 4 到 10 倍,取決於工作負載。

品質差距實際上所處的位置

最重要的分數是獨立評測的那個。在 Artificial Analysis 的 Intelligence Index 上,DeepSeek V4 Pro 獲得 53 分,在該指數目前列出的 104 個模型中排名第 2;o3 則在 30 分上下——同一套評測框架下差距超過 20 分。這就是兩年進展之後,頂級推理旗艦處境的最簡潔總結:它不再只是價格上被壓著打;在獨立綜合指標上,它也被打敗了。

逐項基準檢視的圖景更為混亂,需要如實標註。DeepSeek V4 Pro 的頭條智能體數據——Terminal-Bench 2.1 為 87.9、CyberGym 為 83.3、DeepSWE 為 62.7、AutomationBench 領先封閉前沿模型——皆是 DeepSeek 在 0813 發布時的自稱成績,截至本文撰寫時仍未經獨立複現;且部署期間的錯誤配置事件意味著,無人能斷定早期第三方數據收集之際,API 所提供的是否為最終修正後的權重。o3 的發布基準同樣出自供應商之口,但其中部分已在 2025 年經獨立重測驗證,當時它確實位居推理榜單之首。在數學與純推理方面,o3 的公開紀錄看起來仍比 DeepSeek V4 Pro 更勝一籌——DeepSeek 的強項在於智能體工具使用、程式編寫與長時程任務,這與 o3 主導的數學奧林匹亞屬於不同的測試組合。

A two-column scoreboard for OpenAI o3 vs DeepSeek V4 Pro: left column o3 shows $2/$8 pricing, 200K context, closed weights, Artificial Analysis Index around 30, math-and-reasoning strength, retiring August 26 2026; right column DeepSeek V4 Pro shows $0.44/$0.87 pricing today, 1M context, MIT open weights, Artificial Analysis Index 53 (#2 of 104), agentic-and-coding strength, GA August 13 2026. Footer: o3 figures partly independent; DeepSeek agent benchmarks vendor-reported. OrcaRouter logo bottom-right.

o3 仍然做得更好的地方

有兩項優點在此較中依然成立。第一,數學與嚴謹推理:o3 的 AIME 96.7% 與 GPQA 87.7% 依然高於 DeepSeek V4 Pro 已公布的所有數據;如果你的工作負載是艱難的證明或競賽題目,o3——在它仍可運行的期間——是更安全的答案。第二,圖像推理:o3 可以在其思考鏈中考慮螢幕截圖或圖表,而 DeepSeek V4 Pro 僅限文字;0813 版本沒有加入視覺編碼器;如果你的任務需要模型讀取圖像,DeepSeek V4 Pro 在那方面無法取代 o3。這兩項優點都不是留在即將退役模型上的理由,但兩者都讓我們有理由誠實承認:這次遷移並非純粹的升級。

另一件值得注意的事是開放權重的差異,這根本不是基準測試的問題。o3 是封閉的,如今正被整併而逐漸消失;你無法讓它繼續在自己硬體上運作。DeepSeek V4 Pro 的 0813 檢查點則永久屬於你,採用 MIT 授權——同樣的權重、同樣的 1.6 兆參數模型,只要你有約 1.5 TB 的硬體就能自行託管。對於那些因依賴一個供應商可能隨時退役的封閉模型而吃過虧的團隊來說,這正是針對 o3 退役所構成問題的結構性解答。

遷移工作負載

「對於從 o3 轉換過來的 API 團隊而言,DeepSeek V4 Pro 是最經濟的落腳點,而且在大多數 API 用量實際所在的代理型(agentic)與編碼工作上,它很少會是降級。真正的坑在於營運面,而非品質面:V4 Pro 在官方 API 上被限制為 500 個並發請求,這個上限在代理艦隊(agent fleet)的規模下必然會撞到,而且其價格將於 8 月 17 日變動。這兩者正是路由層存在的意義。」

在 OrcaRouter 上,DeepSeek V4 Pro 以供應商列表價格提供,0% 加成——所以今天的 $0.44/$0.87 在 DeepSeek 上線的當天也會同步上線於此,而當 8 月 17 日的尖峰/離峰計費表生效時,這裡也會在同一天反映。同一個金鑰也能用於這個 o3 替代系列中的其餘模型,而自動故障轉移是應對 500 並發上限的簡潔解答:將生產路徑指向 V4 Pro,並在同一金鑰上加上第二個模型,讓路由器吸收這個上限。OpenAI o3 本身不在該金鑰上——在 12 月 11 日快照截止日期之前,它仍可透過 OpenAI 自家的 API 與數個第三方平台使用。

Screenshot of the Artificial Analysis model page for o3 showing its rank of #107/182 on the Intelligence Index, a score of 31 (below the median of 35), a 200K-token context window, $2.00 per 1M input and $8.00 per 1M output pricing, and a 118 tokens-per-second speed reading.

數學對誰有利

對於任何以編碼、代理循環或長上下文處理為 o3 工作負載的人來說,這個數學差距一點都不接近:DeepSeek V4 Pro 在獨立指數上擊敗 o3,成本僅為其一小部分,而且其開放權重意味著這種特定依賴無法在您不知情的情況下被淘汰。目前有真正理由繼續維持 o3 運作的團隊是少數——困難的純數學推理,以及任何建構在 o3 圖像思考之上的東西——即使是這些團隊也應該在十二月之前針對真實工作負載測試替代方案,因為截止日期不會在乎您的邊緣案例。o3 定義的高階推理時代隨著其退役公告而結束;DeepSeek V4 Pro 恰好就是下一個時代中最便宜座位所在之處。

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro showing a 1M-token context window, 384K max output, $0.44 per 1M input and $0.88 per 1M output tokens, and Tools/JSON/Reasoning capability chips.

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube