
DeepSeek V4 Pro 發布日期:已比 Kimi K3 便宜 14 倍,但智能程度尚未及。
- meta新Meta: Muse Spark 1.22026-08-0557智能72程式
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimax新MiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 2110 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
- tencentTencent: Hy32026-07-0642智能59程式
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42程式
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39程式
- anthropicAnthropic: Claude Sonnet 52026-06-3055智能72程式
- klingKling: Kling 3.0 Turbo2026-06-1757智能52程式57數學
2026年7月31日,該公司發布了一則更新日誌條目,宣布其平價模型擊敗了其昂貴模型。該條目是關於DeepSeek V4 Flash,284B效率等級,標題聲稱「智能體能力顯著增強,基準測試結果遠超 V4-Pro-Preview。」V4-Pro-Preview 就是DeepSeek V4 Pro——擁有1.6兆參數的旗艦級模型,每個 token 的價格是 Flash 的三倍。同一條目結尾用一句話提到它:「DeepSeek-V4-Pro 的正式發布將很快到來。」而這就是目前流傳的預測的背景:當真正的 V4 Pro 推出時,它將達到Kimi K3的水平,但價格便宜十倍。其中一半已經可以衡量,而且它在幾乎無人預料的方向上是錯的。
關於這篇文章是什麼、不是什麼,先說個明。這裡沒有外洩的系統卡,沒有內部基準,沒有日期。流傳中的預測來自 X 上的 @scaling01 ——「DeepSeek-V4 Pro 會很猛,大概也是 Kimi-K3 等級,但便宜 10 倍」—— 這是一位備受追蹤的從業者所做的預測,不是任何有管道的人士的爆料。把這當成外洩,就是糟糕的發布日期報導之所以產生的方式。我們能做的,反而是把這個說法的兩半可檢驗部分,拿去對照已經存在的數據,因為預覽版三個月來一直可以呼叫,而它和 Kimi K3 都被獨立實驗室跑過。以下一切按來源標註:公司自己的文件、Artificial Analysis 的量測,或是我們自己算並展示的算式。
DeepSeek 實際說了些什麼,以及它沒說些什麼
已確認的範圍比「未發布機型」的說法所暗示的還要大。V4 Pro 並非空談——你現在就可以呼叫它。尚未發生的,是公司本身認為正式發布的動作。
• 架構 — 一個混合專家模型,總參數為 1.6T,每個 token 啟用 49B 參數,已由公司確認,並在 Artificial Analysis 上同樣列為 1600B/49B。
• 上下文與輸出 — 一個 1M token 的輸入窗口(1,048,576),最多可輸出 384K tokens。文字輸入、文字輸出;不支援圖片、音訊或影片輸入。
• 許可證與權重 — MIT 許可證,權重已發佈於 Hugging Face。這是一款開放權重的旗艦模型,也正是與 Kimi K3 進行比較會如此引人關注的原因。
• 定價 — 每次快取未命中時每百萬輸入代幣 $0.435,快取命中時每百萬輸入代幣 $0.003625,以及每百萬輸出代幣 $0.87,資料來自公司自身的定價頁面。
• 介面:OpenAI 風格的 ChatCompletions 與 Anthropic 格式的端點,以及推理強度等級、工具呼叫與結構化輸出。
• 目前時間線 — V4 系列於 2026 年 4 月 24 日以預覽版形式登場;舊版deepseek-chat 和 deepseek-reasoner 模型名稱已於 2026 年 7 月 24 日退役;Flash 於 2026 年 7 月 31 日推出正式版;Pro 則沒有。
• 2026年8月6日 — DeepSeek 向開發者表示,計劃在「不久的將來」上調 DeepSeek API 服務的整體定價,並預期會有大幅調漲;同時重申官方 V4 Pro 版本將隨後推出。目前尚未公布新的費率及生效日期。
而那些真正未知的部分,也就是人們大部分在搜尋的內容:
• GA 日期——仍未公佈。「即將推出」仍是該公司正式承諾的全部內容。未經證實的媒體報導指向八月中旬的時間窗口——一家媒體拋出了 8 月 10 日至 20 日的時間範圍,而一家經銷商的定價頁面在 8 月 3 日調整了 V4 Pro 快取價格,這種模式在歷史上通常預示著發佈在即——但這些都不是公司的官方說法。目前尚未確認任何日期。
• GA 版本將改變什麼 — 未說明。該公司並未透露官方 V4 Pro 是基於相同權重的重新後訓練、全新的預訓練,還是重新定價。
• 價格能否挺過這關——仍是未解之題,而且關於這點,我們下面會談到一個具體的擔憂理由。
有一項修正值得明確提出,因為這個問題的搜尋結果遭到污染:你會找到一些頁面宣稱 V4 系列已於 2026 年 7 月 20 日正式全面上市。該公司自己的變更日誌在該日期十一天後表示,官方 V4 Pro 版本仍在等待發布,並補充說 7 月 31 日的更新「僅升級了 DeepSeek-V4-Flash API。DeepSeek-V4-Pro API 以及 APP/WEB 模型保持不變。」當第三方摘要與供應商的主要變更日誌不一致時,以變更日誌為準。

價格宣稱:「便宜10倍」是保守的解讀。
Kimi K3 的定價為每百萬輸入 token 3.00 美元,每百萬輸出 15.00 美元,快取命中為 0.30 美元。V4 Pro 的定價為 0.435 美元和 0.87 美元,快取命中為 0.003625 美元。兩者相互比較後,「10倍」其實是區間的低標,而非標題數字:
• 輸入 tokens——$3.00 對比 $0.435,因此 V4 Pro 便宜 6.9 倍。這是該說法誇大的唯一一個面向。
• 輸出 tokens — 15.00 美元對比 0.87 美元,即便宜 17.2 倍。輸出是推理模型的主要開銷所在,因此這是最重要的數字。
• 70/30 的輸入輸出混合方案 — 每百萬 $6.60 對比 $0.5655,即 11.7 倍。
• Artificial Analysis 的 7:2:1 快取命中/輸入/輸出混合 — 2.31 美元對比 0.18 美元,即 12.8 倍。
• 快取輸入—— $0.30 對比 $0.003625,約 83 倍。該公司的快取讀取價格在 Artificial Analysis 追蹤的 101 個模型中排名第 4,與其自身的快取未命中費率相比折扣達 99%。
假設性的混合比較容易引起爭議,所以這裡提供一個實測的數據。Artificial Analysis 公布了它實際花費在每個模型上執行完整 Intelligence Index 的費用——相同的評測套件、相同的測試框架、真實的 token 計數,而非假設的比例。Kimi K3 的評測費用為 2,437.41 美元。V4 Pro 則為 176.34 美元。這是在相同的工作負載下,以實際支付的金額計算,差距達 13.8 倍。
那個數字低於17.2倍輸出價格比的原因值得理解,因為那是V4 Pro之所以便宜、有一部分是自找的唯一環節。V4 Pro很囉嗦:它通過索引燒掉了1.8億個輸出token,相比之下Kimi K3是1.3億個,而該級別的中位數是1億個。因此,它表達內容時要多耗約38%的token,這侵蝕了它每個token的優勢。13.8倍這個數字已把這點計入;17.2倍則沒有。如果你在編列預算,請使用實測的那個。
這也是故事中你可以自己查證、而不是光憑信任的部分。因為 OrcaRouter 會以 0% 加價直接轉傳供應商的列表價格,所以我們 deepseek/deepseek-v4-pro 與 kimi/kimi-k3 模型頁面上的每個 token 價格,就是這兩家供應商自己的價格——K3 在我們的頁面上顯示 $3.00/$15.00,在 Moonshot 上也顯示 $3.00/$15.00——而不是隱藏了價差的轉售價格——這表示上述的計算可以在同一份帳單上重現;而且如果任一供應商調整價格,變動會在同一天反映在我們這一端,而不是等到合約週期結束後才生效。
智力主張:13分的差距,而非持平
「Kimi K3 等級」是預測中經不起當前數字檢驗的那一半。截至2026年8月5日,在 Artificial Analysis 的 Intelligence Index 上,Kimi K3 得分57,DeepSeek V4 Pro(推理模式,最大努力)得分44——在101個模型中排名第6,這確實是相當強勁的排名,但仍落後13分。兩者由同一實驗室以同一綜合指標測量,均以最大推理努力運行,且均在100萬 token 的上下文下進行。
供應商基準測試講述了一個不同且更討喜的故事,這正是它們需要標註的原因。該公司報告 V4 Pro-Preview 在 SWE-bench Verified 上達到 80.6%,在 GPQA Diamond 上達到 90.1%。Moonshot 報告 Kimi K3 在 SWE-bench Verified 上達到 76.8%,在 GPQA Diamond 上達到 93.5%。從表面價值來看,V4 Pro 在程式碼基準測試中徹底勝出。兩組數據均未經獨立複現,它們是由對結果有利害關係的團隊在不同的測試框架上產生的,而在唯一一個由第三方自行運行兩個模型的綜合測試中,排名發生反轉。這就是不信任供應商之間單一基準測試比較的全部理由。

關於這個指數數字,有兩點需要各自說明。首先,如果你看到較舊的文章引用 V4 Pro 的分數是 52 而非 44,那些文章並沒有錯——Artificial Analysis 自己在四月發表時的文章確實將 V4 Pro (Max) 列為 52 分,並稱其為第 2 名的開放權重推理模型。指數會經過修訂,而修訂會改變每個模型的分數。實際上的規則是,只有同一時間快照的比較才有意義;四月的 52 分和八月的 57 分不應該出現在同一個句子裡。其次,Artificial Analysis 的頁面日期標示為「2026 年 4 月發布」,且沒有區分預覽版本與未來的正式版本,因此其 44 分是對端點所提供內容的測量結果,無論測試是在何時進行。
V4 Pro 明顯勝過 Kimi K3 的地方,在於那些與智慧無關的軸線上。它的生成速度為每秒 66.5 個 token,而 K3 為每秒 37.6 個;該等級的中位數為 65.9——因此 V4 Pro 在其等級中約居平均水準,而 Kimi K3 則異常緩慢。首次 token 產出時間為 1.61 秒,K3 則為 2.85 秒。對互動式 agent 迴圈而言,這個差異在每一輪中都能感受到,也是目前預覽版本最有力的論據。
Flash官方建置所告訴我們關於Pro的事
關於未發布的模型,這是最接近真實證據的內容,而且它來自於已經經歷過這個過程的兄弟產品。
公司7月31日的變更日誌指出,「DeepSeek-V4-Flash-0731 保持與 DeepSeek-V4-Flash-Preview 相同的模型架構和規模,僅重新進行了後訓練。」權重數量相同、架構相同、價格相同——僅後訓練。Artificial Analysis 對其評分為50,而先前 Flash 版本的評分為40。綜合指標提升10分,完全來自後訓練,且每個 token 無額外成本。其在指數上的輸出 token 消耗也下降了12%,從約234M降至約206M,因此在相同定價下運行成本更低。
將該先例套用到 Pro 上,算術結果無可避免:44 加 10 等於 54。Kimi K3 是 57。即使官方 V4 Pro 重現了該公司公開展示過最成功的單一訓練後升級,它仍比「Kimi K3 等級」少了約三分——而運行成本卻約僅為其十四分之一。這是一個非凡的結果,而這並非預測所預期的結果。
關於該推論的誠實告誡——這是算術而非預測:{{1}}在284B模型上獲得+10的提升,對1.6T模型能達到的表現說明不了什麼{{/1}},{{2}}且提升空間可能更大,也可能小得多{{/2}}。該公司尚未表示{{3}}Pro版本將僅限於後訓練{{/3}}。再者,該指數是綜合性的,所以{{4}}三分可能只是一個基準測試的差異{{/4}}。無論如何仍要計算這個數字,是因為它是唯一存在且經供應商確認的量化先例,遠比該預測所依據的基礎更為可靠。
那份變更日誌中還有一個細節值得特別標示,而非僅是重複提及:Flash 的 agentic 分數是在「公司即將推出的 Harness 精簡模式」下,以最大努力(max effort)、topp=0.95、temperature=1.0 的設定所產生。產生這些數字的 harness 尚未公開釋出——它在八月初才進入封閉測試——因此原則上,公司以外的任何人都仍然無法重現這些數據;這不是因為數據有誤,而是因為該工具無法取得。預期 Pro 版本推出時也會帶著同樣的星號。
可能推翻廉價模式論點的條款
在該公司的定價文件中,埋藏著一項幾乎沒有任何 V4 產品線方案將其納入定價的政策。用公司的話說,API「即將採用」一套方案,根據該方案,「在尖峰時段,價格將為一般價格的 2 倍,適用於所有計費項目。」尖峰時段定義為每日北京時間 09:00–12:00 與 14:00–18:00——每天七小時,天天如此。生效日期「以官方公告為準」,截至本文撰寫之際,該附加費用尚未生效。
注意方向。該公司歷史上提供非高峰時段的折扣,在 V3 和 R1 上;這是尖峰附加費,對標準費率。如果在所述倍數下啟動,V4 Pro 的日間價格變成 $0.87(進)和 $1.74(出),比較結果也隨之改變:對 Kimi K3 的 11.7 倍綜合優勢降至 5.8 倍,實測的 13.8 倍降至 6.9 倍。仍然便宜。不再是「便宜 10 倍」,而且在歐洲或亞洲團隊實際工作的時段也不再便宜。
8月6日,更大的那隻靴子落地了。DeepSeek 在其開發者平台上宣布,計劃上調 DeepSeek API 服務的整體定價——「在不久的將來,預期會有顯著漲幅」。新的費率和生效日期都尚未公布,公司也未說明這項漲價是獨立於尖峰時段計費方案,還是會與之一同生效。報導該公司的媒體將這項公告解讀為官方 V4 Pro 即將發布的訊號——一款尚未發布的旗艦產品,你不會以激進的定價把它放進一個你即將退出的折扣體系中。任何現在基於 V4 Pro 建立成本模型的人,都應該把兩種情況都納入建模;任何讀到「這家公司便宜 14 倍」這類標題的人——包括這篇文章——都應該知道,它所描述的是一份附有已公告到期條件的價目表。這正是預測中價格那一半最可能失效的方式,而這與模型本身毫無關係。
您將如何知道官方版本已發布
在公司出貨的方式中,有一個細節比日期更為重要,而且它是一個真正的營運風險。
API 模型 ID 是 deepseek-v4-pro,不是 deepseek-v4-pro-preview,也不是帶有日期的建置字串——即使公司自己的變更日誌將目前建置稱為 V4-Pro-Preview,並將出貨的 Flash 建置稱為 V4-Flash-0731。當 Flash 正式發布時,官方指示是:「API 呼叫方式保持不變——只需將模型名稱設為 deepseek-v4-flash 即可使用最新版本。」換句話說,鎖定模型 ID 並不代表鎖定建置版本。同一個字串默默地開始提供不同的權重,行為有實質差異,且指標分數多了十分。
所以,關於「V4 Pro 何時發布」的實際答案是:如果你正在呼叫 deepseek-v4-pro,在生產環境中,你可能會透過觀察自己的輸出變化來發現。具體來說,要注意的事項包括:公司 API 變更日誌中出現一個新的帶日期條目——Flash 的發布最初就是出現在那裡;以及一個建置後綴,例如 V4-Pro-0731,在該條目的文字中出現,即使可呼叫的 ID 仍然保持不帶後綴;Artificial Analysis 的 V4 Pro 頁面重新評分,這是你會得到的第一個獨立確認;宣布的漲價落實為實際費率,因為正式發布(GA)是漲價和尖峰時段排程雙雙落地的自然時機;以及公司的 Responses API,其文件指出 deepseek-v4-pro 支援計畫於 8 月初推出——該模型從「已規劃」清單消失並出現在「已支援」清單,這幾乎就是公司會發布的最接近官方發布訊號。還有兩個我們無法確認的訊號,仍然值得知道:一家轉銷商的定價頁面在 8 月 3 日調整了 V4 Pro 的快取價格,這種模式在歷史上往往出現在發布之前;而公司的內部評測框架正在封閉測試中,這表示當它推出時,其供應商基準測試終於可能可以查核。一個形似 deepseek-v4-pro-202606 的字串也作為外洩的建置識別碼流傳;我們無法在公司的任何資產中驗證它,而且在有人能驗證之前,它不應具有任何分量。
你今天應該在預覽版上進行開發嗎?
對大多數評估此模型的人來說,發布日期是錯誤的問題。預覽版可呼叫、有定價、採用 MIT 授權,且在智慧評比中獨立測得第 6 名(共 101 個)。真正的問題是即將到來的 GA 版本會對你現在建置的工作造成什麼影響,而答案有兩種截然不同的可能。
如果您在能力上於 V4 Pro 與 Kimi K3 之間做選擇,{{1}}目前的證據顯示,Kimi K3 在綜合評分上領先 13 分,而 V4 Pro 在速度、延遲和成本上大幅勝出——{{2}}且一項待定的後訓練升級可能會縮小智慧差距,但不會完全彌平。{{3}}如果您的任務處於艱深推理的前沿,{{4}}那 13 分就是勝負關鍵,價格反而是次要考量。如果您的任務屬於高量且僅是困難等級,支付 14 倍的價格則難以合理化。
如果你已經選定 V4 Pro,需要管理的風險不是發布日期,而是無聲的偷換:那個模型 ID 背後的建置版本會在你不知不覺中改變,就像 Flash 當時一樣,而你的評測應該要能偵測到這一點。保留一組可以按需重跑的迴歸測試集,並讓第二個模型在不需要修改程式碼的情況下就能觸及。這就是我們當初以這種方式建置容錯切換的平凡原因——V4 Pro、V4 Flash 和 Kimi K3 全都位於同一個 OrcaRouter 金鑰之後,掛在一個相容 OpenAI 的端點上,所以「在三個模型上重跑評測,然後轉移流量」只是編輯設定,而不是一場採購流程;一個糟糕的 GA 版本也只是一個路由決策,而不是一樁事故。當推翻這個選擇不需要任何成本時,嘗試一個尚未經過驗證的旗艦模型就容易多了。

人們真正在問的問題
截至目前(2025年),DeepSeek 官方並未發布 DeepSeek V4 Pro。已發布的模型包括 DeepSeek-V2、DeepSeek-V3 及 DeepSeek-R1 系列等。若有新的發布消息,請以官方公告為準。
兩者都有可能,取決於你指的是什麼,這正是搜尋結果相互矛盾的原因。自2026年4月24日V4預覽版發布以來,該模型一直可以公開調用,並公布了定價、以MIT許可開放的權重,以及獨立的基準測試報導。但該公司2026年7月31日自己的更新日誌明確指出,V4 Pro API「沒有變化」,官方版本「將很快推出」;8月6日,DeepSeek再次表示正式版本將盡快發布,同時宣布API大幅漲價。所以:可用,但尚未正式。目前尚未確認任何日期;未經證實的報導指向8月中旬,這意味著等待時間不會太長。
官方版本會跟Kimi K3一樣好嗎?
根據目前唯一可量化的先例,恐怕未必。Flash 的官方版本僅靠後期訓練就在 Artificial Analysis 的 Intelligence Index 上獲得 10 分的提升;V4 Pro 目前為 44 分,Kimi K3 為 57 分,因此若獲得相同增幅,結果會落在 54 分。這種推斷可能往任一方向失準——1.6T 參數模型與 284B 模型的提升空間可能不同,且該公司並未表示 Pro 版本僅限於後期訓練。但任何如今宣稱兩者持平的人,所宣稱的內容並無任何已發表的測量數據支持。
為什麼 DeepSeek 的廉價模型目前得分比它的旗艦模型還高?
這是因為發布時序安排所致,而非 Flash 是更好的模型。Flash 在 7 月 31 日獲得了一次訓練後升級,使其指數得分從 40 提升至 50;Pro 尚未獲得同等升級,因此仍以 4 月的訓練後狀態接受評測。該公司自己也如此表示,將 Flash-0731 的代理式結果描述為「遠超 V4-Pro-Preview」。這種排名逆轉只是未完成發布過程中的一個快照,而即將到來的 Pro 發布正是終結此局面之物。
以 $0.435 / $0.87 的價格來建立成本模型是否安全?
有條件地,而且比一週前更不安全。這是公司目前公布的定價,且已反映出自 V4 發表時的費率大幅永久調降。但 DeepSeek 於 8 月 6 日宣布計劃全面調漲 API 價格,「預期將有顯著漲幅」,而新費率與生效日期尚未公布——此外,還有一項已公布但尚未生效的尖峰時段政策,會讓所有計費項目在每天七小時內加倍計算。請將兩種情境都納入模型,並注意即使是在加倍的情況下,仍比 Kimi K3 便宜約 6 倍。
誠實的解讀
這個預測一開始只對了一半,而它對的那一半,恰恰是人們最難以置信的部分。「便宜10倍」其實還是低估了:在相同的評測工作負載下,DeepSeek V4 Pro 的預覽版花費 176.34 美元,Kimi K3 則為 2,437.41 美元;而在快取輸入的場景下,差距不是十倍,而是將近八十倍。「達到 Kimi K3 水準」這部分則尚未實現——獨立實驗室對兩者進行的唯一一項綜合評測中,分數為 44 比 57;即使以公司自身最佳先例樂觀推估,也僅落在 54。
會改變這種解讀的因素,具體且值得留意。如果官方 V4 Pro 版本以訓練後升級的形式推出,而 Artificial Analysis 將其重新評分至 57 以上,這項預測便完全獲得證實,而本文的核心數字也將過時。如果它與尖峰時段附加費或 8 月 6 日宣布的漲價一同推出,價格論點便減半,有趣的問題變成:6 倍折扣能否買來 13 分的差距?如果該公司發布其評測框架(目前已進入封閉測試),目前讓 V4 Pro 在程式設計上佔優勢的廠商基準測試將首次可以查核。在這些情況之一發生之前,對 DeepSeek V4 Pro 的準確總結是:它是可下載權重的最佳性價比嚴肅推理模型;它不是最聰明的;而且其廠商已告訴我們,它尚未完成。
本文中的比較4
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
