產生的標題卡標題為「Step 5 Preview 對比 DeepSeek V4 Pro —— 你可以下載什麼」,分為兩欄:Step 5 Preview 的 AA 指數為 44,總參數 600B/活躍參數 27B,權重承諾於 10 月 15 日發布,而其儲存庫只包含一個 .gitattributes 檔案;DeepSeek V4 Pro 的 AA 指數為 36,總參數 1.6T/活躍參數 49B,權重採用 MIT 授權且現在即可下載,並在 Hugging Face 上有完整檢查點。頁腳寫著「兩項指數數字均依據 Artificial Analysis Intelligence Index v4.3.2,在最高推理強度下測得。」
Guides & Insights

Step 5 Preview 對比 DeepSeek V4 Pro:一個是承諾,另一個是 MIT 授權條款

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這場對決的一切,都取決於一個與基準測試毫無關係的問題:你究竟能下載到什麼?DeepSeek V4 Pro——廠商於 2026 年 8 月 13 日以 DeepSeek-V4-Pro-0813 名義發布的版本——是一個採用 MIT 授權的 1.6 兆參數混合專家模型,權重現在就擺在 Hugging Face 上。Step 5 Preview則是 StepFun 在 2026 年 9 月 20 日發表的 600 億參數稀疏 MoE,它在同一份獨立評測榜上高出八分,而它的 Hugging Face 儲存庫裡頭只有一個檔案:.gitattributes。StepFun 說 BF16 檢查點要到 10 月 15 日才會推出。所以,這個比較真正的樣貌並不是「哪個模型比較好」,而是「這兩者之中,哪一個是你這一季就能拿來開發的,哪一個還得再等。」

這種說法不如跑分對決來得刺激,卻有用得多,因為八分的差距和二十五天的等待並不是同一類事實。其中一項,你今天就能據此規劃。

八項要點,以及真正重要的四項

Artificial Analysis 讓這兩款模型都跑過 Intelligence Index v4.3.2——共十項評估——這也是唯一由同一方對這兩者進行測量的地方。

• 智慧指數 — Step 5 Preview 44 對比 DeepSeek V4 Pro 36

• 在該排行榜上的排名 — Step 5 Preview 在 200 個中排名第 24,而 DeepSeek V4 Pro 在其類別 113 個中排名第 7

• Terminal-Bench 4.0 — Step 5 Preview 33.3%;DeepSeek V4 Pro 並未列在同一份榜單上,因此沒有可引用的同類 agentic 資料列

• 輸出速度 — Step 5 Preview 99.8 詞元/秒,相較於 DeepSeek V4 Pro 88.8 詞元/秒

• 首個 token 時間 — Step 5 Preview 2.96 秒 vs DeepSeek V4 Pro 1.69 秒

• 每 100 萬個 token 的價格 — Step 5 Preview 輸入 $1.00/輸出 $2.70,相較於 DeepSeek V4 Pro 在 DeepSeek 尖峰費率下為輸入 $1.32/輸出 $3.96,離峰時段減半至 $0.66/$1.98

• 快取折扣 — Step 5 Preview 95% 對比 DeepSeek V4 Pro 97%

• 上下文 —— 兩者皆為 1M tokens;DeepSeek 公布了 384,000-token 的輸出上限,StepFun 則尚未公布。

• 權重 — Step 5 Preview 已結束,BF16 檢查點預定於 10 月 15 日;DeepSeek V4 Pro MIT,現已可下載

兩行數據與標題形成反差。DeepSeek V4 Pro 在 1.69 秒內吐出第一個 token,而 Step 5 Preview 則要 2.96 秒——每次呼叫都領先 43%,在漫長的 agent 迴圈中會層層累積成實實在在的耗時。而且它的快取折扣還多出兩個百分點,這對這兩款模型所主打的正好是同一種工作負載最為要緊:一個每一輪都重新送出相同系統提示與程式庫上下文的 agent,幾乎完全活在那個折扣裡。

八分的總體差距確實存在,而且它也比「八分」聽起來的要窄。一項指數是十項評估的綜合體,而兩個模型的分野正是在於其組成方式。Step 5 Preview 在 Terminal-Bench 4.0 上的 33.3% 是貨真價實的代理式成果;DeepSeek V4 Pro 自身最亮眼的強項,則是以開放權重層級中無人能及的價格提供長時程推理能力。兩個排行榜都沒有公布讓兩者直接對決的項目,而這正是這項比較無法用單一數字定論的誠實原因。

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

當供應商改變心意時,「開放」能為你帶來什麼

這是這場對決中,規格表無法承載的部分;而且值得用實際日期來說明,因為它發生在 Step 5 Preview 宣布的十一天前。

DeepSeek 曾告知使用者 V4 Pro 即將退役。9 月 9 日,該公司表示請求將被導向較新的 DeepSeek V4.1 Flash;9 月 10 日,它把日期確定為北京時間 9 月 14 日 12:00。9 月 11 日,它又推翻了決定——用 DeepSeek 自己的話來說,V4 Pro API 服務在 9 月 14 日之後繼續提供,計費不變。模型字串、100 萬個 token 的上下文,以及 500 個請求的併發上限,全都維持原樣,而 DeepSeek 的 Models & Pricing 頁面把這項逆轉以註腳的形式標在 deepseek-v4-pro 那一列。

把這理解為一場示範:開放權重真正能保護你免受什麼,以及它們無法保護你免受什麼。API 幾乎因為一項排程決策而被收回。權重則不會。一個 MIT 授權的檢查點放在你自己的硬體上,沒有供應商能宣布它退役;而那是一種不同於價格承諾的保證——它根本不是承諾。

而這正是 Step 5 Preview 目前所卡住的缺口。StepFun 已承諾 BF16 檢查點於 10 月 15 日推出,而它早已預留的儲存庫名稱——stepfun-ai/Step-5-Preview-BF16——正是你用來微調與量化的格式,在建立時命名、日後才填入內容。這是排程上的訊號,而非既成產物。在該儲存庫裡除了.gitattributes之外還裝有別的內容之前,Step 5 Preview 就是一個你只能租用的模型,依單一廠商的條件使用,既沒有可讀取的授權,若條件生變也毫無退路。

成為便宜選項的兩種方法

這兩款模型的定價都大幅低於封閉前沿,而且背後的機制並不相同,這對於這個價格能維持多久至關重要。

DeepSeek V4 Pro 之所以便宜,是因為有實驗室公開了權重,而競爭激烈的推論服務市場把利潤空間壓掉了。這形成了一道結構性的下限:任何人都能部署這個檢查點,因此價格是由 GPU 每小時成本決定,而不是由公司的定價策略決定。DeepSeek 自家的 API 以兩個時段計價——尖峰時段為 1.32 美元與 3.96 美元,離峰時段減半——而尖峰時段很窄,只在 UTC 平日早晨的幾個小時,因此多數流量都落在較便宜的費率上,週末也永遠不會遇到較高的價格。

Step 5 Preview 之所以便宜,是因為 StepFun 決定這樣定價。只有一個端點、一份價目表,沒有第二個來源。這不是指控——一個 600B/27B 的稀疏模型,其服務成本確實比參數量所暗示的更低,而激活參數比例就是原因。這單純是另一種價格,而當 StepFun 決定這個預覽版已完成任務的那一天,差異就會顯現出來。

兩者之間的價格差距小到不該決定任何事:$1.00 和 $2.70 對上 $1.32 和 $3.96,在輸入上相差 24%、輸出上相差 32%,完全落在快取折扣、輸出長度差異或重試率所能抹平的範圍內。在冗長度問題上,兩者很接近——Step 5 Preview 在索引測試中產生了 160M 輸出 token,而中位數為 92M,DeepSeek V4 Pro 自己的執行結果也落在同一區間。兩者都不是節省的模型,而且賣點都是每 token 便宜,而非每項任務便宜。

Generated two-column comparison scoreboard titled 'Step 5 Preview vs DeepSeek V4 Pro — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, parameters 600B total / 27B active, price $1.00 / $2.70, cache discount 95%, TTFT 2.96s, and weights due October 15. The right column gives DeepSeek V4 Pro the rows AA Index 36, parameters 1.6T total / 49B active, price $1.32 / $3.96, cache discount 97%, TTFT 1.69s, and weights MIT-licensed and downloadable now. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2 at maximum reasoning effort.'

在真實堆疊中,每一個各自該放在哪裡

如果你需要一個可以微調、量化、託管在你自己的 VPC,或交給法務團隊並附上他們看得懂的授權檔案的模型,這根本不是難以取捨的選擇,也無關基準測試。DeepSeek V4 Pro 今天已依 MIT 授權提供。Step 5 Preview 沒有授權、沒有設定檔,也沒有參數檔案,而你最早能規劃的時間點是十月中。八點的指數差距並不會改變這個盤算,因為無法下載的模型就無法部署。

如果你想要的是每百萬輸入 token 一美元價位下所能取得的最強代理表現,Step 5 Preview 在唯一同時評測過兩者的榜單上領先,而且對於佔據代理迴圈大部分的試錯工作——擷取、分類、測試鷹架,以及介於兩次真正重要的呼叫之間的那些例行呼叫——它是更合適的預設選擇。它每秒 99.8 個 token 的輸出速度,也比 DeepSeek V4 Pro 的 88.8 更快完成輸出,縮短的不只是帳單,而是迴圈本身。

最棘手的情況,正是大多數團隊實際所處的處境:你想要 Step 5 Preview 的那個數字,卻不能把一個上線當天就開放、又沒有公布輸出上限的預覽端點,放進正式環境的流量路徑上。這是個路由問題,而這場比較也正以此作結。DeepSeek V4 Pro 可透過 OrcaRouter 以每百萬個 token 0.66 美元與 1.98 美元取得,也就是 DeepSeek 每百萬 token 1.32 美元與 3.96 美元價目表中的離峰半價,而一旁的周邊文字模型同樣如此——用同一把金鑰就能存取超過 200 個模型,且零加成,因此 DeepSeek 一旦調整價格,當天就會反映在你的帳單上,而不是等到續約時才生效。把探索性的那部分流量導向預覽版,讓正式路徑留在背後有授權的模型上,並以跨供應商的自動容錯移轉,來承擔預覽端點容量曲線所迫使其必須做的工作。

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro at www.orcarouter.ai/models/deepseek/deepseek-v4-pro, showing the model id deepseek/deepseek-v4-pro, a 1M-token context and 384K max output, input pricing of $0.66 and output pricing of $1.98 per million tokens, a p50 time to first token of 4.01 seconds, 3,730M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

什麼能解決這件事?

有三件事,而這三件事都是可以查核的,而非可以爭論的。

首先是授權條款。當 BF16 檢查點發布時,儲存庫對於企業可以拿它做什麼,是怎麼規定的?寬鬆的授權本身就能彌補這個落差的大部分,因為它讓那八分的領先成為你可以擁有的東西,而不是租來的。限制性的授權則會讓 DeepSeek V4 Pro 成為這對模型中唯一一個你真正能據以打造產品的模型。

第二個是輸出上限。DeepSeek 公布的是 384,000 個 token。StepFun 的公告宣稱具備 1M 上下文,卻未提及輸出上限;而洩漏期間流傳的另一份第三方配置則列出 350,000 上下文與 64,000 的輸出上限。對於這兩款模型所主打的長時程代理式工作而言,這個數字絕非無足輕重的附註。

第三點是,一旦拿掉預覽後綴,價格是否還守得住。預覽價是獲客數字;正式推出價是商業模式。DeepSeek V4 Pro 的底價由競爭激烈的服務市場決定,不會有太大變動。Step 5 Preview 的底價則可能在某個星期二就變動。

在前兩個問題得到回答之前,務實的解讀是:DeepSeek V4 Pro 是你部署的模型,而 Step 5 Preview 則是你用來進行基準測試的模型——但有一個附帶條件:一個僅推出數天的預覽端點,竟然比一個成熟的 MIT 授權旗艦模型高出八個百分點,這是一個真實的結果,也是為什麼 10 月 15 日值得記在行事曆上,而不是被忽視。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新