
Step 5 Preview 對比 DeepSeek V4 Pro:一個是承諾,另一個是 MIT 授權條款
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
這場對決的一切,都取決於一個與基準測試毫無關係的問題:你究竟能下載到什麼?DeepSeek V4 Pro——廠商於 2026 年 8 月 13 日以 DeepSeek-V4-Pro-0813 名義發布的版本——是一個採用 MIT 授權的 1.6 兆參數混合專家模型,權重現在就擺在 Hugging Face 上。Step 5 Preview則是 StepFun 在 2026 年 9 月 20 日發表的 600 億參數稀疏 MoE,它在同一份獨立評測榜上高出八分,而它的 Hugging Face 儲存庫裡頭只有一個檔案:.gitattributes。StepFun 說 BF16 檢查點要到 10 月 15 日才會推出。所以,這個比較真正的樣貌並不是「哪個模型比較好」,而是「這兩者之中,哪一個是你這一季就能拿來開發的,哪一個還得再等。」
這種說法不如跑分對決來得刺激,卻有用得多,因為八分的差距和二十五天的等待並不是同一類事實。其中一項,你今天就能據此規劃。
八項要點,以及真正重要的四項
Artificial Analysis 讓這兩款模型都跑過 Intelligence Index v4.3.2——共十項評估——這也是唯一由同一方對這兩者進行測量的地方。
• 智慧指數 — Step 5 Preview 44 對比 DeepSeek V4 Pro 36
• 在該排行榜上的排名 — Step 5 Preview 在 200 個中排名第 24,而 DeepSeek V4 Pro 在其類別 113 個中排名第 7
• Terminal-Bench 4.0 — Step 5 Preview 33.3%;DeepSeek V4 Pro 並未列在同一份榜單上,因此沒有可引用的同類 agentic 資料列
• 輸出速度 — Step 5 Preview 99.8 詞元/秒,相較於 DeepSeek V4 Pro 88.8 詞元/秒
• 首個 token 時間 — Step 5 Preview 2.96 秒 vs DeepSeek V4 Pro 1.69 秒
• 每 100 萬個 token 的價格 — Step 5 Preview 輸入 $1.00/輸出 $2.70,相較於 DeepSeek V4 Pro 在 DeepSeek 尖峰費率下為輸入 $1.32/輸出 $3.96,離峰時段減半至 $0.66/$1.98
• 快取折扣 — Step 5 Preview 95% 對比 DeepSeek V4 Pro 97%
• 上下文 —— 兩者皆為 1M tokens;DeepSeek 公布了 384,000-token 的輸出上限,StepFun 則尚未公布。
• 權重 — Step 5 Preview 已結束,BF16 檢查點預定於 10 月 15 日;DeepSeek V4 Pro MIT,現已可下載
兩行數據與標題形成反差。DeepSeek V4 Pro 在 1.69 秒內吐出第一個 token,而 Step 5 Preview 則要 2.96 秒——每次呼叫都領先 43%,在漫長的 agent 迴圈中會層層累積成實實在在的耗時。而且它的快取折扣還多出兩個百分點,這對這兩款模型所主打的正好是同一種工作負載最為要緊:一個每一輪都重新送出相同系統提示與程式庫上下文的 agent,幾乎完全活在那個折扣裡。
八分的總體差距確實存在,而且它也比「八分」聽起來的要窄。一項指數是十項評估的綜合體,而兩個模型的分野正是在於其組成方式。Step 5 Preview 在 Terminal-Bench 4.0 上的 33.3% 是貨真價實的代理式成果;DeepSeek V4 Pro 自身最亮眼的強項,則是以開放權重層級中無人能及的價格提供長時程推理能力。兩個排行榜都沒有公布讓兩者直接對決的項目,而這正是這項比較無法用單一數字定論的誠實原因。

當供應商改變心意時,「開放」能為你帶來什麼
這是這場對決中,規格表無法承載的部分;而且值得用實際日期來說明,因為它發生在 Step 5 Preview 宣布的十一天前。
DeepSeek 曾告知使用者 V4 Pro 即將退役。9 月 9 日,該公司表示請求將被導向較新的 DeepSeek V4.1 Flash;9 月 10 日,它把日期確定為北京時間 9 月 14 日 12:00。9 月 11 日,它又推翻了決定——用 DeepSeek 自己的話來說,V4 Pro API 服務在 9 月 14 日之後繼續提供,計費不變。模型字串、100 萬個 token 的上下文,以及 500 個請求的併發上限,全都維持原樣,而 DeepSeek 的 Models & Pricing 頁面把這項逆轉以註腳的形式標在 deepseek-v4-pro 那一列。
把這理解為一場示範:開放權重真正能保護你免受什麼,以及它們無法保護你免受什麼。API 幾乎因為一項排程決策而被收回。權重則不會。一個 MIT 授權的檢查點放在你自己的硬體上,沒有供應商能宣布它退役;而那是一種不同於價格承諾的保證——它根本不是承諾。
而這正是 Step 5 Preview 目前所卡住的缺口。StepFun 已承諾 BF16 檢查點於 10 月 15 日推出,而它早已預留的儲存庫名稱——stepfun-ai/Step-5-Preview-BF16——正是你用來微調與量化的格式,在建立時命名、日後才填入內容。這是排程上的訊號,而非既成產物。在該儲存庫裡除了.gitattributes之外還裝有別的內容之前,Step 5 Preview 就是一個你只能租用的模型,依單一廠商的條件使用,既沒有可讀取的授權,若條件生變也毫無退路。
成為便宜選項的兩種方法
這兩款模型的定價都大幅低於封閉前沿,而且背後的機制並不相同,這對於這個價格能維持多久至關重要。
DeepSeek V4 Pro 之所以便宜,是因為有實驗室公開了權重,而競爭激烈的推論服務市場把利潤空間壓掉了。這形成了一道結構性的下限:任何人都能部署這個檢查點,因此價格是由 GPU 每小時成本決定,而不是由公司的定價策略決定。DeepSeek 自家的 API 以兩個時段計價——尖峰時段為 1.32 美元與 3.96 美元,離峰時段減半——而尖峰時段很窄,只在 UTC 平日早晨的幾個小時,因此多數流量都落在較便宜的費率上,週末也永遠不會遇到較高的價格。
Step 5 Preview 之所以便宜,是因為 StepFun 決定這樣定價。只有一個端點、一份價目表,沒有第二個來源。這不是指控——一個 600B/27B 的稀疏模型,其服務成本確實比參數量所暗示的更低,而激活參數比例就是原因。這單純是另一種價格,而當 StepFun 決定這個預覽版已完成任務的那一天,差異就會顯現出來。
兩者之間的價格差距小到不該決定任何事:$1.00 和 $2.70 對上 $1.32 和 $3.96,在輸入上相差 24%、輸出上相差 32%,完全落在快取折扣、輸出長度差異或重試率所能抹平的範圍內。在冗長度問題上,兩者很接近——Step 5 Preview 在索引測試中產生了 160M 輸出 token,而中位數為 92M,DeepSeek V4 Pro 自己的執行結果也落在同一區間。兩者都不是節省的模型,而且賣點都是每 token 便宜,而非每項任務便宜。

在真實堆疊中,每一個各自該放在哪裡
如果你需要一個可以微調、量化、託管在你自己的 VPC,或交給法務團隊並附上他們看得懂的授權檔案的模型,這根本不是難以取捨的選擇,也無關基準測試。DeepSeek V4 Pro 今天已依 MIT 授權提供。Step 5 Preview 沒有授權、沒有設定檔,也沒有參數檔案,而你最早能規劃的時間點是十月中。八點的指數差距並不會改變這個盤算,因為無法下載的模型就無法部署。
如果你想要的是每百萬輸入 token 一美元價位下所能取得的最強代理表現,Step 5 Preview 在唯一同時評測過兩者的榜單上領先,而且對於佔據代理迴圈大部分的試錯工作——擷取、分類、測試鷹架,以及介於兩次真正重要的呼叫之間的那些例行呼叫——它是更合適的預設選擇。它每秒 99.8 個 token 的輸出速度,也比 DeepSeek V4 Pro 的 88.8 更快完成輸出,縮短的不只是帳單,而是迴圈本身。
最棘手的情況,正是大多數團隊實際所處的處境:你想要 Step 5 Preview 的那個數字,卻不能把一個上線當天就開放、又沒有公布輸出上限的預覽端點,放進正式環境的流量路徑上。這是個路由問題,而這場比較也正以此作結。DeepSeek V4 Pro 可透過 OrcaRouter 以每百萬個 token 0.66 美元與 1.98 美元取得,也就是 DeepSeek 每百萬 token 1.32 美元與 3.96 美元價目表中的離峰半價,而一旁的周邊文字模型同樣如此——用同一把金鑰就能存取超過 200 個模型,且零加成,因此 DeepSeek 一旦調整價格,當天就會反映在你的帳單上,而不是等到續約時才生效。把探索性的那部分流量導向預覽版,讓正式路徑留在背後有授權的模型上,並以跨供應商的自動容錯移轉,來承擔預覽端點容量曲線所迫使其必須做的工作。

什麼能解決這件事?
有三件事,而這三件事都是可以查核的,而非可以爭論的。
首先是授權條款。當 BF16 檢查點發布時,儲存庫對於企業可以拿它做什麼,是怎麼規定的?寬鬆的授權本身就能彌補這個落差的大部分,因為它讓那八分的領先成為你可以擁有的東西,而不是租來的。限制性的授權則會讓 DeepSeek V4 Pro 成為這對模型中唯一一個你真正能據以打造產品的模型。
第二個是輸出上限。DeepSeek 公布的是 384,000 個 token。StepFun 的公告宣稱具備 1M 上下文,卻未提及輸出上限;而洩漏期間流傳的另一份第三方配置則列出 350,000 上下文與 64,000 的輸出上限。對於這兩款模型所主打的長時程代理式工作而言,這個數字絕非無足輕重的附註。
第三點是,一旦拿掉預覽後綴,價格是否還守得住。預覽價是獲客數字;正式推出價是商業模式。DeepSeek V4 Pro 的底價由競爭激烈的服務市場決定,不會有太大變動。Step 5 Preview 的底價則可能在某個星期二就變動。
在前兩個問題得到回答之前,務實的解讀是:DeepSeek V4 Pro 是你部署的模型,而 Step 5 Preview 則是你用來進行基準測試的模型——但有一個附帶條件:一個僅推出數天的預覽端點,竟然比一個成熟的 MIT 授權旗艦模型高出八個百分點,這是一個真實的結果,也是為什麼 10 月 15 日值得記在行事曆上,而不是被忽視。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
