產生的主視覺對比卡片標題為「Step 5 Preview 對比 A.X-K2」,副標題為「600B 的 API 模型對上 690B 的下載模型」。左欄「Step 5 Preview」寫道:AA Index 44,中位數 26;StepFun,於 2026 年 9 月 20 日發布;總參數約 600B/活躍參數 27B;上下文 1M tokens;每 1M 為 $1.00 輸入/$2.70 輸出;API,需付費。右欄「A.X-K2」寫道:AA Index 21,中位數 18;SK Telecom,於 2026 年 8 月 12 日發布;總參數約 690B/活躍參數 33B;上下文 262K tokens;未公布 API 價格;Apache-2.0 下載。頁尾寫道:「Index 數據依據 Artificial Analysis;A.X-K2 規格依據 SK Telecom。」
Guides & Insights

Step 5 Preview 對決 A.X-K2:600B API 模型對抗 690B 下載

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Step 5 Preview 與 A.X-K2 是今年秋天反覆出現的同一道抉擇的兩個選項:向 API 租用前沿等級的模型,還是把開放權重的旗艦模型帶回家自行運行。StepFun 的 Step 5 Preview 屬於租用派——於 2026 年 9 月 20 日發布,同日即可呼叫,每百萬輸入 token 收費 1.00 美元、每百萬輸出 token 收費 2.70 美元,總參數約 6,000 億、活躍參數 270 億,具備 100 萬 token 的上下文,並在獨立的人工分析智慧指數(Artificial Analysis Intelligence Index)拿下 44 分。SK Telecom 的 A.X-K2 則屬於下載派——於 2026 年 8 月 12 日以 Apache 2.0 授權釋出,總參數約 6,880 億至 6,920 億、活躍參數 330 億,上下文為 262K token,指數得分 21 分。一個規模更大,一個有標價,而有標價的那個,分數高出一大截。這種反差就是整場比較的重點,值得你在憑原則選邊站之前先弄明白。

這兩款模型常見的框架是國族式的:韓國的主權 AI 旗艦對上中國最激進的實驗室之一。那種框架對部署決策沒有幫助。有用的是,A.X-K2 是這兩者中唯一你能自己持有的,而 Step 5 Preview 是這兩者中唯一你能按 token 購買的。其餘一切都是由這個分野衍生而來。

數字,緊扣其來源

唯一真正能同基準比較的指標是 Intelligence Index,而且兩邊都是獨立評測:Step 5 Preview 為 44,對比同類模型的中位數 26;A.X-K2 為 21,對比其開放權重比較類別的中位數 18,兩者皆由同一個第三方以同一套量表測得。以撰寫當下讀到的數字來看,這些是今日的數據——當評測方重新校準時,這個指數上的分數會變動,而同一 A.X-K2 頁面較早的一次讀數顯示出更高的數字。這場對比中的其他一切,都附帶著你必須一併背負的出處標註。

• 獨立智慧 — Step 5 Preview:在 Artificial Analysis Intelligence Index 上獲 44 分,相較於 A.X-K2 在同一指數上獲 21 分,兩者皆經獨立測量。

• 總參數/活躍參數 — Step 5 Preview:依 StepFun 所述,總計約 600B,活躍參數 27B;對比 A.X-K2:依 SK Telecom 資料與索引卡,總計約 688–692B,活躍參數 33B。

• 上下文視窗 — Step 5 Preview:StepFun 為 1M tokens,相較於 A.X-K2:262K tokens。

• 模態 — Step 5 Preview 接受文字與圖像;A.X-K2 僅支援文字。

• 價格 — Step 5 Preview:每百萬輸入 $1.00、每百萬輸出 $2.70,由供應商公布;對比 A.X-K2:完全未公布商用 API 價格。

• 執行位置 — Step 5 Preview:StepFun 自家的 API 與 Studio,以及推廣期間的合作夥伴介面,對比 A.X-K2:你的硬體,透過下載即可。

• 發布 — Step 5 Preview 於 2026 年 9 月 20 日宣布,相較於 A.X-K2 於 2026 年 8 月 12 日發布。

• 授權條款 — Step 5 Preview:封閉預覽版,承諾於 2026 年 10 月 15 日釋出 BF16 權重,對比 A.X-K2:Apache 2.0。

A.X-K2:更重的儀器,證據卻更單薄

SK Telecom 打造 A.X-K2 作為 A.X K1 的後繼者,而這套架構直指長脈絡成本:採用混合專家(mixture-of-experts)配置,擁有 256 個專家、每個 token 啟用其中 8 個,並原生以 FP8 訓練,還搭載了該公司稱為 Sparse Gated Attention 的機制。這是一項紮實的工程成果,也正是為什麼一個總參數量近 7,000 億的模型,竟能由一家並非超大規模雲端業者的組織提供服務。

它沒有的,是獨立驗證。SK Telecom 報告,相較於 A.X K1,它在十四項基準測試上平均提升 32.2 分,在長脈絡與代理評估上躍升約 83.9 分,在 AIME 2026 上達到 97.1,在韓國知識基準 KMMLU-Pro 上達到 80.5,並在 CLIcK 上達到 91.6,還表示它在數學與韓語相關工作上可匹敵或超越近期 Qwen 和 DeepSeek 的發布版本。這些每一個都是廠商自家公布的數字。獨立分數——Intelligence Index 上的 21 分——超過其所屬開放權重比較類別的中位數 18,但比 Step 5 Preview 低二十三分;而 A.X-K2 的強項正落在該特定指數不太重視的地方:它的九項評估大多以英語為主、以推理與代理為核心,而且其中沒有任何一項是韓語基準測試。

這些都不會讓 A.X-K2 成為比其分數更差的模型。這反而讓它的分數成為一個下限,代表它在韓語或數學密集型工作負載上的表現——根據廠商自己的說法——直到獨立實驗室公布那些評測結果為止。成本方面則更具體:這個權重等級的參考部署需要四張 B300 等級的 GPU,以及以 FP8 格式計算的大約 656 GiB。那就是下載的代價,而且不同於 token 帳單,它不會在實驗結束時隨之縮減回去。

步驟 5 預覽:你今天就能透過 HTTP 試用的那一個

Step 5 Preview 的優勢不在於它更大或更開放——它兩者皆非——而在於它已定價、可供呼叫且經獨立評分,並且在十月期間可在三個合作夥伴介面免費試用。對於一個評估而非自行託管的團隊而言,這種組合比 Apache 2.0 授權更有價值,因為它把硬體決策轉化為一次 API 呼叫。不過,StepFun 關於該模型的技術文件在常見的地方相當薄弱:600B/27B 參數組合與 1M-token 上下文都是廠商自家的數字,其承諾的權重尚未發布,而獨立評測委員會關於它最有用的數字,可說不是 44 分,而是其冗長程度——在該指數的任務套件中生成約 1.6 億個輸出 token,而中位數接近 8,200 萬,且 A.X-K2 更為極端,約 2.3 億,對比 1.4 億的中位數。對一個每百萬輸出 token 收費 $2.70 的模型而言,這個差距就是便宜評估與昂貴生產習慣之間的差別。

為什麼較大的模型分數較低

參數數量不是得分,而這個配對乾淨俐落地證明了這一點。A.X-K2 多出的約 3,000 億總參數,換來的是密度,並在其自家評估套件所獎勵的地方展現出來——韓語深度、數學、廣泛知識——而兩款模型都名列其中的那個指數,則以英文為主、偏重推理且以代理為中心,而 Step 5 Preview 的建構團隊似乎刻意針對此處進行了調校。27B 啟用參數的設計,也讓 StepFun 模型在任何給定吞吐量下的服務成本都明顯更低,而這正是它之所以能有託管價格的原因。

還有第二種不那麼好看、結論卻正好相反的解讀。A.X-K2 自 8 月 12 日推出,Step 5 Preview 則自 9 月 20 日推出;較新的模型受到獨立檢視的週數較少,隨著更多評估出爐,其 44 可能還會變動。這兩個數字都是暫時性的,就像任何模型第一季的成績都是暫時性的一樣。差別在於,A.X-K2 的暫時性分數是 SK Telecom 手上最好的證據,而 Step 5 Preview 的暫時性分數則建立在第三方至少已部分重現的規格之上。

服務經濟學,而這正是決策真正所在之處。

如果你能直接呼叫它,每百萬個 token 輸入付 1.00 美元、輸出付 2.70 美元,這樣就結束了——不必採購、不必買 GPU、不必維運。如果你選擇下載,就得負擔硬體、電力、量化工作和評估框架的成本,但你的提示詞和資料都可以留在自己的邊界之內。A.X-K2 以 33B 活躍參數來說並不是筆電能跑的模型;參考配置是一組小型叢集。Step 5 Preview 的封閉預覽在 10 月 15 日之前完全不提供任何邊界,屆時承諾會釋出 BF16 權重——而在那些檔案真正出現在儲存庫之前,那個日期只是承諾,而不是一個選項。

Generated two-column scoreboard card titled 'Step 5 Preview vs A.X-K2 - the scoreboard'. The left column gives Step 5 Preview an independent index of 44 with a class median of 26, about 600B total and 27B active parameters, a 1M-token context, text and image input, $1.00 / $2.70 per 1M tokens, vendor API access as a closed preview, and a September 20 2026 release date. The right column gives A.X-K2 an independent index of 21 with a class median of 18, about 688-692B total and 33B active parameters, a 262K-token context, text-only input, no published price, Apache-2.0 download access, and an August 12 2026 release date. A footer reads 'Index figures per Artificial Analysis; vendor specifications per each lab, unreproduced.'

這正是路由層真正發揮價值、而不只是自我宣傳的時刻。多數團隊不想一次定生死地回答「租用還是自建」;他們想先知道某個模型在自己的流量上表現如何,再決定是否為它購置硬體,並在答案改變時保有轉換的能力。OrcaRouter 不路由 Step 5 Preview,也不路由 A.X-K2——這兩者目前都不在我們的目錄中。它所做的,是把超過 200 個模型放在單一 API 金鑰與一張帳單之後,0% 加價,並原樣傳遞供應商定價,因此你用任一款新旗艦模型所比較的對象,就是你今天下午就能呼叫的那一批,而且自動容錯切換會在你還在決定的同時,讓正式環境路徑持續運作。

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.Screenshot of the Artificial Analysis model page for A.X-K2, headed 'A.X-K2 Intelligence, Performance & Price Analysis', showing SK Telecom as the creator, an open-weights release date of August 2026, the line 'A.X-K2 scores 21 on the Artificial Analysis Intelligence Index, placing it above average among comparable models (median: 18)', a 262k-token context window, and the note that it generated 230M output tokens against a median of 140M.

該選哪一個

如果你的工作負載屬於一般推理、代理式程式編寫,或任何需要長脈絡的任務;如果你希望按 token 計費,而不是購買晶片;而且如果圖像輸入對你很重要——那就選擇 Step 5 Preview:它在獨立評分、脈絡長度、首次回應延遲,以及模態多樣性上都勝出,而且它是這兩者中唯一一個你能在本月以無需採購流程的方式展開試辦的。

選擇 A.X-K2,如果你的語言是韓語、如果你的工作量數學密集,或者如果資料根本不能離開你的基礎設施——而且要在心裡清楚知道:你是憑信任接受 SK Telecom 的基準測試表、硬體帳單是真實存在的,而你能指出的獨立分數低了二十三分。如果這筆交易看起來不划算,誠實的答案並不是改選另一款旗艦;而是在你自己的流量上對兩者做基準測試,因為那是任何一家廠商的數字都無法替代的唯一比較。

兩個模型都不是安全的預設選項。Step 5 Preview 是便宜、克制、可呼叫的選項,但權重仍在路上;A.X-K2 則是更笨重、主權化、可下載的選項,但證據仍待補。挑選真正綁住你團隊的那個限制——是邊界,還是帳單——然後放掉另一個。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新