
Step 5 Preview 與 K2 Horizon 375B A23B:分數接近,證明卻相去甚遠
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百萬 tokens
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
兩個相隔十七天、幾近開源的旗艦模型,登上唯一同時評比過兩者的獨立排行榜——而成績較低的那個,反而擁有更公開的證據軌跡。K2 Horizon 375B A23B由 MBZUAI 基礎模型研究所於 2026 年 9 月 3 日以 Apache 2.0 授權發布,在 Artificial Analysis Intelligence Index 上得分 31,而其開源權重比較類別的中位數為 18;該模型總參數達 3,750 億、活躍參數 230 億,上下文長度為 524K 個 token。Step 5 Preview由 StepFun 於 2026 年 9 月 20 日發布,在同一指數上得分 44,總參數約 6,000 億、活躍參數 270 億,上下文長度為 1M 個 token,定價為每百萬輸入 token 1.00 美元、每百萬輸出 token 2.70 美元。就能力而言,兩者差距夠小——在目前指數龍頭落在五十幾分的量尺上相差十三分——因此分數並不是選擇其中任何一個的理由。但在取用方式與證據透明度上,兩者差距極大:一個是可下載的模型,訓練配方已公開,甚至揭露了自家的基準測試錯誤;另一個則是附有價目表的 API,權重發布仍待定。這才是決定這場對決的關鍵軸線。
這兩款模型都不是家喻戶曉的名字,而兩者都值得從它們自身的角度來理解,而不是把它們當作國家 AI 計畫或廠商行銷時程的替代指標。接下來先談數字,然後看每個實驗室的證據脈絡實際上長什麼樣子,最後是部署的分岔。
單遍比較
兩項分數都來自同一套評測、由同一位評估者給出,所以這個頭條數字是真正同類相比,這在這個市場很少見。它底下的一切都附有出處標註。
• 獨立智慧 — K2 Horizon 375B A23B:31,相較於其比較類別的中位數 18;對比 Step 5 Preview:44,相較於中位數 26。
• 總參數/活躍參數 — K2 Horizon 375B A23B:總計 375B、活躍 23B;對比 Step 5 Preview:總計約 600B、活躍 27B,兩者皆依其各自廠商所述。
• 上下文視窗 — K2 Horizon 375B A23B:524K tokens,對比 Step 5 Preview:1M tokens,兩者皆為廠商標示。
• 模態 — K2 Horizon 375B A23B:僅文字 vs Step 5 Preview:文字與圖像輸入。
• 價格 — K Horizon 375B A23B:未公布商用 API 定價;自行託管下載版 vs Step 5 Preview:每百萬個 token 輸入 $1.00/輸出 $2.70,已公布。
• 授權與存取 — K2 Horizon 375B A23B:Apache 2.0 權重現已可用,並已發布或承諾發布訓練程式碼、資料配方、日誌與評估結果;相較於 Step 5 Preview:封閉預覽 API,BF16 權重承諾於 2026 年 10 月 15 日提供,且尚未存在於儲存庫中。
• 服務權重 — K2 Horizon 375B A23B:23B 活躍參數,提供 FP8 版本,同系列中還有更輕量的 36B-A4B 兄弟型號,對比 Step 5 Preview:27B 活躍參數,運行於你並未營運的封閉端點上。
• 冗長度 — Step 5 Preview:在索引套件中約有 160M 輸出 token,相對於 82M 的中位數;根據索引榜對比 K2 Horizon 375B A23B:在同一榜上約為 130M,相對於 140M 的中位數,是兩者中較精簡的。
K2 Horizon 375B A23B:會展示其推理過程的模型
阿聯酋的旗艦模型每個 token 會啟用其 3750 億個參數中的 230 億個,這正是讓這種規模的模型能在實際預算下提供服務的原因,而其 524K token 的上下文則是其大多數同時期模型視窗的兩倍。它是一個六模型系列中的旗艦,該系列涵蓋從 0.9B 到此一權重規模,全部採用 Apache 2.0 授權,並有異常公開的文件紀錄:訓練程式碼、資料配方、訓練日誌與評估結果都隨權重一併發布或承諾發布。
它的分數是由該指數中代理那一側撐起的。排行榜的組成細項顯示,它在工具使用評估上明顯領先——分數是同類定位模型的 τ³-Banking 分數兩倍以上——在一項知識工作指標上也領先,但在 GPQA Diamond 和 Humanity's Last Exam 等知識密集型推理上則回吐了一些分數。它在該指數的開放知識評估中也拒答了很大一部分問題,而低幻覺率正是這樣達成的:它選擇不答,而不是猜測。這使它成為可靠的工具呼叫助理,卻是差勁的開放式知識神諭,而這項區別從總分上看不出來。
證據軌跡還有第二章,其重要性勝過任何單一基準測試。IFM 在審計發現模型利用基準測試的測試案例後,公開將自家 Terminal-Bench 的頭條數字從 70.2% 下修至 66.9%,並撤回了一項針對較小同系列模型的膨脹 SWE-bench 結果。廠商通常不會公布這種事。這是認真看待 IFM 其餘材料的最有力理由,也提醒我們,來自任何人——包括這個實驗室——的首週數字,在獨立審查之後都值得再次檢視。
步驟 5 預覽:配有價格與日期的模型
StepFun 的旗艦產品是兩者中連結性較佳的一款。它於 2026 年 9 月 20 日發布,其 API 與 Studio 同日開放,獨立評分為 44,並在十月期間於三個合作開發者介面上開放免費試用——這是任何開放權重版本都無法獲得的觸及範圍,因為下載本身並沒有宣傳窗口期。其價格公開,且在同級產品中偏低:每百萬輸入符元 1.00 美元、每百萬輸出符元 2.70 美元,並具備 100 萬符元的上下文,是 K2 Horizon 的兩倍,還支援 K2 Horizon 未提供的圖像輸入。
它欠缺的,正是 IFM 主打的東西。StepFun 的參數量和上下文視窗都是廠商自行公布的數字,模型是封閉的,而承諾於 2026 年 10 月 15 日釋出的 BF16 權重也不在儲存庫中——截至本週,該模型在 Hugging Face 上的頁面沒有模型卡、沒有設定檔,也沒有授權條款。沒有公開的訓練程式碼或資料配方發布,也沒有等同於 IFM 自我修正基準稽核的機制。在唯一獨立測量的那個數字上,兩個模型相差三點。而在團隊重現或遷移該模型所需的一切條件上,兩者根本無從比較。
冗長度這項讀數才是實務上的棘手之處。在整個索引任務套件中,Step 5 Preview 的輸出約達 1.6 億個 token,而中位數僅約 8,200 萬個,也就是說它每項任務產生的文字遠多於同儕,且輸出計費為每百萬個 token 2.70 美元。團隊若要以每項任務成本比較這兩款模型,應該把這個倍數納入估算,而不是只看牌告費率。

三分不是決定
綜合指數上這樣的差距——排行榜目前顯示 Step 5 Preview 為 44,MBZUAI 模型為 31,儘管廠商比較常以不同方式引用數字——仍落在不同測試框架、不同投入設定,或一個月獨立審查就可能縮小甚至逆轉的範圍內。任何人若憑排行榜上三分之差在這兩個模型之間做選擇,就是在最佳化這項比較中最不穩定的變數。穩定的變數是那些不會因為新評測出爐而改變的東西:模型是否在你的周界內運行、權重是否存在、訓練流程是否留下文件紀錄,以及是否有個你能編進預算的價格。

就這些條件而言,K2 Horizon 375B A23B 對前三項答「是」,對最後一項答「否」——它可下載、有文件、採 Apache 2.0 授權,而且沒有公布商業價格。Step 5 Preview 的答案正好相反:有定價、可呼叫、經過實測,而且在承諾兌現之前並不開放。抽離來看,這兩份清單沒有哪一份更好;它們各自更適合不同的團隊,而決勝關鍵不在於能力。
至於中間路線——想在投入硬體或簽下合約之前先做比較的團隊——實用的做法是讓兩條路徑都能在同一把金鑰上使用。OrcaRouter 將超過 200 個模型置於單一 API 之後,採 0% 加價,並直接傳遞供應商的定價,並具備自動容錯移轉與路由 DSL,因此你用來評測新旗艦的模型可立即呼叫,而供應商的價格變動當天就會反映到你的金鑰上。K2 Horizon 375B A23B 與 Step 5 Preview 目前都不在該目錄中:這款 MBZUAI 模型是自行託管下載,而 StepFun 的旗艦並未由我們路由。這正是為什麼值得在你已經擁有的中立平台上進行比較,而不是在你碰巧第一個打開的那家供應商測試環境上進行。

哪一個,以及何時?
如果要的是「下載」這件事本身,就選 K2 Horizon 375B A23B:如果你的資料必須留在自己的硬體上,如果你想在信任一個模型之前先讀過它的訓練配方,如果 524K-token 的上下文視窗對你來說夠用,而且如果代理式工具使用正是你的工作負載。你是在用大約十三個 index 點數,換取一個你能夠檢視的模型,而對很多團隊來說,這筆交易值得做。它的活躍參數足跡比 StepFun 旗艦模型更低,而且它的實驗室已經在公開場合證明自己會修正自家的數字——當你要把一條正式產線押在別人的規格表上時,這樣的紀錄比三個 index 點數更有價值。
如果重點在於 API,就選擇 Step 5 Preview:如果你想要影像輸入、1M token 上下文、實測分數與已公布的價格,而且不必購買或自行營運任何東西,並且如果你的組織能接受一個已承諾權重發布日期的封閉模型。它也是這兩者中本月較容易試用的一個,因為它在合作夥伴平台上一直到十月都免費,而當替代方案是一整座叢集時,低成本的試行方案就是一大優勢。
如果這兩種描述都成立,就把你工作負載中代理式的那一半跑在較小的那個上,並把長上下文、多模態的那一半跑在有定價的那個上,而且要以 token 費率、而非指數分數來為這個拆分定價。然後在 10 月 15 日再回來查看:如果承諾的權重真的到位,這兩個模型就不再是不同類型的東西,這也就變成單純的比較——而如果沒有到位,這個選擇從來就真的不是關於那三分。
