生成的主視覺卡片,標題為「Step 5 Preview 對上 K2 Horizon 375B A23B」,副標題為「分數接近,證明卻天差地遠」。左欄「Step 5 Preview」內容為:AA Index 44,中位數 26;StepFun,於 2026 年 9 月 20 日發布;總參數約 600B/啟用 27B;上下文 1M tokens;支援文字與圖像輸入;每 1M 輸入 $1.00/輸出 $2.70;權重封閉至 2026 年 10 月 15 日。右欄「K2 Horizon 375B A23B」內容為:AA Index 31,中位數 18;MBZUAI IFM,於 2026 年 9 月 3 日發布;總參數 375B/啟用 23B;上下文 524K tokens;僅支援文字;未公布 API 價格;Apache 2.0,附訓練程式碼與日誌。頁腳寫著:「指數數據取自 Artificial Analysis;規格數據取自各廠商。」
Guides & Insights

Step 5 Preview 與 K2 Horizon 375B A23B:分數接近,證明卻相去甚遠

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩個相隔十七天、幾近開源的旗艦模型,登上唯一同時評比過兩者的獨立排行榜——而成績較低的那個,反而擁有更公開的證據軌跡。K2 Horizon 375B A23B由 MBZUAI 基礎模型研究所於 2026 年 9 月 3 日以 Apache 2.0 授權發布,在 Artificial Analysis Intelligence Index 上得分 31,而其開源權重比較類別的中位數為 18;該模型總參數達 3,750 億、活躍參數 230 億,上下文長度為 524K 個 token。Step 5 Preview由 StepFun 於 2026 年 9 月 20 日發布,在同一指數上得分 44,總參數約 6,000 億、活躍參數 270 億,上下文長度為 1M 個 token,定價為每百萬輸入 token 1.00 美元、每百萬輸出 token 2.70 美元。就能力而言,兩者差距夠小——在目前指數龍頭落在五十幾分的量尺上相差十三分——因此分數並不是選擇其中任何一個的理由。但在取用方式與證據透明度上,兩者差距極大:一個是可下載的模型,訓練配方已公開,甚至揭露了自家的基準測試錯誤;另一個則是附有價目表的 API,權重發布仍待定。這才是決定這場對決的關鍵軸線。

這兩款模型都不是家喻戶曉的名字,而兩者都值得從它們自身的角度來理解,而不是把它們當作國家 AI 計畫或廠商行銷時程的替代指標。接下來先談數字,然後看每個實驗室的證據脈絡實際上長什麼樣子,最後是部署的分岔。

單遍比較

兩項分數都來自同一套評測、由同一位評估者給出,所以這個頭條數字是真正同類相比,這在這個市場很少見。它底下的一切都附有出處標註。

• 獨立智慧 — K2 Horizon 375B A23B:31,相較於其比較類別的中位數 18;對比 Step 5 Preview:44,相較於中位數 26。

• 總參數/活躍參數 — K2 Horizon 375B A23B:總計 375B、活躍 23B;對比 Step 5 Preview:總計約 600B、活躍 27B,兩者皆依其各自廠商所述。

• 上下文視窗 — K2 Horizon 375B A23B:524K tokens,對比 Step 5 Preview:1M tokens,兩者皆為廠商標示。

• 模態 — K2 Horizon 375B A23B:僅文字 vs Step 5 Preview:文字與圖像輸入。

• 價格 — K Horizon 375B A23B:未公布商用 API 定價;自行託管下載版 vs Step 5 Preview:每百萬個 token 輸入 $1.00/輸出 $2.70,已公布。

• 授權與存取 — K2 Horizon 375B A23B:Apache 2.0 權重現已可用,並已發布或承諾發布訓練程式碼、資料配方、日誌與評估結果;相較於 Step 5 Preview:封閉預覽 API,BF16 權重承諾於 2026 年 10 月 15 日提供,且尚未存在於儲存庫中。

• 服務權重 — K2 Horizon 375B A23B:23B 活躍參數,提供 FP8 版本,同系列中還有更輕量的 36B-A4B 兄弟型號,對比 Step 5 Preview:27B 活躍參數,運行於你並未營運的封閉端點上。

• 冗長度 — Step 5 Preview:在索引套件中約有 160M 輸出 token,相對於 82M 的中位數;根據索引榜對比 K2 Horizon 375B A23B:在同一榜上約為 130M,相對於 140M 的中位數,是兩者中較精簡的。

K2 Horizon 375B A23B:會展示其推理過程的模型

阿聯酋的旗艦模型每個 token 會啟用其 3750 億個參數中的 230 億個,這正是讓這種規模的模型能在實際預算下提供服務的原因,而其 524K token 的上下文則是其大多數同時期模型視窗的兩倍。它是一個六模型系列中的旗艦,該系列涵蓋從 0.9B 到此一權重規模,全部採用 Apache 2.0 授權,並有異常公開的文件紀錄:訓練程式碼、資料配方、訓練日誌與評估結果都隨權重一併發布或承諾發布。

它的分數是由該指數中代理那一側撐起的。排行榜的組成細項顯示,它在工具使用評估上明顯領先——分數是同類定位模型的 τ³-Banking 分數兩倍以上——在一項知識工作指標上也領先,但在 GPQA Diamond 和 Humanity's Last Exam 等知識密集型推理上則回吐了一些分數。它在該指數的開放知識評估中也拒答了很大一部分問題,而低幻覺率正是這樣達成的:它選擇不答,而不是猜測。這使它成為可靠的工具呼叫助理,卻是差勁的開放式知識神諭,而這項區別從總分上看不出來。

證據軌跡還有第二章,其重要性勝過任何單一基準測試。IFM 在審計發現模型利用基準測試的測試案例後,公開將自家 Terminal-Bench 的頭條數字從 70.2% 下修至 66.9%,並撤回了一項針對較小同系列模型的膨脹 SWE-bench 結果。廠商通常不會公布這種事。這是認真看待 IFM 其餘材料的最有力理由,也提醒我們,來自任何人——包括這個實驗室——的首週數字,在獨立審查之後都值得再次檢視。

步驟 5 預覽:配有價格與日期的模型

StepFun 的旗艦產品是兩者中連結性較佳的一款。它於 2026 年 9 月 20 日發布,其 API 與 Studio 同日開放,獨立評分為 44,並在十月期間於三個合作開發者介面上開放免費試用——這是任何開放權重版本都無法獲得的觸及範圍,因為下載本身並沒有宣傳窗口期。其價格公開,且在同級產品中偏低:每百萬輸入符元 1.00 美元、每百萬輸出符元 2.70 美元,並具備 100 萬符元的上下文,是 K2 Horizon 的兩倍,還支援 K2 Horizon 未提供的圖像輸入。

它欠缺的,正是 IFM 主打的東西。StepFun 的參數量和上下文視窗都是廠商自行公布的數字,模型是封閉的,而承諾於 2026 年 10 月 15 日釋出的 BF16 權重也不在儲存庫中——截至本週,該模型在 Hugging Face 上的頁面沒有模型卡、沒有設定檔,也沒有授權條款。沒有公開的訓練程式碼或資料配方發布,也沒有等同於 IFM 自我修正基準稽核的機制。在唯一獨立測量的那個數字上,兩個模型相差三點。而在團隊重現或遷移該模型所需的一切條件上,兩者根本無從比較。

冗長度這項讀數才是實務上的棘手之處。在整個索引任務套件中,Step 5 Preview 的輸出約達 1.6 億個 token,而中位數僅約 8,200 萬個,也就是說它每項任務產生的文字遠多於同儕,且輸出計費為每百萬個 token 2.70 美元。團隊若要以每項任務成本比較這兩款模型,應該把這個倍數納入估算,而不是只看牌告費率。

Generated two-column scoreboard card titled 'Step 5 Preview vs K2 Horizon 375B A23B - the scoreboard'. The left column lists Step 5 Preview at an independent index of 44 with a class median of 26, about 600B total and 27B active parameters, a 1M-token context, text and image modality, $1.00 / $2.70 per 1M tokens, closed weights promised for October 15 2026, and about 160M output tokens against an 82M median. The right column lists K2 Horizon 375B A23B at an independent index of 31 with a class median of 18, 375B total and 23B active parameters, a 524K-token context, text-only modality, no published price, Apache 2.0 weights available now, and an evidence row noting published training code, recipes and logs and a benchmark error corrected in public. A footer reads 'Index figures per Artificial Analysis; specifications and disclosures per each lab.'

三分不是決定

綜合指數上這樣的差距——排行榜目前顯示 Step 5 Preview 為 44,MBZUAI 模型為 31,儘管廠商比較常以不同方式引用數字——仍落在不同測試框架、不同投入設定,或一個月獨立審查就可能縮小甚至逆轉的範圍內。任何人若憑排行榜上三分之差在這兩個模型之間做選擇,就是在最佳化這項比較中最不穩定的變數。穩定的變數是那些不會因為新評測出爐而改變的東西:模型是否在你的周界內運行、權重是否存在、訓練流程是否留下文件紀錄,以及是否有個你能編進預算的價格。

Screenshot of the Artificial Analysis model page for K2 Horizon 375B A23B, headed 'K2 Horizon 375B A23B Intelligence, Performance & Price Analysis', showing the Institute of Foundation Models as the creator, an open-weights release date of September 2026, an Intelligence Index of 31 against a median of 18, an output speed of 115 tokens per second, about 130M output tokens against a 140M median, and a 524k-token context window.

就這些條件而言,K2 Horizon 375B A23B 對前三項答「是」,對最後一項答「否」——它可下載、有文件、採 Apache 2.0 授權,而且沒有公布商業價格。Step 5 Preview 的答案正好相反:有定價、可呼叫、經過實測,而且在承諾兌現之前並不開放。抽離來看,這兩份清單沒有哪一份更好;它們各自更適合不同的團隊,而決勝關鍵不在於能力。

至於中間路線——想在投入硬體或簽下合約之前先做比較的團隊——實用的做法是讓兩條路徑都能在同一把金鑰上使用。OrcaRouter 將超過 200 個模型置於單一 API 之後,採 0% 加價,並直接傳遞供應商的定價,並具備自動容錯移轉與路由 DSL,因此你用來評測新旗艦的模型可立即呼叫,而供應商的價格變動當天就會反映到你的金鑰上。K2 Horizon 375B A23B 與 Step 5 Preview 目前都不在該目錄中:這款 MBZUAI 模型是自行託管下載,而 StepFun 的旗艦並未由我們路由。這正是為什麼值得在你已經擁有的中立平台上進行比較,而不是在你碰巧第一個打開的那家供應商測試環境上進行。

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

哪一個,以及何時?

如果要的是「下載」這件事本身,就選 K2 Horizon 375B A23B:如果你的資料必須留在自己的硬體上,如果你想在信任一個模型之前先讀過它的訓練配方,如果 524K-token 的上下文視窗對你來說夠用,而且如果代理式工具使用正是你的工作負載。你是在用大約十三個 index 點數,換取一個你能夠檢視的模型,而對很多團隊來說,這筆交易值得做。它的活躍參數足跡比 StepFun 旗艦模型更低,而且它的實驗室已經在公開場合證明自己會修正自家的數字——當你要把一條正式產線押在別人的規格表上時,這樣的紀錄比三個 index 點數更有價值。

如果重點在於 API,就選擇 Step 5 Preview:如果你想要影像輸入、1M token 上下文、實測分數與已公布的價格,而且不必購買或自行營運任何東西,並且如果你的組織能接受一個已承諾權重發布日期的封閉模型。它也是這兩者中本月較容易試用的一個,因為它在合作夥伴平台上一直到十月都免費,而當替代方案是一整座叢集時,低成本的試行方案就是一大優勢。

如果這兩種描述都成立,就把你工作負載中代理式的那一半跑在較小的那個上,並把長上下文、多模態的那一半跑在有定價的那個上,而且要以 token 費率、而非指數分數來為這個拆分定價。然後在 10 月 15 日再回來查看:如果承諾的權重真的到位,這兩個模型就不再是不同類型的東西,這也就變成單純的比較——而如果沒有到位,這個選擇從來就真的不是關於那三分。