一張生成的主視覺卡片,標題為「Reflection Beam vs Kimi K3」,副標為「同樣的基準測試名稱,兩套不同的測試框架。」並有三個數據標籤,分別寫著「Terminal-Bench 2.1:80.1 對 88.3」、「獨立執行:85.0」以及「價格:未公開 對 $3 / $15」。下方有三個扁平線性圖示:一個帶勾號的剪貼板、一把測量長條的尺,以及一個置於長條圖上的放大鏡。OrcaRouter 標誌合成在右下角。
Guides & Insights

Reflection Beam 對比 Kimi K3:相同的基準名稱,兩套不同的測試框架

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Reflection Beam 在 Terminal-Bench 2.1 上得分 80.1。Kimi K3 得分 88.3。把這兩個數字並排放在一起——正如本週大多數報導所做的那樣——你會得出結論:Beam 距離該領域最佳的開放模型大約還差八分。但這兩個數字並非來自同一個房間。Beam 的 80.1 是廠商自行回報的,取自 Reflection 自家發布文章中的表格。Kimi K3 的 88.3 同樣是廠商自行回報的,這次來自 Moonshot 自家的表格——而廠商的表格只會在競爭對手的成績是跑在該廠商自己的測試框架上、使用該廠商自己的提示集、在該廠商自己的推理強度設定下時,才會印出對手的成績。第三方機構 Artificial Analysis 其後以同名基準測試跑了 Kimi K3,並公布結果為 85.0。那是 4.9 分的差距,而非 8.2 分——而且這個修正的方向完全可以預料,因為被侵蝕的那個數字,永遠是來自那個有東西需要證明的實驗室。

那正是本文標題所承諾的比較所面臨的整體問題,也是這篇文章前半部分談的是來源出處、而非分數的原因。Reflection Beam是一個擁有 5,010 億參數的稀疏專家混合模型,每個詞元啟用 230 億參數,由 Reflection AI 於 2026 年 10 月 5 日發表,同日推出與 OpenAI 相容的測試版端點。Kimi K3是 Moonshot AI 的旗艦開源模型,收錄於我們自家的目錄中,發布日期為 2026 年 7 月 15 日,並由 Artificial Analysis 獨立評分。其中一款是有費率表與第三方測試框架實測結果的已上市產品;另一款則是列入候補名單的測試版,其權重、技術報告與價格都還不存在。將兩者相比並非對等的比較,若假裝對等,只會產出一個看似精確、實則錯誤的頁面。

30秒版本

• 就紙面數據而言,Beam 每 FLOP 更快,但實務上並未定價,也未經重現。Kimi K3 則由第三方評分,輸入每百萬個 token 定價 3.00 美元、輸出 15.00 美元,且已全面正式推出。

• 在雙方都跑過的那唯一一項基準測試——Terminal-Bench 2.1——上,一旦雙方的數字都來自中立的測試框架,真實差距約為五個百分點,而非八個。

• Beam 真正的優勢是結構性的,而非數字上的:一個 23B 活躍參數的服務設定檔,以及一個承諾中的 Apache 2.0 授權條款。這兩者目前都無法使用。

• 如果你這週就需要一個模型,這不是碰運氣。這是一個已推出的模型,以及一個候補名單。

Reflection 究竟發表了什麼,又是針對誰

Reflection 的發布貼文中,用一張評分卡與另外七個模型進行比較:Inkling、Nemotron 3 Ultra、GLM 5.2、GLM 5.3、Kimi K3、Qwen 3.8 Max 和 DeepSeek V4.1 Flash。表格中的每個數字都是廠商自行報告的,沒有任何一項經過獨立重現,而且 Artificial Analysis 上沒有 Reflection Beam 的頁面——截至 2026 年 10 月 6 日,該模型頁面在他們的網站上顯示 404。原始表格中有幾個儲存格標記為 NR,因為該模型未運行。

以下是那張表格中 Beam 對 K3 的完整切片,每個維度一行:

• Terminal-Bench 2.1 — Beam 80.1 對 Kimi K3 88.3

SWE-Bench Pro v2-Hard — Beam 77.2 對 Kimi K3 88.2

• DeepSWE v1.1 — Beam 44.4 對 Kimi K3 68.0

• SWE Atlas 程式碼庫問答 — Beam 34.6 對比 Kimi K3 68.0

• HLE,不使用工具 — Beam 36.2 對 Kimi K3 46.9

• GPQA Diamond — Beam 90.5 對比 Kimi K3 93.5

• SciCode — Beam 49.7 vs Kimi K3 58.7

• MCP Atlas — Beam 78.7 對比 Kimi K3 82.3

• 具備上下文管理的 BrowseComp — Beam 77.4 對比 Kimi K3 91.2

• DeepSearchQA 搭配上下文管理 — Beam 80.1 對比 Kimi K3 95.0

誠實地讀那份清單,這次發布的輪廓就會浮現。Reflection 並沒有在任何地方宣稱勝過 K3。它宣稱的是:在推理分數相當的情況下,花費的推論算力比 GLM 5.2 少三到四倍,卻能落在某一級別的前段班——而兩個模型唯一接近的那一列,Terminal-Bench 2.1,正是這項比較最不可信的一列。

為什麼測試框架比分數更重要

基準名稱只是標籤,而非規格。Terminal-Bench 2.1 指的是在特定代理框架下執行的一組特定任務,搭配特定的重試策略、特定的 token 預算,以及特定的推理強度設定。兩個實驗室都可以誠實地報告一個「Terminal-Bench 2.1」的數字,卻得出無法相互比較的結果,因為大部分的變異正是來自框架與強度設定。Artificial Analysis 之所以會以一個組織的形式存在,正是因為這個原因:它以單一套測試框架、單一組配置,跨多個模型運行,好讓它的數字可以彼此相減。

所以 Reflection 為 Beam 印出的 80.1,是廠商在自家測試框架上得出的廠商數字,而它為 K3 印出的 88.3 也是廠商數字——該廠商就是 Reflection,在衡量自家的競爭對手。第二個數字是這一行裡最不可靠的數字:一間實驗室在自家測試框架上跑對手的權重,既沒有誘因以對手的最佳配置來跑,也沒有義務揭露自己選了哪一種配置。這其中沒有任何不誠實之處;它就只是一個數字,其來源無法支撐報導賦予它的分量。

Artificial Analysis 自家的測試結果顯示,Kimi K3 在 Terminal-Bench 2.1 上取得 85.02,同時在 Terminal-Bench v4.0——一項不同且更難的測試——上為 12.6,AA Coding Index 為 76.2(在榜上眾多模型中排名第 9),Intelligence Index 為 43.6,GPQA Diamond 93.5,HLE 46.9,SciCode 59.5,tau-banking 45.98,以及 88.7 的 Long-Context Recall。這些數字是從我們自家系統中 K3 的型錄卡讀出的,來源標註為 artificialanalysis.ai,評估快照日期為 2026 年 7 月 15 日。在那份清單所涵蓋的範圍裡,Beam 只有一個數字,而它來自 Reflection。這樣的缺席應該是暫時的,而非永久的:Artificial Analysis 已表示 Reflection 提供了存取權,而它正在對該模型進行基準測試,其自家早期的說法——Beam「將會是我們所見過、在同等智慧水準下最省 token 的開源模型之一」——是基準測試機構在釋出一項預期,而非在報告結果。在那個分數印出來之前,本文的數字是無法相減的,我們也不打算假裝不然。

A two-column infographic titled 'Reflection Beam vs Kimi K3 - the scoreboard'. The left column 'Reflection Beam' reads 'Terminal-Bench 2.1: 80.1 vendor', 'Context window: 256K beta', 'Input modality: text only', 'Price per 1M tokens: not published', 'Cache reads: none documented', 'AA Intelligence Index: none'. The right column 'Kimi K3' reads 'Terminal-Bench 2.1: 88.3 vendor, 85.0 independent', 'Context window: 1.05M', 'Input modality: text + image', 'Price per 1M tokens: 3.00 / 15.00', 'Cache reads: 0.30', 'AA Intelligence Index: 43.6'. A footer reads 'Beam figures vendor-reported and unreproduced; K3 figures per Artificial Analysis and MoonshotAI's published rate card.' The OrcaRouter logo is composited in the bottom-right corner.

每一個要花多少錢,以及每一個是什麼

成本比較的結果並不接近,而且根本稱不上是比較,因為其中一方是空白的。

• 價格 — Kimi K3 每百萬個 token 為輸入 $3.00/輸出 $15.00,快取讀取為 $0.30;相較之下,Reflection Beam:在 Reflection 的部落格、文件或模型列表中,任何地方都未公布價格,且平台主控台藏於註冊牆之後。

• 上下文 — Kimi K3 上為 1,048,576 個 token,相較於 Beam 測試版的 256,000 個,且 Beam 自家文件中的註腳寫著「上下文視窗在測試期間可能有所變動。」

• 模態 —— Kimi K3 接受文字與圖像;Reflection Beam 為文字輸入、文字輸出,推出時不具備圖像或音訊通道。

• 可用性 — Kimi K3 即日起正式推出;Reflection Beam 為需排隊候補的 beta 版本,權重承諾於十月稍晚以 Apache 2.0 授權釋出。

• 獨立評分 — K3 在 Artificial Analysis 中有完整的評分列;Beam 則無。

• 服務概況 — Kimi K3 是一款大型、偏稠密的前沿模型,根據我們自家 playground 在過去一週的測量,輸出速度為每秒 46.8 個 token;Beam 的 23B 活躍參數是支持更低延遲與更低每 token 成本的實質架構論據,但目前沒有公開端點可供實測。

這個效率宣稱值得再多花一句話審慎看待,因為它是這次發布的頭條賣點,而它所承擔的分量已超出它所能負荷。Reflection 的「推論運算量少 3 到 4 倍」來自一張圖表,該圖表將 FLOPs 近似為活躍參數數量的兩倍乘以平均生成詞元數。這個公式刻意排除了提示前填充、注意力成本與服務開銷——也就是在長上下文代理工作中佔據帳單大头的那些部分。這是對運算比值的粗略估算,不是實測數據,不是金額數字,而且是由廠商自己建構出來的。就把它當作一個假設,讓權重日後供其他人檢驗吧。

OrcaRouter 在這其中的定位

Kimi K3 是我們提供的其中一條路由。它列出的價格是每百萬 token 輸入 $3.00、輸出 $15.00,快取讀取為 $0.30,這是 Moonshot 的供應商費率原樣轉嫁、分毫未加——所以如果 Moonshot 更動它的價目表,我們頁面上的數字會在同一天跟著變,而不是等經銷商哪天重新整理才更新。它可以透過 一組與 OpenAI 相容的金鑰,與其他 200 多個模型並列呼叫,這在這裡有個具體原因:「Beam 還是 K3?」的誠實答案是,正在避險的團隊不該二選一。因為 自動故障轉移是路由本身的一部分,而不是你得自行打造的東西,像 Beam 這樣的模型——beta、未定價、未經任何第三方評分——正是你該放在一部分流量上、而非放在關鍵路徑上的東西。你預設把工作路由到 K3,等你的候補名單邀請到手時分給 Beam 一部分流量,並讓路由在出錯時回退到 K3。這是你能對一個未經證實的模型做出的決定。把正式環境路徑賭在這種東西上則不是。

A screenshot of the OrcaRouter model page for kimi/kimi-k3, showing the model name, a 1,048,576-token context, text and image input, tool and reasoning support, and pricing of $3.00 input and $15.00 output per million tokens with an 8.63 s median time to first token.

什麼會改變這個判決?

三件事,按重要性由高至低排列。

一個價格。若 Beam 的定價落在 K3 級距之下,效率論證就會從理論變成具體事實。第二,權重。Apache 2.0 加上一份技術報告,能讓任何手上有幾台節點的人,在固定的品質門檻下量測每顆 GPU 的每秒 token 數——這才是真正能定奪運算宣稱的測試。第三,第三方測試框架的實測。Reflection 已讓 Artificial Analysis 取得存取權,預期會有一個分數從中出爐;在那個數字印出來之前,坊間流通的每一項 Beam 對 K3 的數據,追根究底都來自這兩家供應商之一所寫的文件。

兩個值得直接回答的問題

Reflection Beam 比 Kimi K3 更好嗎?

就目前可取得的證據來看,不——而且也沒有任何人發表過證據證明確實如此。Reflection 自己的表格顯示,K3 在上述全部十個共同列中都領先,其中幾項的差距(SWE Atlas 34.6 對 68.0,DeepSearchQA 80.1 對 95.0)並不小。Beam 的論點在於每單位能力的成本,而在權重與價格出現之前,這個論點不過是廠商自繪的一張圖表。

我應該等 Beam 的權重釋出後,再基於 K3 進行開發嗎?

唯有在自架設是必要條件而非偏好時,才需要如此考慮,因為那是這兩者無法互相替代的唯一面向——K 僅提供 API,而 Beam 承諾提供 Apache 2.0 權重。如果你是呼叫 API,K3 已可使用、已有評分與定價,而 Beam 還在候補名單。那種決定沒有任何版本值得為它延後專案。

A screenshot of the OrcaRouter models index page, showing the filter rail for input modality, context length, input price, status and series alongside a model grid headed '207 models, 16 providers, one API key, one bill' and a three-step panel explaining how to call any model through the OpenAI-compatible endpoint.

Reflection 給了我們一個日期和一張圖表,而日期不是模型。這次發布真正能確立的一件事是:一個 501B 模型、啟用 23B 參數,可以被訓練到與開放前沿只差幾個百分點——如果權重真的到位、數字也經得起檢驗,這對效率而言會是個有意義的結果。但這還不足以成為把工作從一個第三方實際測量過的模型上移走的理由。