一張生成的主視覺卡片,標題為「Reflection Beam:501B 參數、23B 啟用」,副標為「稀疏 MoE/23.8T 預訓練 token/256K token API 上下文/權重本月承諾釋出/所有數據皆由廠商自行回報」。文字下方有三個扁平線性圖示:一個堆疊層示意圖,其中多數層以淡色呈現、僅一層highlighted,一組九塊伺服器磚的機架,以及一份帶有小掛鎖的文件大綱。OrcaRouter 標誌合成於右下角。
Guides & Insights

Reflection Beam 詳解:501B 參數、23B 活躍參數,以及尚未釋出的權重

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年10月5日,Reflection 宣布Reflection Beam,這是一款稀疏專家混合語言模型,總參數量5010億,每個 token 啟動其中230億個參數,並在同日推出其 Beta、OpenAI 相容端點。這意味著任一時刻只有4.6%的模型處於活躍狀態——即使以當前開放權重領域的標準來看,這也是相當激進的比例——而整個發布成敗就取決於這個數字。Reflection 表示,完整權重、技術報告和模型卡將於本月稍後以 Apache 2.0 發布。截至今日,這些都尚未出現,Reflection 自家平台各處都未公布價格,而 Artificial Analysis 也沒有該模型的條目。因此,對這次發布最誠實的總結是:由訓練該模型的實驗室提出的一項非常具體的效率主張,而所有佐證數字都由該實驗室提供。

Reflection 自家的比較表將 Reflection Beam 與 Inkling、Nemotron 3 Ultra、GLM 5.2、GLM 5.3、Kimi K3、Qwen3.8 Max及 DeepSeek V4.1 Flash並列比較,這如實描繪了它所瞄準的層級:強大但並非最前沿的開放與半開放模型,其中幾款的規模只有 Beam 的一小部分。Beam 在原始能力上並未超越這個群體,而我們會確切指出它在哪些地方落敗。它宣稱能做到的,是在推理分數相當時,耗費的推論運算量大約只有 GLM 5.2 的三分之一到四分之一,同時仍能位居該群體前段。這項宣稱正是本文的主題。

今天實際存在的是什麼

本節所有內容均取自 Reflection 自家的文件,閱讀日期為 2026 年 10 月 6 日。此 API 已以 beta 版形式上線,但須先排進等候名單才能使用;權重則尚未釋出。

• 型號 ID — Beam-501B-A23B,建立於 2026 年 10 月 5 日。

• 介面 — 位於 api.reflection.ai/openai/v1 的 OpenAI 相容介面,僅提供 Chat Completions 與 Models 清單,別無其他。沒有 Completions,沒有 embeddings,沒有 batches。

• 上下文 — 256,000 個詞元,並在數字本身附上一則註腳:「上下文視窗在測試版期間可能有所變動。」最大輸出為 128,000 個詞元。

• 推理 — 一個 reasoning_effort 參數,包含五個值:low、medium、high、xhigh 和 max。預設值為 medium,而且無論設定為何,模型一律會進行推理——沒有關閉開關。

• 模態——文字輸入、文字輸出。推出時不支援圖像或音訊輸入,這與 Inkling 有實質差異;Inkling 是 Mira Murati 的 Thinking Machines 在七月推出的多模態優先模型。

• 知識截止日期 — 2026年6月30日。

• 價格——未公開。Reflection 的部落格文章、其說明文件與模型列表全都略過它,而平台主控台則藏在註冊牆之後。

最後一行比表面上看起來更重要。Beam 比較集中的其他每個模型,都有公開定價,你今天就能輸入到試算表裡。Beam 沒有,這表示現在任何關於它的成本論點,都是關於運算的論點,而不是關於金錢的論點。

A single-column infographic titled 'Reflection Beam - the scoreboard' with six rows reading 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300', 'API context: 256,000 tokens (beta footnote)', 'Reasoning effort: five levels, default medium', 'Price: not published anywhere' and 'Independent scores: none - no Artificial Analysis row'. A footer reads 'Vendor-reported; no independent reproduction. Weight release promised for later this month.' The OrcaRouter logo is composited in the bottom-right corner.

501比23的比例就是論點所在

稀疏性並非新事;問題在於一間實驗室願意把它推到多遠。GLM 5.2 在據報約 7,440 億的總參數中,約有 400 億個活躍參數——約 5.4%。Reflection Beam 則在 5,010 億中佔 4.6%。就帳面而言,這只是再往前一小步,而 Reflection 對其所能宣稱的成果也相當謹慎。

發布文章中的效率數字來自一張以 Artificial 與 DataCurve 資料繪製的圖表,圖中將推理分數對應到估計的推論 FLOPs,而 FLOPs 是以活躍參數數量的兩倍乘以平均生成詞元數來近似。這個公式刻意排除了提示前綴處理(prompt prefill)、注意力成本與服務開銷。它是個粗略的估算模型,並非實測結果,Reflection 也沒有把它當成實測來呈現——但它同時是「相同分數下便宜 3 到 4 倍」這項說法唯一的量化依據,而且還是由供應商自己寫的。就把它當成一項假設:等權重正式發布後,自然會有人能加以檢驗。

這種架構在實務上換來的,是一套服務側寫。230 億個活躍參數,代表這是一個能在相對少量 GPU 上、以互動式延遲運行的模型;而即使模型卡上的參數數量相同,它仍與 5,010 億參數的稠密模型是截然不同的產品。這正是 Reflection 能談論接近前沿的推理能力,卻不必談論資料中心規模部署的原因。

不到四週就能完成預訓練,而且揭露的資訊異常具體

訓練說明是這份發布內容中讀起來真正具有資訊價值的部分,因為 Reflection 公布了大多數實驗室都會保留在內部的數字。

• 預訓練——在 NVL72 機架中的 6,144 顆 GB300 晶片上處理 23.8 兆個 token,於不到四週內完成,據報導有效吞吐率達 92.3%,過程中曾九次從檢查點回溯。

• 強化學習 — 使用 10,500 顆 GB300 晶片,為期四週,超過 1 億次 rollout,最大 rollout 上下文為 256,000 個 token,約 13 億個沙箱與約 100 萬個不同環境,平均有 110,000 次 rollout 同時執行。

• 中期訓練——將模型的有效上下文擴展至100萬個詞元。

• 穩定性 — 非同步策略梯度在長達數天的延遲下仍能保持穩定,再加上可控制的長度懲罰,讓推理長度無須重新訓練即可調整。

把預訓練與 RL 這兩條線一起看,這個說法的輪廓就浮現了。效率這件事不只是關於推論時的有效參數量;也關乎模型訓練得有多快,以及有多少算力投入了受環境綁定的 RL,而不是投入更多 token。一百萬個環境與 13 億個沙箱,是關於工具使用與代理式訓練基礎設施的宣言,而且這與 Reflection 選擇率先端出的基準測試相符。

有一個數字值得特別標記。那篇部落格說 midtraining 會把有效脈絡延伸到 100 萬個 token;API 文件則列出 256,000 個 token 的服務上限,並附上一則 beta 註腳。前者是訓練端的能力,後者是服務端的限制,兩者並不矛盾——但這個落差正好是那種在沒人讀第二份文件時,會變成「100 萬脈絡」標題的東西,而下週要寫 Beam 相關報導的人,應該去讀一讀第二份文件。

A screenshot of the Artificial Analysis language-model leaderboard, showing the ranked Intelligence Index table with per-model scores. No Reflection Beam row is present - the model is absent from the board, which is the point of the capture.

基準測試:Reflection Beam 在哪裡勝出,以及在哪裡未能勝出

以下每一項數字皆由廠商自行回報,出自 Reflection 發布文章中的表格,且其中沒有任何一項經過獨立重現。比較欄位所用的數字,與 Reflection 為其他模型公布的相同;若原始表格中某個儲存格顯示「NR」,代表該模型並未執行。Beam 沒有 Artificial Analysis 的資料列,因此這裡沒有任何內容經過第三方測試框架。

代理式編程

• Terminal-Bench v2.1 — Beam 80.1 對比 GLM 5.2 81.0、GLM 5.3 88.2、Kimi K3 88.3、Qwen3.8 Max 86.6、DeepSeek V4.1 Flash 90.6、Inkling 63.8、Nemotron 3 Ultra 56.4。

• SWE-Bench Pro v1 — Beam 65.5 對比 Qwen3.8 Max 67.7,GLM 5.2 62.1,Inkling 54.3,Nemotron 3 Ultra 46.4。

• SWE-Bench Pro v2-Hard — Beam 77.2 對比 Kimi K3 88.2,GLM 5.3 84.3,Inkling 56.9。

• SWE-Bench Verified — Beam 80.9 對比 Inkling 77.6,Nemotron 3 Ultra 70.7。

• SWE-Bench Multilingual — Beam 78.0 對 Nemotron 3 Ultra 67.7。

• DeepSWE v1.1 — Beam 44.4 對比 DeepSeek V4.1 Flash 74.2、Kimi K3 68.0、GLM 5.3 61.0、Qwen3.8 Max 51.0、GLM 5.2 44.0。

• SWE Atlas 程式碼庫問答 — Beam 34.6 對 Kimi K3 68.0,GLM 5.3 61.0。

最後那一列才是值得好好深思的。長跨度儲存庫問答,正是模型必須在漫長互動過程中把整個程式碼庫記在腦中的情境,而 34.6 對上 68.0 可不是四捨五入的差距。DeepSWE 也說明了類似的故事:44.4 讓 Beam 與 GLM 5.2 並駕齊驅,卻遠遠落後於 DeepSeek V4.1 Flash。

推理

• AIME 2026 — Beam 97.8 對上 GLM 5.2 99.2,Inkling 97.1。

• HLE,無工具 — Beam 36.2 對上 Kimi K3 46.9、Qwen3.8 Max 43.6、GLM 5.3 42.3、GLM 5.2 40.5、DeepSeek V4.1 Flash 39.1、Inkling 29.7、Nemotron 3 Ultra 26.7。

• GPQA — Beam 90.5 對上 Kimi K3 93.5、Qwen3.8 Max 92.6、GLM 5.3 91.7、GLM 5.2 91.2、DeepSeek V4.1 Flash 90.9、Inkling 87.2、Nemotron 3 Ultra 87。

• SciCode — Beam 49.7 對比 GLM 5.3 的 59.0、Kimi K3 58.7、Qwen3.8 Max 52.1、DeepSeek V4.1 Flash 52.0、Inkling 46.1、Nemotron 3 Ultra 44.6。

• CriPT AA — Beam 16.3 對比 Kimi K3 23.4、GLM 5.2 20.9、Qwen3.8 Max 20.0、GLM 5.3 19.1、DeepSeek V4.1 Flash 14.3、Inkling 5.4、Nemotron 3 Ultra 3.1。

Beam 的推理表現概況處於中段,而且模式相當一致:穩穩領先 Reflection 名單上來自前一代的兩款模型,但落後於當前這款。GPQA Diamond 拿到 90.5 是不錯的分數,卻有四款其他模型超越它。

• MCP Atlas — Beam 78.7 對比 Qwen3.8 Max 84.5、GLM 5.3 84.2、Kimi K3 82.3、GLM 5.2 77.8、Inkling 76.0、Nemotron 3 Ultra 63.1。

• AutomationBench,公開分割 — Beam 37.0 對比 DeepSeek V4.1 Flash 54.8、GLM 5.3 48.2、Kimi K3 46.7、Qwen3.8 Max 39.8、GLM 5.2 26.2。

• tau3 banking — Beam 38.0 對比 Qwen3.8 Max 55.2、GLM 5.2 37.1、Kimi K3 37.1、Inkling 25.0、Nemotron 3 Ultra 22.6。

• 具備上下文管理的 BrowseComp — Beam 77.4 對比 Kimi K3 91.2、Inkling 77.1、Nemotron 3 Ultra 44.4。

• 具備上下文管理的 DeepSearchQA — Beam 80.1 對比 Kimi K3 95.0。

Reflection 也在文章中展示了兩項能力示範:在「Land or Water」謎題上達到 95.5% 的解題率,那是一塊 180×90、共 16,200 點的棋盤,需要維持龐大的盤面狀態——這個數字介於 Reflection 歸給 Opus 5 與 Fable 5 在同一任務上的 92.5% 與 97.8% 之間——以及對最小的 Gemma-4 進行 Text2SQL 微調,將留出集準確率提升至 66.5%。示範是經過挑選的;它們顯示模型能完成某件事,而非多常能做到。

你今天可以用它做什麼,以及你不該以它為前提來規劃什麼

如今,一般情況下確切可行的事只有一件:申請 Beta 存取權,並使用符合 OpenAI 形式的用戶端,透過 Reflection 自家的端點呼叫 Beam-501B-A23B。官方並未公布價格,因此無法推算在其上執行工作負載的成本。權重也未釋出,因此無法自行託管、無法量化、無法微調,也沒有第三方可重現性。更沒有獨立的基準測試項目,因此上述的整體效能樣貌,全都仰賴單一實驗室的表格。

Reflection Beam 不是我們的路由之一。我們不會暗示它是,也不會把你導向可能有它的經銷商。我們能告訴你的是那個比較組的價格,因為其中四個模型是由我們路由,而下列數字是今天早上從我們自家目錄即時讀取的:GLM 5.2 每百萬 token 輸入 $1.40、輸出 $4.40,GLM 5.3 為 $1.26 與 $3.96,Qwen3.8 Max 為 $2.00 與 $6.00,DeepSeek V4.1 Flash 為 $0.15 與 $0.60。這是實實在在的價差——DeepSeek V4.1 Flash 的輸入成本比 GLM 5.2 便宜近十倍——這也是為什麼一個沒有定價的 beta 模型很難納入決策。OrcaRouter 以一組與 OpenAI 相容的金鑰串接這些模型以及 200 多個其他模型,並依供應商定價原樣傳遞、不加收任何費用,這意味著廠商調價當天我們這邊就會生效,而不是等經銷商哪天更新。而且因為自動容錯移轉是路由的一部分,而不是你得自己建置的東西,一個新且未經證實的模型正是你可以只放一部分流量、而不是放在關鍵路徑上的那種東西——這也是使用一個還沒有人重現其基準測試結果的模型時,唯一負責任的方式。

A screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model name, the pass-through list price of $1.40 per million input tokens and $4.40 per million output tokens, the 1,000,000-token context window and the release date 2026-06-16.

在認真看待效率宣稱之前,該注意什麼

三件事將能讓這個問題塵埃落定,而其中兩件已承諾會在本月內兌現。

第一項是權重。Apache 2.0 與一份技術報告,會讓任何擁有幾台節點的人都能衡量真正重要的事——在固定品質門檻下,每顆 GPU 每秒可處理多少 token,以及 230 億個活躍參數是否真能帶來圖表所暗示的每 FLOP 分數。在那之前,效率論述都只是餐巾紙上的算術。

第二點是價格。沒有標價的模型,在成本比較中沒有立足之地;而如果 Beam 的定價高於 GLM 和 DeepSeek 這個級距,那麼對任何有預算的人來說,算力故事就不再重要。如果低於這個級距,情況很快就會改觀。

第三個是第三方在執行這套測試套件。上述每個數字都出自同一份文件,而一份由廠商自行提報、卻讓自家模型在十六列中有七列落後的表格,對該實驗室的誠實度而言是個好跡象——但它仍然只是一個實驗室、一套測試框架、一組提示詞。

如果你今天就需要一個有能力的代理式程式設計者,而且需要知道它的成本,答案目前還不是 Reflection Beam。也許三週後會是。值得為其效率宣稱押注的模型,是那種你可以下載其權重、自己計算其 FLOPs 的模型——而在這項檢驗上,Reflection 給我們的是日期,而不是模型。

本文中的比較4

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新