
Reflection Beam 推出 Beta 版 API,但權重仍需再等兩週
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 150 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 222 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Reflection 的第一個模型叫做Reflection Beam,而今天早上它有趣的地方並不在於它已經存在——而是它只有一半存在。該公司在 2026 年 10 月 5 日發表 Beam,將其描述為稀疏混合專家模型,總參數量 5,010 億,每個 token 啟用 230 億參數,並在同一天推出 Beta 版、與 OpenAI 相容的端點。權重承諾本月稍晚以 Apache 2.0 釋出,同時附上技術報告、模型卡與服務堆疊。在這些東西到位之前,唯一能執行 Beam-501B-A23B 的人,就是 Reflection 發放候補名單金鑰的對象,而流通中的每一項效能數據都來自同一個實驗室自家的表格。
發布停在這種地方很奇怪,而值得精確說明我們手上的是哪一半。Reflection 已經推出了一個你可以報名試用的預覽版,以及一套沒有人重現過的基準測試表。它還沒有推出標題中「開放權重」所指的那個東西。
今天早上實際上正在直播的是什麼?
本節中的所有內容均來自 Reflection 自己的部落格文章與文件,閱讀日期為 2026 年 10 月 6 日。
• 模型 ID — Beam-501B-A23B,建立於 2026 年 10 月 5 日,於 api.reflection.ai/openai/v1 提供服務,僅有 Chat Completions 與 Models 清單,別無其他。
• 形狀 — 總參數為 5,010 億,每個 token 啟用 230 億,啟用比例約為 4.6%。作為規模參考,GLM 5.2 約為 5.4%。
• 情境 — API 上為 256,000 個 token,並在該數字本身附有註腳,警告視窗在 beta 期間可能有所變動。最大輸出為 128,000 個 token。
• 推理 — 一個 reasoning_effort 參數,提供五種設定:low、medium、high、xhigh 和 max。medium 是預設值,且模型一律會進行推理。沒有關閉開關,也沒有非推理模式。
• 模態 — 文字輸入,文字輸出。推出時不支援圖像、音訊或視訊輸入。
• 價格——未公開。部落格文章沒有提及,說明文件也沒有提及,而平台主控台則位於註冊牆之後。
• 使用權 — 候補名單。沒有自助途徑,也沒有權重,因此沒有下載、沒有量化,也沒有微調。
價格那一行,是會改變你如何解讀其他一切的那一行。在 Reflection 自己的表格中,Beam 被拿來比較的七個模型裡,有四個有公開定價,你今天就能放進試算表。Beam 沒有,所以目前任何關於它的成本說法,都是關於運算,而不是關於美元。

發射所繫的數字
Reflection 的賣點是推論效率,而且它對這代表什麼異常具體:在進階推理基準測試上,Beam 的得分與 GLM 5.2 相當,但使用的推論運算量少了 3 到 4 倍。據描述,面對 2 兆參數等級的模型時,增益甚至更大,而 Qwen 3.8-Max 正屬於這個級別。
那個說法背後的圖表值得仔細閱讀,因為它是整篇文章的關鍵支撐證據。圖中標繪了 DeepSWE、Humanity's Last Exam 與 Terminal-Bench 2.1 上推理分數對比估計推論 FLOPs 的關係,並將 FLOPs 估算為大約是活躍參數量乘以每次嘗試平均生成 token 數的兩倍。這個公式刻意排除了提示預填、依賴上下文的注意力運算與服務額外開銷——Reflection 在圖說中已如此說明。它是模型之間的一致比較,而非任何人帳單的測量值,而且它也是效率主張唯一的量化支持,且是由打造該模型的實驗室所撰寫。就把它當成一項假設,讓權重交給其他人去檢驗。
這套架構實際上換來的是一套推論服務輪廓。兩百三十億個活躍參數,代表這是個能在相對少量 GPU 上以互動式延遲合理執行的模型;儘管規格表上的數字相同,它仍是與 5,010 億參數稠密模型不同的產品。這就是為什麼 Reflection 可以談論接近前沿的推理能力,卻不必談資料中心規模的部署——也是為什麼最終的權重釋出,會是比 beta 金鑰更重要的事件。
Beam 在 Reflection 自身資料表上的落點
以下每一項數據皆由廠商提供,出自 Reflection 發布貼文中的表格,且沒有任何一項經過獨立重現。若 Reflection 未公布某個模型的數字,原始文件中該儲存格會顯示為 NR。比較欄位屬於 Reflection,不是我們的,也不是第三方的。
程式編寫與終端機作業
• Terminal-Bench v2.1 — Reflection Beam 80.1,對上 GLM 5.2 81.0、GLM 5.3 88.2、Kimi K3 88.3、Qwen 3.8-Max 86.6 以及 DeepSeek V4.1 Flash 90.6。Beam 落後於它們每一個。
• SWE-Bench Verified — Reflection Beam 80.9,對上 Inkling 77.6 與 Nemotron 3 Ultra 70.7。這是 Beam 看起來最強的地方,但請注意,清單上只有最弱的兩個模型曾在它上面執行。
• SWE-Bench Pro v1 — Reflection Beam 65.5 對上 Qwen 3.8-Max 67.7、GLM 5.2 62.1、Inkling 54.3、Nemotron 3 Ultra 46.4。
• SWE-Bench Pro v2-Hard — Reflection Beam 77.2,對上 Kimi K3 88.2、GLM 5.3 84.3、Inkling 56.9。距離榜首有十分的差距。
• DeepSWE v1.1 — Reflection Beam 44.4,對上 DeepSeek V4.1 Flash 74.2、Kimi K3 68.0、GLM 5.3 61.0、Qwen 3.8-Max 51.0、GLM 5.2 44.0。Beam 與前一代持平,並落後領先者三十分。
• SWE Atlas Codebase QnA — Reflection Beam 34.6,對上 Kimi K3 68.0 與 GLM 5.3 61.0。在長時間互動中將大型儲存庫牢記於心,是這份清單上最困難的一件事,而 Beam 的 34.6 並不是四捨五入造成的差距。
推理與科學
• AIME 2026 — Reflection Beam 97.8,對上 GLM 5.2 的 99.2 與 Inkling 的 97.1。
• HLE(不使用工具)——Reflection Beam 36.2,對比 Kimi K3 46.9、Qwen 3.8-Max 43.6、GLM 5.3 42.3、GLM 5.2 40.5、DeepSeek V4.1 Flash 39.1、Inkling 29.7、Nemotron 3 Ultra 26.7。位居中段,僅領先兩款前一代模型。
• GPQA Diamond — Reflection Beam 90.5,相較於 Kimi K3 93.5、Qwen 3.8-Max 92.6、GLM 5.3 91.7、GLM 5.2 91.2、DeepSeek V4.1 Flash 90.9。
• SciCode — Reflection Beam 49.7,對上 GLM 5.3 的 59.0、Kimi K3 的 58.7、Qwen 3.8-Max 的 52.1、DeepSeek V4.1 Flash 的 52.0。
• CriPT AA — Reflection Beam 16.3 對上 Kimi K3 23.4、GLM 5.2 20.9、Qwen 3.8-Max 20.0、GLM 5.3 19.1、DeepSeek V4.1 Flash 14.3、Inkling 5.4、Nemotron 3 Ultra 3.1。
工具、搜尋與長上下文
• MCP Atlas — Reflection Beam 78.7,對比 Qwen 3.8-Max 的 84.5、GLM 5.3 的 84.2、Kimi K3 的 82.3、GLM 5.2 的 77.8。
• AutomationBench,公開分割 — Reflection Beam 37.0 對上 DeepSeek V4.1 Flash 54.8、GLM 5.3 48.2、Kimi K3 46.7、Qwen 3.8-Max 39.8、GLM 5.2 26.2。
• tau3 banking — Reflection Beam 38.0 對比 Qwen 3.8-Max 55.2、GLM 5.2 37.1、Kimi K3 37.1。
• 搭配上下文管理的 BrowseComp — Reflection Beam 77.4 對上 Kimi K3 91.2、Inkling 77.1、Nemotron 3 Ultra 44.4。
• 具備脈絡管理的 DeepSearchQA —— Reflection Beam 80.1 對上 Kimi K3 95.0。
• AA-LCR — Reflection Beam 79.3 對比 Kimi K3 88.7、DeepSeek V4.1 Flash 84.0、Qwen 3.8-Max 80.3、GLM 5.3 79.7、Nemotron 3 Ultra 79.3、GLM 5.2 78.3、Inkling 77.3。長上下文召回是 Beam 真正具有競爭力而非中游水平的那一項通用能力指標。
把這四張表放在一起讀,就會浮現一個一致的格局:Beam 在 Reflection 的清單上,幾乎每一列都勝過兩款前一代模型,卻輸給當前這款,差距從些微到足以判定出局不等。一家廠商願意公布自家模型在這麼多列上都落後的表格,對該實驗室的誠信而言是個好跡象。但這並不代表該模型已處於前沿。

迄今為止唯一的獨立聲音,以及它沒有說出的內容
目前唯一有公開記錄的第三方評估是 Artificial Analysis;該機構於10月5日表示,Reflection 已授予其存取權,且它正獨立對 Beam 進行基準測試,並補充說早期指標顯示,就 Beam 的智能水準而言,它將是該機構見過 token 效率最高的開放模型之一。
那是來自一個組織的有意義聲明,而其指數正是大多數買家實際上會閱讀的那一份;這也是一則沒有附上數字的聲明。截至今天早上,Artificial Analysis 的排行榜上並沒有 Beam 這一列——模型頁面會回傳 404,而排行榜的酬載也不包含 Beam 項目——因此,就目前而言,token 效率的宣稱只是第三方承諾它將會發布某些內容。指數中尚未有任何內容以 Beam 重新計算過。
訓練內容的披露,是這次發布中最有力的部分。
Reflection 貼文中的工程部分包含了多數實驗室都保留在內部的數字,而這些數字值得記錄下來,因為它們是這次發布中一個月後仍會引人興趣的那部分內容。
• 預訓練 — 在 NVL72 機櫃中的 6,144 顆 NVIDIA GB300 晶片上,使用 23.8 兆個精選符元,端到端在不到四週內完成,據報導達到 92.3% 的有效吞吐量,過程中並有九次半自動回退,歸因於梯度範數尖峰或疑似靜默資料損毀。
• 強化學習 —— 使用 10,500 顆 GB300 晶片、為期四週,超過 1 億次 rollout,最大 rollout 上下文達 256,000 個 token,約 13 億個沙箱,以及約 100 萬個為程式設計、代理式與 STEM 任務所蒐集的不同環境。
• 服務 — 新權重以約 12 秒的中位時間送達推論機群,階層式分發將跨機櫃流量減少 75%,並讓全機群採用的速度比每個副本自行拉取權重快 2.2 倍。
• 穩定性——全非同步策略梯度,在從延遲一天的互動中學習時仍保持數值穩定,另加可控的長度懲罰,讓推理長度與分數之間得以取捨,而無需重新訓練。
• 資料 — 約 95% 的原始網際網路 token 透過解析、去重與整理而被剔除,並聲稱傳統篩選器會漏掉 Reflection 所保留 token 中約 1.8 兆個,其中包括其精選網頁程式碼 token 的 87%。
有兩行值得標記。貼文說 midtraining 將 Beam 的有效上下文擴展到 100 萬個 token,而 API 文件則列出 256,000 個 token 的服務限制,並附有 beta 註腳。那些是訓練端的能力與服務端的限制,而非矛盾,但這個落差正是如果沒人讀第二份文件就會變成「1M 上下文」標題的東西。而超過 1 億次 rollout 的 RL 數字被呈現為任何開放實驗室中最大規模的同類運行之一,這是有關規模的主張,而非關於規模換來了什麼——分數對 rollouts 的曲線是廠商自己的,且停在廠商停止繪製的地方。

你今天可以使用 Reflection Beam 做什麼
有一件事:加入等候名單,而且如果你取得金鑰,就用 OpenAI 格式的用戶端,透過 Reflection 自家的端點呼叫 Beam-501B-A23B。目前沒有公開定價,因此無法據此估算工作負載的成本。沒有權重,因此無法自行託管、無法量化,也無法由第三方重現。沒有獨立的基準測試結果列,所以上方整個效能全貌,僅建立在單一實驗室的表格上。
Reflection Beam 並不是我們的其中一條路線,我們也不會暗示它是。我們能給你的,是它試圖進入的那個領域的價格,今早直接從我們自家的價目表即時讀取:GLM 5.2 每百萬詞元輸入 $1.40、輸出 $4.40,GLM 5.3 是 $1.26 與 $3.96,Qwen 3.8-Max 是 $2.00 與 $6.00,而 DeepSeek V4.1 Flash 則是 $0.15 與 $0.60。光看輸入價格,最便宜與最貴之間就相差超過九倍——而這正是為什麼一個沒有掛牌價的 beta 模型,無論它的效率圖表看起來多麼漂亮,都著實難以被納入決策之中。
OrcaRouter 以單一 OpenAI 相容金鑰串接這四個以及另外 200 多個模型,直接傳遞供應商的定價,不額外加價,因此供應商一調價,我們這邊當天就同步生效,而不必等轉售商更新價格表。自動容錯移轉是路由機制本身的一部分,而不是你得針對各家供應商自行打造的東西;這意味著一個未經實證的模型——沒有可重現性、沒有獨立評分,也沒有價格——正是那種該放上一部分流量,而不是放上關鍵路徑的東西。
當主張變得可檢驗時
有三件事能定奪此事,而 Reflection 已把其中兩件放進了這個月內。
第一項是權重。Apache 2.0 加上一份技術報告,讓任何擁有幾個節點的人都能衡量真正重要的事——在固定品質門檻下,每 GPU 每秒可處理的 token 數,以及 230 億個活躍參數是否真能帶來圖表所暗示的每 FLOP 分數。在那之前,效率論點只是餐巾紙上的算術,而每個複述它的人,都只是在複述 Reflection 的圖說。
第二個是價格。沒有定價的模型在成本比較中沒有位置。如果 Beam 的定價高於 GLM 和 DeepSeek 這個層級,對任何有預算的人來說,運算成本這回事就不再重要;如果低於,情況很快就會改觀。
第三項是指標。Artificial Analysis 表示,它正在對 Beam 進行基準測試,且尚未公布任何數字。當那一列出現時,它將是這則報導中第一個不是由 Reflection 計算出來的數字。
如果你今天就需要一個能力強大的代理式編碼器,而且需要知道它的成本,答案目前還不是 Reflection Beam。也許三週後會是。一項效率主張值得押注的模型,是那種你可以下載其權重、也能自己計算其 FLOPs 的模型——而在這項檢驗上,Reflection 給我們的是一個日期和一份候補名單,不是一個模型。
本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
