
Reflection Beam 與 Claude Opus 5.5:一個今天就能用,一個還得等
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 150 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Reflection Beam 與 Claude Opus 5.5目前還算不上真正的對手,而原因出在行政作業層面,而非技術層面。Reflection 的首款模型 Beam 於 2026 年 10 月 5 日發表,是一個 5,010 億參數的稀疏混合專家模型,每個 token 啟用 230 億個參數——但它只能透過候補名單取得,權重承諾於本月稍晚以 Apache 2.0 釋出,而且至今沒有任何地方公布價格。Opus 5.5 則於 2026 年 9 月 22 日推出,是 Anthropic 的旗艦模型:100 萬 token 的上下文視窗,支援文字、圖像與檔案輸入,定價為每百萬輸入 token 4.00 美元、每百萬輸出 token 20.00 美元。所以,這個比較最誠實的說法是:其中一款模型你今天下午就能以已知成本投入正式生產環境,另一款則還不行——而這裡的其他一切,都只是在權重正式落地後會如何發展的推測。
簡短的回答
如果問題是這週該以哪個模型為基礎來開發,那答案幾乎沒有爭議,就是 Opus 5.5:它已正式開放使用、有獨立評分、支援多模態、已公布定價,而且透過 API 提供服務,你五分鐘內就能呼叫。Beam 的立論並不建立在勝過 Opus 5.5 之上——Reflection 自家資料中沒有任何內容聲稱它做得到。它建立在一個狹窄得多的主張上:在給定的推理分數下,Beam 消耗的推論算力大約只有四分之一。如果由 Reflection 以外的人來測量時這一點仍成立,那麼對於答案要好、但不必最好的高流量工作來說,Beam 就會變得有意思。如果不然,Beam 就只是一個還得排候補名單的中段開源模型。
以下內容會把這場對決中哪些部分在今日已是事實、哪些部分是賭注,區分開來。
確切來說,每個模型是什麼
Opus 5.5 是 Claude Opus 5 的封閉式、託管後繼版本,Anthropic 將其定位為適用於大型程式庫中的多步驟變更、程式碼審查,以及長時間自主運作的代理工作階段。它接受文字、圖像與檔案,回傳文字,提供 1,000,000 個詞元的上下文視窗,輸出詞元上限為 128,000,並支援可設定推理投入程度的擴展思考。它並非開放權重,其知識受限於 Anthropic 的訓練截止點,而非任何你能掌控的因素。
Reflection Beam 則是相反的架構。它擁有 5,010 億總參數,其中 230 億為活躍參數——每個 token 約有 4.6% 的模型處於運作狀態,即使對比 GLM 5.2 的約 5.4%,這仍是相當激進的比例——其建構目標是降低服務成本,而非降低訓練成本。它僅支援文字。其 API 上下文為 256,000 個 token,並附註警告該數字在 beta 期間可能變動,最大輸出則為 128,000 個 token。該端點與 OpenAI 相容,位於 api.reflection.ai/openai/v1,僅提供 Chat Completions 與 Models 列表,別無其他。其 reasoning_effort 參數接受五種值,預設為 medium,且無法關閉。
• 價格 — Claude Opus 5.5 每百萬 token 輸入 $4.00、輸出 $20.00,快取讀取為 $0.20、快取寫入為 $5.00;相較之下,Reflection Beam:未公布於部落格文章、說明文件或模型清單中。
• 可用性 — Opus 5.5 即日起正式開放使用;Beam 則是 Beta 版的候補名單,權重、技術報告與模型卡承諾將於本月稍後發布。
• 模態 — Opus 5.5 接受文字、圖像與檔案;Beam 僅接受文字。
• 上下文 — 1,000,000 個 token 對比 256,000 個,而 Beam 的數字帶有 beta 但書。
• 開放權重 —— Opus 5.5 沒有,Beam 則承諾以 Apache 2.0 釋出,但至今尚未兌現。
• 獨立評分 —— Opus 5.5 具備此項;Beam 則無。

價格是無法比較的部分
Opus 5.5 的 $4.00 與 $20.00 是供應商的定價表價格,而在我們的價目表上,它們原封不動地轉嫁,沒有任何加價。快取讀取 $0.20 與快取寫入 $5.00,對 Opus 5.5 所主攻的工作負載影響極大——一場長時間的代理式工作階段,會在同一份 200,000 個詞元的程式碼庫上反覆重讀,其中幾乎全部都是按快取費率計費,而不是輸入費率。那是一項真實存在、卻經常被低估的槓桿,值得在你斷定前沿模型超出預算之前先做建模。
Beam 沒有可比的數字。沒有標價可供比較,沒有快取層級可供建模,也沒有公布 beta 的費率。Reflection 尚未說明 Beam 會按 token 出售、按席位計量收費,還是隨權重一併免費提供。今天任何報出 Beam 每百萬成本的人,都是在憑空捏造。
實際後果是:這個價格比較並不是「Opus 5.5 很貴,而 Beam 比較便宜」,而是「其中一個有價格,另一個有日期」。對今天就得做出決定的團隊來說,這種不對稱比基準測試更能一錘定音。
基準測試:兩個重疊的數字,以及它們為何仍無法相提並論
Reflection 的發布表格並未包含 Opus 5.5,或任何前沿閉源模型。其比較組完全由開放或半開放模型組成:Inkling、Nemotron 3 Ultra、GLM 5.2、GLM 5.3、Kimi K3、Qwen 3.8-Max 與 DeepSeek V4.1 Flash。因此任何 Beam 對 Opus 的表格都必須手動彙整,而誠實地彙整意味著要指明測試框架的差異,而不是加以抹平。
恰好有兩項基準測試是兩個模型都有已發表數據的,而且這兩組配對都不是受控的。
• Humanity's Last Exam — Reflection 報告指出 Beam 在無工具情況下為 36.2;Artificial Analysis 記錄 Opus 5.5 為 61.4。兩套不同的測試框架、兩種不同的配置——Opus 5.5 的數字並未標註為「無工具」——以及 25 分的落差,與其說反映了模型,不如說反映了設定。
• SciCode — Reflection 回報 Beam 為 49.7;Artificial Analysis 則針對 Opus 5.5 記錄到 66.9。同一個基準測試,同一個問題:一個數字是廠商自行執行的結果,另一個是第三方測試框架。
其他部分完全沒有重疊。Beam 的表格是建立在 Terminal-Bench v2.1 之上,而目前的 Artificial Analysis 指數採用的是 Terminal-Bench 4.0——同一套測試套件的不同版本,這就是為什麼 Beam 的 80.1 和 Opus 5.5 在該看板上的 59.6 無法相提並論,也絕不該並列印出。在該指數本身,Artificial Analysis 在 Max / Default Fallback 配置下給予 Opus 5.5 57.6 的評分,在該次評測的 147 個模型中排名第四。Beam 在指數中沒有任何一列:其模型頁面回傳 404,而截至今天早上,排行榜上沒有任何 Beam 的項目。
關於 Beam,公開紀錄中唯一真正獨立的說法,來自 Artificial Analysis 於 10 月 5 日表示:Reflection 已給予它存取權限,而它正獨立對該模型進行基準測試——且早期指標顯示,以 Beam 的智慧水準而言,它將是該機構見過 token 效率最高的開放模型之一。這是出自正確來源的一句強而有力的話,但仍是一句沒有數字的表述。決定這場對決的,將會是那個數字。

效率主張真正見真章的地方
Reflection 的論點並不是 Beam 比前沿模型更聰明。而是 Beam 的得分與 GLM 5.2 相當,推論運算量卻少 3 到 4 倍,而且面對 Qwen 3.8-Max 所屬的 2 兆參數級別模型時,差距還會擴大。其背後的圖表將生成的 FLOPs 估算為活躍參數數量的兩倍乘以每次嘗試平均生成的 token 數,而圖表自己的圖說也承認,這不包含提示預填充、注意力與服務開銷。
若照字面接受這點,真正有趣的目標根本不是 Opus 5.5——而是市場中段。Opus 5.5 以每項任務的能力為競爭點,並在需要判斷力的任務上勝出:多步驟重構、程式碼審查,以及錯誤答案的代價高於 token 成本的工作。一個每個 token 只有 4.6% 處於清醒狀態的模型,則以每項任務的成本為競爭點,並在數量主導、品質標準是「夠好且由下游驗證」的地方勝出。這些是不同的產品,而把 Beam 與 Opus 5.5 放在單一計分板上對比,衡量的是錯誤的東西。
有一個值得點名的二階效應。如果 Beam 的效率主張成立,它最自然的歸宿,就是那些你原本會把前沿模型的 token 花在它大材小用的任務上的工作負載。那是路由決策,不是模型選擇,而這正是為什麼在這裡,價格問題比基準測試問題更重要的原因:你無法依成本將工作路由到一個沒有成本的模型。
將它們並排執行,當 Beam 可呼叫時
Opus 5.5 即日起已在我們的型錄上,每百萬個 token 分別為 $4.00 與 $20.00,以原價轉嫁、不額外加價,並與其他 200 多個模型並列,只需一組相容於 OpenAI 的金鑰,網址為 api.orcarouter.ai/v1。如果你想在工作負載上,把前沿模型與便宜的開源模型做 A/B 測試,這正是這套架構的樣貌:兩個模型 ID、一組金鑰,不用簽第二份合約,也不必改動程式碼——而且路由中的自動容錯移轉,意味著某家供應商下午出狀況,也不會拖垮你的工作流程。
Beam 目前還不能成為那的一部分,我們也不會假裝不是如此。Beam 不是我們的路由之一,我們也不會把你指向任何可能轉售它的人。當它在 Apache 2.0 之下時,你將能夠自己託管它,並路由到你自己的端點;在那之前,途徑就是 Reflection 的等候名單。
對於一個確實需要前沿模型的工作負載,該做的比較並不是與 Beam 比。而是要與型錄上其他所有模型比:GLM 5.3 為 $1.26 和 $3.96,Qwen 3.8-Max 為 $2.00 和 $6.00,以及 DeepSeek V4.1 Flash 為 $0.15 和 $0.60,這些都是今早即時讀取的價格。如果 Beam 定價具有競爭力,這就是它將落入的層級,而這是一個比發布圖表所暗示的還要艱難許多的競爭環境。

什麼會改變這個判決?
三件事,依它們會有多重要的順序排列。
一個針對 Beam 的 Artificial Analysis 資料列。不是即將推出某個東西的公告——而是那個資料列。如果這項指數落在 Opus 5.5 的 57.6 附近,而 token 效率的宣稱又在第三方測試框架的檢驗下站得住腳,市場中段就會真正感到不安,Beam 也會成為大量高流量工作的預設選擇。如果它落在更接近開放權重集群的四十出頭,Beam 就只是個扎實的便宜模型,別無其他。
價格。沒有牌價的模型無法贏得成本論證,因為沒有可比較的基準。如果 Beam 的價格低於 GLM 5.3 級距,效率故事很快就會變成預算故事。如果它的價格高於 DeepSeek V4.1 Flash 的 $0.15 與 $0.60,卻沒有能力優勢,它將很難爭取到它原本為之打造的大量工作負載。
權重。在它們釋出之前,「開放權重」只是一項尚未授予之授權的聲明,而沒有人能拿一個他們真正能運行的模型來核對 FLOPs-per-score 的計算。那正是 Reflection 所招來、卻尚未促成的檢驗。
在至少其中一項真正落地之前,實務上的選擇毫無懸念。Opus 5.5 是你得以推敲、估算成本並正式上線的模型。Beam 則是你只能觀望的模型。
本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
