為文章《Reflection Beam vs Claude Opus 5.5:一個你今天就能呼叫,一個還得等待》生成的主視覺卡片,標題為《Reflection Beam vs Claude Opus 5.5》,副標題為《一個你今天就能呼叫,一個還得等待》,並有三個標籤,分別寫著《等候名單 vs 正式推出》、《未公布價格 vs $4 / $20》和《僅支援文字 vs 多模態》。
Guides & Insights

Reflection Beam 與 Claude Opus 5.5:一個今天就能用,一個還得等

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Reflection Beam 與 Claude Opus 5.5目前還算不上真正的對手,而原因出在行政作業層面,而非技術層面。Reflection 的首款模型 Beam 於 2026 年 10 月 5 日發表,是一個 5,010 億參數的稀疏混合專家模型,每個 token 啟用 230 億個參數——但它只能透過候補名單取得,權重承諾於本月稍晚以 Apache 2.0 釋出,而且至今沒有任何地方公布價格。Opus 5.5 則於 2026 年 9 月 22 日推出,是 Anthropic 的旗艦模型:100 萬 token 的上下文視窗,支援文字、圖像與檔案輸入,定價為每百萬輸入 token 4.00 美元、每百萬輸出 token 20.00 美元。所以,這個比較最誠實的說法是:其中一款模型你今天下午就能以已知成本投入正式生產環境,另一款則還不行——而這裡的其他一切,都只是在權重正式落地後會如何發展的推測。

簡短的回答

如果問題是這週該以哪個模型為基礎來開發,那答案幾乎沒有爭議,就是 Opus 5.5:它已正式開放使用、有獨立評分、支援多模態、已公布定價,而且透過 API 提供服務,你五分鐘內就能呼叫。Beam 的立論並不建立在勝過 Opus 5.5 之上——Reflection 自家資料中沒有任何內容聲稱它做得到。它建立在一個狹窄得多的主張上:在給定的推理分數下,Beam 消耗的推論算力大約只有四分之一。如果由 Reflection 以外的人來測量時這一點仍成立,那麼對於答案要好、但不必最好的高流量工作來說,Beam 就會變得有意思。如果不然,Beam 就只是一個還得排候補名單的中段開源模型。

以下內容會把這場對決中哪些部分在今日已是事實、哪些部分是賭注,區分開來。

確切來說,每個模型是什麼

Opus 5.5 是 Claude Opus 5 的封閉式、託管後繼版本,Anthropic 將其定位為適用於大型程式庫中的多步驟變更、程式碼審查,以及長時間自主運作的代理工作階段。它接受文字、圖像與檔案,回傳文字,提供 1,000,000 個詞元的上下文視窗,輸出詞元上限為 128,000,並支援可設定推理投入程度的擴展思考。它並非開放權重,其知識受限於 Anthropic 的訓練截止點,而非任何你能掌控的因素。

Reflection Beam 則是相反的架構。它擁有 5,010 億總參數,其中 230 億為活躍參數——每個 token 約有 4.6% 的模型處於運作狀態,即使對比 GLM 5.2 的約 5.4%,這仍是相當激進的比例——其建構目標是降低服務成本,而非降低訓練成本。它僅支援文字。其 API 上下文為 256,000 個 token,並附註警告該數字在 beta 期間可能變動,最大輸出則為 128,000 個 token。該端點與 OpenAI 相容,位於 api.reflection.ai/openai/v1,僅提供 Chat Completions 與 Models 列表,別無其他。其 reasoning_effort 參數接受五種值,預設為 medium,且無法關閉。

• 價格 — Claude Opus 5.5 每百萬 token 輸入 $4.00、輸出 $20.00,快取讀取為 $0.20、快取寫入為 $5.00;相較之下,Reflection Beam:未公布於部落格文章、說明文件或模型清單中。

• 可用性 — Opus 5.5 即日起正式開放使用;Beam 則是 Beta 版的候補名單,權重、技術報告與模型卡承諾將於本月稍後發布。

• 模態 — Opus 5.5 接受文字、圖像與檔案;Beam 僅接受文字。

• 上下文 — 1,000,000 個 token 對比 256,000 個,而 Beam 的數字帶有 beta 但書。

• 開放權重 —— Opus 5.5 沒有,Beam 則承諾以 Apache 2.0 釋出,但至今尚未兌現。

• 獨立評分 —— Opus 5.5 具備此項;Beam 則無。

A generated two-column scoreboard titled 'Reflection Beam vs Claude Opus 5.5 — the scoreboard'. Left column 'Reflection Beam': Availability waitlisted beta; Price not published; Context 256,000 tokens (beta); Input text only; Open weights promised Apache 2.0, not out; Independent score none yet. Right column 'Claude Opus 5.5': Availability generally available; Price $4.00 / $20.00; Context 1,000,000 tokens; Input text, image, file; Open weights no; Independent score AA index 57.6. Footer reads 'Beam figures vendor-reported and unaudited. Opus 5.5 price is the provider list rate; its index is Artificial Analysis, read 6 October 2026.'

價格是無法比較的部分

Opus 5.5 的 $4.00 與 $20.00 是供應商的定價表價格,而在我們的價目表上,它們原封不動地轉嫁,沒有任何加價。快取讀取 $0.20 與快取寫入 $5.00,對 Opus 5.5 所主攻的工作負載影響極大——一場長時間的代理式工作階段,會在同一份 200,000 個詞元的程式碼庫上反覆重讀,其中幾乎全部都是按快取費率計費,而不是輸入費率。那是一項真實存在、卻經常被低估的槓桿,值得在你斷定前沿模型超出預算之前先做建模。

Beam 沒有可比的數字。沒有標價可供比較,沒有快取層級可供建模,也沒有公布 beta 的費率。Reflection 尚未說明 Beam 會按 token 出售、按席位計量收費,還是隨權重一併免費提供。今天任何報出 Beam 每百萬成本的人,都是在憑空捏造。

實際後果是:這個價格比較並不是「Opus 5.5 很貴,而 Beam 比較便宜」,而是「其中一個有價格,另一個有日期」。對今天就得做出決定的團隊來說,這種不對稱比基準測試更能一錘定音。

基準測試:兩個重疊的數字,以及它們為何仍無法相提並論

Reflection 的發布表格並未包含 Opus 5.5,或任何前沿閉源模型。其比較組完全由開放或半開放模型組成:Inkling、Nemotron 3 Ultra、GLM 5.2、GLM 5.3、Kimi K3、Qwen 3.8-Max 與 DeepSeek V4.1 Flash。因此任何 Beam 對 Opus 的表格都必須手動彙整,而誠實地彙整意味著要指明測試框架的差異,而不是加以抹平。

恰好有兩項基準測試是兩個模型都有已發表數據的,而且這兩組配對都不是受控的。

• Humanity's Last Exam — Reflection 報告指出 Beam 在無工具情況下為 36.2;Artificial Analysis 記錄 Opus 5.5 為 61.4。兩套不同的測試框架、兩種不同的配置——Opus 5.5 的數字並未標註為「無工具」——以及 25 分的落差,與其說反映了模型,不如說反映了設定。

• SciCode — Reflection 回報 Beam 為 49.7;Artificial Analysis 則針對 Opus 5.5 記錄到 66.9。同一個基準測試,同一個問題:一個數字是廠商自行執行的結果,另一個是第三方測試框架。

其他部分完全沒有重疊。Beam 的表格是建立在 Terminal-Bench v2.1 之上,而目前的 Artificial Analysis 指數採用的是 Terminal-Bench 4.0——同一套測試套件的不同版本,這就是為什麼 Beam 的 80.1 和 Opus 5.5 在該看板上的 59.6 無法相提並論,也絕不該並列印出。在該指數本身,Artificial Analysis 在 Max / Default Fallback 配置下給予 Opus 5.5 57.6 的評分,在該次評測的 147 個模型中排名第四。Beam 在指數中沒有任何一列:其模型頁面回傳 404,而截至今天早上,排行榜上沒有任何 Beam 的項目。

關於 Beam,公開紀錄中唯一真正獨立的說法,來自 Artificial Analysis 於 10 月 5 日表示:Reflection 已給予它存取權限,而它正獨立對該模型進行基準測試——且早期指標顯示,以 Beam 的智慧水準而言,它將是該機構見過 token 效率最高的開放模型之一。這是出自正確來源的一句強而有力的話,但仍是一句沒有數字的表述。決定這場對決的,將會是那個數字。

A screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), captured 6 October 2026, showing the model name and id, Imtokens context, Max output 128K, input text + image + file, Vision & Tools and JSON Reasoning tags, the INPUT $4.00 and OUTPUT $20.00 pricing tiles, p50 TTFT 5.81 s, p95 TTFT 10.00 s, 48.5M tokens of 7-day traffic, the benchmark provenance lines 'Public benchmarks by Anthropic - 2026-09-22' and 'AI Analysis', and a code sample using base_url https://api.orcarouter.ai/v1.

效率主張真正見真章的地方

Reflection 的論點並不是 Beam 比前沿模型更聰明。而是 Beam 的得分與 GLM 5.2 相當,推論運算量卻少 3 到 4 倍,而且面對 Qwen 3.8-Max 所屬的 2 兆參數級別模型時,差距還會擴大。其背後的圖表將生成的 FLOPs 估算為活躍參數數量的兩倍乘以每次嘗試平均生成的 token 數,而圖表自己的圖說也承認,這不包含提示預填充、注意力與服務開銷。

若照字面接受這點,真正有趣的目標根本不是 Opus 5.5——而是市場中段。Opus 5.5 以每項任務的能力為競爭點,並在需要判斷力的任務上勝出:多步驟重構、程式碼審查,以及錯誤答案的代價高於 token 成本的工作。一個每個 token 只有 4.6% 處於清醒狀態的模型,則以每項任務的成本為競爭點,並在數量主導、品質標準是「夠好且由下游驗證」的地方勝出。這些是不同的產品,而把 Beam 與 Opus 5.5 放在單一計分板上對比,衡量的是錯誤的東西。

有一個值得點名的二階效應。如果 Beam 的效率主張成立,它最自然的歸宿,就是那些你原本會把前沿模型的 token 花在它大材小用的任務上的工作負載。那是路由決策,不是模型選擇,而這正是為什麼在這裡,價格問題比基準測試問題更重要的原因:你無法依成本將工作路由到一個沒有成本的模型。

將它們並排執行,當 Beam 可呼叫時

Opus 5.5 即日起已在我們的型錄上,每百萬個 token 分別為 $4.00 與 $20.00,以原價轉嫁、不額外加價,並與其他 200 多個模型並列,只需一組相容於 OpenAI 的金鑰,網址為 api.orcarouter.ai/v1。如果你想在工作負載上,把前沿模型與便宜的開源模型做 A/B 測試,這正是這套架構的樣貌:兩個模型 ID、一組金鑰,不用簽第二份合約,也不必改動程式碼——而且路由中的自動容錯移轉,意味著某家供應商下午出狀況,也不會拖垮你的工作流程。

Beam 目前還不能成為那的一部分,我們也不會假裝不是如此。Beam 不是我們的路由之一,我們也不會把你指向任何可能轉售它的人。當它在 Apache 2.0 之下時,你將能夠自己託管它,並路由到你自己的端點;在那之前,途徑就是 Reflection 的等候名單。

對於一個確實需要前沿模型的工作負載,該做的比較並不是與 Beam 比。而是要與型錄上其他所有模型比:GLM 5.3 為 $1.26 和 $3.96,Qwen 3.8-Max 為 $2.00 和 $6.00,以及 DeepSeek V4.1 Flash 為 $0.15 和 $0.60,這些都是今早即時讀取的價格。如果 Beam 定價具有競爭力,這就是它將落入的層級,而這是一個比發布圖表所暗示的還要艱難許多的競爭環境。

A generated single-column card titled 'Reflection Beam — the state of play, 6 October 2026', used as the article's closing fact sheet. Rows read 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300, under four weeks', 'RL campaign: 10.5K GB300, 4 weeks, 100M+ rollouts', 'API context: 256,000 tokens, beta footnote', 'Reasoning effort: five levels, default medium, no off switch', 'Price: not published anywhere' and 'Independent score: none yet - no Artificial Analysis row'. The footer reads 'Vendor-reported; nothing independently reproduced. Weights, tech report and model card promised later this month.'

什麼會改變這個判決?

三件事,依它們會有多重要的順序排列。

一個針對 Beam 的 Artificial Analysis 資料列。不是即將推出某個東西的公告——而是那個資料列。如果這項指數落在 Opus 5.5 的 57.6 附近,而 token 效率的宣稱又在第三方測試框架的檢驗下站得住腳,市場中段就會真正感到不安,Beam 也會成為大量高流量工作的預設選擇。如果它落在更接近開放權重集群的四十出頭,Beam 就只是個扎實的便宜模型,別無其他。

價格。沒有牌價的模型無法贏得成本論證,因為沒有可比較的基準。如果 Beam 的價格低於 GLM 5.3 級距,效率故事很快就會變成預算故事。如果它的價格高於 DeepSeek V4.1 Flash 的 $0.15 與 $0.60,卻沒有能力優勢,它將很難爭取到它原本為之打造的大量工作負載。

權重。在它們釋出之前,「開放權重」只是一項尚未授予之授權的聲明,而沒有人能拿一個他們真正能運行的模型來核對 FLOPs-per-score 的計算。那正是 Reflection 所招來、卻尚未促成的檢驗。

在至少其中一項真正落地之前,實務上的選擇毫無懸念。Opus 5.5 是你得以推敲、估算成本並正式上線的模型。Beam 則是你只能觀望的模型。

本文中的比較3

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新