
Reflection Beam 對決 Gemini 3.1 Pro Preview:一個讀影片,一個讀文字
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 150 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
先從這場對比中沒有任何基準測試表提及的不對稱性說起。Reflection Beam於 2026 年 10 月 5 日發布,是一個 5,010 億參數的稀疏混合專家模型,每個 token 啟用 230 億個參數,而且它輸入文字、輸出文字。除此之外別無其他。Gemini 3.1 Pro Preview是該廠商自 2026 年 2 月 19 日以來的前沿多模態模型,可接受文字、圖像、影片、音訊與檔案,而它是這項比較中唯一一個「它能不能看見我想提問的東西」這個問題,對雙方有不同答案的模型。其他一切——稀疏比例、上下文視窗、價格級距——都只是論點。而那一點則是規格。
這也意味著,它是這組配對中最不對稱的一對,卻也最有用,因為它揭示了模型比較真正的目的。如果你的工作負載是文字,Beam 和 Gemini 3.1 Pro 是同一道光譜上的兩個選項,這道光譜從便宜且未經衡量,一路延伸到昂貴且經過徹底評分。如果你的工作負載包含視訊畫面,那就根本無從比較。
每個模型是什麼
Gemini 3.1 Pro Preview 是 Google 的預覽層級旗艦:1,048,576 個詞元的上下文、最高輸出 65,536 個詞元、五種輸入模態,以及透過價格階梯而非單一費率達到的百萬詞元窗口。Google 將其定位於強化軟體工程、改善代理可靠性,以及在複雜工作流程中更有效率地使用詞元。它不是開放權重。其名稱仍帶有「Preview」,這是 Google 自二月以來一直為此模型維持的狀態。
Reflection Beam 是 Reflection 的首款模型,也是一個開放權重系列的開端。總參數量五千零一十億,活躍參數兩百三十億——每個 token 約有 4.6% 的模型處於運作狀態。使用 6,144 顆 GB300 晶片,在不到四週內完成 23.8 兆個預訓練 token,接著在 10,500 顆 GB300 晶片上進行為期四週的強化學習訓練,在約一百萬個環境中完成超過一億次 rollout。其 API 與 OpenAI 相容,位於 api.reflection.ai/openai/v1,提供 Chat Completions 與 Models 列表;上下文長度為 256,000 個 token,並附有一則 beta 註腳;其 reasoning_effort 參數有五個等級,且沒有關閉選項;權重則承諾於本月稍晚以 Apache 2.0 授權釋出。
• 模態——Gemini 3.1 Pro Preview 接受文字、圖像、影片、音訊和檔案;Reflection Beam 僅接受文字。
• 上下文與輸出 — Gemini 為輸入 1,048,576 個 token、輸出 65,536 個;Beam 則為輸入 256,000 個、輸出 128,000 個。
• 價格 — Gemini 3.1 Pro Preview 每百萬個詞元(token)輸入 $2.00、輸出 $12.00,適用於 200,000 個詞元以內;超過此上限則分別調升至 $4.00 與 $18.00,快取讀取為 $0.20;Reflection Beam 則未公布價格。
• 工具介面 — Google 這一側提供原生工具呼叫、結構化輸出與搜尋接地;Beam 這一側提供工具呼叫與結構化輸出,且端點僅限於 Chat Completions。
• 權重 — Gemini 為專有;Beam 已承諾採用 Apache 2.0,但尚未發布。
• 獨立評分 — Gemini 3.1 Pro Preview 擁有 Artificial Analysis 指數;Beam 在排行榜上則沒有列名。
模態差距就是整個論點的核心。
值得具體一點,而不是泛指「多模態」,因為實際後果很具體。
一個會接收螢幕錄影、產品照片、掃描合約或客服中心音訊檔的工作負載,無論出什麼價格、用什麼提示、選哪個方案,Beam 都無法提供服務。在 API 層沒有任何變通方法:Beam 的文件只描述了一種輸入模態和一種輸出模態,並未列出任何影像或音訊途徑。Gemini 3.1 Pro Preview 能處理全部五種,這表示它是這裡唯一能直接套用到輸入並非已是文字的工作流程中的模型。
反向情況也值得說明,因為這正是人們常搞錯的一種。如果你的輸入是文字,而且之後也仍會是文字,Gemini 的五種模態對你毫無好處,而你卻為了執行文字工作負載,付出多模態模型的價格。這並不是支持 Beam 的論點——而是主張模態問題應該在基準測試問題之前先回答,因為它能比任何分數比較更便宜、更可靠地淘汰選項。
兩個預覽,兩種不同的意義
兩個模型名稱都帶有但書,而這兩項但書並不相同,這正是這組配對最耐人尋味的地方。
Gemini 3.1 Pro 的「Preview」是一種命名慣例,套用在一個自二月以來即可普遍呼叫的模型上;它擁有獨立評分、已公布的價目表(其中包含有文件記載的長上下文層級),以及完整的工具介面。實務上,這裡的「preview」意味著 Google 保留取代它的權利,而不是指它難以取得或未經評分。
Beam 的測試版是一道真正的門檻。存取權採候補名單制,模型 ID 建立於 2026 年 10 月 5 日,沒有費率表,沒有第三方評分,而能讓任何人驗證其核心主張的產物——權重、技術報告、模型卡——只是承諾,並未交付。上下文長度數字帶有一則註腳,警告它可能在測試期間變更,而這是任何正式可用模型都不需要的避險措辭。
後果的不對稱性,在採購層面至關重要。採用 Gemini 3.1 Pro Preview 的團隊,等於接受模型更迭風險。今天採用 Beam 的團隊,則等於接受未知的價格、未知的獨立評分,以及無法自行運行該模型。這些是不同類別的風險,而價格往往是最常起決定作用的那一項。

基準測試,以及引用問題
Reflection 的發布表格並未包含 Gemini 3.1 Pro Preview 或任何 Google 模型。其比較組合僅限於開放與半開放模型:Inkling、Nemotron 3 Ultra、GLM 5.2、GLM 5.3、Kimi K3、Qwen 3.8-Max 與 DeepSeek V4.1 Flash。因此,這兩個模型從未在已發布的表格中彼此對照測試過,而以下的數字來自雙方不同的測試框架。
• Artificial Analysis Intelligence Index — Gemini 3.1 Pro Preview 錄得 29.7,在其該次測試中於 147 個之中排名第 58。Beam 則完全沒有任何指數資料列。
• GPQA Diamond — Gemini 3.1 Pro Preview 在 Artificial Analysis 的評測中取得 94.1,相較於 Beam 廠商回報的 90.5。
• SciCode — Gemini 獲得 58.7 分,而 Beam 廠商報告的分數為 49.7 分。
• Humanity's Last Exam — Gemini 為 47.0,對比 Beam 廠商回報的 36.2,後者明確不含。
• Terminal-Bench v2.1 — 根據 Artificial Analysis,Gemini 為 73.8,對比 Beam 廠商報告的 80.1。這是 Beam 在這場對決中最強的一項,也是對一款自二月以來就已在市場上的模型的一次收割。
• 長上下文召回——Gemini 為 82.0,對比 Beam 在 AA-LCR 上廠商報告的 79.3。
• tau-squared Bench — Gemini 拿到 95.6,對比 Beam 在 MCP Atlas 的 78.7,以及在 tau3 banking 的 38.0。這些是與代理式工具使用相關的評估,並非同一項,而名稱上的差異很重要。
這張表的 Gemini 那一側另有一個誠信問題,值得單獨用一句話來說明。在不同來源中,Gemini 3.1 Pro Preview 的獨立指數分數曾被引用為 30、46、47.7 與 57,而 Artificial Analysis 在同一時刻於不同模型頁面上提供不同的指數修訂版。上方的 29.7 這個數字,是我們在 2026 年 10 月 6 日所讀取頁面上的那一個,也是我們唯一會引用的數字——但任何文章若把單一 Gemini 指數數字與競爭對手並列,卻不說明它出自哪個快照,就是把一個浮動數字當成固定數字來呈現。同樣的告誡反過來也適用於 Beam,因為那裡根本沒有任何快照。
價格,以及沒有人事先規劃的層級
Gemini 3.1 Pro Preview 每百萬個 token 的輸入價格為 $2.00、輸出價格為 $12.00,適用於最多 200,000 個 token;超過此數後則為 $4.00 與 $18.00。快取讀取為每百萬個 $0.20,快取寫入為 $0.375。分層界線正是值得事先規劃的部分:這款模型最引人注目的賣點是 1,048,576 個 token 的上下文視窗,而一旦請求超過 200,000 個 token,輸入費率就會加倍,輸出費率則上漲一半。因此,圍繞百萬 token 視窗所設計的工作負載,其大部分流量都會以第二層級計價,而不是第一層級。
Beam 沒有費率表,因此沒有可建模的層級,也沒有任何可資比較的對象。這種缺席並非中立:這意味著關於 Beam 成本最保守、最站得住腳的說法,就是它無從得知;而其效率定位唯一可量化的佐證,是 Reflection 自家的圖表——該圖表將生成的 FLOPs 估算為活躍參數量的兩倍,再乘以 DeepSWE、HLE 與 Terminal-Bench 2.1 上每次嘗試的平均生成 token 數,並在圖說中坦承提示前填充(prompt prefill)、注意力與服務額外負擔均被排除在外。在百萬 token 上下文真正舉足輕重的工作負載上,prefill 絕非可以忽略的誤差,而它恰恰是這道公式漏掉的那一項。

工具使用、搜尋,以及兩種設計的差異所在
Gemini 3.1 Pro Preview 所宣稱的強項是軟體工程、代理可靠性與 token 效率,而其公布的工具有函式呼叫、結構化輸出與搜尋接地。最後一項是任何比較代理式技術堆疊的人都該留意的重點:接地搜尋是 Google 這一方的第一方能力,而這改變了工具使用型代理在沒有外部檢索服務接入的情況下所能做到的事。
Beam 的工具故事比規格表上的一行敘述所暗示的更有趣,也更難評估。Reflection 回報 MCP Atlas 為 78.7、AutomationBench 公開版為 37.0、tau3 銀行領域為 38.0、具備脈絡管理的 BrowseComp 為 77.4,以及具備脈絡管理的 DeepSearchQA 為 80.1——並指出在強化學習期間,模型在有網路存取權時,自然學會查詢其他語言模型,並呼叫 OCR API,儘管訓練混合資料中並未包含瀏覽任務。如果這種泛化成立,這就是關於代理式遷移的真實訊號。同時,就目前而言,這也只是來自一次訓練過程的廠商觀察,沒有獨立查核。
在雙方都有數據的工具使用列中,情況是好壞參半,而非一面倒。{{1}}Beam 的廠商表格在 MCP Atlas 上將其排在 GLM 5.2 之前,並在 tau3 banking 上與 GLM 5.2 和 Kimi K3 持平,而 Gemini 的 tau-squared Bench 分數 95.6 是雙方發表過最高的代理式數字。{{/1}}不同的測試套件、不同的測試框架,且沒有共同的評估——這是這項比較中反覆出現的問題。
選擇,以及如何對沖
從上述得出的決策規則簡單到可以用一行說明:只要有任何一項輸入不是文字,Beam 就不是選項,比較也隨之結束。如果每一項輸入都是文字,問題就變成:Beam 那項未註明出處的效率主張,是否值得一個未知的價格與缺乏獨立評分,相對於一個要價 $2.00 與 $12.00、具有有明文記載的階梯及完整工具介面的模型。
Gemini 3.1 Pro Preview 已在我們的型錄中,完全依照供應商的表定價格轉嫁、不額外加價,透過一組與 OpenAI 相容的金鑰,在 api.orcarouter.ai/v1 上與其他 200 多款模型一同提供——同一組金鑰也能取用 Beam 在價格上與之競爭的那些模型,從每百萬 token 收費 $1.26 與 $3.96 的 GLM 5.3,到收費 $0.15 與 $0.60 的 DeepSeek V4.1 Flash,價格皆為今早即時讀取。由於 200,000 token 這道分層界線是路由問題,而非模型問題,路由 DSL 讓你直接表達:把簡短的請求留在便宜層級,並將真正冗長的那些釘選在視窗正是你選擇該模型的原因之處,一次呼叫就能完成,不必寫在應用程式碼裡。
Reflection Beam 不是我們的路線之一,我們也不會指引你去找任何聲稱擁有它的人。如果 Apache 2.0 權重如承諾於本月到來,自架就成為純文字工作的第三個選項,而效率主張也能在你自己的硬體上驗證。

什麼會改變答案?
Beam 對上 Gemini 的論點,建立在每一次 Beam 比較所依據的同樣兩個項目上,而這次對決還增加了第三個。
一個價格。少了它,效率論點就無法轉化為預算決策,而這個模型是在用一張圖表競爭,而不是價目表。
一份獨立評分。Artificial Analysis 於 10 月 5 日表示,Reflection 已給予它存取權限,而它正在對 Beam 進行基準測試,並形容早期指標顯示,以 Beam 的智慧水準而言,它將成為該機構見過最省 token 的開源模型之一。這是正確的來源說出了正確的話,但排行榜上仍然沒有 Beam 這一列——模型頁面傳回 404,而且截至今天早上,排行榜上沒有任何 Beam 的條目。
而不會改變的一點是:Beam 僅支援文字。沒有權重發布、沒有降價,也沒有任何指數分數能改變這件事,這意味著對一整類工作負載而言,這場比較永遠根本不會成為比較。如果你的管線中有影片,那麼在第一個基準測試載入之前,答案就已經是 Gemini 3.1 Pro Preview 了。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
