
Reflection Beam 与 Gemini 3.1 Pro Preview:一个读视频,一个读文本
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 150 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
从一个在这场对决中任何基准测试表都不会提到的非对称性说起。Reflection Beam于 2026 年 10 月 5 日宣布,是一个 5010 亿参数的稀疏专家混合模型,每个 token 激活 230 亿参数,它接收文本并输出文本。仅此而已。Gemini 3.1 Pro Preview,该厂商自 2026 年 2 月 19 日起的前沿多模态模型,接受文本、图像、视频、音频和文件,并且它是本次比较中唯一一个“它能看见我想问的东西吗”这个问题对双方会给出不同答案的模型。其余一切——稀疏比例、上下文窗口、价格层级——都是论点。而那一点是规格说明。
这也意味着它是这组中对称性最低的一对,同时也是最有用的,因为它揭示了模型比较究竟是为了什么。如果你的工作负载是文本,那么 Beam 和 Gemini 3.1 Pro 只是同一条谱系上的两个选项,这条谱系从廉价且未经充分衡量,一直延伸到昂贵且经过全面评分。如果你的工作负载中包含视频帧,那就没有什么可比较的了。
每个模型是什么
Gemini 3.1 Pro Preview 是 Google 预览级别的旗舰模型:1,048,576 个 token 的上下文,最大输出 65,536 个 token,五种输入模态,以及通过阶梯定价而非统一费率实现的百万 token 窗口。Google 将其定位为面向增强的软件工程、更可靠的智能体表现,以及在复杂工作流中更高效的 token 使用。它并非开放权重。其名称中仍带有"Preview",而这是 Google 自二月以来一直为这款模型保留的状态。
Reflection Beam 是 Reflection 的首个模型,也是一个开放权重系列的开端。总计五千零一十亿参数,其中 230 亿处于激活状态——每个 token 仅约 4.6% 的模型处于唤醒状态。在 6,144 块 GB300 芯片上用了不到四周时间完成 23.8 万亿预训练 token,随后在 10,500 块 GB300 芯片上进行了为期四周的强化学习训练,在大约一百万个环境中完成了超过 1 亿次 rollout。其 API 在 api.reflection.ai/openai/v1 上兼容 OpenAI,提供 Chat Completions 和 Models 列表;其上下文为 256,000 个 token,并带有 beta 脚注;其 reasoning_effort 参数有五个级别,且没有关闭开关;其权重承诺于本月晚些时候以 Apache 2.0 许可发布。
• 模态 — Gemini 3.1 Pro Preview 接受文本、图像、视频、音频和文件;Reflection Beam 仅接受文本。
• 上下文与输出——Gemini 为 1,048,576 个 token 输入和 65,536 个 token 输出,而 Beam 为 256,000 个输入和 128,000 个输出。
• 价格 — Gemini 3.1 Pro Preview 每百万 token 输入 $2.00、输出 $12.00,最多 200,000 token;超过该额度后分别升至 $4.00 和 $18.00;缓存读取为 $0.20;Reflection Beam 未公布价格。
• 工具能力面 — Google 侧支持原生工具调用、结构化输出和搜索接地;Beam 侧支持工具调用和结构化输出,但端点仅限于 Chat Completions。
• 权重——Gemini 为专有;Beam 承诺采用 Apache 2.0,但尚未发布。
• 独立评分——Gemini 3.1 Pro Preview 拥有 Artificial Analysis 指数;Beam 在榜单上没有条目。
模态差距就是整个论点。
值得具体说明,而不是空泛地指向“多模态”,因为实际后果是具体的。
一个需要摄取屏幕录制、产品照片、扫描合同或呼叫中心音频文件的工作负载,无论价格如何、使用何种提示词、选择哪个套餐,Beam 都无法处理。在 API 层面也没有变通办法:Beam 的文档只描述了一种输入模态和一种输出模态,并且没有列出任何图像或音频通路。Gemini 3.1 Pro Preview 能处理全部五种,这意味着它是这里唯一可以放入输入尚不是文本的工作流中的模型。
相反的情况也值得说明,因为这是人们容易搞错的一点。如果你的输入是文本,并且之后也仍是文本,那么 Gemini 的五种模态对你毫无好处,而你却在用多模态模型的价格来运行文本工作负载。这并不是支持 Beam 的论据——它说明的是,模态问题应该在基准测试问题之前得到回答,因为它比任何分数比较都更便宜、更可靠地排除选项。
两个预览,两种不同的含义
两个模型名称都带有一个限定条件,而这两个限定条件并不相同,这正是这对组合最有趣的地方。
Gemini 3.1 Pro 的 “Preview” 只是一种命名惯例,该模型自二月以来一直可普遍调用,拥有独立评分、已公布的价目表(其中包含有文档说明的长上下文档位)以及完整的工具面。实际上,这里的 “preview” 意味着 Google 保留将其取代的权利,而不是说它难以获得或未经评分。
Beam 的 beta 是一道真正的门槛。要获得访问权限,需先加入等候名单,模型 ID 创建于 2026 年 10 月 5 日,没有价目表,没有第三方评分,而能让任何人验证其核心主张的产物——权重、技术报告、模型卡——只是承诺提供,而非已经交付。上下文数值附有一条脚注,警告该数值在 beta 期间可能变动,这是任何正式可用模型都不需要的保留。
其后果的不对称性,在采购层面有着切实的影响。采用 Gemini 3.1 Pro Preview 的团队,是在承担模型更迭的风险。而今天采用 Beam 的团队,则要接受未知的价格、未知的独立评分,以及无法自行运行该模型。这些属于不同类别的风险,而其中价格往往是起决定作用的那个。

基准测试与引用问题
Reflection 的发布表格不包含 Gemini 3.1 Pro Preview 或任何 Google 模型。它的对比集合仅限开放与半开放模型:Inkling、Nemotron 3 Ultra、GLM 5.2、GLM 5.3、Kimi K3、Qwen 3.8-Max 和 DeepSeek V4.1 Flash。因此,这两个模型从未在已发布的表格中相互对比过,下面的数据来自双方不同的测试框架。
• Artificial Analysis Intelligence Index——Gemini 3.1 Pro Preview 录得 29.7,在其本次运行中于 147 个模型中位列第 58。Beam 则完全没有相应的指数条目。
• GPQA Diamond — Gemini 3.1 Pro Preview 在 Artificial Analysis 上达到 94.1,而 Beam 厂商报告的为 90.5。
• SciCode —— Gemini 为 58.7,而 Beam 厂商报告的为 49.7。
• Humanity's Last Exam — Gemini 得分 47.0,对比 Beam 厂商报告的 36.2,后者明确未使用工具。
• Terminal-Bench v2.1 — 根据 Artificial Analysis,Gemini 为 73.8,而 Beam 的厂商报告成绩为 80.1。这是 Beam 在这场对决中最强的一行,也是对一款自 2 月以来就已上市的模型的收割。
• 长上下文召回 — 在 AA-LCR 上,Gemini 达 82.0,而 Beam 的厂商报告值为 79.3。
• tau-squared Bench —— Gemini 为 95.6,而 Beam 在 MCP Atlas 上为 78.7、在 tau3 banking 上为 38.0。这些是针对智能体工具使用的相关评测,并非同一个评测,而名称上的差异很重要。
这张表格中 Gemini 这一侧还存在一个单独的诚信问题,值得单独用一句话来说明。在不同来源中,Gemini 3.1 Pro Preview 的独立指数得分分别被引用为 30、46、47.7 和 57,而 Artificial Analysis 会在同一时刻的不同模型页面上提供不同的指数修订版本。上文的 29.7 这个数字,是我们于 2026 年 10 月 6 日读取的页面上所显示的数值,也是我们唯一会引用的数值——但任何一篇文章,如果把某个单一的 Gemini 指数数值与竞争对手并列,却不说明它来自哪个快照,那就是在把一个浮动数值当作固定数值来呈现。反过来,同样的告诫也适用于 Beam,因为那里根本没有快照。
价格,以及没人规划的那个层级
Gemini 3.1 Pro Preview 每百万 token 在不超过 200,000 token 时为输入 $2.00、输出 $12.00,超过后则为 $4.00 和 $18.00。缓存读取为每百万 $0.20,缓存写入为 $0.375。值得提前规划的是这一档位分界线:该模型最核心的卖点是 1,048,576 token 的上下文窗口,而一旦请求超过 200,000 token,输入价格就会翻倍,输出价格则上涨一半。因此,围绕百万 token 窗口设计的工作负载,其大部分流量实际上都按第二档而非第一档计价。
Beam 没有价目表,因此既没有可建模的档位,也没有可供比较的对象。这种缺失并非中立:它意味着,关于 Beam 成本最稳妥、最站得住脚的说法就是其成本未知;而其效率定位唯一的量化支撑,是 Reflection 自己的一张图表——该图将生成的 FLOPs 估算为活跃参数量的两倍,乘以 DeepSWE、HLE 和 Terminal-Bench 2.1 上每次尝试的平均生成 token 数,而图注则承认提示预填充、注意力和服务开销均被排除在外。在百万 token 上下文真正重要的那些工作负载上,预填充绝非可忽略的零头,而恰恰是公式所遗漏的那一项。

工具使用、搜索,以及两种设计的不同之处
Gemini 3.1 Pro Preview 所宣传的优势在于软件工程、智能体可靠性和 token 效率,其公开的工具能力包括函数调用、结构化输出和搜索接地。最后这一项值得任何比较智能体技术栈的人注意:接地搜索是谷歌方面的第一方能力,它改变了工具调用型智能体在无需接入外部检索服务的情况下所能做到的事情。
Beam 的工具能力表现比一条规格参数所暗示的更有意思,也更难评估。Reflection 报告称,MCP Atlas 为 78.7,AutomationBench 公开测试为 37.0,tau3 银行业测试为 38.0,带上下文管理的 BrowseComp 为 77.4,带上下文管理的 DeepSearchQA 为 80.1——并指出在强化学习过程中,尽管训练数据混合中并不包含浏览任务,该模型在获得网络访问权限后还是自发学会了查询其他语言模型并调用 OCR API。如果这种泛化能力成立,那将是关于智能体迁移能力的一个真实信号。但就目前而言,这也只是来自一次训练运行的厂商观察,尚无独立验证。
在双方都有数字的工具使用行上,情况是喜忧参半,而非一边倒。Beam 的厂商表格显示,它在 MCP Atlas 上领先于 GLM 5.2,并在 tau3 banking 上与 GLM 5.2 和 Kimi K3 持平;而 Gemini 的 tau-squared Bench 数值 95.6 是双方公布过的最高智能体数值。不同的套件、不同的测试框架,且没有共同的评估——这是这一对比中反复出现的问题。
选择,以及如何对冲
从上述内容中得出的决策规则简单到可以用一句话说明:如果任何输入不是文本,Beam 就不是可选项,比较也就到此为止。如果每个输入都是文本,问题就变成:Beam 那个未注明出处的效率主张,是否值得一个未知的价格和没有独立评分,与一个收费 $2.00 和 $12.00、有文档记录的阶梯定价和完整工具面的模型相比,又是否划算。
Gemini 3.1 Pro Preview 已上线我们的目录,按提供商标价原样透传,不额外加价,通过 api.orcarouter.ai/v1 上一个兼容 OpenAI 的密钥即可访问,并与 200 多个其他模型并列——同一个密钥也能调用 Beam 在价格上与之竞争的模型,从 GLM 5.3 的 $1.26 和 $3.96 到 DeepSeek V4.1 Flash 的 $0.15 和 $0.60,这是今早实时读取的价格。由于 200,000 token 的层级边界是路由问题而不是模型问题,路由 DSL 让你可以直接表达这一点:将短请求留在便宜层级,把真正长的请求固定到你因窗口而选择该模型的层级,在一次调用中完成,而无需在应用代码中处理。
Reflection Beam 不是我们的路线之一,我们也不会把你引向任何声称拥有它的人。如果 Apache 2.0 权重如承诺的那样在本月到位,自托管就会成为纯文本工作的第三种选择,而效率方面的说法也就能在你自己硬件上得到验证。

什么会改变答案
Beam 对 Gemini 的论据,就建立在每一次 Beam 对比所依赖的那同样两项之上,而这次对决还增加了第三项。
一个价格。没有它,效率论证就无法转化为预算决策,而该模型比拼的是一张图表,而非一份费率卡。
一份独立评分。Artificial Analysis 于10月5日表示,Reflection 已向其开放访问权限,它正在对 Beam 进行基准测试,并称早期指标表明,Beam 将成为其见过的同智能水平下 token 效率最高的开源模型之一。那是正确的来源说了正确的话,但榜单上仍然没有 Beam 这一行——截至今天上午,模型页面返回 404,排行榜上也没有 Beam 的条目。
而不会改变的一点是:Beam 仅支持文本。没有权重发布、没有降价,也没有任何指数评分能改变这一点,这意味着对于整整一类工作负载,这种比较永远不会真正成为比较。如果你的流水线中有视频,那么在第一个基准测试还没加载完之前,答案就已经是 Gemini 3.1 Pro Preview 了。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
