
Reflection Beam 对比 Claude Opus 5.5:一个今天就能调用,一个还得等
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 150 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Reflection Beam与Claude Opus 5.5目前还谈不上是真正的竞争对手,而原因在于行政层面,而非技术层面。Reflection 的首个模型 Beam 于 2026 年 10 月 5 日发布,是一个拥有 5010 亿参数的稀疏混合专家模型,每个 token 激活 230 亿个参数——但它只能通过等待名单获取,其权重承诺于本月晚些时候以 Apache 2.0 许可发布,而且任何地方都尚未公布价格。Opus 5.5 于 2026 年 9 月 22 日发布,是 Anthropic 的旗舰产品:100 万 token 的上下文窗口,支持文本、图像和文件输入,标价为每百万输入 token 4.00 美元、每百万输出 token 20.00 美元。所以,这场比较诚实的说法是:其中一款模型,你今天下午就能以已知成本投入生产;而另一款则不能——除此之外的一切,都只是关于权重落地之后会发生什么的推测。
简短的回答
如果问题是这周该基于哪个模型来构建,那答案毫无疑问是 Opus 5.5:它已正式可用、有独立评分、支持多模态、有明确定价,并且通过一个你五分钟内就能调用的 API 提供服务。Beam 的论据并不建立在击败 Opus 5.5 之上——Reflection 自己的材料中也没有任何内容声称它能做到这一点。它的立足点是一个窄得多的命题:在给定的推理得分下,Beam 大约只消耗四分之一的推理算力。如果这一点在 Reflection 之外的人进行测量时依然成立,那么对于那些答案必须够好但不必最好的高吞吐量工作,Beam 就变得有意思了。如果不成立,Beam 就只是一个带等候名单的中游开源模型。
以下内容将这场对决中如今已成事实的部分与属于押注的部分区分开来。
每个模型究竟是什么,准确地说
Opus 5.5 是 Claude Opus 5 的闭源托管式后续版本,Anthropic 将其定位为适用于大型代码库中的多步骤变更、代码审查以及长时间自主运行的会话。它接受文本、图像和文件输入,返回文本,提供 1,000,000 个 token 的上下文窗口,最多可输出 128,000 个 token,并支持可配置推理强度的扩展思考。它并非开放权重,其知识受限于 Anthropic 的训练截止时间,而非任何你可控的因素。
Reflection Beam 是相反的构造。它共有 5010 亿参数,其中 230 亿处于激活状态——每个 token 约有 4.6% 的模型被唤醒,这一比例即便与 GLM 5.2 约 5.4% 相比也相当激进——其设计目标是服务成本低廉,而非训练成本低廉。它仅支持文本。其 API 上下文为 256,000 个 token,并附有脚注警告该数字在 beta 期间可能变动,最大输出为 128,000 个 token。该端点在 api.reflection.ai/openai/v1 上兼容 OpenAI,仅提供 Chat Completions 以及 Models 列表,别无其他。其 reasoning_effort 参数接受五个取值,默认为 medium,且无法关闭。
• 价格 — Claude Opus 5.5 每百万 token 输入 $4.00、输出 $20.00,缓存读取为 $0.20,缓存写入为 $5.00;相比之下,Reflection Beam:博客文章、文档和模型列表中均未公布。
• 可用性 — Opus 5.5 今日已正式开放使用;Beam 目前是测试版的候补名单,权重、技术报告和模型卡均承诺于本月晚些时候发布。
• 模态 — Opus 5.5 接受文本、图像和文件;Beam 仅接受文本。
• 上下文——1,000,000 个 token 对比 256,000 个,其中 Beam 的数字附带 beta 版注意事项。
• 开放权重 — Opus 5.5 没有,Beam 曾承诺以 Apache 2.0 发布,但尚未兑现。
• 独立评分 — Opus 5.5 具备,Beam 没有。

价格是无法比较的部分
Opus 5.5 的 $4.00 和 $20.00 是供应商的标价,在我们的价目表中原样传递,不添加任何费用。$0.20 的缓存读取和 $5.00 的缓存写入,对于 Opus 5.5 所面向的工作负载而言影响巨大——一个长时间运行的智能体会话会一轮又一轮地重复读取同一份 200,000 token 的代码库,其中绝大部分按缓存费率计费,而非输入费率。这是一根真实存在且常被低估的杠杆,在你断定前沿模型超出预算之前,值得先建模测算一下。
Beam 没有可比的数字。没有可供对比的标价,没有可供建模的缓存层级,也没有针对 beta 的公开费率。Reflection 没有说明 Beam 将按 token 售卖、按席位计量,还是随权重一同免费赠送。今天任何引用 Beam 每百万成本的人都是在凭空捏造。
实际后果是:价格对比并不是“Opus 5.5 很贵,Beam 更便宜”,而是“其中一个有价格,另一个有日期”。对于今天就要做决定的团队来说,这种不对称比基准测试更能一锤定音。
基准测试:两个重叠的数字,以及它们为何仍然无法比较
Reflection 的发布表格中不包含 Opus 5.5,也不包含任何前沿闭源模型。它的对比对象全部是开源或半开源模型:Inkling、Nemotron 3 Ultra、GLM 5.2、GLM 5.3、Kimi K3、Qwen 3.8-Max 和 DeepSeek V4.1 Flash。因此,任何 Beam 对比 Opus 的表格都必须手工拼凑,而要诚实地拼凑它,就意味着要明确指出测试框架上的差异,而不是把这些差异抹平。
恰好有两个基准测试中两个模型都有已公布的数据,而且这两组配对都不是受控的。
• Humanity's Last Exam——Reflection 报告 Beam 为 36.2,且未使用任何工具;Artificial Analysis 则记录 Opus 5.5 为 61.4。两套不同的测试框架,两种不同的配置——Opus 5.5 的数值并未标注为无工具——而二十五分的差距,与其说反映了模型之间的差异,不如说揭示了测试配置本身的问题。
• SciCode——Reflection 报告 Beam 为 49.7;Artificial Analysis 记录 Opus 5.5 为 66.9。同样的基准测试,同样的问题:一个数字来自厂商自己的运行,另一个来自第三方测试框架。
其余部分则完全不重叠。Beam 的表格基于 Terminal-Bench v2.1 构建,而当前的 Artificial Analysis 指数运行的是 Terminal-Bench 4.0——同一测试套件的不同版本,正因如此,Beam 在该榜上的 80.1 与 Opus 5.5 的 59.6 并非可比较的数据,绝不应被并列展示。就指数本身而言,Artificial Analysis 在 Max / Default Fallback 配置下给 Opus 5.5 打出 57.6,在该轮运行的 147 个模型中排名第四。Beam 没有指数条目:其模型页面返回 404,截至今天早上排行榜上也没有 Beam 的收录。
关于 Beam 唯一真正独立且有公开记录的声明,是 Artificial Analysis 在 10 月 5 日表示,Reflection 已向其提供访问权限,并且它正在独立对该模型进行基准测试——而且早期指标表明,就其智能水平而言,Beam 将成为它见过的 token 效率最高的开放模型之一。这是一句来自正确来源的有力表述,但仍然是一句没有数字的表述。决定这场对决的,将是那个数字。

效率说法真正见效之处
Reflection 的论点并不是 Beam 比前沿模型更聪明,而是:Beam 在使用少 3 到 4 倍推理计算量的情况下,得分与 GLM 5.2 相当;并且面对 Qwen 3.8-Max 所在的 2 万亿参数级别模型时,这一差距还会扩大。其背后的图表将生成的 FLOPs 估算为活跃参数数量的两倍乘以每次尝试平均生成的 token 数,而它自己的图注也承认,这不包括提示词预填充、注意力以及服务开销。
如果照单全收,真正有意思的目标根本不是 Opus 5.5——而是市场的中段。Opus 5.5 以每项任务的能力为竞争点,在需要判断力的任务上取胜:多步骤重构、代码审查,以及错误答案的代价高于 token 成本的工作。而一个每个 token 只有 4.6% 处于“清醒”状态的模型,则以每项任务的成本为竞争点,在规模量占主导、质量门槛是“足够好、由下游验证”的场景中取胜。它们是不同的产品,把 Beam 和 Opus 5.5 放在同一块记分板上比较,衡量的是错误的东西。
有一个值得命名的二阶效应。如果 Beam 的效率主张成立,它最自然的用武之地,就是那种你本来会把前沿模型的 token 花在它大材小用的任务上的工作负载。这是一个路由决策,而不是模型选择,也正是为什么在这里价格问题比基准问题更重要:你无法基于成本,把请求路由到一个没有成本的模型。
当 Beam 可调用时,将它们并排运行
Opus 5.5 今天已上架我们的目录,价格为每百万 token 4.00 美元和 20.00 美元,按标价原样传递、分文不加,并与 200 多个其他模型并列,共用一把兼容 OpenAI 的密钥,接入地址为 api.orcarouter.ai/v1。如果你想针对某个工作负载,在前沿模型和廉价开源模型之间做 A/B 测试,这套配置就是为此而生:两个模型 ID、一把密钥,无需第二份合同,也无需改动代码——而且路由中的自动故障转移意味着,某家供应商下午出点状况,不会把你的流水线一并拖下水。
Beam 目前还不能参与其中,我们也不会假装它可以。Reflection Beam 不在我们的路由之列,我们不会把你引向任何可能转售它的人。当权重以 Apache 2.0 发布时,你将能够自行托管并路由到你自己的端点;在那之前,唯一的途径就是 Reflection 的等候名单。
对于确实需要前沿模型的工作负载,要做的比较不是与 Beam 比,而是要与目录中其他所有模型比:GLM 5.3 为 $1.26 和 $3.96,Qwen 3.8-Max 为 $2.00 和 $6.00,DeepSeek V4.1 Flash 为 $0.15 和 $0.60,这些都是今早实时读取的。如果 Beam 定价有竞争力,这就是它将进入的档位,而这是一个比发布图表所暗示的艰难得多的竞争区间。

什么会改变这一裁决?
三件事,按其重要程度排序。
一条关于 Beam 的 Artificial Analysis 评测行。不是那种"即将登场"的公告——而是那一行榜单数据。如果其指数落在 Opus 5.5 的 57.6 附近,同时那项 token 效率方面的说法能经受住第三方测试框架的检验,那么中端市场就会真正变得难受,而 Beam 会成为大量高吞吐量工作的默认选择。如果它落在四十几分低位、更靠近开源权重模型那一档,那 Beam 就只是一个扎实的便宜模型,仅此而已。
价格。一个没有标价的模型赢不了成本论证,因为根本没有可比较的对象。如果 Beam 的定价落在 GLM 5.3 这一档之下,效率叙事很快就会变成预算叙事。如果它的定价高于 DeepSeek V4.1 Flash 的 $0.15 和 $0.60,却又没有能力上的优势,它将难以争取到它本为之打造的大批量业务。
权重。在它们存在之前,“开放权重”只是关于一项尚未授予的许可的说法,而且没有人能用一个自己真正能运行的模型,去核验每分 FLOPs 的算术。这正是 Reflection 已经招来、却尚未使其成为可能的检验。
在这些中至少有一个落地之前,实际选择毫无悬念。Opus 5.5 是你可以推演、核算成本并据此交付的模型。Beam 则是你持续关注的模型。
本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
