一张生成的 hero 卡片,标题为“Reflection Beam vs Kimi K3”,副标题为“同一个基准测试名称,两套不同的评测框架。”,还有三个统计标签,分别显示“Terminal-Bench 2.1:80.1 对 88.3”、“独立运行:85.0”和“价格:未公开 对 $3 / $15”。下方有三个扁平线性图标:一个带对勾的剪贴板、一把测量条形的尺子,以及一个覆盖在柱状图上的放大镜。OrcaRouter 标志合成在右下角。
Guides & Insights

Reflection Beam 与 Kimi K3:同一个基准测试名称,两套不同的评测框架

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Reflection Beam 在 Terminal-Bench 2.1 上得分 80.1。Kimi K3 得分 88.3。把这两个数字并排放置——正如本周大多数报道所做的那样——你就会得出 Beam 比该领域最好的开放模型大约低八分。但这两个数字并非出自同一个房间。Beam 的 80.1 是厂商上报的,取自 Reflection 自己发布文章中的表格。Kimi K3 的 88.3 同样是厂商上报的,这次来自 Moonshot 自己的表格——而厂商的表格只有在竞争对手的分数是在厂商自己的测试框架上、按其自己的提示集、在其自己的努力设置下跑出来的时候,才会把它印出来。第三方 Artificial Analysis 此后在一个同名基准上运行了 Kimi K3,并公布了 85.0。那是 4.9 分的差距,而非 8.2 分——而且这一修正的方向完全可预测,因为被侵蚀的那个数字,永远来自那个需要证明自己的实验室。

这正是本文标题所承诺的那种比较所面临的全部问题,也是这篇文章前半部分讨论来源出处而非评分的原因。Reflection Beam是一个拥有 5010 亿参数的稀疏专家混合模型,每个 token 激活 230 亿参数,由 Reflection AI 于 2026 年 10 月 5 日发布,同日上线了兼容 OpenAI 的测试版端点。Kimi K3是 Moonshot AI 的旗舰开源模型,已收录在我们自己的目录中,发布日期为 2026 年 7 月 15 日,并由 Artificial Analysis 独立评分。两者之中,一个是已在售的产品,有价目表,也有第三方评测框架的运行结果;另一个则是需要排队等候的测试版,其权重、技术报告和价格都尚不存在。将两者进行比较并不是一种对称的操作,假装它们对称只会产出一个看似精确、实则错误的页面。

30秒版本

• 纸面上,Beam 每 FLOP 更快,但实际中未定价,也未被复现。Kimi K3 由第三方评分,定价为每百万 token 输入 3.00 美元、输出 15.00 美元,并且已全面可用。

• 在双方都跑过的那一个基准测试——Terminal-Bench 2.1——上,只要双方的分数都来自中立的测试框架,诚实的差距大约只有五点,而不是八点。

• Beam 的真正优势是结构性的,而非数字上的:一个 23B 活跃参数的服务配置,以及承诺采用的 Apache 2.0 许可证。这两者目前都尚不可用。

• 如果你这周就需要一个模型,这不是抛硬币碰运气。它就是一个已推出的模型和一个候补名单。

Reflection 实际发布了什么,以及针对谁

Reflection 的发布帖用一张评分卡与另外七个模型进行对比:Inkling、Nemotron 3 Ultra、GLM 5.2、GLM 5.3、Kimi K3、Qwen 3.8 Max 和 DeepSeek V4.1 Flash。表格中的每个数字都来自厂商报告,没有任何一项经过独立复现,而且 Artificial Analysis 上没有 Reflection Beam 的页面——截至 2026 年 10 月 6 日,其网站上的模型页面返回 404。原文中有几个单元格标记为 NR,因为该模型未运行。

以下是该表格中 Beam 与 K3 对比的全部内容,每个维度一行:

• Terminal-Bench 2.1 — Beam 80.1 对比 Kimi K3 88.3

• SWE-Bench Pro v2-Hard — Beam 77.2 对比 Kimi K3 88.2

• DeepSWE v1.1 — Beam 44.4 对比 Kimi K3 68.0

• SWE Atlas 代码库问答 — Beam 34.6 对比 Kimi K3 68.0

• HLE,无工具 — Beam 36.2 对比 Kimi K3 46.9

• GPQA Diamond — Beam 90.5 对比 Kimi K3 93.5

• SciCode — Beam 49.7 对比 Kimi K3 58.7

• MCP Atlas — Beam 78.7 对比 Kimi K3 82.3

• 结合上下文管理的 BrowseComp — Beam 77.4 对 Kimi K3 91.2

• 带上下文管理的 DeepSearchQA — Beam 80.1 对比 Kimi K3 95.0

如实读那份清单,发布的轮廓就显现出来了。Reflection 并未在任何一项上宣称胜过 K3。它宣称的是:在推理分数相当的情况下,跻身某一梯队的顶端,同时推理算力消耗比 GLM 5.2 少三到四倍——而两个模型差距最小的那一行,Terminal-Bench 2.1,恰恰是这项比较最不可信的一行。

为什么评测框架比分数更重要

基准名称只是一个标签,而不是一份规范。Terminal-Bench 2.1 指的是在特定智能体脚手架下运行的一组特定任务,并配有特定的重试策略、特定的 token 预算和特定的推理投入程度设置。两个实验室都可以诚实地报告一个“Terminal-Bench 2.1”数值,却得出彼此不可比较的数字,因为大部分差异都来自脚手架和投入程度设置。Artificial Analysis 作为一个组织之所以存在,正是因为这个原因:它用同一个评测框架、同一种配置,跨多个模型运行,因此它的数字可以相互相减。

所以 Reflection 为 Beam 打印出的 80.1 是供应商测试平台上的供应商数字,而它为 K3 打印出的 88.3也是一个供应商数字——这个供应商就是 Reflection,测量的是自己的竞争对手。第二个数字是这一行里最不可靠的数字:一个在自家测试框架上跑竞争对手权重的实验室,既没有动力按竞争对手的最佳配置去跑它们,也没有义务披露自己选了哪种配置。这里面没有任何不诚实之处;它只是一个来源并不足以支撑报道所赋予它的分量的数字。

Artificial Analysis 自己的运行结果显示,Kimi K3 在 Terminal-Bench 2.1 上为 85.02,同时在 Terminal-Bench v4.0——一项不同且更难的测试——上为 12.6,AA Coding Index 为 76.2(在榜单上的模型中排名第 9),Intelligence Index 为 43.6,GPQA Diamond 为 93.5,HLE 为 46.9,SciCode 为 59.5,tau-banking 为 45.98,Long-Context Recall 为 88.7。这些数字是从我们自己系统中 K3 的目录卡片上读取的,来源标注为 artificialanalysis.ai,评估快照日期为 2026 年 7 月 15 日。Beam 在那个列表所涵盖的范围内只有一个数字,而且它来自 Reflection。这种缺失应该是暂时的,而不是永久的:Artificial Analysis 已表示 Reflection 向其提供了访问权限,并且它正在对该模型进行基准测试,而它自己早期的措辞——Beam“将成为我们见过的、在其智能水平上 token 效率最高的开放模型之一”——是一家基准测试机构在释放一种预期,而不是在报告一个结果。在那个分数出炉之前,本文的数字不能相减,我们也不会假装不是这样。

A two-column infographic titled 'Reflection Beam vs Kimi K3 - the scoreboard'. The left column 'Reflection Beam' reads 'Terminal-Bench 2.1: 80.1 vendor', 'Context window: 256K beta', 'Input modality: text only', 'Price per 1M tokens: not published', 'Cache reads: none documented', 'AA Intelligence Index: none'. The right column 'Kimi K3' reads 'Terminal-Bench 2.1: 88.3 vendor, 85.0 independent', 'Context window: 1.05M', 'Input modality: text + image', 'Price per 1M tokens: 3.00 / 15.00', 'Cache reads: 0.30', 'AA Intelligence Index: 43.6'. A footer reads 'Beam figures vendor-reported and unreproduced; K3 figures per Artificial Analysis and MoonshotAI's published rate card.' The OrcaRouter logo is composited in the bottom-right corner.

每件东西的价格,以及每件东西是什么

成本比较并不接近,而且根本算不上比较,因为其中一方是空白的。

• 价格 — Kimi K3 每百万 tokens 输入 $3.00 / 输出 $15.00,缓存读取为 $0.30;而 Reflection Beam:在 Reflection 的博客、文档或模型列表中均未公布任何价格,且平台控制台需注册后才能访问。

• 上下文 —— 在 Kimi K3 上为 1,048,576 个 token,而在 Beam 测试版上为 256,000 个;Beam 自己的文档中还有一条脚注写道:“上下文窗口在测试期间可能会发生变化。”

• 模态 — Kimi K3 接受文本和图像;Reflection Beam 为文本输入、文本输出,发布时不支持图像或音频路径。

• 可用性 — Kimi K3 今日已正式全面可用;Reflection Beam 是处于候补名单的测试版,其权重承诺于 10 月晚些时候以 Apache 2.0 许可发布。

• 独立评分 — K3 在 Artificial Analysis 中拥有完整的一行数据;Beam 则没有。

• 服务概况——Kimi K3 是一个大型、偏稠密的前沿模型,根据我们过去一周在自己 playground 上的测量,其输出速度为每秒 46.8 个 token;Beam 的 23B 激活参数是支持更低延迟和更低单 token 成本的真正架构论据,但目前没有面向公众开放的端点可供对其进行测量。

这个效率主张值得再谨慎地多说一句,因为它是这次发布的主打卖点,且承担着超出自身所能承受范围的论证负担。Reflection 的“推理计算量少 3 到 4 倍”来自一张图表,该图表将 FLOPs 近似为激活参数量两倍乘以平均生成 token 数。该公式有意排除了提示词预填充、注意力开销和服务开销——而这些正是长上下文智能体工作成本中占大头的部分。它是对一个计算量比值的粗略估算,不是实测结果,也不是美元金额,而且它是由厂商自己构建的。请把它当作一个假设,模型权重将让其他人得以检验。

OrcaRouter 在这其中的位置

Kimi K3 是我们提供的线路之一。它的标价是每百万 token 输入 $3.00、输出 $15.00,缓存读取为 $0.30,这是 Moonshot 的供应商价格原样透传、分文不加——所以如果 Moonshot 调整了它的价目表,我们页面上的数字当天就会跟着变,而不用等某个转售商什么时候去刷新。它可以通过一个 OpenAI 兼容密钥,与 200 多个其他模型一起调用,这一点在这里很重要,原因很具体:对“选 Beam 还是 K3?”这个问题,诚实的回答是,做对冲的团队不该二选一。因为自动故障转移本身就是路由的一部分,而不是需要你自己搭建的东西,所以像 Beam 这样的模型——beta、未定价、没有任何第三方评分——正是那种该放在一部分流量上、而不是放在关键路径上的东西。你默认把工作路由到 K3,等候补名单邀请到手后给 Beam 分一小片流量,出错时让路由回落到 K3。这是你可以对一个未经检验的模型做出的决定。把生产路径押在它身上,则不是。

A screenshot of the OrcaRouter model page for kimi/kimi-k3, showing the model name, a 1,048,576-token context, text and image input, tool and reasoning support, and pricing of $3.00 input and $15.00 output per million tokens with an 8.63 s median time to first token.

什么会改变这一裁决?

三件事,按重要程度从高到低排列。

一个价格。Beam 的定价落在 K3 档位以下,效率方面的论据就会变得具体可感,而不再停留于理论。第二,权重。Apache 2.0 加上一份技术报告,能让任何手头有几个节点的人,在固定的质量门槛下测量每 GPU 每秒的 token 数——这才是真正能裁定一项算力主张的测试。第三,第三方评测框架的运行。Reflection 已向 Artificial Analysis 开放了访问权限,预计会得出一个分数;在这个数字公布之前,市面上流传的每一个 Beam 对 K3 的数字,都能追溯到由这两家厂商之一撰写的一份文件。

两个值得直接回答的问题

Reflection Beam 比 Kimi K3 更好吗?

根据目前可获得的证据,不——而且也没有人公开发表过证据表明它确实如此。Reflection 自己的表格显示,K3 在上述所有十个共同行上都领先,其中几项的差距(SWE Atlas 34.6 对 68.0,DeepSearchQA 80.1 对 95.0)并不接近。Beam 的依据是单位能力成本,而在权重和价格出现之前,这一依据不过是一张由厂商绘制的图表。

我应该在基于 K3 构建之前等待 Beam 的权重吗?

只有当自托管是硬性要求而非偏好时,才需要这样考虑,因为这是两者唯一无法互相替代的维度——K3 只提供 API,而 Beam 承诺会开放 Apache 2.0 权重。如果你只是调用 API,K3 已经可用、有评测分数和明确定价,而 Beam 还处于候补名单阶段。这个决策无论怎么权衡,都不值得让项目因此延期。

A screenshot of the OrcaRouter models index page, showing the filter rail for input modality, context length, input price, status and series alongside a model grid headed '207 models, 16 providers, one API key, one bill' and a three-step panel explaining how to call any model through the OpenAI-compatible endpoint.

Reflection 给了我们一个日期和一张图表,而日期不是模型。这次发布真正确立的一点是:一个激活 23B 参数的 501B 模型可以被训练到与开放前沿相差几个点的水平——如果权重发布且数字成立,这将是关于效率的一项有意义的结果。这还不是把工作从第三方实际测量过的模型上移走的理由。