一张生成的主视觉卡片,标题为「Reflection Beam:501B 参数,23B 激活」,副标题为「稀疏 MoE / 23.8T 预训练 token / 256K token 的 API 上下文 / 承诺本月放出权重 / 所有数字均由厂商自报」。文字下方是三个扁平线性图标:一个堆叠层示意图,其中大部分层被淡化、仅一层高亮;一排九块服务器砖块;以及一份带小挂锁的文档轮廓。OrcaRouter 标志合成在右下角。
Guides & Insights

Reflection Beam 详解:501B 参数、23B 激活参数,以及尚未发布的权重

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年10月5日,Reflection 宣布 Reflection Beam,这是一个稀疏混合专家语言模型,总参数量为5010亿,每个 token 激活其中230亿个参数,并在同一天为其上线了一个测试版、兼容 OpenAI 的端点。这意味着该模型在任何时刻只有4.6%处于激活状态——即便以当前开放权重领域的标准来看,这也是一个激进的比例——而整个发布所倚仗的正是这个数字。Reflection 表示,完整权重、技术报告和模型卡将于本月晚些时候在 Apache 2.0 许可下发布。截至今天,它们尚未出现,Reflection 自己的任何渠道上都没有公布价格,Artificial Analysis 也没有为该模型列出条目。因此,对这次发布的诚实总结是:由训练该模型的实验室提出的一个关于效率的非常具体的声明,而所有支撑数字都由该实验室提供。

Reflection 自己的对比表将 Reflection Beam 与 Inkling、Nemotron 3 Ultra、GLM 5.2、GLM 5.3、Kimi K3、Qwen3.8 Max以及DeepSeek V4.1 Flash进行对比,这相当准确地描绘了它瞄准的层级:强大但并非前沿的开源与半开源模型,其中几个只有 Beam 规模的一小部分。Beam 在原始能力上并未击败这一领域,我们将向你展示它究竟在哪里落败。它声称要做的是,在推理分数相当的情况下,接近该领域顶端,同时所消耗的推理计算量大约只有 GLM 5.2 的三分之一到四分之一。这一主张正是这篇文章的核心。

如今实际存在的是什么

本节所有内容均摘自 Reflection 自己的文档,查阅日期为 2026 年 10 月 6 日。API 已在 beta 阶段上线,但需通过等候名单才能使用;权重尚未发布。

• 模型 ID — Beam-501B-A23B,创建于 2026年10月5日。

• 接口 — 位于 api.reflection.ai/openai/v1 的兼容 OpenAI 接口,仅暴露 Chat Completions 和 Models 列表,别无其他。没有 Completions,没有 embeddings,没有 batches。

• 上下文 — 256,000 个 token,该数字本身附有一条脚注:“上下文窗口在测试期间可能会发生变化。” 最大输出为 128,000 个 token。

• 推理 — 一个具有五个值的 reasoning_effort 参数:low、medium、high、xhigh 和 max。默认值为 medium,并且无论设置如何,模型始终会进行推理——没有关闭开关。

• 模态——输入文本,输出文本。发布时不支持图像或音频输入,这与Inkling有着本质区别,后者是Mira Murati的Thinking Machines于7月推出的以多模态为先的模型。

• 知识截止日期 — 2026年6月30日。

• 价格 — 未公布。Reflection 的博客文章、其文档及其模型列表均未提及,而平台控制台则藏在注册墙之后。

最后那句话的重要性超出表面看起来的程度。Beam 对比集中的其他每一个模型都有公开标价,你今天就可以把它填进电子表格。Beam 没有,这意味着现在关于它的任何成本论证都是关于算力的论证,而不是关于美元的论证。

A single-column infographic titled 'Reflection Beam - the scoreboard' with six rows reading 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300', 'API context: 256,000 tokens (beta footnote)', 'Reasoning effort: five levels, default medium', 'Price: not published anywhere' and 'Independent scores: none - no Artificial Analysis row'. A footer reads 'Vendor-reported; no independent reproduction. Weight release promised for later this month.' The OrcaRouter logo is composited in the bottom-right corner.

501比23的比例就是论点

稀疏性并不新鲜;问题在于一家实验室愿意把它推进到何种程度。GLM 5.2 约有 400 亿活跃参数,而据报道其总参数量约为 7440 亿——约占 5.4%。Reflection Beam 则在 5010 亿中占 4.6%。从纸面上看,这不过是又向前迈出的一小步,而 Reflection 对围绕它所宣称的能力也很谨慎。

发布博文中的效率数字来自一张基于 Artificial Analysis 和 DataCurve 数据构建的图表,该图表将推理得分与估算的推理 FLOPs 对应绘制,其中 FLOPs 近似为活跃参数量乘以平均生成 token 数的两倍。该公式有意排除了提示预填充、注意力开销和服务开销。它是一个粗略估算模型,而非实测结果,Reflection 也没有将其作为实测结果来呈现——但它也是“相同得分下便宜 3 到 4 倍”这一说法唯一的量化支撑,而且它是由厂商自己撰写的。把它当作一个假设:等权重发布后,会让其他人来检验。

这种架构在实践中带来的是一个服务配置。230亿活跃参数是一个你可以在相对较少的GPU上以交互式延迟运行的模型,即使显卡上的参数数量相同,这也与一个5010亿参数的稠密模型是不同的产品。这就是为什么Reflection可以谈论接近前沿的推理,而不必谈论数据中心规模的部署。

预训练用时不到四周,而且披露的内容异常具体

训练说明是这份发布内容中真正具有信息量的部分,因为 Reflection 公布了大多数实验室都秘而不宣的数字。

• 预训练——在 NVL72 机架中的 6,144 块 GB300 芯片上处理 23.8 万亿个 token,不到四周完成,据报道有效吞吐率达 92.3%,期间从检查点进行了九次回退。

• 强化学习——10,500 块 GB300 芯片,为期四周,超过 1 亿次 rollout,最大 rollout 上下文为 256,000 个 token,约 13 亿个沙盒和约 100 万个不同环境,平均有 110,000 次 rollout 并发运行。

• 中期训练——将模型的有效上下文扩展至100万个tokens。

• 稳定性——异步策略梯度在日级陈旧度下仍保持稳定,并带有可控的长度惩罚,从而无需重新训练即可调整推理长度。

把预训练和强化学习这两条线放在一起读,这一主张的轮廓便显现出来。这个效率故事不只关乎推理时的激活参数;它还关乎模型的训练速度有多快,以及有多少算力投入到了受环境约束的强化学习之中,而不是用于增加更多 token。一百万个环境和 13 亿个沙箱,是在宣示工具使用与智能体训练基础设施的实力,而这也与 Reflection 选择率先展示的那些基准测试相吻合。

有一个数字值得单独标注一下。博客称中期训练将 有效上下文扩展至 100 万个 token;而 API 文档列出的服务上限却是 256,000 个 token,并附有一条 beta 脚注。前者是训练侧的能力,后者是服务侧的限制,二者并不矛盾——但如果没人去读第二份文档,这个落差恰恰会变成"100 万上下文"的标题,下周要写 Beam 的人,都该读读第二份文档。

A screenshot of the Artificial Analysis language-model leaderboard, showing the ranked Intelligence Index table with per-model scores. No Reflection Beam row is present - the model is absent from the board, which is the point of the capture.

基准测试:Reflection Beam 在哪些方面胜出,又在哪些方面不胜出

以下每个数字均为厂商报告,出自 Reflection 发布文章中的表格,其中没有任何内容经过独立复现。对比列中的数字,与 Reflection 为其他模型发布的是同一组数字;如果原始表格中某个单元格显示“NR”,则表示该模型未运行。Beam 没有 Artificial Analysis 行,因此此处没有任何内容经过第三方测试框架。

智能体编程

• Terminal-Bench v2.1 —— Beam 80.1 对比 GLM 5.2 81.0、GLM 5.3 88.2、Kimi K3 88.3、Qwen3.8 Max 86.6、DeepSeek V4.1 Flash 90.6、Inkling 63.8、Nemotron 3 Ultra 56.4。

• SWE-Bench Pro v1 — Beam 65.5 对比 Qwen3.8 Max 67.7,GLM 5.2 62.1,Inkling 54.3,Nemotron 3 Ultra 46.4。

• SWE-Bench Pro v2-Hard — Beam 77.2 对比 Kimi K3 88.2,GLM 5.3 84.3,Inkling 56.9。

• SWE-Bench Verified — Beam 80.9 对比 Inkling 77.6,Nemotron 3 Ultra 70.7。

• SWE-Bench Multilingual — Beam 78.0 对比 Nemotron 3 Ultra 67.7。

• DeepSWE v1.1 —— Beam 44.4 对比 DeepSeek V4.1 Flash 74.2、Kimi K3 68.0、GLM 5.3 61.0、Qwen3.8 Max 51.0、GLM 5.2 44.0。

• SWE Atlas Codebase QnA — Beam 34.6 对比 Kimi K3 68.0,GLM 5.3 61.0。

最后那一行值得好好琢磨。长时程仓库问答正是模型必须在长时间交互中把整个代码库记在脑子里的场景,而 34.6 对 68.0 可不是什么舍入误差。DeepSWE 也讲述了类似的故事:44.4 让 Beam 与 GLM 5.2 持平,却远远落后于 DeepSeek V4.1 Flash。

推理

• AIME 2026 —— Beam 97.8 对比 GLM 5.2 99.2,Inkling 97.1。

• HLE,无工具 — Beam 36.2 对比 Kimi K3 46.9、Qwen3.8 Max 43.6、GLM 5.3 42.3、GLM 5.2 40.5、DeepSeek V4.1 Flash 39.1、Inkling 29.7、Nemotron 3 Ultra 26.7。

• GPQA Diamond — Beam 90.5 对比 Kimi K3 93.5、Qwen3.8 Max 92.6、GLM 5.3 91.7、GLM 5.2 91.2、DeepSeek V4.1 Flash 90.9、Inkling 87.2、Nemotron 3 Ultra 87。

• SciCode — Beam 49.7 对比 GLM 5.3 59.0,Kimi K3 58.7,Qwen3.8 Max 52.1,DeepSeek V4.1 Flash 52.0,Inkling 46.1,Nemotron 3 Ultra 44.6。

• CriPT AA — Beam 16.3 对比 Kimi K3 23.4、GLM 5.2 20.9、Qwen3.8 Max 20.0、GLM 5.3 19.1、DeepSeek V4.1 Flash 14.3、Inkling 5.4、Nemotron 3 Ultra 3.1。

Beam 的推理表现处于中游,而且规律很一致:在 Reflection 的榜单上,它轻松领先于上一代的两款模型,但落后于当前这款。GPQA Diamond 上 90.5 分的成绩很扎实,但有另外四款模型超过了它。

• MCP Atlas — Beam 78.7 对比 Qwen3.8 Max 84.5,GLM 5.3 84.2,Kimi K3 82.3,GLM 5.2 77.8,Inkling 76.0,Nemotron 3 Ultra 63.1。

• AutomationBench 公开测试集 —— Beam 37.0,对比 DeepSeek V4.1 Flash 54.8、GLM 5.3 48.2、Kimi K3 46.7、Qwen3.8 Max 39.8、GLM 5.2 26.2。

• tau3 banking — Beam 38.0,对比 Qwen3.8 Max 55.2、GLM 5.2 37.1、Kimi K3 37.1、Inkling 25.0、Nemotron 3 Ultra 22.6。

• 具备上下文管理能力的 BrowseComp —— Beam 77.4 对比 Kimi K3 91.2、Inkling 77.1、Nemotron 3 Ultra 44.4。

• 具备上下文管理能力的 DeepSearchQA — Beam 80.1 对比 Kimi K3 95.0。

Reflection 还在帖子中展示了两项能力演示:在“Land or Water”谜题上达到 95.5% 的解决率,那是一个 180×90、包含 16,200 个点的网格,需要维持庞大的棋盘状态——这一数字介于 Reflection 归因给 Opus 5 和 Fable 5 在同一任务上的 92.5% 与 97.8% 之间——以及对最小的 Gemma-4 进行 Text2SQL 微调,将留出集准确率提升至 66.5%。演示内容是经过挑选的;它们展示的是模型能完成某件事,而不是它完成这件事的频率。

今天你可以用它做什么,以及哪些事情不应围绕它来规划

如今,通常恰好只有一件事可行:申请 beta 访问权限,并通过 Reflection 自己的端点,用 OpenAI 形态的客户端调用 Beam-501B-A23B。没有公布价格,因此无法对在其上运行的工作负载进行成本建模。没有权重,因此无法自托管、无法量化、无法微调,也无法实现第三方复现。没有独立的基准测试条目,因此上面整幅性能图景都只依托于一家实验室的表格。

Reflection Beam 不是我们提供的路由之一。我们不会暗示它是,也不会把你引向可能拥有它的经销商。我们能告诉你的是这个对比组的成本,因为其中四个模型我们都在路由,下面的数字是今天早上从我们自己的目录里实时读取的:GLM 5.2,每百万 token 输入 $1.40、输出 $4.40,GLM 5.3 为 $1.26 和 $3.96,Qwen3.8 Max 为 $2.00 和 $6.00,DeepSeek V4.1 Flash 为 $0.15 和 $0.60。这是一个实实在在的价差——DeepSeek V4.1 Flash 的输入价格比 GLM 5.2 便宜近十倍——也正是为什么一个没有标价的测试版模型很难被纳入决策。OrcaRouter 用一个兼容 OpenAI 的密钥即可调用这些以及 200 多个其他模型,按提供商的目录价原样透传,不额外加价,这意味着供应商调价当天我们这边就会生效,而不是等某个经销商什么时候刷新。而且由于自动故障转移是路由本身的一部分,而不是需要你自己搭建的东西,一个全新且未经检验的模型正是那种可以放在一部分流量上、而不是放在关键路径上的东西——这也是使用一个基准测试尚无任何人复现的模型时唯一负责任的方式。

A screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model name, the pass-through list price of $1.40 per million input tokens and $4.40 per million output tokens, the 1,000,000-token context window and the release date 2026-06-16.

在认真对待这一效率声明之前,需要注意什么

三件事将解决这个问题,其中两件已承诺在月内完成。

首先是权重。Apache 2.0 加上一份技术报告,才能让任何手头只有几个节点的人去测量真正重要的东西——在固定质量门槛下的每 GPU 每秒 token 数,以及 230 亿活跃参数是否真能兑现图表所暗示的每 FLOP 得分。在那之前,效率方面的论点不过是餐巾纸上的算术。

第二点是价格。一个没有标价的模型在成本比较中没有立足之地;如果 Beam 的定价落在 GLM 和 DeepSeek 这一档之上,那么对任何有预算的人来说,算力叙事就不再重要了。如果它落在这一档之下,情况会迅速改变。

第三点是,运行这套测试的是一个第三方。上面每一个数字都出自同一份文档,而一张由厂商自行报告、却在十六行中有七行把自家模型排在后面的表格,是该实验室诚实与否的一个好迹象——但它终究只是一家实验室、一套测试框架、一组提示词。

如果你今天就需要一个能力强的智能体编程器,并且需要知道它的成本,那么答案还不是 Reflection Beam。它可能要等三周后才会出现。值得为一项效率声明押注的模型,是那种你能下载其权重、并能自己计算其 FLOPs 的模型——而按照这一标准,Reflection 给我们的只是一个日期,而不是一个模型。

本文中的对比4

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新