
Reflection Beam 发布测试版 API,权重仍需再等两周
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 150 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 222 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Reflection 的首个模型名为 Reflection Beam,而今天早上关于它有意思的一点并不是它已经存在——而是它只存在了一半。该公司于 2026 年 10 月 5 日发布 Beam,将其定位为一款稀疏混合专家模型,总参数量达 5010 亿,每个 token 激活 230 亿参数,并在同一天推出了一个兼容 OpenAI 的 beta 端点。权重承诺将于本月晚些时候以 Apache 2.0 许可发布,同时还会发布技术报告、模型卡以及服务栈。在这些东西落地之前,唯一能运行 Beam-501B-A23B 的人,是 Reflection 发放候补名单密钥的那些人,而目前流传的每一项性能数据都来自同一家实验室自己的表格。
发布会停在这个地方很奇怪,而值得精确说明的是:我们拿到的是哪一半。Reflection 已经发布了一个可以注册的预览版,以及一组无人复现的基准测试表。它还没有发布标题里“open-weight”所指的那个东西。
今天早上究竟有什么是真正上线的?
本节中的所有内容均来自 Reflection 自己的博客文章和文档,阅读于 2026 年 10 月 6 日。
• 模型 ID —— Beam-501B-A23B,创建于 2026 年 10 月 5 日,在 api.reflection.ai/openai/v1 上提供服务,仅支持 Chat Completions 和一个 Models 列表,别无其他。
• 形态 — 总参数 5010 亿,每个 token 激活 230 亿,激活率约为 4.6%。作为参照,GLM 5.2 接近 5.4%。
• 上下文 — API 上为 256,000 个 token,该数字本身附有一则脚注,提示该窗口在测试期间可能会发生变化。最大输出为 128,000 个 token。
• 推理 — 一个 reasoning_effort 参数,具有五个设置:low、medium、high、xhigh 和 max。medium 是默认值,并且模型始终会进行推理。没有关闭开关,也没有非推理模式。
• 模态 — 文本输入,文本输出。发布时不支持图像、音频或视频输入。
• 价格 —— 未公布。博客文章未提供,文档中也没有,而平台控制台则位于注册墙之后。
• 访问权限——候补名单。没有自助途径,也没有权重,因此无法下载、无法量化,也无法微调。
价格这一行,才是会改变你解读其他所有内容的那一行。在 Reflection 自己的表格中,被拿来与 Beam 比较的七款模型里,有四款的公开标价今天就能放进电子表格。Beam 则没有,所以现在任何关于它的成本说法,说的都是算力,而不是美元。

发布所依赖的那个数字
Reflection 的卖点在于推理效率,而且它对这一点的具体含义说得格外明确:在高级推理基准测试中,Beam 的得分与 GLM 5.2 相当,同时所用推理算力少 3 到 4 倍。据称,面对参数规模达 2 万亿的模型家族时,这一优势还要更大,而 Qwen 3.8-Max 正属于这一家族。
那个说法背后的图表值得仔细阅读,因为它是整篇文章中承重的证据。它把推理得分与估算的 FLOPs 对应绘制,涵盖 DeepSWE、Humanity's Last Exam 和 Terminal-Bench 2.1,并将 FLOPs 估算为大致等于活跃参数数量乘以每次尝试生成 token 的平均数量。该公式有意排除了提示预填充、依赖上下文的注意力运算以及服务开销——Reflection 在图注中这么说了。它是模型之间的一致比较,而不是对任何人账单的测量,而且它也是效率方面唯一的量化支撑,并且是由构建该模型的实验室撰写的。把它当作一个假设,权重将让其他人来检验。
这套架构在实践中真正换来的是一个服务配置。两千三百亿活跃参数意味着,你可以用相对较少的 GPU 以交互级延迟运行这个模型——尽管卡片上的数字相同,但它与一个五千零一十亿参数的稠密模型是两种不同的产品。正因如此,Reflection 才能在不谈数据中心级部署的情况下,谈论接近前沿的推理能力——也正因如此,最终的权重发布才是比 beta 密钥更重要的事件。
Beam 落在 Reflection 自有表中的位置
下文中每个数字均为厂商报告的数据,来自 Reflection 发布文章中的表格,且均未经独立复现。若 Reflection 未公布某个模型的数字,原表中该单元格显示为 NR。对比列来自 Reflection,而非我们,也非第三方。
编码和终端工作
• Terminal-Bench v2.1 — Reflection Beam 80.1 对比 GLM 5.2 81.0、GLM 5.3 88.2、Kimi K3 88.3、Qwen 3.8-Max 86.6 以及 DeepSeek V4.1 Flash 90.6。Beam 低于上述每一个。
• SWE-Bench Verified — Reflection Beam 为 80.9,Inkling 为 77.6,Nemotron 3 Ultra 为 70.7。这是 Beam 表现最强的地方,但请注意,列表中只有两个最弱的模型在该基准上运行过。
• SWE-Bench Pro v1 — Reflection Beam 65.5,对比 Qwen 3.8-Max 67.7、GLM 5.2 62.1、Inkling 54.3、Nemotron 3 Ultra 46.4。
• SWE-Bench Pro v2-Hard — Reflection Beam 77.2,对比 Kimi K3 88.2、GLM 5.3 84.3、Ink 56.9。距离榜首有十分的差距。
• DeepSWE v1.1 — Reflection Beam 44.4,对比 DeepSeek V4.1 Flash 74.2、Kimi K3 68.0、GLM 5.3 61.0、Qwen 3.8-Max 51.0、GLM 5.2 44.0。Beam 与上一代持平,落后领先者三十分。
• SWE Atlas Codebase QnA — Reflection Beam 为 34.6,相较 Kimi K3 的 68.0 和 GLM 5.3 的 61.0。在长时间交互中始终把大型代码仓库记在脑中,是这份清单上最难的事,而 Beam 的 34.6 可不是四舍五入的误差。
推理与科学
• AIME 2026 — Reflection Beam 97.8,对比 GLM 5.2 的 99.2 与 Inkling 的 97.1。
• 无工具的 HLE —— Reflection Beam 36.2,对比 Kimi K3 46.9、Qwen 3.8-Max 43.6、GLM 5.3 42.3、GLM 5.2 40.5、DeepSeek V4.1 Flash 39.1、Inkling 29.7、Nemotron 3 Ultra 26.7。处于中游水平,仅领先于两款上一代模型。
• GPQA Diamond — Reflection Beam 90.5,对比 Kimi K3 93.5、Qwen 3.8-Max 92.6、GLM 5.3 91.7、GLM 5.2 91.2、DeepSeek V4.1 Flash 90.9。
• SciCode — Reflection Beam 49.7,对比 GLM 5.3 的 59.0、Kimi K3 的 58.7、Qwen 3.8-Max 的 52.1、DeepSeek V4.1 Flash 的 52.0。
• CriPT AA — Reflection Beam 16.3 对比 Kimi K3 23.4、GLM 5.2 20.9、Qwen 3.8-Max 20.0、GLM 5.3 19.1、DeepSeek V4.1 Flash 14.3、Inkling 5.4、Nemotron 3 Ultra 3.1。
工具、搜索和长上下文
• MCP Atlas——Reflection Beam 78.7,对比 Qwen 3.8-Max 的 84.5、GLM 5.3 的 84.2、Kimi K3 的 82.3、GLM 5.2 的 77.8。
• AutomationBench 公开测试集——Reflection Beam 37.0,对比 DeepSeek V4.1 Flash 54.8、GLM 5.3 48.2、Kimi K3 46.7、Qwen 3.8-Max 39.8、GLM 5.2 26.2。
• tau3 banking — Reflection Beam 38.0 对比 Qwen 3.8-Max 55.2、GLM 5.2 37.1、Kimi K3 37.1。
• 带上下文管理的 BrowseComp —— Reflection Beam 77.4,对比 Kimi K3 91.2、Inkling 77.1、Nemotron 3 Ultra 44.4。
• 带上下文管理的 DeepSearchQA —— Reflection Beam 80.1,对比 Kimi K3 95.0。
• AA-LCR —— Reflection Beam 79.3,对比 Kimi K3 88.7、DeepSeek V4.1 Flash 84.0、Qwen 3.8-Max 80.3、GLM 5.3 79.7、Nemotron 3 Ultra 79.3、GLM 5.2 78.3、Inkling 77.3。长上下文召回是通用能力各项中,Beam 真正具有竞争力而非处于中游的那一项。
把四张表放在一起看,一个一致的轮廓就出现了:在 Reflection 的清单上,Beam 击败了两个上一代模型,却在几乎每一行上都输给了当前这一代,差距从微小到足以判定不合格不等。一家厂商发布表格,让自己的模型在这么多行上落后,这说明该实验室很诚实。但这并不说明该模型处于前沿。

迄今为止唯一独立的声音,以及它未曾言明的内容
目前唯一有记录的第三方评估来自Artificial Analysis,该公司于10月5日表示,Reflection已向其开放了访问权限,它正在独立对Beam进行基准测试,并补充说,早期指标表明,就其智能水平而言,Beam将是其所见过的token效率最高的开放模型之一。
这是来自一个机构的、意义重大的声明,该机构的指数正是多数买家实际会看的那个;同时,这也是一份没有给出任何数字的声明。截至今天早上,Artificial Analysis 的排行榜上还没有 Beam 这一行——模型页面返回 404,排行榜的数据载荷中也不含任何 Beam 条目——因此,就目前而言,关于 token 效率的说法只是第三方作出的一项承诺,称其将会发布某些内容。该指数中还没有任何内容基于 Beam 重新计算过。
培训披露,这是此次发布中最有力的部分
Reflection 的帖子中的工程部分包含大多数实验室都会保密的数字,这些数字值得记录,因为它们是此次发布中一个月后仍会引人关注的部分。
• 预训练——在 NVL72 机架的 6,144 块 NVIDIA GB300 芯片上,用 23.8 万亿个经过筛选的 token 完成训练,端到端耗时不到四周,据报告有效吞吐率达 92.3%,其间还进行了九次半自动回退,归因于梯度范数尖峰或疑似静默数据损坏。
• 强化学习——10,500 块 GB300 芯片运行四周,超过 1 亿次 rollout,最大 rollout 上下文为 256,000 个 token,约 13 亿个沙盒,以及约 100 万个不同的环境,来源涵盖编程、智能体和 STEM 任务。
• 服务——新权重到达推理集群的中位时间约为 12 秒,分层分发将跨机架流量削减了 75%,并使全集群采用速度比每个副本自行拉取权重快 2.2 倍。
• 稳定性——完全异步的策略梯度,在从延迟一天的交互中学习时仍保持数值稳定,此外还有可控的长度惩罚,可在无需重新训练的情况下权衡推理长度与得分。
• 数据——通过解析、去重和整理,约 95% 的原始互联网 token 被消除;并声称,常规过滤器会漏掉 Reflection 保留的约 1.8 万亿个 token,其中包括其整理后的网页代码 token 的 87%。
有两行值得标出来。帖子称,中期训练将 Beam 的有效上下文扩展到 100 万 token,而 API 文档则列出了 25.6 万 token 的服务上限,并附有一条 beta 脚注。前者是训练侧能力,后者是服务侧限制,二者并不矛盾,但如果没人去读第二份文档,这个差距恰恰会变成一个“100 万上下文”的标题。至于超过 1 亿次 rollout 的强化学习数字,它被说成是所有开放实验室中规模最大的此类运行之一,而这只是在宣称规模,并不是在说明这样的规模换来了什么——那条分数与 rollout 数的曲线是厂商自己的,而且停在厂商自己停止绘制的地方。

今天您可以用 Reflection Beam 做什么
有一点:加入等候名单,如果你拿到密钥,就用 OpenAI 形态的客户端,通过 Reflection 自己的端点调用 Beam-501B-A23B。没有公布价格,因此无法基于它来对工作负载的成本建模。没有权重,因此无法自托管、无法量化,也无法由第三方复现。没有独立的基准测试行,因此上面的整个性能图景都只依赖于单一实验室的表格。
Reflection Beam 不是我们的线路之一,我们也不会暗示它是。我们能提供的是它试图进入的领域的价格,这是今早从我们自己的目录中实时读出的:GLM 5.2 每百万 tokens 输入 $1.40、输出 $4.40,GLM 5.3 为 $1.26 和 $3.96,Qwen 3.8-Max 为 $2.00 和 $6.00,DeepSeek V4.1 Flash 为 $0.15 和 $0.60。仅就输入而言,最便宜和最贵之间就相差九倍以上——这就是为什么一个没有标价的 beta 模型,无论其效率图表看起来多好,都真的很难被纳入决策。
OrcaRouter 用一个兼容 OpenAI 的密钥,就能通行于这四家以及另外 200 多个模型,按供应商的标价原样透传,不做任何加价,因此供应商一调价,我们这边当天就会生效,而不必等某个转售商什么时候去刷新价目表。自动故障转移是路由本身的一部分,而不是你得围绕每一家提供商去自行搭建的东西;这意味着,一个尚未经过验证的模型——既无法复现,也没有独立评分,还没有价格——恰恰是那种该放到一部分流量上、而不是放在关键路径上的东西。
当主张变得可检验时
有三件事能敲定这件事,而 Reflection 已把其中两件安排在了本月内。
首先是权重。Apache 2.0 加上一份技术报告,让任何拥有几个节点的人都能测量真正重要的东西——在固定质量门槛下,每 GPU 每秒的 token 数,以及 230 亿活跃参数是否真的能带来图表所暗示的每 FLOP 得分。在那之前,效率论证只是餐巾纸上的算术,而每个重复它的人,不过是在复述 Reflection 的图注。
第二个是价格。一个没有标价的模型在成本比较中毫无立足之地。如果 Beam 的定价落在 GLM 和 DeepSeek 这一档之上,那么对任何有预算的人来说,算力叙事就不再重要;如果落在这一档之下,局面就会迅速改变。
第三项是指数。Artificial Analysis 表示正在对 Beam 进行基准测试,但尚未公布任何数字。当那一行出现时,它将是本报道中第一个并非由 Reflection 计算的数字。
如果你今天就需要一个能力出众的智能体编程器,并且想知道它的成本,那么答案还不是 Reflection Beam。三周后也许就是了。一项效率宣称值得押注的模型,是那种你可以自己下载其权重、自己计算其 FLOPs 的模型——而按这个标准,Reflection 给我们的只是一个日期和一份等候名单,而不是一个模型。
本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
