Cognition SWE-2 的标题卡,副标题为“Kimi K3 后训练版本,在 FrontierCode 1.1 Main 上达到 50.0%,成本降低 64%”,并配有三张卡片:FrontierCode 1.1 Main 50.0%、对比 Claude Fable 5.1 50.9%,以及单次 rollout 成本降低 64%。
Guides & Insights

Cognition SWE-2:接近前沿的编码,降价 64%,以及其下的基准测试陷阱

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Cognition SWE-2 本周发布,带来了一个生来就适合传播的数字:在 FrontierCode 1.1 Main 上达到 50.0%,仅比 Claude Fable 5.1 的 50.9% 低一个百分点,成本却少 64%。该模型是 Moonshot AI 的 Kimi K3 的后训练版本——后者是拥有 2.8 万亿参数的开放权重基础模型——Cognition 表示,其强化学习在多项基准测试中提升了 5–6 个点。这两个数字都出自厂商自身,且均未被独立复现。不过,第二个数字才是那个应改变你解读第一个数字方式的说法,因为事实证明,“加五或六”几乎能描述 SWE-2 所做的一切,包括它输得很惨的那些地方。

这不是在贬低它。这是这个版本最有用的一点,而这恰恰是几乎所有发布报道都不会明说的部分。

Cognition 实际发布了什么

SWE-2 是 Devin 的编程模型,而非附有价目表的通用 API 模型。它已发布,自今日起在 Devin Desktop 和 CLI 中可用——这是 Cognition 自己的说法,目前正在 Devin Web 和 Fusion 上逐步推出。第三方报道将此次公告的日期定在 2026 年 9 月 10 日;而 Cognition 自家博客文章的署名日期为 09.11.26。无论如何,它问世才不过几天。模型权重为专有,且没有公开的按 token 计费价目表。如果你想使用 SWE-2,就只能在 Devin 内部使用它。

其基础是 Kimi K3,一个拥有 2.8 万亿参数的混合专家模型,每个 token 约有 104B 参数处于激活状态——约为 SWE-1.7 基础模型规模的三倍。Cognition 指出,K3 在达到这一阶段之前,已经针对智能体编程进行了大量强化学习训练,而且其自身的强化学习“仍能找到相当大的提升空间”。这与 SWE-1.7 的模式如出一辙,后者同样是在 Kimi 基础模型上经过后训练得到的。

有一个细节,比任何单项基准分数都更重要:FrontierCode 是 Cognition 的基准测试。 该公司负责编写任务——与 20 多位开源维护者合作,每个任务耗时超过 40 小时,每位维护者都在自己的代码库中定义什么才算“可合并”——同时运营排行榜并对提交结果进行评分。这是一项严肃的评估设计,同时也是一套内部工具。Cognition 报告的是每个模型在推理强度设置下的最佳分数,而根据其自己的方法学附录,开放权重对比模型(包括 Kimi K3)都是在 Cognition 的 Devin CLI 中运行的。这些都不意味着数字有误。但当你引用这些数字时,所有这些都应当被一并说明。

Two-column scoreboard headed 'Cognition SWE-2 vs Claude Fable 5.1'. Left column Cognition SWE-2: FrontierCode 1.1 Main 50.0%, Terminal-Bench 2.1 92.8%, Terminal-Bench 4 27.3%, Cost per rollout 64% lower, Base model Kimi K3 2.8T, Independent eval none yet. Right column Claude Fable 5.1: FrontierCode 1.1 Main 50.9%, Terminal-Bench 2.1 91.4%, Terminal-Bench 4 55.8%, Cost per rollout baseline, Base model proprietary, Independent eval third-party scored.

如实解读基准表

四项基准测试,均为厂商自行报告。以下是每一项实际所说明的内容,每项一行。

• FrontierCode 1.1 Main — SWE-2 50.0%,对比 Kimi K3 44.2%、Grok 4.6 48.0%、GPT-5.6 Sol 47.5%、Claude Fable 5.1 50.9%、GPT-6 Astra 53.3%、SWE-1.7 42.0%。距前沿不到一个百分点,领先于表中其他所有模型。

• DeepSWE 1.1 —— SWE-2 73.0%,领先于 Claude Fable 5.1 的 67.4% 和 Grok 4.6 的 67.5%,落后于 GPT-6 Astra 的 74.1%。正是在这一项上,SWE-2 最有说服力地正面击败了一款前沿模型。

• Terminal-Bench 2.1 — SWE-2 达到 92.8%,在 Cognition 的榜单中位列第一,领先于 Claude Fable 5.1 的 91.4% 和 GPT-6 Astra 的 89.9%。这是大多数发布报道标题中引用的数字。

• Terminal-Bench 4 —— SWE-2 为 27.3%,相比之下 Claude Fable 5.1 为 55.8%,GPT-6 Astra 为 57.9%。差距约为 28 个百分点,而这一行也是被引用得最少的。

显而易见的反驳是,所有模型在 Terminal-Bench 4 上都会掉分——它是一个更难、时间跨度更长的后继基准,分数下降理所当然。有趣的部分在于掉了多少,而且降幅并不成比例。从 Terminal-Bench 2.1 到 4,Claude Fable 5.1 大约损失 35.6 分,GPT-6 Astra 约损失 32.0 分。SWE-2 损失约 65.5 分,其基础模型 Kimi K3 约 66.8 分。因此在长时程智能体任务上,SWE-2 不只是低于前沿模型——当任务变长时,它的退化速度大约是它们的两倍。

Terminal-Bench 4 是不是“现行”版本,这一点值得直截了当地说明:它是当前版本,而 2.1 则是已被取代的那个。SWE-2 领先的那一行对应的是已退役的基准测试。它落后的那一行对应的则是当前版本。这两个事实都成立,而发布报道往往只挑其中一个来讲。

“Kimi K3 加五”——预测没人公布过的分数的启发式方法

把四项基准测试与 SWE-2 自身的基础模型逐一对比,几乎会机械般地得出一个结果。与 Kimi K3 相比,SWE-2 在 FrontierCode 1.1 Main 上提升 5.8 分,在 DeepSWE 1.1 上提升 4.5 分,在 Terminal-Bench 2.1 上提升 4.5 分,在 Terminal-Bench 4 上提升 5.8 分。

四个基准测试,四个差距,全部在 4.5 到 5.8 之间。后训练改变的是水平,而不是形态。在 K3 强的地方,SWE-2 也强,而且大约高五分。在 K3 弱的地方——Terminal-Bench 4 就是明显的例子——SWE-2 也弱,而且大约高五分。

这为你提供了一个可用的预测方法,适用于 Cognition 未做基准测试的任何任务,而这类任务占大多数。查一下 Kimi K3 在你的工作负载上的表现,加五分,你就能得到对 SWE-2 的估计,比任何头条数字给出的都更准确。这也解释了这次发布的真正论点:Cognition 并没有声称自己已经超越了前沿。它声称的是,无论你以哪个维度衡量,它都把整条成本-性能曲线向外推移了,同时与最佳模型保持固定距离。

64% 是真实的,但你无法购买它

“比 Claude Fable 5.1 便宜 64%”是一个关于某一具体测量结果的真实陈述——而这个测量结果是在 FrontierCode 上每次 rollout 平均花费的美元金额,而不是 token 价格。SWE-2 没有按 token 计费的费率,因为不存在 SWE-2 API。这一成本声明描述的是任务在 Devin 内部的成本,而 Devin 将模型、运行框架、脚手架以及 Cognition 的服务栈打包进一张账单。

这一区别很有分量。你不能把 SWE-2 的成本与另一家供应商的 token 价格相比较,因为它们不是同一种单位。而且你无法把 SWE-2 用到别处:专有权重,单一供应商,单一智能体产品。一些报道中“成本最高降低 70%”的数字,是 Cognition 在各项基准测试中给出的区间的上限;FrontierCode 1.1 Main 的数字是 64%。

效率数字甚至可以说是更务实的故事,而且这些也同样是厂商报告的。SWE-2 在中等强度下,虽然平均少用了 58% 的回合、成本降低了 81%,却仍超过了 SWE-1.7 的 FrontierCode 分数。每次运行的平均步骤数从 SWE-1.7 的 127 步降到中等强度下的 53 步(高强度为 80 步,最高为 98 步),而首次真正代码编辑的中位步骤数从第 48 步降到第 18 步。这直接回应了关于 SWE-1.7 在简单任务上过度探索的抱怨,而且这类改进会出现在你的账单上,远早于一个点的基准差距出现。

Screenshot of Cognition's official SWE-2 announcement blog post, headed 'Introducing SWE-2: Pushing the Pareto Frontier', bylined 09.11.26, showing the opening claim of 50.0% on FrontierCode 1.1 Main within one point of Fable 5.1 while being 64% cheaper, and a cost-versus-solve-rate Pareto chart labelling the medium, high and max effort levels.

训练技巧才是真正的新闻

抛开排行榜上的位置不谈,这里有一项真正新颖的工程成果,这也是为什么即便你从不打开 Devin,这次发布也值得一读。

Cognition 在单次 RL 训练中训练了全部三个推理努力等级——中等、高和最高。其机制是按努力等级施加线性成本惩罚,每个惩罚都经过调校,以匹配基座模型自身成本-性能帕累托曲线在该点的斜率。Cognition 认为惩罚必须为线性的理由才是有意思的部分:只有线性惩罚才能让训练目标仅取决于平均成本与求解率,而不是取决于分布的形状。

通常的做法是分别训练各个努力档位,或者事后外挂一个更便宜的检查点。而在一次训练中把它们一起训练,才让公司得以宣称自己推进的是整条前沿,而不是前沿上的某一个点。配套改动包括:长度加权的奖励基线、将 RL 环境数量增至三倍、指令遵循叠加层,以及一个利用更早的 SWE-2 检查点来加固验证器、抵御奖励攻击的飞轮。在服务侧,则有配合量化感知训练的 NVFP4 和 FP8 内核、一个为将接受长度提升 15% 而重新训练的 DSpark 推测解码草稿模型,以及一个预填充延迟器——它以更差的首 token 时间为代价,换来每 GPU 吞吐量 10–20% 的提升。

如果你做后训练,那么这套配方就是本次发布中可迁移的部分。如果你不做,结论就更简单:SWE-2 便宜的原因并不是它是个更小的模型,而是运行它的成本被写进了奖励函数。

如果你想在 Devin 之外获得 Kimi K3 的能力

SWE-2 并不在 OrcaRouter 上,而且也不会在——专有权重,没有 API,仅限 Devin 分发。其基础模型则是另一回事。 Kimi K3 已在 OrcaRouter 上路由,即 kimi/kimi-k3,价格为每 100 万个输入 token 3.00 美元、每 100 万个输出 token 15.00 美元,未在提供商费率上加价,具有 100 万 token 上下文窗口、原生工具调用、图像输入,以及通过顶层 reasoning_effort 参数而非采样设置来控制推理深度。

这才是本次发布实际结论的诚实版本。SWE-2 向你展示了,在 K3 之上执行得当的一轮 RL 在其能力上限附近是什么样子——真实提升 4.5 到 5.8 个百分点,外加显著的效率收益,但代价也同样真实。它没有给你的,是一个可以调用的模型。如果你想将底层能力用于你自己的代码、你自己的测试框架或你自己的流水线,K3 才是这套技术栈中你真正能够触及的部分,而且只需通过一个 OpenAI 兼容端点即可访问。

在数据尚未经过审计的情况下,这也是这场押注中更稳妥的一半。SWE-2 的基准测试是 Cognition 自家做的,公司外部无人复现过。而这场比较真正依赖的,是 Kimi K3 的测试结果——如果你通过 OrcaRouter 进行路由,就可以在其背后设置一条回退链,这样你正在试用的模型就不会在它让你失望的那天变成生产环境的依赖项。

Screenshot of the OrcaRouter model page for Kimi K3, showing model ID kimi/kimi-k3, input $3.00 per 1M tokens, output $15.00 per 1M tokens, cache read $0.300, 1M-token context, text and image input, p50 time-to-first-token of 9.85 seconds, and 2,739.4M tokens of traffic over 7 days.

谁应该采取行动,什么才能解决此事

如果你已经在为 Devin 付费,那么 SWE-2 无疑是好消息:它正在你的产品中逐步推出,每个任务的成本都比它所取代的方案更低,而效率数据表明,它在简单工作上会少浪费轮次。先在队列中较简单的任务上试用它——努力等级设计意味着,成本优势主要体现在中等档位上。

如果你打算从外部挑选一个编码模型,那就等独立评测。目前还没有:Artificial Analysis 没有 SWE-2 的条目,而 FrontierCode 排行榜是 Cognition 自家的工具。有三件事能给出定论。第三方在 Terminal-Bench 4 上运行 SWE-2——这一行决定它是前沿级模型,还是只是快。任何对 FrontierCode 差距的独立复现。以及每 token 价格,而这需要 Cognition 在 Devin 之外销售该模型——这一项改动就能让那个 64% 与你收到的任何其他报价具有可比性。

在那之前,公允的总结就是基础模型差距已经给你的那个。SWE-2 就是 Kimi K3 加五分,代价是 Cognition 把它设计进了奖励函数。这在训练上是一项真正的成就,在 Devin 内部也是一笔真正划算的交易。它还不是前沿模型,而那个它看似能击败一切的基准,正是已经不再算数的那个。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新