Cognition SWE-2 的标题卡,标题为“Cognition SWE-2”,副标题为“由 Cognition 开发的编码模型,基于 Kimi K3 后训练,并在 Devin 内提供服务”,下方有三张卡片,分别写着“由 Cognition 制作”“基础模型 Kimi K3 2.8T”和“在 Devin Desktop 和 CLI 中提供服务”。
Guides & Insights

Cognition SWE-2:谁制造了它,它运行在什么评测框架中,以及这些数字究竟说明了什么

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Cognition SWE-2 是由 Cognition 打造的编程模型,而 Cognition 正是 Devin 背后的公司;它并非通过模型 API 提供服务,而是在 Devin 内部运行:Cognition 自己的发布文章称,SWE-2 率先在 Devin Desktop 和 Devin CLI 中上线,随后逐步推广至 Devin Web 和 Fusion。它是在 Kimi K3 的基础上后训练而来的,后者是 Moonshot AI 拥有 2.8 万亿参数的模型。对于大多数人来到这里时真正想问的那个问题,这就是全部答案;它值得放在最前面说明,因为相当一部分导向本页的搜索都会多出第四个词——Devin——并把这一模型归功于 Devin,而不是 Cognition。Devin 是 Cognition 所销售的智能体。SWE-2 则是 Cognition 训练出来、供其在内部运行的模型。

本页是一份参考页面,而非发布报道。SWE-2 已于 2026 年 9 月 10 日发布,距今已过去一周多;这里给出这个日期,是为了把模型锚定在时间线上,而不是为了报道某起事件。接下来要说的是:有哪些内容已有记录、由谁记录,以及还有哪些尚无人核实。

谁制造了 SWE-2,以及为什么它的归属信息总是飘忽不定

这种困惑并非没有道理。Cognition 并不像实验室出售 API 模型那样出售 SWE-2。没有附带上下文窗口的模型卡,没有公布的 token 价格,也没有可在请求体中传入的标识符。有的是一款产品——Devin——而模型是作为它的一部分到来的。Cognition 自己的文字强化了这种混同:发布文章是从 Devin 的视角写的,基准测试表对于尚未读过该公司早先 FrontierCode 工作的人来说没有解释,而关于可用性的那行提到 Devin 四次、Cognition 一次——还是在署名栏里。

所以,说白了:Cognition 打造了 SWE-2。Cognition 打造了 Devin。这两者并不是一回事,但眼下你无法只拥有其一而不拥有另一个。这也不是一次偶然的命名巧合。Cognition 已经以 SWE 为前缀发布了一连串软件工程模型——SWE-1.5、SWE-1.6、SWE-1.7,如今又有了 SWE-2,期间还出过一个 SWE-1.6 Preview 检查点——同时还有 SWE-grep、SWE-check 这类更细分的工具。这个前缀是该公司对软件工程的简称,它比本段提到的每一个模型都早了大约一年。

名称:是模型,而非基准

这是搜索者将SWE-2错误归于他人的第二个原因,值得单独成段,而非仅以脚注形式提及。

SWE-bench 是一个基准测试。它是由 SWE-bench 团队维护的独立评测,托管在 swebench.com 上,并发布了多个版本:源自真实 GitHub issue 的原始 2,294 个实例数据集,以及 Verified、Lite、Multilingual 和 Multimodal 子集。它被用于对编码智能体进行通用评分,其中也包括 Devin——Cognition 早在 2024 年 3 月就在其博客上发布了一份 Devin 在 SWE-bench 上的技术报告,至今仍保留在那里。

SWE-2 是一个模型。它不是 SWE-bench 的某个版本,也不是后者的缩写。并不存在 SWE-bench 2:已发布的系列包括 SWE-bench、Verified、Lite、Multilingual 和 Multimodal,而现存的版本编号属于该基准的各个子集,而非某个带编号的后续版本。Cognition 针对这些模型所采用的权威基准名为 FrontierCode,它完全是另一套工具,而且正如下一节所述,它归 Cognition 所有。

如果你来到这里,期待的是 SWE-bench 评估的第二代,那这就是整个误解所在。

发布日期以及 SWE-2 的分发方式

Cognition 的公告文章署名日期为 2026 年 9 月 10 日,而该页面自身的结构化数据给出的发布时间戳为 2026-09-10。两者一致。当日,SWE-2 已在 Devin Desktop 和 Devin CLI 中可用,Devin Web 和 Fusion 随后跟进。

那就是分发面,而且它就是整个分发面。没有开放权重——Hugging Face 上没有来自 Cognition 的、针对这个模型的任何东西——也没有接受 SWE-2 标识符的厂商托管端点。如果你的执行框架是你自己的,SWE-2 就不是你今天能安装进去的组件。如果你的执行框架是 Devin,那 SWE-2 就已经在你面前了。

对于需要的是基础模型而非 SWE-2 的能力边界的人来说,Kimi K3 是一个独立且文档更完善的模型,它在 OrcaRouter 上以 kimi/kimi-k3 的形式提供路由——一个 API 即可访问 200 多个模型,按提供商标价计费,不加价。这一点在这里之所以重要,是有具体原因的:Cognition 起步所依托的底层能力可以独立获取,尽管经过后训练的模型无法做到。

边界:Cognition 记录了哪些内容,以及没有记录哪些内容

参考页面应当诚实地呈现其自身证据的形态,而这恰恰是 SWE-2 最为薄弱之处。

• 推理强度 — 三个有文档记录的级别:medium、high 和 max。Cognition 表示,这些级别在行为上的差异是刻意设计的:medium 更早进入行动,承担简单和中等的工作;而 high 和 max 会做更多规划、探索更多代码库,并在验证上投入更多。
• 分发渠道 — 发布时提供 Devin Desktop 和 Devin CLI,Devin Web 和 Fusion 随后逐步推出。没有 API,没有权重,也没有自托管路径。
• 基础模型 — Kimi K3,Cognition 将其描述为一个 2.8T 参数的模型,此前已针对智能体编程进行过大量强化学习。Kimi K3 论文为该基础模型提供了 1M token 的上下文窗口和原生视觉能力。
• 上下文窗口、最大输出、模态、后训练参数量 — SWE-2 均未公布。Cognition 的公告对它们只字未提,Cognition 的其他页面也没有填补这一空白。

最后一行中的区分并非吹毛求疵。Kimi K3 的百万 token 窗口是关于 Kimi K3 的事实。Cognition 并没有说 SWE-2 继承了它,而在不同训练配方上进行后训练,恰恰是可能改变模型所能接受内容的那类变化。如果你需要一个用于规划的上下文窗口数值,你能核实的数值属于基础模型,并且你应当将 SWE-2 的视为未知,而不是假定二者一致。

Scoreboard headed 'Cognition SWE-2 - the scoreboard' listing Base model Kimi K3 2.8 trillion, FrontierCode 1.1 Main 50.0%, DeepSWE 1.1 73.0%, Terminal-Bench 4 27.3%, Distribution Devin only with no API, and Independent score none yet, over a footer reading 'All figures vendor-reported by Cognition; no independent scores yet.'

费率表,以 Cognition 唯一报价的货币计价

SWE-2 没有按 token 计价的价格,因为不存在 SWE-2 端点。Cognition 的成本主张以不同单位表述:它称 SWE-2 在 FrontierCode 1.1 Main 上与 Claude Fable 5.1 相差不到一个百分点——50.0% 对 50.9%——同时便宜 64%。仔细看单位。这 64% 是在 FrontierCode 上每次 rollout 花费的平均美元数,是一个任务级数字,把模型、harness、scaffolding 和 Cognition 的服务栈打包进同一张账单。它不是 token 费率,也不能与 token 费率相提并论。

确实存在的那份价目表是 Devin 的。在 Devin 的定价页面上,2026 年 9 月 28 日看到的是:免费版为 0 美元,Pro 为每月 20 美元,Max 为每月 200 美元,Teams 为每月 80 美元,另加每个完整开发者席位 40 美元。SWE-2 这一项列在 Pro 中,并标有一个日期——“免费使用 SWE-2——在 Devin Desktop 和 CLI 中免费至 2026 年 10 月 10 日。”这是一个还剩大约两周的促销窗口,而且它是该页面上唯一真正对时间敏感的 SWE-2 数字:10 月 10 日之后该模型在 Devin 内的成本并未在那里写明。

Cognition 的效率数据值得与成本方面的说法并列引用,而且它们和本页其他所有内容一样,均来自厂商自报。在 FrontierCode 1.1 Main 上,中等努力程度的 SWE-2 得分高于 SWE-1.7,同时平均少用 58% 的轮次,成本低 81%。每次运行的平均步数从 SWE-1.7 的 127 步降至中等程度的 53 步、高程度的 80 步和最高程度的 98 步,首次真正代码编辑的中位数步数则从第 48 步提前到第 18 步。

基准测试,附带了测试框架

软件工程得分对产生它们时所处的脚手架异常敏感,因此,没有其测试框架的数字就算不上一个数字。Cognition 在公告的方法论附录中说明了其测试框架政策:若存在公开来源,结果便来自公开来源;否则就在 Cognition 的内部评估框架上运行,并采用各模型主要面向开发的那套测试框架——Anthropic 模型用 Claude Code,OpenAI 模型用 Codex,xAI 模型用 Grok Build,开放权重模型用 Devin CLI。对于每个模型,Cognition 都报告其在不同推理努力程度设置下的最佳得分。

由此得出两个后果,而这两点都应与这些数字一并提及。第一,有几行并非同类比较:在 Claude Code 中得出的 Fable 5.1 数值与在 Devin CLI 中得出的 Kimi K3 数值,衡量的是两个不同的智能体系统,而非处于同一中立测试框架下的两个模型。第二,“各努力设置下的最佳分数”意味着每个单元格都是某个模型的最佳表现,而非在相同设置下的对比。若将努力程度固定不变,比较结果会有所不同,而 Cognition 并未公布这样的比较。

以下四行均由供应商报告且未经审计。

• FrontierCode 1.1 Main —— SWE-2 50.0%,Kimi K3 44.2%,Grok 4.6 48.0%,Claude Fable 5.1 50.9%,GPT-5.6 Sol 47.5%,GPT-6 Astra 53.3%,SWE-1.7 42.0%。这是最抓眼的一行,而 FrontierCode 是 Cognition 自家的基准——任务由 Cognition 与 20 多位开源维护者共同编写,排行榜由它运营,提交也由它评分。这些都不代表数字有误;只是当你复述这些数字时,这些背景都该一并出现在那句话里。
• DeepSWE 1.1 —— SWE-2 73.0%,Kimi K3 68.5%,Grok 4.6 67.5%,Claude Fable 5.1 67.4%,GPT-5.6 Sol 72.7%,GPT-6 Astra 74.1%,SWE-1.7 37.7%。在这一行,SWE-2 最令人信服地正面击败了前沿模型。
• Terminal-Bench 2.1 —— SWE-2 92.8%,Kimi K3 88.3%,Grok 4.6 88.4%,Claude Fable 5.1 91.4%,GPT-5.6 Sol 88.8%,GPT-6 Astra 89.9%,SWE-1.7 81.5%。这是 SWE-2 最好看的数字,而当前版本的 Terminal-Bench 并不是 2.1。
• Terminal-Bench 4 —— SWE-2 27.3%,Kimi K3 21.5%,Grok 4.6 20.3%,Claude Fable 5.1 55.8%,GPT-5.6 Sol 37.3%,GPT-6 Astra 57.9%,SWE-1.7 7.6%。这是被引用得最少的一行,也是该模型落后前沿约 28 个百分点的一行。

这一比较还需要多一个背景信息,因为它解释了前沿那一行不寻常的形状从何而来。Cognition 对其图表自己的脚注指出,Fable 5.1 在 FrontierCode 1.1 Main 上的最高努力设置得分为 50.3%,每任务成本为 12.83 美元——低于它自己中等设置的 50.9% 和 3.28 美元。更多努力换来了更低的分数,而成本大约是四倍。这就是前沿模型的曲线向后折回自身,也是为什么 50.0% 对 50.9% 比单看这两个数字所显示的更接近的部分原因。

可信度数字

Cognition 单独列出的可信度部分,是此次发布中与排行榜毫无关系的那一部分;它报告称,SWE-2 在其宣传与审查类提示中总体通过了 98.0%——英文为 99.8%,简体中文为 95.2%,繁体中文为 99.1%——并且其依赖上下文的脆弱性评估发现,对于任何受测模型,都没有任何框架条件会产生统计显著的变化。这些都是 Cognition 的判断,由一个 GPT-5.6 Luna 评委在一个包含 145 个问题的集合上得出,而且和那些基准测试一样,属于厂商自行报告。

独立解读:目前还没有

截至 2026 年 9 月 28 日,SWE-2 在 Artificial Analysis 上没有条目。在模型索引中搜索该名称没有任何结果,直接请求模型页面会返回 404。唯一收录 SWE-2 的排行榜是 FrontierCode,而它属于 Cognition。这让这次发布只剩下厂商报告的数字,别无其他;这并不是在批评这些数字——而是在说明读者能核查其中多少。

有两件具体的事本可以一锤定音,而这两件事都不存在。由第三方在 Terminal-Bench 4 上跑一遍 SWE-2,就能判定它究竟是一个碰巧便宜、接近前沿的模型,还是一个碰巧在某个已退役版本上领先的快速模型。而对前沿差距的任何独立复现,都会告诉你:相对 F 5.1 的那一分优势,究竟是模型本身的属性,还是别的什么属性。

与 Cognition 自家的模型不同,Artificial Analysis 确实收录了 Kimi K3——而 Kimi K3 的数据来自第三方,这使得基座模型成为这套栈中证据更充分的那一半。这种不对称正是如今 SWE-2 的实际形态:后训练是最有意思的部分,也是最难以验证的部分;基座是有据可查的部分,也是你真正能调用的那一个。

Screenshot of the 'Coding benchmark results' section of Cognition's SWE-2 announcement post, showing the four-row seven-column vendor benchmark table — FrontierCode 1.1 Main, DeepSWE 1.1, Terminal-Bench 2.1 and Terminal-Bench 4, each row carrying SWE-2, Kimi K3, Grok 4.6, Fable 5.1, GPT-5.6 Sol, GPT-6 Astra and SWE-1.7 — above the paragraph stating that SWE-2 is post-trained from Kimi K3, a 2.8-trillion-parameter model, and a link line reading 'See how models rank on the FrontierCode leaderboard'.

使用 SWE-2,以及在它未经审计期间该做什么

如果你已经为 Devin 付费,这个决定就很简单,而且不取决于上述任何附加条件。SWE-2 已经在你的产品中,Cognition 表示它每个任务的成本都低于它所取代的模型,而效率数据——轮次减少 58%、平均成本降低 81%、首次编辑步数中位数为第 18 步而非第 48 步——描述的是一个在常规工作上浪费你更少时间的模型。先让它在中等投入下处理你队列里较简单的任务,Cognition 自己的投入级别设计正是把成本优势放在这里。

如果你要在 Devin 之外选择一个编程模型,那么实话实说,SWE-2 并不是一个你可以评估的候选对象,因为没有什么可调用的。没有标识符,没有每 token 价格,也没有端点。你能评估的是基础模型。

Screenshot of the OrcaRouter model page for Kimi K3, showing the model ID kimi/kimi-k3, the modality rows for text plus image input and text output, the Vision, Tools, JSON and Reasoning capability chips, an OpenAI-compatible code sample pointed at api.orcarouter.ai, and a live stat strip reading $3.00 input and $15.00 output per 1M tokens.

Kimi K3 通过 OrcaRouter 路由,价格为每 100 万输入 token 3.00 美元、每 100 万输出 token 15.00 美元,未在供应商费率之上加价,具备 100 万 token 上下文窗口、原生工具调用、图像输入以及顶级的推理强度控制。这是本次发布中可触达的那一半:Cognition 据此进行后训练的能力,通过一个兼容 OpenAI 的端点即可获得,而无需依赖某一家厂商的智能体产品。而且由于无论哪种方式都属于未经审计的领域,你可以在其背后设置一条回退链,这样你正在试用的模型就不会在让你失望的那天变成生产环境的依赖。

SWE-2 告诉你的东西,如果你把它当作证据而非产品页来读,比标题更窄,也更有用:在 Kimi K3 之上执行的一次出色 RL 训练,在四个基准上把水平提升了大约五个点,而没有改变形态,并且做到这一点所用的轮次少了 58%。这在 Devin 内部是一个真实结果。但它还不是 Cognition 之外的任何人复现过的结果,而 SWE-2 看似能胜过一切的唯一一个基准,正是该领域已经停止评分的那个。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新