Cognition SWE-2 的標題卡,副標題寫著「A Kimi K3 post-train,在 FrontierCode 1.1 Main 上達 50.0%,成本降低 64%」,並搭配三張卡片:FrontierCode 1.1 Main 50.0%、對比 Claude Fable 5.1 的 50.9%,以及每次 rollout 成本降低 64%。
Guides & Insights

Cognition SWE-2:緊鄰前沿的程式編寫,享 64% 折扣,以及底下的基準測試陷阱

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Cognition SWE-2 本週推出,帶著一個注定會廣為流傳的數字:在 FrontierCode 1.1 Main 上達到 50.0%,與 Claude Fable 5.1 的 50.9% 相差不到一分,成本卻低 64%。這款模型是 Moonshot AI 的 Kimi K3 的後訓練版本——後者是擁有 2.8 兆參數的開放權重基礎模型——而 Cognition 表示,其強化學習在數項基準測試上帶來了 5–6 分的提升。這兩項數字都出自廠商自家,且都未經獨立複現。不過,第二項數字才是那個應該改變你如何看待第一項數字的說法,因為「加五或六」事實上是對 SWE-2 幾乎所有表現的描述,包括它慘敗的地方。

這不是貶抑。這是這次發布最有用的一點,而這正是幾乎所有發表報導都沒有明講的部分。

Cognition 實際上發布了什麼

SWE-2 是 Devin 的程式碼模型,並非附有價目表的一般用途 API 模型。它已推出即日起於 Devin Desktop 與 CLI 提供,這是 Cognition 自己的說法,並正於 Devin Web 和 Fusion 陸續推出。第三方報導將此公告的日期定為 2026 年 9 月 10 日;Cognition 自家部落格文章的署名日期則為 09.11.26。無論如何,這都是幾天前的事。模型權重為專有,且沒有公布每 token 的費率表。如果你想使用 SWE-2,就得在 Devin 裡面用。

其基礎模型是 Kimi K3,一個擁有 2.8 兆參數的混合專家(Mixture-of-Experts)模型,每個 token 約有 104B 參數處於啟用狀態——約為 SWE-1.7 基礎模型的三倍大。Cognition 指出,K3 在達到這個階段之前,早已針對代理式編碼進行了大量 RL 訓練,而且它自身的 RL「仍找到相當大的進步空間」。這與 SWE-1.7 的模式如出一轍,後者同樣是在 Kimi 基礎模型上進行後訓練。

這裡有個細節,比任何單一基準分數都更重要:FrontierCode 是 Cognition 的基準測試。這家公司自己出題——找來二十多位開源維護者,每道題目耗費超過 40 小時,由每位維護者定義在自己的儲存庫裡什麼才算「可合併」——自己營運排行榜,也自己評分提交內容。這是一套嚴謹的評估設計,同時也是一件自家內部工具。Cognition 會回報每個模型在各種推理投入程度設定下的最佳分數,而根據其自家的方法論附錄,包括 Kimi K3 在內的開放權重比較模型,都是在 Cognition 的 Devin CLI 裡執行的。這些都不代表那些數字是錯的。但當你引用這些數字時,這一切都該被寫進那句話裡。

Two-column scoreboard headed 'Cognition SWE-2 vs Claude Fable 5.1'. Left column Cognition SWE-2: FrontierCode 1.1 Main 50.0%, Terminal-Bench 2.1 92.8%, Terminal-Bench 4 27.3%, Cost per rollout 64% lower, Base model Kimi K3 2.8T, Independent eval none yet. Right column Claude Fable 5.1: FrontierCode 1.1 Main 50.9%, Terminal-Bench 2.1 91.4%, Terminal-Bench 4 55.8%, Cost per rollout baseline, Base model proprietary, Independent eval third-party scored.

誠實地解讀基準表

四個基準測試,全部由廠商自行呈報。以下是每一項實際上所說的內容,每列一行。

• FrontierCode 1.1 Main — SWE-2 50.0%,相較於 Kimi K3 的 44.2%、Grok 4.6 的 48.0%、GPT-5.6 Sol 的 47.5%、Claude Fable 5.1 的 50.9%、GPT-6 Astra 的 53.3%、SWE-1.7 的 42.0%。距離前沿不到一個百分點,領先表上其餘所有項目。

• DeepSWE 1.1 — SWE-2 73.0%,領先 Claude Fable 5.1 的 67.4% 與 Grok 4.6 的 67.5%,落後 GPT-6 Astra 的 74.1%。這一列正是 SWE-2 最足以令人信服地直接擊敗前沿模型之處。

• Terminal-Bench 2.1 — SWE-2 92.8%,在 Cognition 的表中拿下最高分,領先 Claude Fable 5.1 的 91.4% 與 GPT-6 Astra 的 89.9%。這是大多數發布頭條中引用的數字。

• Terminal-Bench 4 — SWE-2 27.3%,對比 Claude Fable 5.1 的 55.8% 與 GPT-6 Astra 的 57.9%。差距約 28 個百分點,而這也是最少被引述的一列。

顯而易見的反駁是,每個人在 Terminal-Bench 4 上都會掉分——它是更難、時間跨度更長的後繼版本,所以分數下滑理所當然。有趣的部分是幅度有多大,而且跌幅並非等比例。從 Terminal-Bench 2.1 到 4,Claude Fable 5.1 掉了約 35.6 分,GPT-6 Astra 掉了約 32.0 分。SWE-2 掉了約 65.5 分,而其基礎模型 Kimi K3 掉了約 66.8 分。因此,在長時程的代理式工作上,SWE-2 不只是落後於前沿模型——當任務拉長時,它的退化速度大約是它們的兩倍。

Terminal-Bench 4 是否為「現行」版本,值得直接說清楚:它是當前版本,而 2.1 已被取代。SWE-2 領先的那一列,是已退役的基準測試;它落後的那一列,才是現行基準。這兩個事實都成立,而發布報導往往只挑其中一個來講。

「Kimi K3 加五」——預測那些無人發表過的分數的啟發式方法

將這四項基準測試與 SWE-2 自身的基礎模型並列比較,幾乎會機械式地得出一個結果。相較於 Kimi K3,SWE-2 在 FrontierCode 1.1 Main 上提升 5.8 分,在 DeepSWE 1.1 上提升 4.5 分,在 Terminal-Bench 2.1 上提升 4.5 分,並在 Terminal-Bench 4 上提升 5.8 分。

四項基準測試,四個差距,全都介於 4.5 和 5.8 之間。後訓練改變的是水準,不是形態。K3 強的地方,SWE-2 就強,而且大約再多五。K3 弱的地方——Terminal-Bench 4 就是明顯的例子——SWE-2 就弱,而且大約再多五。

這讓你對任何 Cognition 未進行基準測試的任務,都能得到一個可用的預測——而大多數任務都是如此。查一下 Kimi K3 在你的工作負載上表現如何,加五個百分點,你對 SWE-2 的估計就會比任何頭條數字所能給出的都更準確。這也解釋了這次發布的真正論點:Cognition 並不是聲稱自己擊敗了前沿。它聲稱的是,無論你以哪個軸向來衡量,它都把整條成本效能曲線向外推移,同時與最佳模型保持固定的落後距離。

64% 是真的,但你買不到它

「比 Claude Fable 5.1 便宜 64%」是一項關於特定量測的真實陳述——而該量測是 FrontierCode 上每次 rollout 平均花費的美金,不是代幣價格。SWE-2 沒有按代幣計價的費率,因為沒有 SWE-2 API。這項成本說法描述的是在 Devin 內部執行一項任務的成本,它把模型、執行框架、輔助鷹架與 Cognition 的服務堆疊打包成一張帳單。

那個區別是有實質意義的。你不能拿 SWE-2 的成本去和另一家廠商的 token 價格相比,因為它們不是同一個單位。而且你也不能把 SWE-2 帶到別處使用:專有權重、單一廠商、單一 agent 產品。某些報導中「成本最多可降低 70%」的數字,是 Cognition 在各項基準測試中所引用範圍的上限;而 FrontierCode 1.1 Main 的數字則是 64%。

效率數字真要說的話,反而是更實際的重點,而且這些同樣是廠商自行回報的數據。SWE-2 在中等強度下擊敗 SWE-1.7 的 FrontierCode 分數,同時平均少用 58% 的回合數,成本也少了 81%。每次執行的平均步驟數從 SWE-1.7 的 127 降到中等強度下的 53(高強度為 80,最高強度為 98),而第一次真正進行程式碼編輯的中位數則從第 48 步提前到第 18 步。這直接回應了 SWE-1.7 在簡單任務上過度探索的抱怨,而且這種改進會遠早於區區一分的基準測試差距,先反映在你的帳單上。

Screenshot of Cognition's official SWE-2 announcement blog post, headed 'Introducing SWE-2: Pushing the Pareto Frontier', bylined 09.11.26, showing the opening claim of 50.0% on FrontierCode 1.1 Main within one point of Fable 5.1 while being 64% cheaper, and a cost-versus-solve-rate Pareto chart labelling the medium, high and max effort levels.

訓練技巧才是真正的新聞

撇除排行榜上的定位不談,這裡有一項真正新穎的工程設計,這正是為什麼即使你從未打開 Devin,這次發布仍值得一讀。

Cognition 在單一 RL 訓練中,訓練了全部三個推理努力等級——中等、高與最高。其機制是針對每個努力等級施加線性成本懲罰,每一項都經過調校,以匹配基礎模型自身在該點的成本效能 Pareto 曲線斜率。Cognition 主張懲罰必須為線性的理由才是有趣之處:唯有線性懲罰能讓訓練目標僅取決於平均成本與解題率,而非取決於分布形狀的東西。

常見做法是分別訓練各個投入等級,或是事後再外掛一個較便宜的檢查點。而在同一次訓練中把它們一起訓練,才讓公司得以宣稱自己推進的是整條前沿,而不是前沿上的某一個點。配套的變更包括:以長度加權的獎勵基準、將 RL 環境數量增為三倍、遵循指令的疊加層,以及一個飛輪機制,利用較早期的 SWE-2 檢查點來強化驗證器、防範獎勵駭取。在服務端方面,則是搭配量化感知訓練的 NVFP4 與 FP8 核心、一個經重新訓練而將接受長度延長 15% 的 DSpark 推測解碼草稿模型,以及一個能為每顆 GPU 的吞吐量帶來 10–20% 效益、代價是首字延遲變差的預填充延遲器。

如果你進行後訓練,這份配方就是本次發布中可轉移的部分。如果你不進行,重點更簡單:SWE-2 之所以便宜,不是因為它是更小的模型,而是因為運行它的成本被寫進了獎勵函數。

如果你想在 Devin 之外獲得 Kimi K3 的能力

SWE-2 不在 OrcaRouter 上,而且未來也不會——專有權重、沒有 API、僅由 Devin 發佈。它的基礎模型則是另一回事。Kimi K3 已在 OrcaRouter 上路由kimi/kimi-k3,每 100 萬個輸入 token 收費 $3.00 美元,每 100 萬個輸出 token 收費 $15.00 美元,且未在供應商費率之上加價,具備 100 萬 token 的上下文視窗、原生工具呼叫、圖像輸入,以及透過頂層 reasoning_effort 參數而非取樣設定來控制推理深度。

那就是本次發布實用結論的誠實版本。SWE-2 向你展示了,在 K3 之上執行得當的一輪 RL,在其效能範圍頂端會是什麼樣子——實實在在的 4.5 到 5.8 分提升,外加大幅效率增益,但代價也十分真實。它沒有給你的,是一個你可以直接呼叫的模型。如果你想讓底層能力指向你自己的程式碼、你自己的測試框架或你自己的管線,K3 才是這套堆疊中你真正能觸及的部分,而且只要透過一個 OpenAI 相容端點就能觸及。

在這些數據尚未經過審計的情況下,它也是這場押注中較安全的那一半。SWE-2 的基準測試數據出自 Cognition 自家,公司以外沒有人重現過。Kimi K3 的數據才是這項比較真正賴以成立的依據——而如果你透過 OrcaRouter 進行路由,你就能在它背後架設一條備援鏈,如此一來,你正在試用的模型就不會在讓你失望的那一天成為生產環境的依賴。

Screenshot of the OrcaRouter model page for Kimi K3, showing model ID kimi/kimi-k3, input $3.00 per 1M tokens, output $15.00 per 1M tokens, cache read $0.300, 1M-token context, text and image input, p50 time-to-first-token of 9.85 seconds, and 2,739.4M tokens of traffic over 7 days.

誰應該採取行動,而什麼能讓這件事塵埃落定?

如果你已經付費使用 Devin,SWE-2 無疑是個好消息:它正在你的產品中逐步推出,每項任務的成本比它所取代的方案更低,而效率數據顯示,它在簡單工作上會浪費較少的回合。先從你待辦佇列中較簡單的一端試用它——努力等級的設計意味著 medium 才是成本優勢所在。

如果你正從外部挑選程式碼模型,請先等待獨立評估。目前還沒有:Artificial Analysis 沒有 SWE-2 的條目,而 FrontierCode 排行榜是 Cognition 自家的工具。有三件事能定論。第三方在 Terminal-Bench 4 上運行 SWE-2,這正是決定它是接近前沿的模型,還是只是速度快的模型的那一項。任何對 FrontierCode 差距的獨立重現。以及每 token 的價格,這會需要 Cognition 在 Devin 之外銷售該模型——這是唯一能讓這個 64% 與你收到的其他任何報價相提並論的改變。

在那之前,公允的總結就是基礎模型差距已經給出的那個。SWE-2 是 Kimi K3 加五分,而這個代價是 Cognition 設計進獎勵函數裡的。那是訓練上的真實成就,也是在 Devin 內部真正划算的交易。它還不是前沿模型,而它看似能擊敗一切的唯一一項基準測試,正是那項已不再計分的測試。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新