
Cognition SWE-2:緊鄰前沿的程式編寫,享 64% 折扣,以及底下的基準測試陷阱
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 每百萬 tokens
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Cognition SWE-2 本週推出,帶著一個注定會廣為流傳的數字:在 FrontierCode 1.1 Main 上達到 50.0%,與 Claude Fable 5.1 的 50.9% 相差不到一分,成本卻低 64%。這款模型是 Moonshot AI 的 Kimi K3 的後訓練版本——後者是擁有 2.8 兆參數的開放權重基礎模型——而 Cognition 表示,其強化學習在數項基準測試上帶來了 5–6 分的提升。這兩項數字都出自廠商自家,且都未經獨立複現。不過,第二項數字才是那個應該改變你如何看待第一項數字的說法,因為「加五或六」事實上是對 SWE-2 幾乎所有表現的描述,包括它慘敗的地方。
這不是貶抑。這是這次發布最有用的一點,而這正是幾乎所有發表報導都沒有明講的部分。
Cognition 實際上發布了什麼
SWE-2 是 Devin 的程式碼模型,並非附有價目表的一般用途 API 模型。它已推出即日起於 Devin Desktop 與 CLI 提供,這是 Cognition 自己的說法,並正於 Devin Web 和 Fusion 陸續推出。第三方報導將此公告的日期定為 2026 年 9 月 10 日;Cognition 自家部落格文章的署名日期則為 09.11.26。無論如何,這都是幾天前的事。模型權重為專有,且沒有公布每 token 的費率表。如果你想使用 SWE-2,就得在 Devin 裡面用。
其基礎模型是 Kimi K3,一個擁有 2.8 兆參數的混合專家(Mixture-of-Experts)模型,每個 token 約有 104B 參數處於啟用狀態——約為 SWE-1.7 基礎模型的三倍大。Cognition 指出,K3 在達到這個階段之前,早已針對代理式編碼進行了大量 RL 訓練,而且它自身的 RL「仍找到相當大的進步空間」。這與 SWE-1.7 的模式如出一轍,後者同樣是在 Kimi 基礎模型上進行後訓練。
這裡有個細節,比任何單一基準分數都更重要:FrontierCode 是 Cognition 的基準測試。這家公司自己出題——找來二十多位開源維護者,每道題目耗費超過 40 小時,由每位維護者定義在自己的儲存庫裡什麼才算「可合併」——自己營運排行榜,也自己評分提交內容。這是一套嚴謹的評估設計,同時也是一件自家內部工具。Cognition 會回報每個模型在各種推理投入程度設定下的最佳分數,而根據其自家的方法論附錄,包括 Kimi K3 在內的開放權重比較模型,都是在 Cognition 的 Devin CLI 裡執行的。這些都不代表那些數字是錯的。但當你引用這些數字時,這一切都該被寫進那句話裡。

誠實地解讀基準表
四個基準測試,全部由廠商自行呈報。以下是每一項實際上所說的內容,每列一行。
• FrontierCode 1.1 Main — SWE-2 50.0%,相較於 Kimi K3 的 44.2%、Grok 4.6 的 48.0%、GPT-5.6 Sol 的 47.5%、Claude Fable 5.1 的 50.9%、GPT-6 Astra 的 53.3%、SWE-1.7 的 42.0%。距離前沿不到一個百分點,領先表上其餘所有項目。
• DeepSWE 1.1 — SWE-2 73.0%,領先 Claude Fable 5.1 的 67.4% 與 Grok 4.6 的 67.5%,落後 GPT-6 Astra 的 74.1%。這一列正是 SWE-2 最足以令人信服地直接擊敗前沿模型之處。
• Terminal-Bench 2.1 — SWE-2 92.8%,在 Cognition 的表中拿下最高分,領先 Claude Fable 5.1 的 91.4% 與 GPT-6 Astra 的 89.9%。這是大多數發布頭條中引用的數字。
• Terminal-Bench 4 — SWE-2 27.3%,對比 Claude Fable 5.1 的 55.8% 與 GPT-6 Astra 的 57.9%。差距約 28 個百分點,而這也是最少被引述的一列。
顯而易見的反駁是,每個人在 Terminal-Bench 4 上都會掉分——它是更難、時間跨度更長的後繼版本,所以分數下滑理所當然。有趣的部分是幅度有多大,而且跌幅並非等比例。從 Terminal-Bench 2.1 到 4,Claude Fable 5.1 掉了約 35.6 分,GPT-6 Astra 掉了約 32.0 分。SWE-2 掉了約 65.5 分,而其基礎模型 Kimi K3 掉了約 66.8 分。因此,在長時程的代理式工作上,SWE-2 不只是落後於前沿模型——當任務拉長時,它的退化速度大約是它們的兩倍。
Terminal-Bench 4 是否為「現行」版本,值得直接說清楚:它是當前版本,而 2.1 已被取代。SWE-2 領先的那一列,是已退役的基準測試;它落後的那一列,才是現行基準。這兩個事實都成立,而發布報導往往只挑其中一個來講。
「Kimi K3 加五」——預測那些無人發表過的分數的啟發式方法
將這四項基準測試與 SWE-2 自身的基礎模型並列比較,幾乎會機械式地得出一個結果。相較於 Kimi K3,SWE-2 在 FrontierCode 1.1 Main 上提升 5.8 分,在 DeepSWE 1.1 上提升 4.5 分,在 Terminal-Bench 2.1 上提升 4.5 分,並在 Terminal-Bench 4 上提升 5.8 分。
四項基準測試,四個差距,全都介於 4.5 和 5.8 之間。後訓練改變的是水準,不是形態。K3 強的地方,SWE-2 就強,而且大約再多五。K3 弱的地方——Terminal-Bench 4 就是明顯的例子——SWE-2 就弱,而且大約再多五。
這讓你對任何 Cognition 未進行基準測試的任務,都能得到一個可用的預測——而大多數任務都是如此。查一下 Kimi K3 在你的工作負載上表現如何,加五個百分點,你對 SWE-2 的估計就會比任何頭條數字所能給出的都更準確。這也解釋了這次發布的真正論點:Cognition 並不是聲稱自己擊敗了前沿。它聲稱的是,無論你以哪個軸向來衡量,它都把整條成本效能曲線向外推移,同時與最佳模型保持固定的落後距離。
64% 是真的,但你買不到它
「比 Claude Fable 5.1 便宜 64%」是一項關於特定量測的真實陳述——而該量測是 FrontierCode 上每次 rollout 平均花費的美金,不是代幣價格。SWE-2 沒有按代幣計價的費率,因為沒有 SWE-2 API。這項成本說法描述的是在 Devin 內部執行一項任務的成本,它把模型、執行框架、輔助鷹架與 Cognition 的服務堆疊打包成一張帳單。
那個區別是有實質意義的。你不能拿 SWE-2 的成本去和另一家廠商的 token 價格相比,因為它們不是同一個單位。而且你也不能把 SWE-2 帶到別處使用:專有權重、單一廠商、單一 agent 產品。某些報導中「成本最多可降低 70%」的數字,是 Cognition 在各項基準測試中所引用範圍的上限;而 FrontierCode 1.1 Main 的數字則是 64%。
效率數字真要說的話,反而是更實際的重點,而且這些同樣是廠商自行回報的數據。SWE-2 在中等強度下擊敗 SWE-1.7 的 FrontierCode 分數,同時平均少用 58% 的回合數,成本也少了 81%。每次執行的平均步驟數從 SWE-1.7 的 127 降到中等強度下的 53(高強度為 80,最高強度為 98),而第一次真正進行程式碼編輯的中位數則從第 48 步提前到第 18 步。這直接回應了 SWE-1.7 在簡單任務上過度探索的抱怨,而且這種改進會遠早於區區一分的基準測試差距,先反映在你的帳單上。

訓練技巧才是真正的新聞
撇除排行榜上的定位不談,這裡有一項真正新穎的工程設計,這正是為什麼即使你從未打開 Devin,這次發布仍值得一讀。
Cognition 在單一 RL 訓練中,訓練了全部三個推理努力等級——中等、高與最高。其機制是針對每個努力等級施加線性成本懲罰,每一項都經過調校,以匹配基礎模型自身在該點的成本效能 Pareto 曲線斜率。Cognition 主張懲罰必須為線性的理由才是有趣之處:唯有線性懲罰能讓訓練目標僅取決於平均成本與解題率,而非取決於分布形狀的東西。
常見做法是分別訓練各個投入等級,或是事後再外掛一個較便宜的檢查點。而在同一次訓練中把它們一起訓練,才讓公司得以宣稱自己推進的是整條前沿,而不是前沿上的某一個點。配套的變更包括:以長度加權的獎勵基準、將 RL 環境數量增為三倍、遵循指令的疊加層,以及一個飛輪機制,利用較早期的 SWE-2 檢查點來強化驗證器、防範獎勵駭取。在服務端方面,則是搭配量化感知訓練的 NVFP4 與 FP8 核心、一個經重新訓練而將接受長度延長 15% 的 DSpark 推測解碼草稿模型,以及一個能為每顆 GPU 的吞吐量帶來 10–20% 效益、代價是首字延遲變差的預填充延遲器。
如果你進行後訓練,這份配方就是本次發布中可轉移的部分。如果你不進行,重點更簡單:SWE-2 之所以便宜,不是因為它是更小的模型,而是因為運行它的成本被寫進了獎勵函數。
如果你想在 Devin 之外獲得 Kimi K3 的能力
SWE-2 不在 OrcaRouter 上,而且未來也不會——專有權重、沒有 API、僅由 Devin 發佈。它的基礎模型則是另一回事。Kimi K3 已在 OrcaRouter 上路由為kimi/kimi-k3,每 100 萬個輸入 token 收費 $3.00 美元,每 100 萬個輸出 token 收費 $15.00 美元,且未在供應商費率之上加價,具備 100 萬 token 的上下文視窗、原生工具呼叫、圖像輸入,以及透過頂層 reasoning_effort 參數而非取樣設定來控制推理深度。
那就是本次發布實用結論的誠實版本。SWE-2 向你展示了,在 K3 之上執行得當的一輪 RL,在其效能範圍頂端會是什麼樣子——實實在在的 4.5 到 5.8 分提升,外加大幅效率增益,但代價也十分真實。它沒有給你的,是一個你可以直接呼叫的模型。如果你想讓底層能力指向你自己的程式碼、你自己的測試框架或你自己的管線,K3 才是這套堆疊中你真正能觸及的部分,而且只要透過一個 OpenAI 相容端點就能觸及。
在這些數據尚未經過審計的情況下,它也是這場押注中較安全的那一半。SWE-2 的基準測試數據出自 Cognition 自家,公司以外沒有人重現過。Kimi K3 的數據才是這項比較真正賴以成立的依據——而如果你透過 OrcaRouter 進行路由,你就能在它背後架設一條備援鏈,如此一來,你正在試用的模型就不會在讓你失望的那一天成為生產環境的依賴。

誰應該採取行動,而什麼能讓這件事塵埃落定?
如果你已經付費使用 Devin,SWE-2 無疑是個好消息:它正在你的產品中逐步推出,每項任務的成本比它所取代的方案更低,而效率數據顯示,它在簡單工作上會浪費較少的回合。先從你待辦佇列中較簡單的一端試用它——努力等級的設計意味著 medium 才是成本優勢所在。
如果你正從外部挑選程式碼模型,請先等待獨立評估。目前還沒有:Artificial Analysis 沒有 SWE-2 的條目,而 FrontierCode 排行榜是 Cognition 自家的工具。有三件事能定論。第三方在 Terminal-Bench 4 上運行 SWE-2,這正是決定它是接近前沿的模型,還是只是速度快的模型的那一項。任何對 FrontierCode 差距的獨立重現。以及每 token 的價格,這會需要 Cognition 在 Devin 之外銷售該模型——這是唯一能讓這個 64% 與你收到的其他任何報價相提並論的改變。
在那之前,公允的總結就是基礎模型差距已經給出的那個。SWE-2 是 Kimi K3 加五分,而這個代價是 Cognition 設計進獎勵函數裡的。那是訓練上的真實成就,也是在 Devin 內部真正划算的交易。它還不是前沿模型,而它看似能擊敗一切的唯一一項基準測試,正是那項已不再計分的測試。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
