Cognition SWE-2 的標題卡,標題為「Cognition SWE-2」,副標題為「由 Cognition 開發的程式碼模型,以 Kimi K3 後訓練而成,並在 Devin 內提供服務」,下方有三張卡片寫著「由 Cognition 製作」、「基礎模型 Kimi K3 2.8T」,以及「在 Devin Desktop 與 CLI 中提供服務」。
Guides & Insights

Cognition SWE-2:誰打造它、它在什麼測試框架中運行,以及這些數字實際上說明了什麼

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Cognition SWE-2是由 Cognition 打造的程式碼模型,而 Cognition 正是 Devin 背後的公司;它是在 Devin 內部提供服務,而非透過模型 API 提供:Cognition 自家的發布文章指出,SWE-2 會先在 Devin Desktop 與 Devin CLI 推出,隨後才擴展到 Devin Web 和 Fusion。它是從Kimi K3後訓練而來,也就是 Moonshot AI 那個 2.8 兆參數的模型。這就是大多數人來到這裡時真正想問的問題的完整答案,而這一點值得在講其他任何事情之前先說清楚,因為有可觀比例、導向這個頁面的搜尋都多加了第四個詞——Devin——並把這個模型歸給 Devin,而不是 Cognition。Devin 是 Cognition 販售的代理。SWE-2 則是 Cognition 訓練來在它內部運作的模型。

本頁是參考頁面,而不是發布報導。SWE-2 已於 2026 年 9 月 10 日推出,距今已超過一週;這個日期是為了將模型定位在時間軸上,而非為了報導事件。以下內容是已記錄的事項、記錄者為誰,以及尚未有人查核的部分。

誰製作了 SWE-2,以及為什麼其歸屬會不斷漂移

這個混淆並非不合理。Cognition 並不是像實驗室銷售 API 模型那樣銷售 SWE-2。沒有附上上下文視窗的模型卡,沒有公開的 token 價格,沒有可以放進請求主體的識別碼。有一個產品——Devin——而模型是作為它的一部分到來。Cognition 自家的文案強化了這種界線消融:發布文章是從 Devin 的觀點寫的,基準測試表對任何尚未讀過該公司早先 FrontierCode 工作的人來說都沒有解釋,而供應情況那一行提到 Devin 四次、Cognition 一次——在署名欄中。

所以,簡單來說:Cognition 打造了 SWE-2。Cognition 打造了 Devin。這兩者並非同一回事,但目前你無法只擁有其中一個而沒有另一個。這也不是一次偶然的命名意外。Cognition 已推出一系列以 SWE 為前綴的軟體工程模型——SWE-1.5、SWE-1.6、SWE-1.7,以及如今的 SWE-2,期間還有一個 SWE-1.6 Preview 檢查點——同時也有像 SWE-grep 和 SWE-check 這類更專門的工具。這個前綴是該公司對軟體工程的簡稱,而它的出現比這一段提到的每一個模型都早了約一年。

名稱:模型,而非基準

這是搜尋者將 SWE-2 歸到錯誤擁有者名下的第二個原因,而這點值得獨立成段,不該只以註腳帶過。

SWE-bench 是一項基準測試。它是由 SWE-bench 團隊維護的獨立評估,架設於 swebench.com,並推出多個版本:最初取自真實 GitHub 問題的 2,294 個實例資料集,以及 Verified、Lite、Multilingual 和 Multimodal 等子集。它被用來為各種程式編寫代理評分,Devin 也不例外——Cognition 早在 2024 年 3 月就發布了一份 Devin 在 SWE-bench 上的技術報告,至今仍在其部落格上。

SWE-2 是一個模型。它不是 SWE-bench 的版本,也不是它的簡稱。並不存在 SWE-bench 2:已發表的系列包含 SWE-bench、Verified、Lite、Multilingual 和 Multimodal,而現有的版本編號屬於該基準的各個子集,並非某個編號的後繼版本。Cognition 為這些模型所採用的正式基準名為 FrontierCode,那完全是另一套工具,而且正如下一節所述,它是由 Cognition 所擁有的。

如果你來到這裡,是期待第二代 SWE-bench 評估,那這就是整個誤解所在。

發布日期與 SWE-2 的發行方式

Cognition 的公告文章署名日期為 2026 年 9 月 10 日,而該頁面本身的結構化資料將發佈時間戳記標示為 2026-09-10。兩者相符。SWE-2 於該日在 Devin Desktop 與 Devin CLI 中提供,Devin Web 與 Fusion 隨後跟進。

那就是發布途徑,而且那就是全部的發布途徑。沒有開放權重——Cognition 沒有在 Hugging Face 上為這個模型發布任何東西——也沒有任何接受 SWE-2 識別碼的廠商代管端點。如果你的代理框架是你自己的,SWE-2 並不是你今天能安裝進去的元件。如果你的代理框架是 Devin,SWE-2 已經在你眼前。

對於需要基礎模型範疇、而非 SWE-2 範疇的人來說,Kimi K3 是另一款且文件更完備的東西,它在 OrcaRouter 上的路由代號為kimi/kimi-k3——一個 API 就能取用 200 多款模型,且依供應商定價、不額外加價。這一點在此有具體的重要性:Cognition 起步所依據的底層能力可以獨立取得,儘管經後訓練的模型不行。

範圍:Cognition 記錄什麼,以及不記錄什麼

一份參考頁面應該誠實面對自身證據的樣貌,而這正是 SWE-2 最薄弱的地方。

• 推理強度 — 三個有文件記載的等級:medium、high 與 max。Cognition 寫道,這些等級在設計上就有不同行為:medium 更早付諸行動,承擔簡單與中階工作;而 high 與 max 則規劃更多、探索更多程式碼庫,並在驗證上投入更多。
• 發布通路 — 推出時支援 Devin Desktop 與 Devin CLI,Devin Web 與 Fusion 陸續推出。沒有 API、沒有權重、沒有自架路徑。
• 基礎模型 — Kimi K3,Cognition 描述為一個 2.8T 參數模型,已針對代理式程式編寫歷經大量 RL。Kimi K3 論文指出該基礎模型具備 100 萬 token 的上下文視窗與原生視覺能力。
• 上下文視窗、最大輸出、模態、後訓練參數數量 — SWE-2 並未公布。Cognition 的公告對這些全未提及,Cognition 其他頁面也沒有補上這個缺口。

最後一列的那項區分並非吹毛求疵。Kimi K3 的百萬權杖視窗是關於 Kimi K3 的事實。Cognition 並未表示 SWE-2 繼承了它,而依照不同配方進行後訓練,正是可能改變模型所能接受內容的那類變更。如果你需要一個脈絡視窗數字來做規劃,你能驗證的那個數字屬於基礎模型,而你應該把 SWE-2 的視為未知,而不是假設兩者一致。

Scoreboard headed 'Cognition SWE-2 - the scoreboard' listing Base model Kimi K3 2.8 trillion, FrontierCode 1.1 Main 50.0%, DeepSWE 1.1 73.0%, Terminal-Bench 4 27.3%, Distribution Devin only with no API, and Independent score none yet, over a footer reading 'All figures vendor-reported by Cognition; no independent scores yet.'

費率表,以 Cognition 唯一報價的貨幣計價

SWE-2 沒有每 token 價格,因為根本沒有 SWE-2 端點。Cognition 的成本說法用的是不同的計價單位:它聲稱 SWE-2 在 FrontierCode 1.1 Main 上與 Claude Fable 5.1 相差不到一分——50.0% 對 50.9%——同時還便宜 64%。仔細看清楚單位。這個 64% 是 FrontierCode 上每次 rollout 平均花費的美金,是一項任務層級數字,把模型、測試框架、輔助框架和 Cognition 的服務堆疊全部打包進同一張帳單。它不是 token 費率,也不能拿來跟 token 費率相比。

確實存在的價目表是 Devin 的。在 Devin 的定價頁面上,於 2026 年 9 月 28 日查看:Free 為 $0,Pro 為每月 $20,Max 為每月 $200,Teams 為每月 $80,外加每位完整開發者席位 $40。SWE-2 這一行位於 Pro 方案中,並附帶一個日期——「免費使用 SWE-2——在 Devin Desktop 和 CLI 中免費,至 2026 年 10 月 10 日。」那是一個促銷窗口,大約還剩兩週,而它是該頁面上唯一真正具有時效性的 SWE-2 數字:10 月 10 日之後該模型在 Devin 內部的成本並未在該處說明。

Cognition 的效率數據值得與成本主張並列引用,而且它們和本頁其他所有內容一樣,都是廠商自行報告的。在 FrontierCode 1.1 Main 上,中等投入的 SWE-2 得分高於 SWE-1.7,同時平均少用 58% 的回合數,成本也低 81%。每次執行的平均步數從 SWE-1.7 的 127 步降至中等投入的 53 步、高投入的 80 步、最高投入的 98 步,而首次真正進行程式碼編輯的中位數則從第 48 步提前到第 18 步。

基準測試,並附有測試框架

軟體工程的分數對其產出時所用的外層框架異常敏感,因此少了評測框架,數字就稱不上是數字。Cognition 在公告的方法論附錄中說明其評測框架政策:若有公開來源,結果便取自公開來源;否則便在 Cognition 的內部評估框架上執行,並使用每個模型主要開發時所搭配的評測框架——Anthropic 模型使用 Claude Code,OpenAI 模型使用 Codex,xAI 模型使用 Grok Build,開放權重模型使用 Devin CLI。針對每個模型,Cognition 會回報其在各種推理強度設定下所取得的最佳分數。

隨之而來有兩項後果,而這兩項都應該與這些數字一起被提及。首先,有幾列並非同類比較:在 Claude Code 中產生的 Fable 5.1 數據,以及在 Devin CLI 中產生的 Kimi K3 數據,是對兩個不同代理系統的測量,而不是在一個中立測試框架中的兩個模型。其次,「跨努力程度設定的最佳分數」意味著每個儲存格都是模型的最佳情況,而不是在對等設定下的結果。若將努力程度固定不變,比較結果會有所不同,而 Cognition 並未發表這樣的比較。

以下四列均由供應商提供,且未經審計。

• FrontierCode 1.1 Main — SWE-2 50.0%、Kimi K3 44.2%、Grok 4.6 48.0%、Claude Fable 5.1 50.9%、GPT-5.6 Sol 47.5%、GPT-6 Astra 53.3%、SWE-1.7 42.0%。這是領頭的那一列,而 FrontierCode 是 Cognition 自家的基準測試——任務由 Cognition 與 20 多位開源維護者共同撰寫,排行榜由他們營運,提交結果也由他們評分。這些都不代表數字有誤;但當你引用這些數字時,這一切都該寫進那句話裡。
• DeepSWE 1.1 — SWE-2 73.0%、Kimi K3 68.5%、Grok 4.6 67.5%、Claude Fable 5.1 67.4%、GPT-5.6 Sol 72.7%、GPT-6 Astra 74.1%、SWE-1.7 37.7%。在這一列,SWE-2 最能令人信服地直接擊敗前沿模型。
• Terminal-Bench 2.1 — SWE-2 92.8%、Kimi K3 88.3%、Grok 4.6 88.4%、Claude Fable 5.1 91.4%、GPT-5.6 Sol 88.8%、GPT-6 Astra 89.9%、SWE-1.7 81.5%。這是 SWE-2 最好看的數字,而目前版本的 Terminal-Bench 並不是 2.1。
• Terminal-Bench 4 — SWE-2 27.3%、Kimi K3 21.5%、Grok 4.6 20.3%、Claude Fable 5.1 55.8%、GPT-5.6 Sol 37.3%、GPT-6 Astra 57.9%、SWE-1.7 7.6%。這是最少被引用的一列,也是該模型大約落後前沿 28 分的一列。

這項比較還需要再多一個背景脈絡,因為它說明了前沿那一列不尋常的形狀從何而來。Cognition 在其圖表的註腳中指出,Fable 5.1 在 FrontierCode 1.1 Main 上的 max-effort 設定得分為 50.3%,每項任務花費 $12.83——低於其自身 medium 設定的 50.9% 和 $3.28。投入更多努力,卻換來更低的分數,成本還約為四倍。這就是前沿模型的曲線向自身回折,也是為什麼 50.0% 對上 50.9% 比單看這兩個數字所暗示的更接近的部分原因。

可信度數字

Cognition 另外設立的可信度章節,是這次發布內容中與排行榜毫無關聯的部分,其中指出 SWE-2 在其宣傳與審查提示整體上通過了 98.0%——英文 99.8%、簡體中文 95.2%、繁體中文 99.1%——並且其依情境而定的脆弱性評估發現,對任何受測模型而言,沒有任何框架條件會造成統計上顯著的變化。那些都是 Cognition 的判斷,由 GPT-5.6 Luna 評審在 145 題的題組上產生,而且就和那些基準測試一樣,屬於廠商自行回報的性質。

獨立解讀:目前還沒有

截至 2026 年 9 月 28 日,SWE-2 在 Artificial Analysis 上沒有條目。在模型索引中搜尋這個名稱不會傳回任何結果,而直接請求模型頁面則會得到 404。唯一刊載 SWE-2 的排行榜是 FrontierCode,它屬於 Cognition。這使得這次發布只剩廠商自行回報的數字,別無其他——這不是在批評這些數字,而是在陳述讀者能查證其中多少。

有兩件具體的事能讓這件事有個定論,而這兩者目前都不存在。由第三方在 Terminal-Bench 4 上對 SWE-2 進行一次跑分,就能判定這究竟是一個剛好便宜的準前沿模型,還是一個剛好在一份已退役版本中居冠的快速模型。而任何對 FrontierCode 差距的獨立重現,都會告訴你:它對上 Fable 5.1 的那一分差距,究竟是模型本身的性質,還是量測工具本身的性質。

有別於 Cognition 自家的模型,Artificial Analysis 確實收錄了 Kimi K3——而 Kimi K3 的數據屬於第三方來源,這使得基礎模型成為這套堆疊中證據較充足的那一半。這種不對稱正是今日 SWE-2 的實際樣貌:後訓練是最有意思的部分,也是最難以驗證的部分;基礎模型則是有文件記載的部分,也是你真正能引用的那一半。

Screenshot of the 'Coding benchmark results' section of Cognition's SWE-2 announcement post, showing the four-row seven-column vendor benchmark table — FrontierCode 1.1 Main, DeepSWE 1.1, Terminal-Bench 2.1 and Terminal-Bench 4, each row carrying SWE-2, Kimi K3, Grok 4.6, Fable 5.1, GPT-5.6 Sol, GPT-6 Astra and SWE-1.7 — above the paragraph stating that SWE-2 is post-trained from Kimi K3, a 2.8-trillion-parameter model, and a link line reading 'See how models rank on the FrontierCode leaderboard'.

使用 SWE-2,以及在它未經審計時該做什麼

如果你已經付費使用 Devin,這個決定就很簡單,不取決於上述任何但書。SWE-2 已經在你的產品裡,Cognition 表示它每項任務的成本低於它所取代的模型,而這些效率數據——回合數減少 58%、平均成本降低 81%、首次編輯的中位數落在第 18 步而非第 48 步——所描述的是能在日常工作上交換掉你更少時間的模型。從你佇列中較簡單的那一端開始,以中等投入程度使用它,因為這正是 Cognition 自家的投入程度設計中,成本優勢所在之處。

如果你正從 Devin 以外挑選程式設計模型,誠實的立場是:SWE-2 不是你能評估的候選項,因為沒有東西可以呼叫。它沒有識別碼、沒有每 token 的價格,也沒有端點。你能評估的是基礎模型。

Screenshot of the OrcaRouter model page for Kimi K3, showing the model ID kimi/kimi-k3, the modality rows for text plus image input and text output, the Vision, Tools, JSON and Reasoning capability chips, an OpenAI-compatible code sample pointed at api.orcarouter.ai, and a live stat strip reading $3.00 input and $15.00 output per 1M tokens.

Kimi K3 已在 OrcaRouter 上提供路由,價格為每 1M 輸入 token $3.00、每 1M 輸出 token $15.00,未對供應商費率加價,具備 1M token 上下文視窗、原生工具呼叫、影像輸入,以及頂層推理強度控制。這是本次發布中可觸及的那一半:Cognition 據以進行後訓練的能力,可透過單一 OpenAI 相容端點取得,而非某家供應商的代理產品。而且由於這無論如何都是未經審核的領域,你可以在它背後設置一條備援鏈,這樣一來,你正在試用的模型就不會在你對它失望的那一天成為正式環境的依賴。

若你把 SWE-2 當作證據、而非產品頁來讀,它告訴你的東西比標題更狹隘,卻也更有用:在 Kimi K3 之上執行一次做得好的強化學習訓練,讓四項基準測試的水準提升約五個百分點,而沒有改變整體形態,並且只花了少 58% 的回合數就做到。這在 Devin 內部是真實的成果。但它還不是 Cognition 以外任何人重現過的結果,而 SWE-2 看似能擊敗一切的那一項基準,正是這個領域已經停止評分的那一項。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新