『Cognition SWE-2』と題されたCognition SWE-2のタイトルカード。サブタイトルは「Cognitionによるコーディングモデル。Kimi K3をポストトレーニングし、Devin内で提供」。その下に3枚のカードがあり、「Cognitionによる開発」「ベースモデル Kimi K3 2.8T」「Devin DesktopとCLIで提供」と記されている。
Guides & Insights

Cognition SWE-2:誰が開発し、どのハーネスで動作し、数字は実際に何を示しているのか

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Cognition SWE-2Devinを手がける企業Cognitionが開発したコーディングモデルで、モデルAPI経由ではなくDevinの内部で提供されています。Cognition自身のローンチ投稿によれば、SWE-2はまずDevin DesktopとDevin CLIで利用可能になり、その後Devin WebとFusionへ順次展開されます。そのポストトレーニングの基盤となったのはKimi K3、すなわちMoonshot AIの2.8兆パラメータモデルです。これが、多くの人がここにたどり着いたときに実際に抱いている疑問への完全な答えであり、何よりも先に述べておく価値があります。というのも、このページにたどり着く検索のかなりの割合で4つ目の単語——Devin——が付け加えられ、モデルがCognitionではなくDevinのものとされているからです。

このページは発表記事ではなく、リファレンスページである。SWE-2 は 2026年9月10日にリリースされており、それはすでに一週間以上前のことだ。ここに日付を記すのは、出来事を報せるためではなく、モデルを時間軸上に固定するためである。以下では、何が文書化されているのか、誰がそれを文書化したのか、そしてまだ誰も確認していないことは何かを述べる。

SWE-2は誰が作っているのか、そしてなぜ帰属先が定まらないのか

その混乱は無理もない。Cognitionは、研究所がAPIモデルを売るようにはSWE-2を売っていない。コンテキストウィンドウを記したモデルカードも、公開されたトークン価格も、リクエストボディに渡せる識別子もない。あるのは製品——Devin——であり、モデルはその一部としてやってくる。Cognition自身の文章も、この混同を強めている。ローンチ投稿はDevinの視点で書かれ、ベンチマーク表は、同社の以前のFrontierCodeの取り組みをすでに読んでいない人には説明されず、提供開始の一文ではDevinが4回、Cognitionが1回——しかも署名欄で——名前を挙げられている。

つまり、はっきり言えばこうだ。Cognitionが作っているのはSWE-2だ。Cognitionが作っているのはDevinだ。この二つは同じものではないが、現時点では片方なくして片方は成立しない。これは一度きりの命名事故でもない。CognitionはSWEという接頭辞のもとで一連のソフトウェアエンジニアリングモデルを出荷してきた——SWE-1.5、SWE-1.6、SWE-1.7、そして今回のSWE-2で、その途中にはSWE-1.6 Previewチェックポイントもあった——さらにSWE-grepやSWE-checkといったより狭い用途のツールも手がけている。この接頭辞は同社におけるソフトウェアエンジニアリングの略称であり、この段落にあるどのモデルよりもおよそ1年早くから使われている。

名前:ベンチマークではなく、モデル

これが、検索者がSWE-2を誤った所有者に結び付けてしまう第2の理由であり、脚注ではなく独立した段落を割り当てるに値する。

SWE-benchはベンチマークです。 これはSWE-benchチームによって維持されている独立した評価で、swebench.comで公開されており、いくつかのエディションで提供されています。実際のGitHubのissueから抽出された元の2,294インスタンスのセットに加え、Verified、Lite、Multilingual、Multimodalの各サブセットがあります。これはコーディングエージェント全般のスコアリングに用いられており、Devinもその対象です。Cognitionは2024年3月にDevin-on-SWE-benchの技術レポートを公開しており、それは今も同社のブログに掲載されています。

SWE-2 はモデルです。 それは SWE-bench のエディションではなく、その略称でもありません。SWE-bench 2 は存在しません。公開されているファミリーは SWE-bench、Verified、Lite、Multilingual、Multimodal を揃えており、存在するバージョン番号はベンチマークのサブセットに属するもので、番号付きの後継版を指すものではありません。これらのモデルに関する Cognition の基準ベンチマークは FrontierCode と呼ばれ、これはまったく別の計測ツールであり、次のセクションで説明するように、Cognition が所有するものです。

もしあなたがここにSWE-bench評価の第2世代を期待して来たのなら、それこそが誤解のすべてです。

リリース日とSWE-2の配布方法

Cognitionの発表記事には2026年9月10日という署名日が付いており、ページ自体の構造化データも公開タイムスタンプを2026-09-10と示している。両者は一致している。SWE-2は同日にDevin DesktopとDevin CLIで利用可能となり、Devin WebとFusionがそれに続いた。

それは配布サーフェスであり、それが配布サーフェスのすべてです。オープンウェイトはありません — このモデルについてCognitionからHugging Faceにあるものは何もありません — そして、SWE-2識別子を受け付けるベンダーがホストするエンドポイントもありません。あなたのハーネスが独自のものであるなら、SWE-2は今日それをインストールできるコンポーネントではありません。あなたのハーネスがDevinであるなら、SWE-2はすでにあなたの目の前にあります。

SWE-2のものではなくベースモデルの性能範囲を必要とする人にとって、Kimi K3は別個の、よりドキュメントが整備されたものであり、OrcaRouter上でkimi/kimi-k3としてルーティングされています — 200以上のモデルに対応する1つのAPIを、プロバイダーの定価でマークアップなしで提供します。これがここで重要なのは、特定の理由があるからです:Cognitionが出発点とした基盤となる能力は、ポストトレーニング済みモデルはそうではないとしても、独立して利用可能です。

エンベロープ:Cognitionが文書化するもの、そしてそうでないもの

リファレンスページは、自らが示す根拠の形について正直であるべきであり、まさにそこが、SWE-2のそれが最も薄いところだ。

• Reasoning effort — 文書化された3つのレベル:medium、high、max。Cognitionによれば、これらのレベルは設計上それぞれ異なる挙動をとる。mediumはより早く行動に移り、単純な作業と中程度の作業を担う。一方、highとmaxはより多くを計画し、コードベースをより広く探索し、検証により多くの時間を費やす。
• 提供形態 — ローンチ時点ではDevin DesktopとDevin CLI、Devin WebとFusionは順次展開中。APIなし、重みなし、セルフホストの手段もなし。
• ベースモデル — Kimi K3。Cognitionはこれを、エージェント型コーディング向けの広範なRLをすでに経た2.8Tパラメータのモデルだと説明している。Kimi K3の論文によれば、そのベースには1Mトークンのコンテキストウィンドウとネイティブなビジョン機能がある。
• コンテキストウィンドウ、最大出力、モダリティ、事後学習済みパラメータ数 — SWE-2については公開されていない。Cognitionの発表はいずれについても何も述べておらず、Cognitionの他のページにもこの空白を埋める情報はない。

その最後の行の区別は揚げ足取りではない。Kimi K3の100万トークンウィンドウはKimi K3に関する事実である。CognitionはSWE-2がそれを継承すると述べておらず、異なるレシピでの事後学習は、モデルが受け入れるものを変えうるまさにその種の変更だ。計画のためにコンテキストウィンドウの数値が必要なら、検証できる数値はベースモデルのものであり、両者が一致すると仮定するのではなく、SWE-2のものは不明として扱うべきだ。

Scoreboard headed 'Cognition SWE-2 - the scoreboard' listing Base model Kimi K3 2.8 trillion, FrontierCode 1.1 Main 50.0%, DeepSWE 1.1 73.0%, Terminal-Bench 4 27.3%, Distribution Devin only with no API, and Independent score none yet, over a footer reading 'All figures vendor-reported by Cognition; no independent scores yet.'

料金表、Cognitionが提示する唯一の通貨にて

SWE-2にはトークン単価が存在しない。SWE-2のエンドポイントが存在しないからだ。Cognitionのコスト主張は別の単位で示されている。SWE-2はFrontierCode 1.1 MainでClaude Fable 5.1と1ポイント以内に収まる——50.0%対50.9%——しかも64%安い、というものだ。その単位を注意深く読んでほしい。この64%は、FrontierCodeにおける1ロールアウトあたりの平均米ドル支出であり、モデル、ハーネス、スキャフォールディング、そしてCognitionのサービングスタックを1つの請求書にまとめたタスクレベルの数値だ。これはトークン単価ではなく、トークン単価と比較することはできない。

実在する料金表はDevinのものである。Devinの料金ページで、2026年9月28日時点で確認したところ、無料は0ドル、Proは月額20ドル、Maxは月額200ドル、Teamsは月額80ドルに加えてフルタイム開発者1席につき40ドルだった。SWE-2の行はProにあり、日付が付いている——「SWE-2の無償利用——Devin DesktopおよびCLIでは2026年10月10日まで無料」。これは残り約2週間のプロモーション期間であり、そのページにあるSWE-2の数字の中で本当に時間に敏感な唯一のものだ。10月10日以降のDevin内でのモデルの費用はそこには記載されていない。

Cognitionの効率に関する数値は、コストの主張の隣に引用する価値があり、このページの他のすべてと同様、ベンダーによる報告です。FrontierCode 1.1 Mainでは、mediumエフォートのSWE-2がSWE-1.7を上回るスコアを出しつつ、ターン数は58%少なく、平均コストは81%低くなっています。1回の実行あたりの平均ステップ数は、SWE-1.7の127から、mediumで53、highで80、maxで98に減少し、最初の実際のコード編集の中央値はステップ48からステップ18に移ります。

ハーネスが添付されたベンチマーク

ソフトウェアエンジニアリングのスコアは、それが生成されたスキャフォールドに異常に敏感であるため、ハーネスを伴わない数値は数値ではない。Cognitionは発表の方法論付録でハーネスポリシーを述べている。結果は、公開ソースが存在する場合はそこから報告され、そうでない場合は、各モデルが主に開発されたハーネスを用いてCognitionの内部評価フレームワークで実行される — AnthropicモデルにはClaude Code、OpenAIモデルにはCodex、xAIモデルにはGrok Build、オープンウェイトモデルにはDevin CLI。Cognitionはすべてのモデルについて、推論エフォート設定全体で最高スコアを報告する。

二つの帰結が続くが、どちらも数字と同じ文脈で語られるべきものだ。第一に、いくつかの行は同条件比較ではない。Claude Code で出された Fable 5.1 の数値と、Devin CLI で出された Kimi K3 の数値は、中立なハーネスにおける2つのモデルの測定ではなく、2つの異なるエージェントシステムの測定である。第二に、「エフォート設定全体での最高スコア」とは、各セルがモデルの最良ケースを意味し、条件を揃えた設定ではない。エフォートを一定に保った比較は違って見えるはずだが、Cognition はそれを公表していない。

以下の4行はすべてベンダー報告によるもので、未監査です。

• FrontierCode 1.1 Main — SWE-2 50.0%、Kimi K3 44.2%、Grok 4.6 48.0%、Claude Fable 5.1 50.9%、GPT-5.6 Sol 47.5%、GPT-6 Astra 53.3%、SWE-1.7 42.0%。これが見出しとなる行であり、FrontierCode は Cognition 自社のベンチマークだ — Cognition が20人以上のオープンソースメンテナーとともにタスクを作成し、リーダーボードを運営し、提出物を採点している。だからといって数値が誤りになるわけではないが、これらの点はすべて、その数値を引用する文の中に盛り込むべきものだ。
• DeepSWE 1.1 — SWE-2 73.0%、Kimi K3 68.5%、Grok 4.6 67.5%、Claude Fable 5.1 67.4%、GPT-5.6 Sol 72.7%、GPT-6 Astra 74.1%、SWE-1.7 37.7%。SWE-2 がフロンティアモデルを文字どおり上回っていると最も説得力をもって示せる行だ。
• Terminal-Bench 2.1 — SWE-2 92.8%、Kimi K3 88.3%、Grok 4.6 88.4%、Claude Fable 5.1 91.4%、GPT-5.6 Sol 88.8%、GPT-6 Astra 89.9%、SWE-1.7 81.5%。SWE-2 の最も見栄えのする数値だが、現行版の Terminal-Bench は 2.1 ではない。
• Terminal-Bench 4 — SWE-2 27.3%、Kimi K3 21.5%、Grok 4.6 20.3%、Claude Fable 5.1 55.8%、GPT-5.6 Sol 37.3%、GPT-6 Astra 57.9%、SWE-1.7 7.6%。最も引用されることの少ない行であり、このモデルがフロンティアからおよそ28ポイント後れを取っている行でもある。

この比較にはもう一つ文脈が必要だ。というのも、それはフロンティア行の異例な形がどこから来るのかを説明するものだからだ。Cognitionが自社のチャートに付した脚注には、FrontierCode 1.1 MainにおけるFable 5.1のmax-effort設定が、1タスクあたり$12.83で50.3%を記録する一方、medium設定では50.9%・$3.28にとどまると記されている。より多くの労力が、約4倍のコストでより低いスコアを買ったのだ。これがフロンティアモデルの曲線が自ら折り返している姿であり、50.0%対50.9%が、二つの数字だけから受ける印象よりも僅差である理由の一端でもある。

信頼性の数値

Cognitionの独立した信頼性セクションは、リリースのうちリーダーボードとは何の関係もない部分であり、そこではSWE-2がプロパガンダおよび検閲に関するプロンプトの98.0%を全体で通過したこと——英語では99.8%、簡体字中国語では95.2%、繁体字中国語では99.1%——、そしてその文脈依存の脆弱性評価では、テストされたどのモデルについても統計的に有意な変化を生じさせるフレーミング条件は見つからなかったことが報告されている。これらはCognitionの判断であり、145問の質問セットに対してGPT-5.6 Lunaのジャッジを用いて生成されたもので、ベンチマークと同じ意味でベンダー報告である。

独立した見解:まだ存在しない

2026年9月28日時点で、SWE-2はArtificial Analysisに項目がありません。モデルインデックスでその名前を検索しても何も返らず、モデルページに直接リクエストすると404になります。SWE-2を掲載している唯一のスコアボードは、Cognitionに属するFrontierCodeです。その結果、このリリースにはベンダーが報告した数値しか残りません。これは数値への批判ではなく、読者がそれらの数値をどれだけ検証できるかについての記述です。

決着をつけるには具体的なものが2つ必要だが、そのどちらも今日は存在しない。Terminal-Bench 4 で SWE-2 を第三者が実行すれば、これがたまたま安価なフロンティア隣接モデルなのか、たまたま退役したエディションの首位に立つ高速モデルなのかが決まるだろう。そして FrontierCode の差を独立に再現できれば、Fable 5.1 に対する1ポイント差がモデルの性質なのか、計測器の性質なのかがわかる。

Cognition自身のモデルとは異なり、Artificial AnalysisはKimi K3を実際に掲載している——そしてKimi K3の数値は第三者によるもので、そのためこのスタックのうちベースモデルの方がより証拠に裏付けられた半分になる。この非対称性こそが、今日のSWE-2の実際の姿だ。ポストトレインは面白い部分であり、最も検証が難しい部分である。ベースは文書化されている部分であり、実際に呼び出せる方でもある。

Screenshot of the 'Coding benchmark results' section of Cognition's SWE-2 announcement post, showing the four-row seven-column vendor benchmark table — FrontierCode 1.1 Main, DeepSWE 1.1, Terminal-Bench 2.1 and Terminal-Bench 4, each row carrying SWE-2, Kimi K3, Grok 4.6, Fable 5.1, GPT-5.6 Sol, GPT-6 Astra and SWE-1.7 — above the paragraph stating that SWE-2 is post-trained from Kimi K3, a 2.8-trillion-parameter model, and a link line reading 'See how models rank on the FrontierCode leaderboard'.

SWE-2の使用と、それが未監査である間に行うべきこと

すでにDevinの料金を支払っているなら、判断は簡単で、上記のどの注意点にも左右されません。SWE-2はあなたの製品に搭載されており、Cognition曰く、置き換えるモデルよりもタスクあたりのコストが低く、その効率の数字 — ターン数58%減、平均コスト81%減、最初の編集の中央値がステップ48ではなくステップ18 — は、日常的な作業であなたの時間をより無駄にしないモデルを物語っています。キューの簡単な方から中程度のエフォートで始めてください。Cognition自身のエフォートレベルの設計がコスト上の利点を置いているのは、まさにそこです。

Devinの外部からコーディングモデルを選ぶのであれば、正直な立場としては、SWE-2は評価できる候補ではありません。呼び出すものが何もないからです。識別子も、トークンあたりの価格も、エンドポイントもありません。評価できるのはベースモデルです。

Screenshot of the OrcaRouter model page for Kimi K3, showing the model ID kimi/kimi-k3, the modality rows for text plus image input and text output, the Vision, Tools, JSON and Reasoning capability chips, an OpenAI-compatible code sample pointed at api.orcarouter.ai, and a live stat strip reading $3.00 input and $15.00 output per 1M tokens.

Kimi K3はOrcaRouter上でルーティングされており、価格は100万入力トークンあたり$3.00、100万出力トークンあたり$15.00で、プロバイダー料金に対する上乗せはなく、100万トークンのコンテキストウィンドウ、ネイティブのツール呼び出し、画像入力、そして最上位レベルのreasoning effort制御を備えています。これが今回のリリースの「手の届く半分」です。Cognitionがポストトレーニングを施す土台としたその能力が、特定ベンダーのエージェント製品ではなく、1つのOpenAI互換エンドポイントを通じて利用できるのです。そして、どちらに転んでも監査されていない領域である以上、その背後にフォールバックチェーンを置くことができます。そうすれば、試用中のモデルが期待を裏切ったその日に、本番環境の依存先になってしまうことはありません。

SWE-2が、製品ページとしてではなく証拠として読んだときにあなたに語ることは、見出しよりも狭く、より有用だ。Kimi K3の上にうまく実行されたRLパスを重ねると、4つのベンチマークで形を変えることなく水準がおよそ5ポイント動き、それを行うのに必要なターン数は58%少なかった。これはDevin内部における実際の結果だ。まだCognitionの外部の誰も再現した結果ではなく、SWE-2がすべてを打ち負かしているように見える唯一のベンチマークは、この分野が採点するのをやめたベンチマークなのだ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新