Titelkarte für Cognition SWE-2 mit der Überschrift „Cognition SWE-2“, mit dem Untertitel „Ein Codierungsmodell von Cognition, nachtrainiert aus Kimi K3, bereitgestellt innerhalb von Devin“, mit drei Karten darunter: „Hergestellt von Cognition“, „Basismodell Kimi K3 2.8T“ und „Bereitgestellt in Devin Desktop und CLI“.
Guides & Insights

Cognition SWE-2: Wer es herstellt, in welchem Harness es läuft und was die Zahlen tatsächlich sagen

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Cognition SWE-2 ist ein Coding-Modell von Cognition, dem Unternehmen hinter Devin, und es wird innerhalb von Devin bereitgestellt statt über eine Modell-API: Der eigene Launch-Post von Cognition besagt, dass SWE-2 zuerst in Devin Desktop und Devin CLI verfügbar ist, mit anschließender Ausrollung auf Devin Web und Fusion. Es ist nachtrainiert auf Kimi K3, dem Modell von Moonshot AI mit 2,8 Billionen Parametern. Das ist die ganze Antwort auf die Frage, die die meisten Leute eigentlich stellen, wenn sie hier landen, und es lohnt sich, sie vor allem anderen zu nennen, denn ein messbarer Anteil der Suchanfragen, die zu dieser Seite führen, fügt ein viertes Wort hinzu — Devin — und schreibt das Modell Devin statt Cognition zu. Devin ist der Agent, den Cognition verkauft. SWE-2 ist das Modell, das Cognition trainiert hat, um darin zu laufen.

Diese Seite ist eine Referenzseite und keine Launch-Story. SWE-2 wurde am 10. September 2026 ausgeliefert; das liegt mehr als eine Woche zurück. Das Datum steht hier, um das Modell zeitlich zu verankern, nicht um ein Ereignis zu melden. Im Folgenden geht es darum, was dokumentiert ist, wer es dokumentiert hat und was noch niemand überprüft hat.

Wer stellt SWE-2 her, und warum driftet die Zuschreibung immer wieder ab?

Die Verwirrung ist nicht unbegründet. Cognition verkauft SWE-2 nicht so, wie ein Labor ein API-Modell verkauft. Es gibt keine Modellkarte mit einem Kontextfenster, keinen veröffentlichten Token-Preis, keine Kennung, die man in einem Request-Body übergeben kann. Es gibt ein Produkt — Devin — und das Modell kommt als Teil davon. Cognitions eigene Prosa verstärkt die Vermischung: Der Launch-Post ist aus Devins Perspektive geschrieben, die Benchmark-Tabelle bleibt für jeden unerklärt, der nicht bereits die frühere FrontierCode-Arbeit des Unternehmens gelesen hat, und die Verfügbarkeitszeile nennt Devin viermal und Cognition einmal — in der Autorenzeile.

Also, ganz offen gesagt: Cognition macht SWE-2.Cognition macht Devin. Die beiden sind nicht dasselbe, aber derzeit kann man das eine nicht ohne das andere haben. Das ist auch kein einmaliger Namenszufall. Cognition hat eine Reihe von Software-Engineering-Modellen unter dem SWE-Präfix veröffentlicht – SWE-1.5, SWE-1.6, SWE-1.7 und nun SWE-2, auf dem Weg dorthin mit einem SWE-1.6-Preview-Checkpoint –, daneben speziellere Tools wie SWE-grep und SWE-check. Das Präfix ist die Kurzbezeichnung des Unternehmens für Software Engineering und ist etwa ein Jahr älter als jedes Modell in diesem Absatz.

Der Name: ein Modell, kein Benchmark

Dies ist der zweite Grund, warum Suchende SWE-2 dem falschen Eigentümer zuordnen, und er verdient einen eigenen Absatz statt einer Fußnote.

SWE-bench ist ein Benchmark. Es ist eine unabhängige Evaluation, die vom SWE-bench-Team gepflegt und unter swebench.com gehostet wird und in mehreren Editionen erscheint: dem ursprünglichen Set mit 2.294 Instanzen, das aus echten GitHub-Issues stammt, sowie den Teilmengen Verified, Lite, Multilingual und Multimodal. Es wird verwendet, um Coding-Agenten allgemein zu bewerten, Devin eingeschlossen — Cognition veröffentlichte im März 2024 einen technischen Bericht über Devin auf SWE-bench, der noch immer auf seinem Blog steht.

SWE-2 ist ein Modell. Es ist keine Edition von SWE-bench und auch keine Kurzform dafür. Es gibt kein SWE-bench 2: Die veröffentlichte Familie umfasst SWE-bench, Verified, Lite, Multilingual und Multimodal, und die existierende Versionsnummerierung gehört zu den Teilmengen des Benchmarks, nicht zu einem nummerierten Nachfolger. Der maßgebliche Benchmark von Cognition für diese Modelle heißt FrontierCode, ein gänzlich anderes Instrument, das – wie der nächste Abschnitt erklärt – Cognition gehört.

Wenn Sie hierher gekommen sind in der Erwartung, eine zweite Generation der SWE-bench-Evaluierung vorzufinden, dann besteht genau darin das ganze Missverständnis.

Veröffentlichungsdatum und wie SWE-2 vertrieben wird

Der Ankündigungsbeitrag von Cognition trägt als Verfasserzeile den 10. September 2026, und die strukturierten Daten der Seite selbst geben den Veröffentlichungszeitstempel mit 2026-09-10 an. Beide Angaben stimmen überein. SWE-2 war an diesem Datum in Devin Desktop und Devin CLI verfügbar, Devin Web und Fusion folgten.

Das ist die Distributionsfläche, und sie ist die gesamte Distributionsfläche. Es gibt keine offenen Gewichte – nichts auf Hugging Face von Cognition für dieses Modell – und keinen vom Anbieter gehosteten Endpunkt, der eine SWE-2-Kennung akzeptiert. Wenn Sie Ihren eigenen Harness verwenden, ist SWE-2 heute keine Komponente, die Sie dort installieren können. Wenn Ihr Harness Devin ist, liegt SWE-2 bereits vor Ihnen.

Für alle, die das Leistungsspektrum des Basismodells statt das von SWE-2 brauchen, ist Kimi K3 eine separate und besser dokumentierte Sache, und es läuft auf OrcaRouter unter kimi/kimi-k3 — eine API für 200+ Modelle zum Listenpreis des Anbieters ohne Aufschlag. Das ist hier aus einem bestimmten Grund wichtig: Die zugrunde liegende Fähigkeit, von der Cognition ausging, ist unabhängig erreichbar, obwohl das nachtrainierte Modell nicht erreichbar ist.

Der Rahmen: was Cognition dokumentiert und was nicht

Eine Referenzseite sollte ehrlich in Bezug auf die Beschaffenheit ihrer eigenen Belege sein, und genau hier ist die von SWE-2 am dünnsten.

• Reasoning-Aufwand — drei dokumentierte Stufen: medium, high und max. Cognition schreibt, dass sich die Stufen bewusst unterschiedlich verhalten: medium geht früher in die Umsetzung und übernimmt einfache und mittlere Arbeiten, während high und max mehr planen, mehr der Codebasis erkunden und mehr für die Verifikation aufwenden.
• Verfügbarkeit — Devin Desktop und Devin CLI zum Start, Devin Web und Fusion werden schrittweise ausgerollt. Keine API, keine Gewichte, kein Self-Hosting-Pfad.
• Basismodell — Kimi K3, von Cognition als ein Modell mit 2,8T Parametern beschrieben, das bereits umfangreiches RL für agentisches Coding durchlaufen hatte. Das Kimi-K3-Paper gibt dieser Basis ein Kontextfenster von 1M Tokens und native Vision.
• Kontextfenster, maximale Ausgabe, Modalitäten, Anzahl der nachtrainierten Parameter — für SWE-2 nicht veröffentlicht. Cognitions Ankündigung sagt nichts darüber, und keine andere Cognition-Seite füllt die Lücke.

Der Unterschied in dieser letzten Zeile ist keine Pedanterie. Das Million-Token-Fenster von Kimi K3 ist eine Tatsache über Kimi K3. Cognition sagt nicht, dass SWE-2 es erbt, und Post-Training mit einer anderen Rezeptur ist genau die Art von Änderung, die verändern kann, was ein Modell akzeptiert. Wenn Sie für die Planung eine Kontextfenster-Zahl benötigen, gehört die Zahl, die Sie verifizieren können, zum Basismodell, und Sie sollten die von SWE-2 als unbekannt behandeln, statt anzunehmen, dass die beiden übereinstimmen.

Scoreboard headed 'Cognition SWE-2 - the scoreboard' listing Base model Kimi K3 2.8 trillion, FrontierCode 1.1 Main 50.0%, DeepSWE 1.1 73.0%, Terminal-Bench 4 27.3%, Distribution Devin only with no API, and Independent score none yet, over a footer reading 'All figures vendor-reported by Cognition; no independent scores yet.'

Die Preisliste – in der einzigen Währung, in der Cognition Angebote macht

Es gibt keinen Preis pro Token für SWE-2, denn es gibt keinen SWE-2-Endpunkt. Cognitions Kostenangabe ist in einer anderen Einheit ausgedrückt: Sie besagt, dass SWE-2 auf FrontierCode 1.1 Main innerhalb eines Punktes von Claude Fable 5.1 liegt – 50,0 % gegenüber 50,9 % – und dabei 64 % günstiger ist. Achten Sie genau auf die Einheit. Die 64 % sind durchschnittliche US-Dollar, die pro Rollout auf FrontierCode ausgegeben werden, eine Kennzahl auf Aufgabenebene, die das Modell, das Harness, das Scaffolding und den Serving-Stack von Cognition in einer Rechnung bündelt. Es ist kein Token-Preis, und es kann nicht mit einem solchen verglichen werden.

Die Preisliste, die tatsächlich existiert, ist die von Devin. Auf Devins Preisseite, gelesen am 28. September 2026: Free für 0 $, Pro für 20 $ pro Monat, Max für 200 $ pro Monat, Teams für 80 $ pro Monat plus 40 $ pro vollständigem Entwicklerplatz. Die SWE-2-Zeile steht unter Pro und trägt ein Datum – „Kostenlose Nutzung von SWE-2 – Kostenlos in Devin Desktop und CLI bis zum 10. Oktober 2026.“ Das ist ein Aktionszeitraum, der noch etwa zwei Wochen läuft, und es ist die einzige SWE-2-Angabe auf dieser Seite, die wirklich zeitkritisch ist: Die Kosten des Modells innerhalb von Devin nach dem 10. Oktober werden dort nicht genannt.

Die Effizienzwerte von Cognition sind es wert, neben der Kostenbehauptung zitiert zu werden, und sie sind – wie alles andere auf dieser Seite – vom Anbieter angegeben. Auf FrontierCode 1.1 Main erzielt SWE-2 bei mittlerem Aufwand eine höhere Punktzahl als SWE-1.7, benötigt dabei 58 % weniger Turns und kostet im Durchschnitt 81 % weniger. Die durchschnittlichen Schritte pro Lauf sinken von 127 bei SWE-1.7 auf 53 bei mittlerem, 80 bei hohem und 98 bei maximalem Aufwand, und der Median der ersten echten Codeänderung verschiebt sich von Schritt 48 auf Schritt 18.

Die Benchmarks, mit dem angebrachten Harness

Software-Engineering-Scores sind ungewöhnlich empfindlich gegenüber dem Scaffold, in dem sie erzeugt wurden, sodass eine Zahl ohne ihr Harness keine Zahl ist. Cognition legt seine Harness-Richtlinie im Methodik-Anhang der Ankündigung dar: Ergebnisse werden aus öffentlichen Quellen berichtet, sofern eine solche existiert, und andernfalls auf dem internen Evaluierungsframework von Cognition ausgeführt – unter Verwendung des Harness, für das jedes Modell primär entwickelt wurde: Claude Code für Anthropic-Modelle, Codex für OpenAI-Modelle, Grok Build für xAI-Modelle und Devin CLI für Open-Weight-Modelle. Für jedes Modell berichtet Cognition den besten Score über die Reasoning-Effort-Einstellungen hinweg.

Daraus folgen zwei Konsequenzen, und beide gehören im selben Atemzug wie die Zahlen genannt. Erstens sind mehrere Zeilen nicht direkt vergleichbar: Ein in Claude Code erzeugter Wert für Fable 5.1 und ein in Devin CLI erzeugter Wert für Kimi K3 sind Messungen zweier unterschiedlicher Agentensysteme, nicht zweier Modelle in einem neutralen Harness. Zweitens bedeutet „beste Punktzahl über alle Effort-Einstellungen hinweg“, dass jede Zelle den besten Fall eines Modells darstellt, nicht eine übereinstimmende Einstellung. Ein Vergleich, der den Effort konstant hält, würde anders aussehen, und Cognition hat keinen veröffentlicht.

Alle vier unten stehenden Zeilen sind anbieterseitig gemeldet und ungeprüft.

• FrontierCode 1.1 Main — SWE-2 50,0 %, Kimi K3 44,2 %, Grok 4.6 48,0 %, Claude Fable 5.1 50,9 %, GPT-5.6 Sol 47,5 %, GPT-6 Astra 53,3 %, SWE-1.7 42,0 %. Dies ist die Schlagzeilen-Zeile, und FrontierCode ist Cgnitions eigener Benchmark – Cognition schreibt die Aufgaben mit über 20 Open-Source-Maintainern, betreibt das Leaderboard und bewertet die Einreichungen. Nichts davon macht die Zahlen falsch; all das gehört in den Satz, in dem man sie wiederholt.
• DeepSWE 1.1 — SWE-2 73,0 %, Kimi K3 68,5 %, Grok 4.6 67,5 %, Claude Fable 5.1 67,4 %, GPT-5.6 Sol 72,7 %, GPT-6 Astra 74,1 %, SWE-1.7 37,7 %. Die Zeile, in der SWE-2 am glaubwürdigsten ein Frontier-Modell direkt schlägt.
• Terminal-Bench 2.1 — SWE-2 92,8 %, Kimi K3 88,3 %, Grok 4.6 88,4 %, Claude Fable 5.1 91,4 %, GPT-5.6 Sol 88,8 %, GPT-6 Astra 89,9 %, SWE-1.7 81,5 %. Der am besten aussehende Wert von SWE-2, und die aktuelle Ausgabe von Terminal-Bench ist nicht 2.1.
• Terminal-Bench 4 — SWE-2 27,3 %, Kimi K3 21,5 %, Grok 4.6 20,3 %, Claude Fable 5.1 55,8 %, GPT-5.6 Sol 37,3 %, GPT-6 Astra 57,9 %, SWE-1.7 7,6 %. Die am seltensten zitierte Zeile und die, in der das Modell rund 28 Punkte hinter der Frontier liegt.

Der Vergleich braucht noch ein weiteres Stück Kontext, denn es erklärt, woher die ungewöhnliche Form der Fable-Zeile stammt. Cognitions eigene Fußnote zu seinen Diagrammen vermerkt, dass die Max-Effort-Einstellung von Fable 5.1 auf FrontierCode 1.1 Main 50,3 % bei 12,83 $ pro Aufgabe erzielt – unterhalb seiner eigenen Medium-Einstellung mit 50,9 % und 3,28 $. Mehr Aufwand erkaufte eine niedrigere Punktzahl bei etwa vierfachen Kosten. Das ist die Kurve des Frontier-Modells, die auf sich selbst zurückbiegt, und es ist mit ein Grund dafür, dass 50,0 % gegenüber 50,9 % näher beieinanderliegen, als die beiden Zahlen allein vermuten lassen.

Die Vertrauenswürdigkeitszahlen

Der separate Abschnitt zur Vertrauenswürdigkeit von Cognition ist der Teil der Veröffentlichung, der nichts mit Ranglisten zu tun hat, und darin wird berichtet, dass SWE-2 insgesamt 98,0 % seiner Propaganda- und Zensur-Prompts bestanden hat – 99,8 % auf Englisch, 95,2 % auf vereinfachtem Chinesisch und 99,1 % auf traditionellem Chinesisch – und dass seine kontextabhängige Schwachstellenbewertung keine Framing-Bedingung ergab, die bei irgendeinem getesteten Modell eine statistisch signifikante Veränderung hervorrief. Dabei handelt es sich um Einschätzungen von Cognition, die mit einem GPT-5.6 Luna Judge anhand eines Sets aus 145 Fragen erstellt wurden, und sie sind in demselben Sinne Anbieterangaben wie die Benchmarks.

Die unabhängige Einschätzung: Die gibt es noch nicht.

Mit Stand vom 28. September 2026 hat SWE-2 keinen Eintrag bei Artificial Analysis. Eine Suche im Modellindex nach dem Namen liefert nichts, und eine direkte Anfrage an die Modellseite endet mit einem 404. Das einzige Scoreboard, das SWE-2 führt, ist FrontierCode, das zu Cognition gehört. Damit bleiben für die Veröffentlichung nur vom Anbieter gemeldete Zahlen und sonst nichts – was keine Kritik an den Zahlen ist, sondern eine Aussage darüber, wie viel davon ein Leser überprüfen kann.

Zwei konkrete Dinge würden die Sache klären, und keines von beiden existiert heute. Ein von Dritten durchgeführter Lauf von SWE-2 auf Terminal-Bench 4 würde entscheiden, ob es sich um ein frontiernahes Modell handelt, das zufällig günstig ist, oder um ein schnelles, das zufällig eine eingestellte Edition anführt. Und jede unabhängige Reproduktion der FrontierCode-Lücke würde zeigen, ob der Ein-Punkt-Vorsprung gegenüber Fable 5.1 eine Eigenschaft des Modells oder eine Eigenschaft des Instruments ist.

Anders als bei den eigenen Modellen von Cognition führt Artificial Analysis Kimi K3 tatsächlich – und die Zahlen zu Kimi K3 stammen von Dritten, was das Basismodell zur besser belegten Hälfte dieses Stacks macht. Diese Asymmetrie ist die praktische Gestalt von SWE-2 heute: Das Post-Training ist der interessante Teil und der am wenigsten verifizierbare Teil; das Basismodell ist der dokumentierte Teil und derjenige, den man tatsächlich aufrufen kann.

Screenshot of the 'Coding benchmark results' section of Cognition's SWE-2 announcement post, showing the four-row seven-column vendor benchmark table — FrontierCode 1.1 Main, DeepSWE 1.1, Terminal-Bench 2.1 and Terminal-Bench 4, each row carrying SWE-2, Kimi K3, Grok 4.6, Fable 5.1, GPT-5.6 Sol, GPT-6 Astra and SWE-1.7 — above the paragraph stating that SWE-2 is post-trained from Kimi K3, a 2.8-trillion-parameter model, and a link line reading 'See how models rank on the FrontierCode leaderboard'.

SWE-2 verwenden und was zu tun ist, solange es nicht auditiert ist

Wenn Sie bereits für Devin bezahlen, ist die Entscheidung einfach und hängt nicht von den oben genannten Vorbehalten ab. SWE-2 ist in Ihrem Produkt, Cognition sagt, dass es pro Aufgabe weniger kostet als das Modell, das es ersetzt, und die Effizienzwerte – 58 % weniger Turns, 81 % niedrigere durchschnittliche Kosten, ein medianer erster Edit bei Schritt 18 statt Schritt 48 – beschreiben ein Modell, das bei gewöhnlicher Arbeit weniger Ihrer Zeit verschwendet. Starten Sie es mit mittlerem Aufwand am einfachen Ende Ihrer Warteschlange, wo das eigene Aufwandsstufen-Design von Cognition den Kostenvorteil verortet.

Wenn Sie ein Coding-Modell von außerhalb von Devin auswählen, ist die ehrliche Position, dass SWE-2 kein Kandidat ist, den Sie bewerten können, weil es nichts gibt, das man aufrufen kann. Es gibt keine Kennung, keinen Preis pro Token und keinen Endpunkt. Was Sie bewerten können, ist das Basismodell.

Screenshot of the OrcaRouter model page for Kimi K3, showing the model ID kimi/kimi-k3, the modality rows for text plus image input and text output, the Vision, Tools, JSON and Reasoning capability chips, an OpenAI-compatible code sample pointed at api.orcarouter.ai, and a live stat strip reading $3.00 input and $15.00 output per 1M tokens.

Kimi K3 wird über OrcaRouter geroutet, zu 3,00 $ pro 1 Mio. Eingabe-Tokens und 15,00 $ pro 1 Mio. Ausgabe-Tokens ohne Aufschlag auf den Anbietertarif, mit einem Kontextfenster von 1 Mio. Tokens, nativem Tool-Calling, Bildeingabe und einer Steuerung des Reasoning-Aufwands auf oberster Ebene. Das ist die erreichbare Hälfte dieses Releases: die Fähigkeit, auf die Cognition nachtrainiert hat, verfügbar über einen einzigen OpenAI-kompatiblen Endpoint statt über das Agentenprodukt eines einzelnen Anbieters. Und weil es so oder so ungeprüftes Terrain ist, können Sie eine Fallback-Kette dahinter schalten, damit ein Modell, das Sie gerade erproben, nicht an dem Tag, an dem es Sie enttäuscht, zu einer Produktionsabhängigkeit wird.

Was SWE-2 Ihnen sagt, wenn Sie es als Belegstatt als Produktseite lesen, ist enger und nützlicher als die Schlagzeile: Ein gut ausgeführter RL-Durchlauf auf Kimi K3 verschob das Niveau über vier Benchmarks hinweg um etwa fünf Punkte, ohne die Form zu verändern, und brauchte dafür 58 % weniger Turns. Das ist ein echtes Ergebnis innerhalb von Devin. Es ist noch kein Ergebnis, das jemand außerhalb von Cognition reproduziert hat, und der eine Benchmark, bei dem SWE-2 alles zu schlagen scheint, ist derjenige, den die Fachwelt nicht mehr bewertet.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert