
Cognition SWE-2: Vem som gör det, vilket testramverk det körs i och vad siffrorna faktiskt säger
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 316 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 196 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
Cognition SWE-2 är en kodmodell skapad av Cognition, företaget bakom Devin, och den tillhandahålls i Devin snarare än via ett modell-API: Cognitions eget lanseringsinlägg säger att SWE-2 först är tillgänglig i Devin Desktop och Devin CLI, med utrullning till Devin Web och Fusion. Den är eftertränad från Kimi K3, Moonshot AI:s modell med 2,8 biljoner parametrar. Det är hela svaret på frågan som de flesta egentligen ställer när de kommer hit, och det är värt att säga först av allt, eftersom en mätbar andel av sökningarna som leder till den här sidan lägger till ett fjärde ord – Devin – och tillskriver modellen Devin i stället för Cognition. Devin är agenten som Cognition säljer. SWE-2 är modellen som Cognition tränade för att köra inuti den.
Den här sidan är en referenssida snarare än en lanseringsartikel. SWE-2 släpptes den 10 september 2026, vilket är mer än en vecka sedan; datumet finns här för att tidsbestämma modellen, inte för att rapportera en händelse. Det som följer är vad som är dokumenterat, vem som dokumenterade det, och vad ingen ännu har kontrollerat.
Vem skapar SWE-2, och varför fortsätter tillskrivningen att glida?
Förvirringen är inte orimlig. Cognition säljer inte SWE-2 på samma sätt som ett labb säljer en API-modell. Det finns inget modellkort med ett kontextfönster, inget publicerat tokenpris, ingen identifierare som du kan skicka i en förfrågningskropp. Det finns en produkt – Devin – och modellen kommer som en del av den. Cognitions egen prosa förstärker sammanblandningen: lanseringsinlägget är skrivet från Devins perspektiv, benchmark-tabellen förklaras inte för någon som inte redan har läst företagets tidigare FrontierCode-arbete, och tillgänglighetsraden nämner Devin fyra gånger och Cognition en gång – i bylinen.
Så, enkelt uttryckt: Cognition gör SWE-2. Cognition gör Devin. De två är inte samma sak, men för närvarande kan man inte ha den ena utan den andra. Det här är inte heller ett engångsmisstag i namngivningen. Cognition har släppt en serie modeller för mjukvaruutveckling under prefixet SWE – SWE-1.5, SWE-1.6, SWE-1.7 och nu SWE-2, med en SWE-1.6 Preview-checkpoint på vägen – vid sidan av snävare verktyg som SWE-grep och SWE-check. Prefixet är företagets kortform för mjukvaruutveckling, och det är ungefär ett år äldre än varje modell i det här stycket.
Namnet: en modell, inte ett benchmark.
Detta är den andra anledningen till att sökare kopplar SWE-2 till fel ägare, och det förtjänar ett eget stycke snarare än en fotnot.
SWE-bench är ett benchmark. Det är en oberoende utvärdering som underhålls av SWE-bench-teamet, hostas på swebench.com, och den finns i flera utgåvor: den ursprungliga uppsättningen med 2 294 instanser hämtad från verkliga GitHub-ärenden, plus delmängderna Verified, Lite, Multilingual och Multimodal. Den används för att poängsätta kodningsagenter generellt, inklusive Devin — Cognition publicerade en teknisk rapport om Devin på SWE-bench redan i mars 2024 som fortfarande finns på deras blogg.
SWE-2 är en modell. Det är inte en utgåva av SWE-bench och inte heller en förkortning av någon sådan. Det finns ingen SWE-bench 2: den publicerade familjen består av SWE-bench, Verified, Lite, Multilingual och Multimodal, och den versionsnumrering som finns tillhör benchmarkens delmängder, inte en numrerad efterföljare. Cognitions normgivande benchmark för dessa modeller heter FrontierCode, vilket är ett helt annat instrument och, som nästa avsnitt förklarar, ett som Cognition äger.
Om du kom hit och förväntade dig en andra generation av SWE-bench-utvärderingen, är det hela missförståndet.
Releasedatum och hur SWE-2 distribueras
Cognitions tillkännagivandeinlägg har en byline daterad 10 september 2026, och sidans egen strukturerade data anger publiceringstidsstämpeln som 2026-09-10. Båda stämmer överens. SWE-2 var tillgängligt i Devin Desktop och Devin CLI det datumet, med Devin Web och Fusion som följde efter.
Det är distributionsytan, och det är hela distributionsytan. Det finns inga öppna vikter — ingenting på Hugging Face från Cognition för den här modellen — och ingen leverantörshostad slutpunkt som tar en SWE-2-identifierare. Om du har ett eget harness är SWE-2 inte en komponent som du kan installera i det idag. Om ditt harness är Devin har du redan SWE-2 framför dig.
För alla som behöver basmodellens kapacitetsomfång snarare än SWE-2:s är Kimi K3 en separat och bättre dokumenterad sak, och den dirigeras på OrcaRouter som kimi/kimi-k3 — ett API för 200+ modeller till leverantörens listpris utan påslag. Det spelar roll här av en specifik anledning: den underliggande förmågan som Cognition utgick från är åtkomlig oberoende, även om den eftertränade modellen inte är det.
Enveloppen: vad Cognition dokumenterar, och vad det inte gör
En referenssida bör vara ärlig om beskaffenheten hos sitt eget underlag, och det är här SWE-2:s är tunnast.
• Reasoning effort — tre dokumenterade nivåer: medium, high och max. Cognition skriver att nivåerna beter sig olika per design: medium går till handling tidigare och hanterar enkelt och medelstort arbete, medan high och max planerar mer, utforskar mer av kodbasen och lägger mer på verifiering.
• Distribution — Devin Desktop och Devin CLI vid lansering, Devin Web och Fusion rullas ut. Inget API, inga vikter, ingen self-host-väg.
• Basmodell — Kimi K3, som Cognition beskriver som en modell med 2,8T parametrar som redan hade genomgått omfattande RL för agentisk kodning. Kimi K3-artikeln ger den basen ett kontextfönster på 1M tokens och inbyggd vision.
• Kontextfönster, max output, modaliteter, antal eftertränade parametrar — publiceras inte för SWE-2. Cognitions tillkännagivande säger inget om något av dem, och ingen annan Cognition-sida fyller luckan.
Distinktionen i den sista raden är inte pedanteri. Kimi K3:s fönster på en miljon token är ett faktum om Kimi K3. Cognition säger inte att SWE-2 ärver det, och efterträning på ett annat recept är precis den typ av förändring som kan ändra vad en modell accepterar. Om du behöver ett kontextfönstervärde för planering tillhör det värde du kan verifiera basmodellen, och du bör behandla SWE-2:s som okänt i stället för att anta att de två stämmer överens.

Prislistan, i den enda valuta som Cognition anger
Det finns inget pris per token för SWE-2, eftersom det inte finns någon SWE-2-endpoint. Cognitions kostnadspåstående är uttryckt i andra enheter: det säger att SWE-2 ligger inom en punkt från Claude Fable 5.1 på FrontierCode 1.1 Main – 50,0 % mot 50,9 % – samtidigt som det är 64 % billigare. Läs enheten noga. De 64 % är genomsnittliga US-dollar som spenderas per rollout på FrontierCode, en siffra på uppgiftsnivå som buntar ihop modellen, harnessen, scaffoldingen och Cognitions serving-stack till en enda faktura. Det är inte en tokenpris, och det kan inte jämföras med en sådan.
Den prislista som faktiskt finns är Devins. På Devins prissida, läst den 28 september 2026: Gratis för $0, Pro för $20 per månad, Max för $200 per månad, Teams för $80 per månad plus $40 per full utvecklarplats. SWE-2-raden ligger under Pro och har ett datum – "Gratis användning av SWE-2 – Gratis i Devin Desktop och CLI till och med den 10 oktober 2026." Det är ett kampanjfönster med ungefär två veckor kvar, och det är den enda SWE-2-siffran på den sidan som verkligen är tidskänslig: modellens kostnad i Devin efter den 10 oktober anges inte där.
Cognitions effektivitetssiffror är värda att citera vid sidan av kostnadspåståendet, och de är leverantörsrapporterade precis som allt annat på den här sidan. På FrontierCode 1.1 Main får SWE-2 vid medelinsats högre poäng än SWE-1.7 samtidigt som den tar 58 % färre turer och i genomsnitt kostar 81 % mindre. Genomsnittliga steg per körning sjunker från 127 på SWE-1.7 till 53 vid medel, 80 vid hög och 98 vid max, och medianen för den första riktiga kodredigeringen flyttas från steg 48 till steg 18.
Benchmarkarna, med testriggen ansluten
Poäng inom programvaruteknik är ovanligt känsliga för den scaffold de togs fram i, så ett tal utan sin harness är inte ett tal. Cognition anger sin harness-policy i tillkännagivandets metodappendix: resultat rapporteras från offentliga källor där en sådan finns, och körs annars i Cognitions interna utvärderingsramverk med den harness som varje modell i första hand utvecklades för — Claude Code för modeller från Anthropic, Codex för modeller från OpenAI, Grok Build för modeller från xAI och Devin CLI för modeller med öppna vikter. För varje modell rapporterar Cognition den bästa poängen över inställningar för resonemangsansträngning.
Två konsekvenser följer, och båda hör hemma i samma andetag som siffrorna. För det första är flera rader inte jämförbara på lika villkor: en siffra för Fable 5.1 framtagen i Claude Code och en siffra för Kimi K3 framtagen i Devin CLI är mätningar av två olika agentsystem, inte två modeller i en neutral testmiljö. För det andra innebär "bästa poäng över alla ansträngningsinställningar" att varje cell är en modells bästa fall, inte en matchad inställning. En jämförelse som håller ansträngningen konstant skulle se annorlunda ut, och Cognition publicerade ingen sådan.
Alla fyra raderna nedan är leverantörsrapporterade och ogranskade.
• FrontierCode 1.1 Main — SWE-2 50,0 %, Kimi K3 44,2 %, Grok 4.6 48,0 %, Claude Fable 5.1 50,9 %, GPT-5.6 Sol 47,5 %, GPT-6 Astra 53,3 %, SWE-1.7 42,0 %. Det här är rubrikraden, och FrontierCode är Cognitions egen benchmark — Cognition skriver uppgifterna tillsammans med över 20 underhållare av öppen källkod, driver resultattavlan och betygsätter inlämningarna. Inget av detta gör siffrorna felaktiga; allt detta hör hemma i meningen där du upprepar dem.
• DeepSWE 1.1 — SWE-2 73,0 %, Kimi K3 68,5 %, Grok 4.6 67,5 %, Claude Fable 5.1 67,4 %, GPT-5.6 Sol 72,7 %, GPT-6 Astra 74,1 %, SWE-1.7 37,7 %. Raden där SWE-2 mest trovärdigt slår en frontier-modell rent ut.
• Terminal-Bench 2.1 — SWE-2 92,8 %, Kimi K3 88,3 %, Grok 4.6 88,4 %, Claude Fable 5.1 91,4 %, GPT-5.6 Sol 88,8 %, GPT-6 Astra 89,9 %, SWE-1.7 81,5 %. SWE-2:s mest fördelaktiga siffra, och den aktuella utgåvan av Terminal-Bench är inte 2.1.
• Terminal-Bench 4 — SWE-2 27,3 %, Kimi K3 21,5 %, Grok 4.6 20,3 %, Claude Fable 5.1 55,8 %, GPT-5.6 Sol 37,3 %, GPT-6 Astra 57,9 %, SWE-1.7 7,6 %. Raden som citeras minst, och den där modellen ligger ungefär 28 punkter efter frontlinjen.
Jämförelsen behöver också ytterligare en kontextuell detalj, eftersom den förklarar varifrån frontier-radens ovanliga form kommer. Cognitions egen fotnot till sina diagram noterar att Fable 5.1:s max-effort-inställning på FrontierCode 1.1 Main får 50,3 % till $12,83 per uppgift – under dess egen medium-inställning på 50,9 % och $3,28. Mer ansträngning gav en lägre poäng till ungefär fyra gånger kostnaden. Det är frontier-modellens kurva som böjer sig tillbaka på sig själv, och det är en del av varför 50,0 % mot 50,9 % ligger närmare varandra än vad de två siffrorna ensamma antyder.
Trovärdighetssiffrorna
Cognitions separata avsnitt om tillförlitlighet är den del av utgåvan som inte har något att göra med resultattavlor, och det rapporterar att SWE-2 klarade 98,0 % av sina propaganda- och censurprompter totalt — 99,8 % på engelska, 95,2 % på förenklad kinesiska och 99,1 % på traditionell kinesiska — och att dess kontextberoende sårbarhetsutvärdering inte fann något inramningsvillkor som gav en statistiskt signifikant förändring för någon testad modell. Det är Cognitions bedömningar, framtagna med en GPT-5.6 Luna-domare på en uppsättning om 145 frågor, och de är leverantörsrapporterade i samma bemärkelse som benchmarkarna.
Den oberoende läsningen: det finns ingen ännu
Per den 28 september 2026 har SWE-2 ingen post på Artificial Analysis. En sökning i modellindexet efter namnet ger inget resultat, och en direkt förfrågan till modellsidan ger 404. Den enda resultattavlan som listar SWE-2 är FrontierCode, som tillhör Cognition. Det lämnar lanseringen med leverantörsrapporterade siffror och inget annat, vilket inte är en kritik av siffrorna — det är ett konstaterande om hur mycket av dem en läsare kan kontrollera.
Två specifika saker skulle avgöra saken, och ingen av dem finns i dag. En tredjepartskörning av SWE-2 på Terminal-Bench 4 skulle avgöra om detta är en gränsnära modell som råkar vara billig eller en snabb sådan som råkar leda en pensionerad utgåva. Och varje oberoende reproduktion av FrontierCode-gapet skulle säga dig om marginalen på en punkt mot Fable 5.1 är en egenskap hos modellen eller en egenskap hos instrumentet.
Till skillnad från Cognitions egna modeller inkluderar Artificial Analysis faktiskt Kimi K3 — och Kimi K3:s siffror kommer från tredje part, vilket gör basmodellen till den bättre underbyggda halvan av den här stacken. Den asymmetrin är den praktiska formen av SWE-2 i dag: post-träningen är den intressanta delen och den minst verifierbara delen; basen är den dokumenterade delen och den man faktiskt kan anropa.

Att använda SWE-2, och vad man ska göra medan den är ogranskad
Om du redan betalar för Devin är beslutet enkelt och beror inte på något av förbehållen ovan. SWE-2 finns i din produkt, Cognition säger att det kostar mindre per uppgift än modellen det ersätter, och effektivitetssiffrorna – 58 % färre turer, 81 % lägre genomsnittlig kostnad, en median för första redigering vid steg 18 i stället för steg 48 – beskriver en modell som slösar mindre av din tid på vanligt arbete. Starta det på medelhög ansträngning i den enkla änden av din kö, vilket är där Cognitions egen design för ansträngningsnivåer placerar kostnadsvinsten.
Om du väljer en kodmodell utanför Devin är den ärliga hållningen att SWE-2 inte är en kandidat du kan utvärdera, eftersom det inte finns något att anropa. Det finns ingen identifierare, inget pris per token och ingen slutpunkt. Det du kan utvärdera är basmodellen.

Kimi K3 dirigeras via OrcaRouter, för $3,00 per 1 miljon indatatokens och $15,00 per 1 miljon utdatatokens utan påslag utöver leverantörens pris, ett kontextfönster på 1 miljon token, inbyggt verktygsanrop, bildinmatning och en kontroll för resonemangsansträngning på översta nivån. Det är den nåbara halvan av den här lanseringen: förmågan som Cognition eftertränade utifrån, tillgänglig via en enda OpenAI-kompatibel endpoint i stället för en leverantörs agentprodukt. Och eftersom det hur som helst är oreviderat territorium kan du lägga en reservkedja bakom den, så att en modell du testar inte blir ett produktionsberoende den dag den gör dig besviken.
Det SWE-2 säger dig, om du läser det som bevis snarare än som en produktsida, är snävare och mer användbart än rubriken: en väl genomförd RL-körning ovanpå Kimi K3 flyttade nivån med ungefär fem punkter över fyra benchmarks utan att ändra formen, och tog 58 % färre turer för att göra det. Det är ett verkligt resultat inne i Devin. Det är ännu inte ett resultat som någon utanför Cognition har reproducerat, och det enda benchmark där SWE-2 verkar slå allt är det som fältet har slutat poängsätta.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
