Titelkort för Cognition SWE-2 som visar en undertext med texten 'En Kimi K3 eftertränad, 50,0 % på FrontierCode 1.1 Main med 64 % lägre kostnad', med tre kort: FrontierCode 1.1 Main 50,0 %, mot Claude Fable 5.1 50,9 %, och Kostnad per rollout 64 % lägre.
Guides & Insights

Cognition SWE-2: Frontier-nära kodning med 64 % rabatt, och benchmark-fällan under ytan

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Cognition SWE-2 lanserades i veckan med en siffra byggd för att spridas: 50,0 % på FrontierCode 1.1 Main, bara en punkt från Claude Fable 5.1 på 50,9 %, för 64 % lägre kostnad. Modellen är en eftertränad version av Moonshot AI:s Kimi K3 – basmodellen med öppna vikter och 2,8 biljoner parametrar – och Cognition säger att förstärkningsinlärningen tillförde 5–6 punkter över flera benchmarks. Båda siffrorna är leverantörens egna, och ingen av dem har reproducerats oberoende. Den andra är dock påståendet som bör förändra hur du läser den första, eftersom ”plus fem eller sex” visar sig beskriva nästan allt SWE-2 gör, inklusive de ställen där den förlorar stort.

Det är inte en kritik. Det är det mest användbara med det här släppet, och det är den delen som nästan ingen av lanseringsbevakningarna säger högt.

Vad Cognition faktiskt levererade

SWE-2 är Devins kodningsmodell, inte en generell API-modell med prislista. Den släpptes och blev tillgänglig från och med idag i Devin Desktop och CLI, enligt Cognition själva, med utrullning pågående på Devin Web och Fusion. Rapportering från tredje part daterar tillkännagivandet till den 10 september 2026; bylinen på Cognitions eget blogginlägg anger 09.11.26. Hur som helst är den bara några dagar gammal. Vikterna är proprietära och det finns ingen publicerad prislista per token. Om du vill använda SWE-2 använder du den inuti Devin.

Basmodellen är Kimi K3, en Mixture-of-Experts-modell med 2,8 biljoner parametrar och ungefär 104 miljarder parametrar aktiva per token – ungefär tre gånger så stor som SWE-1.7:s basmodell. Cognition noterar att K3 redan hade RL-tränats intensivt för agentisk kodning innan det kom dit, och att dess egen RL "fortfarande finner betydande utrymme". Det speglar mönstret från SWE-1.7, som också eftertränades på en Kimi-bas.

Här är detaljen som spelar större roll än något enskilt benchmarkresultat: FrontierCode är Cognitions benchmark. Företaget skriver uppgifterna – med över 20 underhållare av öppen källkod, mer än 40 timmar per uppgift, där varje underhållare definierar vad "mergebar" betyder i sitt eget repo – driver topplistan och betygsätter inlämningarna. Det är en seriös utvärderingsdesign, och det är också ett internt instrument. Cognition rapporterar varje modells bästa poäng över inställningar för resonemangsansträngning, och enligt dess egen metodbilaga kördes de jämförande modellerna med öppna vikter, inklusive Kimi K3, i Cognitions Devin CLI. Inget av detta gör siffrorna felaktiga. Allt detta hör hemma i meningen där du upprepar dem.

Two-column scoreboard headed 'Cognition SWE-2 vs Claude Fable 5.1'. Left column Cognition SWE-2: FrontierCode 1.1 Main 50.0%, Terminal-Bench 2.1 92.8%, Terminal-Bench 4 27.3%, Cost per rollout 64% lower, Base model Kimi K3 2.8T, Independent eval none yet. Right column Claude Fable 5.1: FrontierCode 1.1 Main 50.9%, Terminal-Bench 2.1 91.4%, Terminal-Bench 4 55.8%, Cost per rollout baseline, Base model proprietary, Independent eval third-party scored.

Att läsa benchmark-tabellen ärligt

Fyra benchmarkresultat, alla leverantörsrapporterade. Här är vad var och en faktiskt säger, en rad per rad.

• FrontierCode 1.1 Main — SWE-2 50,0 %, mot Kimi K3 44,2 %, Grok 4.6 48,0 %, GPT-5.6 Sol 47,5 %, Claude Fable 5.1 50,9 %, GPT-6 Astra 53,3 %, SWE-1.7 42,0 %. Inom en punkt från frontlinjen, före allt annat i tabellen.

• DeepSWE 1.1 – SWE-2 73,0 %, före Claude Fable 5.1 på 67,4 % och Grok 4.6 på 67,5 %, efter GPT-6 Astra på 74,1 %. Det här är raden där SWE-2 med störst trovärdighet slår en frontiermodell rakt ut.

• Terminal-Bench 2.1 — SWE-2 92,8 %, högsta poängen i Cognitions tabell, före Claude Fable 5.1 på 91,4 % och GPT-6 Astra på 89,9 %. Det är siffran i de flesta lanseringsrubriker.

• Terminal-Bench 4 — SWE-2 27,3 %, mot Claude Fable 5.1 på 55,8 % och GPT-6 Astra på 57,9 %. En skillnad på ungefär 28 punkter, och raden som citeras minst.

Den uppenbara invändningen är att alla tappar på Terminal-Bench 4 – det är en svårare efterföljare med längre horisont, så förstås faller poängen. Det intressanta är hur mycket, och fallet är inte proportionellt. När man går från Terminal-Bench 2.1 till 4 tappar Claude Fable 5.1 ungefär 35,6 poäng och GPT-6 Astra ungefär 32,0. SWE-2 tappar ungefär 65,5, och dess basmodell Kimi K3 ungefär 66,8. Så på långsiktigt agentiskt arbete ligger SWE-2 inte bara under frontmodellerna – det försämras ungefär dubbelt så snabbt som de när uppgiften blir långvarig.

Huruvida Terminal-Bench 4 är den "live"-versionen är värt att säga rakt ut: det är den aktuella utgåvan, och 2.1 är den ersatta. Raden där SWE-2 leder är det pensionerade riktmärket. Raden där den ligger efter är den aktuella. Båda fakta är sanna, och bevakningen av lanseringen tenderade att välja en av dem.

"Kimi K3 plus fem" — heuristiken som förutspår poängen som ingen publicerade

Ställ de fyra benchmarkarna mot SWE-2:s egen basmodell, och något nästan mekaniskt framträder. Jämfört med Kimi K3 vinner SWE-2 5,8 poäng på FrontierCode 1.1 Main, 4,5 på DeepSWE 1.1, 4,5 på Terminal-Bench 2.1 och 5,8 på Terminal-Bench 4.

Fyra benchmarks, fyra gap, alla mellan 4,5 och 5,8. Efterträningen flyttade nivån, inte formen. Där K3 är starkt är SWE-2 starkt plus ungefär fem. Där K3 är svagt – Terminal-Bench 4 är det tydliga fallet – är SWE-2 svagt plus ungefär fem.

Det ger dig en användbar prognos för alla uppgifter som Cognition inte har benchmarkat, vilket är de flesta. Slå upp hur Kimi K3 presterar på din arbetsbelastning, lägg till fem poäng, och du har en bättre uppskattning av SWE-2 än någon av rubriksiffrorna ger dig. Det förklarar också den faktiska tesen bakom lanseringen: Cognition gör inte anspråk på att ha slagit frontlinjen. Cognition gör anspråk på att ha flyttat hela kostnads-/prestandakurvan utåt samtidigt som man ligger ett fast avstånd bakom den bästa modellen på vilken axel du än mäter.

64 % är verkligt, men du kan inte shoppa det.

"64 % billigare än Claude Fable 5.1" är ett sant påstående om en specifik mätning – och mätningen är genomsnittligt antal amerikanska dollar som spenderas per rollout på FrontierCode, inte ett tokenpris. Det finns inget pris per token för SWE-2 eftersom det inte finns något SWE-2-API. Kostnadspåståendet beskriver vad en uppgift kostar i Devin, som samlar modellen, harnessen, scaffoldingen och Cognitions serving-stack i en enda faktura.

Den distinktionen är inte tandlös. Du kan inte jämföra SWE-2:s kostnad med ett tokenpris från en annan leverantör, eftersom de inte är samma enhet. Och du kan inte ta SWE-2 någon annanstans: proprietära vikter, en leverantör, en agentprodukt. Siffran ”upp till 70 % lägre kostnad” i en del bevakning är den högsta punkten i det spann som Cognition anger över olika benchmarks; siffran för FrontierCode 1.1 Main är 64 %.

Effektivitetssiffrorna är, om något, den mer praktiska historien, och de är också leverantörsrapporterade. SWE-2 vid medelhög ansträngning slår SWE-1.7:s FrontierCode-poäng samtidigt som den använder 58 % färre turer och kostar i genomsnitt 81 % mindre. Genomsnittligt antal steg per körning sjunker från 127 på SWE-1.7 till 53 vid medelhög ansträngning (80 vid hög, 98 vid max), och medianen för första riktiga kodändringen flyttas från steg 48 till steg 18. Det är ett direkt svar på klagomålet att SWE-1.7 utforskade enkla uppgifter för mycket, och det är den typ av förbättring som syns på din faktura långt innan en benchmark-skillnad på en poäng gör det.

Screenshot of Cognition's official SWE-2 announcement blog post, headed 'Introducing SWE-2: Pushing the Pareto Frontier', bylined 09.11.26, showing the opening claim of 50.0% on FrontierCode 1.1 Main within one point of Fable 5.1 while being 64% cheaper, and a cost-versus-solve-rate Pareto chart labelling the medium, high and max effort levels.

Träningstricket är den egentliga nyheten

Om man bortser från topplistepositioneringen finns det en genuint nyskapande ingenjörsbedrift här, vilket är anledningen till att släppet är värt att läsa även om du aldrig öppnar Devin.

Cognition tränade alla tre nivåerna för resonemangsansträngning – medium, hög och max – i en enda RL-körning. Mekanismen är ett linjärt kostnadsstraff per ansträngningsnivå, där vart och ett är kalibrerat för att matcha lutningen i basmodellens egen Pareto-kurva för kostnad kontra prestanda vid den punkten. Cognitions argument för varför straffet måste vara linjärt är det intressanta: endast ett linjärt straff håller träningsmålet som en funktion av enbart genomsnittskostnad och lösningsgrad, snarare än något som beror på fördelningens form.

Den vanliga metoden tränar ansträngningsnivåer separat, eller hakar på en billigare checkpoint efteråt. Att träna dem tillsammans i en enda körning är vad som gör att företaget kan hävda att man flyttade fram hela frontlinjen snarare än en punkt på den. Stödjande förändringar: en längdviktsbaserad belöningsbaslinje, en tredubbling av antalet RL-miljöer, instruktionsföljande överlägg, och ett svänghjul som använder tidigare SWE-2-checkpoints för att härda verifierarna mot belöningshackning. På serveringssidan, NVFP4- och FP8-kärnor med kvantiseringsmedveten träning, en DSpark speculative-decoding utkastmodell omtränad för 15% längre acceptlängder, och en prefill-fördröjare värd 10–20% på genomströmning per GPU till priset av sämre time-to-first-token.

Om du kör efterträning är det receptet den överförbara delen av den här utgåvan. Om du inte gör det är slutsatsen enklare: anledningen till att SWE-2 är billigt är inte att det är en mindre modell. Det är att kostnaden för att köra det skrevs in i belöningsfunktionen.

Om du vill ha Kimi K3-funktionaliteten utanför Devin

SWE-2 finns inte på OrcaRouter, och det kommer det inte att göra — proprietära vikter, inget API, distribution endast via Devin. Dess basmodell är en annan sak. Kimi K3 routas på OrcaRouter som kimi/kimi-k3, till $3.00 per 1M indatatoken och $15.00 per 1M utdatatoken utan påslag utöver leverantörens pris, ett kontextfönster på 1M token, inbyggt verktygsanrop, bildinmatning och ett resonemangsdjup som styrs via en toppnivåparameterreasoning_effort i stället för samplingsinställningar.

Den ärliga versionen av den här utgåvans praktiska slutsats. SWE-2 visar dig hur en väl genomförd RL-körning ovanpå K3 ser ut i den övre delen av sitt spann – ett genuint lyft på 4,5–5,8 punkter, plus stora effektivitetsvinster, till en verklig kostnad. Det den inte ger dig är en modell du kan anropa. Om du vill att den underliggande förmågan ska riktas mot din egen kod, din egen testrigg eller din egen pipeline, är K3 den del av den här stacken som du faktiskt kan komma åt, och den går att komma åt via en enda OpenAI-kompatibel slutpunkt.

Det är också den säkrare halvan av vadet medan siffrorna är ogranskade. SWE-2:s benchmarks är Cognitions egna och ingen utanför företaget har reproducerat dem. Kimi K3:s är de som jämförelsen faktiskt vilar på – och om du dirigerar via OrcaRouter kan du lägga en reservkedja bakom den, så att en modell du provar inte blir ett produktionsberoende den dag den gör dig besviken.

Screenshot of the OrcaRouter model page for Kimi K3, showing model ID kimi/kimi-k3, input $3.00 per 1M tokens, output $15.00 per 1M tokens, cache read $0.300, 1M-token context, text and image input, p50 time-to-first-token of 9.85 seconds, and 2,739.4M tokens of traffic over 7 days.

Vem bör agera, och vad skulle avgöra saken?

Om du redan betalar för Devin är SWE-2 helt enkelt goda nyheter: den rullas ut i din produkt, den är billigare per uppgift än det den ersätter, och effektivitetssiffrorna tyder på att den kommer att slösa färre turer på enkelt arbete. Prova den först på den enkla delen av din kö – designen med insatsnivåer innebär att medel är där kostnadsvinsten ligger.

Om du väljer en kodningsmodell utifrån, vänta på en oberoende utvärdering. Det finns ingen ännu: Artificial Analysis har ingen SWE-2-notering, och FrontierCode-topplistan är Cognitions eget instrument. Tre saker skulle avgöra saken. En tredjepartskörning av SWE-2 på Terminal-Bench 4, vilket är raden som avgör om detta är en frontier-nära modell eller en snabb sådan. Varje oberoende reproduktion av FrontierCode-gapet. Och ett pris per token, vilket skulle kräva att Cognition säljer modellen utanför Devin – den enda förändringen som skulle göra de 64 % jämförbara med något annat du får offererat.

Fram till dess är den rimliga sammanfattningen den som basmodellsgapet redan ger dig. SWE-2 är Kimi K3 plus fem poäng, till en kostnad som Cognition byggt in i belöningsfunktionen. Det är en verklig bedrift inom träning och en genuint bra affär i Devin. Det är ännu inte en frontiermodell, och det enda benchmark där den tycks slå allt är det som slutade räknas.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen