
Cognition SWE-2: Frontier-adjacent programmeren met 64% korting, en de benchmarkval die eronder schuilt
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1 mln tokens
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Cognition SWE-2 is deze week uitgebracht met een getal dat gemaakt is om te reizen: 50,0% op FrontierCode 1.1 Main, binnen één punt van Claude Fable 5.1 op 50,9%, voor 64% minder geld. Het model is een post-train van Kimi K3 van Moonshot AI — de open-weight basis met 2,8 biljoen parameters — en Cognition zegt dat zijn reinforcement learning 5–6 punten toevoegde op meerdere benchmarks. Beide cijfers zijn afkomstig van de leverancier zelf, en geen van beide is onafhankelijk gereproduceerd. Het tweede cijfer is echter de bewering die zou moeten veranderen hoe je het eerste leest, want "plus vijf of zes" blijkt bijna alles te beschrijven wat SWE-2 doet, inclusief de plekken waar het er slecht vanaf komt.
Dat is geen kritiek. Het is het nuttigste aspect van deze release, en het is het deel dat bijna geen enkele verslaggeving over de lancering hardop zegt.
Wat Cognition daadwerkelijk heeft uitgebracht
SWE-2 is het codeermodel van Devin, geen algemeen toepasbaar API-model met een prijslijst. Het is uitgekomen en is met ingang van vandaag beschikbaar in Devin Desktop en CLI, in de eigen woorden van Cognition, terwijl de uitrol op Devin Web en Fusion gaande is. Berichtgeving door derden dateert de aankondiging op 10 september 2026; de byline op de eigen blogpost van Cognition vermeldt 09.11.26. Hoe dan ook is het enkele dagen oud. De gewichten zijn propriëtair en er is geen gepubliceerde tariefkaart per token. Als je SWE-2 wilt gebruiken, doe je dat binnen Devin.
De basis is Kimi K3, een Mixture-of-Experts-model met 2,8 biljoen parameters, waarvan per token ongeveer 104 miljard parameters actief zijn — ongeveer drie keer zo groot als de basis van SWE-1.7. Cognition merkt op dat K3 al zwaar RL-getraind was voor agentic coding voordat het daar aankwam, en dat zijn eigen RL "nog altijd substantiële ruimte vindt". Dat weerspiegelt het patroon van SWE-1.7, dat eveneens op een Kimi-basis werd post-getraind.
Dit is het detail dat meer telt dan welke individuele benchmarkscore dan ook: FrontierCode is de benchmark van Cognition. Het bedrijf schrijft de taken — met meer dan 20 open-source-maintainers, meer dan 40 uur per taak, waarbij elke maintainer in hun eigen repo bepaalt wat 'mergeable' betekent — beheert de ranglijst en beoordeelt de inzendingen. Het is een serieus stuk evaluatieontwerp, en het is ook een instrument van het bedrijf zelf. Cognition rapporteert van elk model de beste score over instellingen voor redeneerinspanning, en volgens zijn eigen methodologiebijlage werden de open-weight vergelijkingsmodellen, waaronder Kimi K3, uitgevoerd binnen de Devin CLI van Cognition. Niets daarvan maakt de cijfers onjuist. Dat hoort allemaal in de zin waarin je ze herhaalt.

De benchmarktabel eerlijk lezen
Vier benchmarks, allemaal door de leverancier gerapporteerd. Dit is wat elk ervan feitelijk zegt, één regel per rij.
• FrontierCode 1.1 Main — SWE-2 50,0%, tegenover Kimi K3 44,2%, Grok 4.6 48,0%, GPT-5.6 Sol 47,5%, Claude Fable 5.1 50,9%, GPT-6 Astra 53,3%, SWE-1.7 42,0%. Binnen één punt van de frontier, en voor op al het andere in de tabel.
• DeepSWE 1.1 — SWE-2 73,0%, voor op Claude Fable 5.1 met 67,4% en Grok 4.6 met 67,5%, achter GPT-6 Astra met 74,1%. Dit is de rij waarin SWE-2 een frontier-model het geloofwaardigst ronduit verslaat.
• Terminal-Bench 2.1 — SWE-2 92,8%, de hoogste score in de tabel van Cognition, voor Claude Fable 5.1 met 91,4% en GPT-6 Astra met 89,9%. Dit is het getal in de meeste koppen over de lancering.
• Terminal-Bench 4 — SWE-2 27,3%, tegenover Claude Fable 5.1 met 55,8% en GPT-6 Astra met 57,9%. Een verschil van ongeveer 28 punten, en de rij die het minst wordt aangehaald.
Het voor de hand liggende tegenargument is dat iedereen zakt op Terminal-Bench 4 — het is een moeilijkere opvolger met een langere horizon, dus natuurlijk dalen de scores. Het interessante deel is hoeveel, en de daling is niet proportioneel. Van Terminal-Bench 2.1 naar 4 verliest Claude Fable 5.1 ongeveer 35,6 punten en GPT-6 Astra ongeveer 32,0. SWE-2 verliest ongeveer 65,5, en zijn basismodel Kimi K3 ongeveer 66,8. Dus bij agentisch werk met een lange horizon staat SWE-2 niet slechts onder de frontier-modellen — het degradeert ongeveer twee keer zo snel als zij wanneer de taak lang duurt.
Of Terminal-Bench 4 de "live" versie is, is het waard om ronduit te zeggen: het is de huidige editie, en 2.1 is de achterhaalde. De rij waarin SWE-2 vooroploopt, is de buiten gebruik gestelde benchmark. De rij waarin het achterblijft, is de huidige. Beide feiten zijn waar, en de berichtgeving rond de lancering koos doorgaans één van de twee.
"Kimi K3 plus five" — de heuristiek die de scores voorspelt die niemand heeft gepubliceerd
Zet de vier benchmarks naast het eigen basismodel van SWE-2 en er komt iets bijna mechanisch uit. Tegenover Kimi K3 boekt SWE-2 een winst van 5,8 punten op FrontierCode 1.1 Main, 4,5 op DeepSWE 1.1, 4,5 op Terminal-Bench 2.1 en 5,8 op Terminal-Bench 4.
Vier benchmarks, vier verschillen, allemaal tussen 4,5 en 5,8. De posttraining verschoof het niveau, niet de vorm. Waar K3 sterk is, is SWE-2 sterk plus ongeveer vijf. Waar K3 zwak is — Terminal-Bench 4 is het duidelijke geval — is SWE-2 zwak plus ongeveer vijf.
Dat geeft je een bruikbare voorspelling voor elke taak die Cognition niet heeft gebenchmarkt, wat de meeste taken zijn. Zoek op hoe Kimi K3 presteert op jouw workload, tel er vijf punten bij op, en je hebt een betere schatting van SWE-2 dan welk kopcijfer dan ook je zal geven. Het verklaart ook de werkelijke these achter de release: Cognition beweert niet de frontier te hebben verslagen. Het beweert de hele kosten-prestatiecurve naar buiten te hebben verplaatst, terwijl het op welke as je ook meet een vaste afstand achter het beste model blijft.
De 64% is echt, maar je kunt het niet kopen.
"64% goedkoper dan Claude Fable 5.1" is een ware bewering over een specifieke meting — en de meting is het gemiddelde bedrag in Amerikaanse dollars dat per rollout op FrontierCode wordt besteed, niet een tokenprijs. Er is geen tarief per token voor SWE-2, omdat er geen SWE-2-API is. De kostenclaim beschrijft wat een taak binnen Devin kost, waarbij het model, de harness, de scaffolding en Cognition's servingstack in één factuur worden gebundeld.
Dat onderscheid is niet vrijblijvend. Je kunt de kosten van SWE-2 niet afzetten tegen een tokenprijs van een andere leverancier, want dat zijn niet dezelfde eenheden. En je kunt SWE-2 niet elders onderbrengen: propriëtaire gewichten, één leverancier, één agentproduct. Het cijfer "tot 70% lagere kosten" in sommige berichtgeving is de bovenkant van de range die Cognition over benchmarks noemt; het cijfer voor FrontierCode 1.1 Main is 64%.
De efficiëntiecijfers zijn, zo al iets, het praktischere verhaal, en die zijn ook nog eens door de leverancier gerapporteerd. SWE-2 overtref bij gemiddelde inspanning de FrontierCode-score van SWE-1.7, terwijl het 58% minder beurten gebruikt en gemiddeld 81% goedkoper is. Het gemiddelde aantal stappen per run daalt van 127 op SWE-1.7 naar 53 bij gemiddelde inspanning (80 bij hoge inspanning, 98 bij maximale inspanning), en de mediaan van de eerste echte codewijziging verschuift van stap 48 naar stap 18. Dat is een direct antwoord op de klacht dat SWE-1.7 eenvoudige taken te veel verkende, en het is het soort verbetering dat veel eerder op je factuur zichtbaar wordt dan een benchmarkverschil van één punt.

De trainingstruc is het echte nieuws.
Zet de positionering op het leaderboard opzij en er is hier één werkelijk vernieuwend stuk techniek, en daarom is de release het lezen waard, zelfs als je Devin nooit opent.
Cognition trainde alle drie de niveaus van redeneerinspanning — medium, hoog en max — in een enkele RL-run. Het mechanisme is een lineaire kostenstraf per inspanningsniveau, elk afgestemd op de helling van de eigen kosten-prestatie-Pareto-curve van het basismodel op dat punt. Het argument van Cognition waarom de straf lineair moet zijn, is het interessante deel: alleen een lineaire straf houdt de trainingsdoelstelling een functie van alleen gemiddelde kosten en oplossingspercentage, in plaats van iets dat afhangt van de vorm van de verdeling.
De gebruikelijke aanpak traint inspanningsniveaus afzonderlijk, of zet er achteraf een goedkopere checkpoint op. Ze samen in één run trainen is wat het bedrijf in staat stelt te claimen dat het de hele frontier heeft vooruitgebracht in plaats van één punt erop. Ondersteunende wijzigingen: een lengtegewogen reward-baseline, een verdrievoudiging van het aantal RL-omgevingen, overlays voor instructieopvolging, en een vliegwiel dat eerdere SWE-2-checkpoints gebruikt om de verifiers weerbaarder te maken tegen reward hacking. Aan de servingzijde: NVFP4- en FP8-kernels met quantization-aware training, een DSpark-conceptmodel voor speculatief decoderen dat opnieuw is getraind voor 15% langere acceptatielengtes, en een prefill-vertrager die 10–20% oplevert op de doorvoer per GPU, ten koste van een slechtere time-to-first-token.
Als je post-training uitvoert, is dat recept het overdraagbare deel van deze release. Als je dat niet doet, is de conclusie eenvoudiger: de reden dat SWE-2 goedkoop is, is niet dat het een kleiner model is. Het is dat de kosten om het te draaien in de beloningsfunctie waren opgenomen.
Als je de Kimi K3-capaciteit buiten Devin wilt
SWE-2 staat niet op OrcaRouter, en dat zal ook niet gebeuren — propriëtaire gewichten, geen API, alleen distributie via Devin. Het basismodel is een ander verhaal. Kimi K3 is gerouteerd op OrcaRouter als kimi/kimi-k3, tegen $3,00 per 1M invoertokens en $15,00 per 1M uitvoertokens zonder markup bovenop het tarief van de provider, een contextvenster van 1M tokens, native tool calling, beeldinvoer, en redeneerdiepte die wordt gestuurd via een top-level reasoning_effortparameter in plaats van sampling-instellingen.
Dat is de eerlijke versie van de praktische conclusie van deze release. SWE-2 laat je zien hoe een goed uitgevoerde RL-pass bovenop K3 eruitziet aan de bovenkant van zijn bereik — een echte stijging van 4,5 tot 5,8 punten, plus grote efficiëntiewinsten, tegen een reële kost. Wat het je niet geeft, is een model dat je kunt aanroepen. Als je de onderliggende capaciteit wilt richten op je eigen code, je eigen harness of je eigen pipeline, is K3 het deel van deze stack dat je daadwerkelijk kunt bereiken, en het is bereikbaar via één OpenAI-compatibel endpoint.
Het is ook de veiligere helft van de weddenschap zolang de cijfers niet gecontroleerd zijn. De benchmarks van SWE-2 zijn die van Cognition zelf en niemand buiten het bedrijf heeft ze gereproduceerd. Die van Kimi K3 zijn de benchmarks waarop de vergelijking feitelijk rust — en als je via OrcaRouter routeert, kun je er een fallback-keten achter zetten, zodat een model dat je aan het testen bent niet op de dag dat het je teleurstelt een productie-afhankelijkheid wordt.

Wie moet handelen, en wat zou het beslechten
Als je al voor Devin betaalt, is SWE-2 ronduit goed nieuws: het wordt uitgerold naar je product, het is goedkoper per taak dan wat het vervangt, en de efficiëntiecijfers suggereren dat het minder beurten zal verspillen aan makkelijk werk. Probeer het eerst aan de eenvoudige kant van je wachtrij — het ontwerp met inspanningsniveaus betekent dat medium is waar de kostenwinst zit.
Als je een codeermodel van buitenaf kiest, wacht dan op onafhankelijke evaluatie. Die is er nog niet: Artificial Analysis heeft geen SWE-2-vermelding, en de FrontierCode-ranglijst is het eigen instrument van Cognition. Drie dingen zouden uitsluitsel geven. Een run van SWE-2 op Terminal-Bench 4 door een derde partij, de rij die bepaalt of dit een model is dat aan de frontier grenst of een snel model. Elke onafhankelijke reproductie van de FrontierCode-kloof. En een prijs per token, waarvoor Cognition het model buiten Devin zou moeten verkopen — de enige verandering die de 64% vergelijkbaar zou maken met al het andere dat je wordt geoffreerd.
Tot die tijd is de eerlijke samenvatting degene die de kloof met het basismodel je al geeft. SWE-2 is Kimi K3 plus vijf punten, tegen een prijs die Cognition in de beloningsfunctie heeft ingebouwd. Dat is een echte prestatie op het gebied van training en een ronduit goede deal binnen Devin. Het is nog geen frontiermodel, en de enige benchmark waarop het alles lijkt te verslaan, is degene die niet meer meetelt.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
