
Cognition SWE-2: Wie maakt het, in welk harnas het draait, en wat de cijfers echt zeggen
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 316 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 196 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
Cognition SWE-2 is een codemodel van Cognition, het bedrijf achter Devin, en het wordt binnen Devin aangeboden in plaats van via een model-API: het eigen lanceringsbericht van Cognition zegt dat SWE-2 eerst beschikbaar is in Devin Desktop en Devin CLI, met uitrol naar Devin Web en Fusion. Het is nagetraind op basis van Kimi K3, het model van Moonshot AI met 2,8 biljoen parameters. Dat is het volledige antwoord op de vraag die de meeste mensen eigenlijk stellen wanneer ze hier terechtkomen, en het is de moeite waard om dit vóór al het andere te zeggen, omdat een meetbaar deel van de zoekopdrachten die naar deze pagina leiden een vierde woord toevoegt — Devin — en het model aan Devin toeschrijft in plaats van aan Cognition. Devin is de agent die Cognition verkoopt. SWE-2 is het model dat Cognition heeft getraind om erin te draaien.
Deze pagina is eerder een referentiepagina dan een lanceringsverhaal. SWE-2 werd uitgebracht op 10 september 2026, wat intussen meer dan een week achter ons ligt; de datum staat hier om het model in de tijd vast te leggen, niet om een gebeurtenis te melden. Wat volgt, is wat gedocumenteerd is, wie het gedocumenteerd heeft, en wat nog niemand heeft gecontroleerd.
Wie maakt SWE-2, en waarom blijft de toeschrijving verschuiven
De verwarring is niet onredelijk. Cognition verkoopt SWE-2 niet zoals een lab een API-model verkoopt. Er is geen modelkaart met een contextvenster, geen gepubliceerde tokenprijs, geen identifier die je in een request body kunt doorgeven. Er is een product — Devin — en het model komt als onderdeel daarvan. Cognitions eigen teksten versterken het samenvallen: de lanceringspost is geschreven vanuit Devins perspectief, de benchmarktabel wordt niet uitgelegd aan iedereen die het eerdere FrontierCode-werk van het bedrijf niet al heeft gelezen, en de beschikbaarheidsregel noemt Devin vier keer en Cognition één keer — in de byline.
Dus, simpel gezegd: Cognition maakt SWE-2. Cognition maakt Devin. De twee zijn niet hetzelfde, maar je kunt momenteel niet het ene hebben zonder het andere. Dit is ook geen eenmalig naamgevingsongeluk. Cognition heeft een reeks software-engineeringmodellen uitgebracht onder het SWE-voorvoegsel — SWE-1.5, SWE-1.6, SWE-1.7 en nu SWE-2, met onderweg een SWE-1.6 Preview-checkpoint — naast meer specifieke tools zoals SWE-grep en SWE-check. Het voorvoegsel is de afkorting van het bedrijf voor software engineering, en het dateert van ongeveer een jaar vóór elk model in deze reeks.
De naam: een model, niet een
Dit is de tweede reden waarom zoekers SWE-2 aan de verkeerde eigenaar koppelen, en die verdient een eigen alinea in plaats van een voetnoot.
SWE-bench is een benchmark. Het is een onafhankelijke evaluatie die wordt onderhouden door het SWE-bench-team, gehost op swebench.com, en het verschijnt in verschillende edities: de originele set van 2.294 instanties uit echte GitHub-issues, plus de subsets Verified, Lite, Multilingual en Multimodal. Het wordt gebruikt om coding agents in het algemeen te beoordelen, Devin inbegrepen — Cognition publiceerde in maart 2024 een technisch rapport over Devin op SWE-bench dat nog steeds op zijn blog staat.
SWE-2 is een model. Het is geen editie van SWE-bench, en het is ook geen afkorting daarvan. Er is geen SWE-bench 2: de gepubliceerde familie omvat SWE-bench, Verified, Lite, Multilingual en Multimodal, en de versienummering die bestaat hoort bij de subsets van de benchmark, niet bij een genummerde opvolger. De referentiebenchmark van Cognition voor deze modellen heet FrontierCode, wat een heel ander instrument is en, zoals de volgende sectie uitlegt, een instrument dat Cognition bezit.
Als je hierheen kwam in de verwachting een tweede generatie van de SWE-bench-evaluatie aan te treffen, dan is dat het hele misverstand.
Releasedatum en hoe SWE-2 wordt gedistribueerd
Het aankondigingsbericht van Cognition draagt een byline van 10 september 2026, en de eigen gestructureerde data van de pagina geven de publicatietijdstempel als 2026-09-10. Beide komen overeen. SWE-2 was op die datum beschikbaar in Devin Desktop en Devin CLI, met Devin Web en Fusion die daarna volgden.
Dat is het distributieoppervlak, en het is het volledige distributieoppervlak. Er zijn geen open gewichten — niets op Hugging Face van Cognition voor dit model — en geen door de leverancier gehost endpoint dat een SWE-2-identifier accepteert. Als je je eigen harness gebruikt, is SWE-2 geen component die je er vandaag in kunt installeren. Als jouw harness Devin is, staat SWE-2 al voor je.
Voor iedereen die de documentatie van het basismodel nodig heeft, is Kimi K3 een apart en beter gedocumenteerd model, en het wordt op OrcaRouter gerouteerd alskimi/kimi-k3 — één API voor meer dan 200 modellen tegen de lijstprijs van de provider, zonder opslag. Dat is hier om een specifieke reden van belang: de onderliggende capaciteit waar Cognition van vertrok, is onafhankelijk bereikbaar, ook al is het post-getrainde model dat niet.
De envelop: wat Cognition documenteert, en wat niet
Een referentiepagina zou eerlijk moeten zijn over de vorm van zijn eigen bewijs, en dit is waar dat van SWE-2 het dunst is.
• Redeneerinspanning — drie gedocumenteerde niveaus: medium, hoog en max. Cognition schrijft dat de niveaus bewust anders werken: medium gaat eerder over tot actie en neemt eenvoudig en middelzwaar werk voor zijn rekening, terwijl hoog en max meer plannen, meer van de codebase verkennen en meer besteden aan verificatie.
• Distributie — Devin Desktop en Devin CLI bij de lancering, Devin Web en Fusion worden uitgerold. Geen API, geen gewichten, geen self-hostpad.
• Basismodel — Kimi K3, door Cognition beschreven als een model met 2,8 biljoen parameters dat al een uitgebreide RL had ondergaan voor agentisch coderen. De Kimi K3-paper geeft die basis een contextvenster van 1M tokens en native vision.
• Contextvenster, maximale output, modaliteiten, aantal post-trained parameters — niet gepubliceerd voor SWE-2. De aankondiging van Cognition zegt niets over een van deze, en geen enkele andere Cognition-pagina vult het gat.
Het onderscheid in die laatste rij is geen pietluttigheid. Het venster van een miljoen tokens van Kimi K3 is een feit over Kimi K3. Cognition zegt niet dat SWE-2 dat erft, en post-training volgens een ander recept is precies het soort verandering dat kan veranderen wat een model accepteert. Als je een getal voor het contextvenster nodig hebt voor planning, dan geldt het getal dat je kunt verifiëren voor het basismodel, en moet je dat van SWE-2 als onbekend beschouwen in plaats van aan te nemen dat de twee overeenkomen.

De tariefkaart, in de enige valuta waarin Cognition prijzen opgeeft
Er is geen prijs per token voor SWE-2, want er is geen SWE-2-endpoint. De kostenclaim van Cognition is anders uitgedrukt: er wordt gezegd dat SWE-2 binnen één punt van Claude Fable 5.1 uitkomt op FrontierCode 1.1 Main — 50,0% tegenover 50,9% — terwijl het 64% goedkoper is. Lees de eenheid zorgvuldig. Die 64% is het gemiddelde aantal Amerikaanse dollars dat per rollout op FrontierCode wordt uitgegeven, een cijfer op taakniveau waarin het model, de harness, de scaffolding en de serving-stack van Cognition in één factuur worden gebundeld. Het is geen tokentarief, en het kan daar ook niet mee worden vergeleken.
De tarievenkaart die wel bestaat, is die van Devin. Op de prijzenpagina van Devin, gelezen op 28 september 2026: Free voor $0, Pro voor $20 per maand, Max voor $200 per maand, Teams voor $80 per maand plus $40 per volledige developer-seat. De SWE-2-regel staat in Pro en bevat een datum — "Gratis gebruik van SWE-2 — Gratis in Devin Desktop en CLI tot en met 10 oktober 2026." Dat is een promotievenster met nog ongeveer twee weken te gaan, en het is het enige SWE-2-getal op die pagina dat echt tijdsgevoelig is: de kosten van het model binnen Devin na 10 oktober worden daar niet vermeld.
Cognitions efficiëntiecijfers zijn het vermelden waard naast de kostenclaim, en ze zijn door de leverancier gerapporteerd, net als alles anders op deze pagina. Op FrontierCode 1.1 Main scoort SWE-2 bij medium effort hoger dan SWE-1.7, terwijl het 58% minder beurten nodig heeft en gemiddeld 81% minder kost. Het gemiddelde aantal stappen per run daalt van 127 op SWE-1.7 naar 53 bij medium, 80 bij high en 98 bij max, en de mediane eerste echte code-edit verschuift van stap 48 naar stap 18.
De benchmarks, met het harnas eraan bevestigd
Scores voor software-engineering zijn ongewoon gevoelig voor de scaffold waarin ze zijn geproduceerd, dus een getal zonder zijn harness is geen getal. Cognition vermeldt zijn harnessbeleid in de methodologiebijlage van de aankondiging: resultaten worden gerapporteerd uit openbare bronnen waar die bestaat, en anders uitgevoerd binnen het interne evaluatieraamwerk van Cognition met de harness waarvoor elk model primair is ontwikkeld — Claude Code voor Anthropic-modellen, Codex voor OpenAI-modellen, Grok Build voor xAI-modellen, en Devin CLI voor open-weightmodellen. Voor elk model rapporteert Cognition de beste score over de instellingen voor reasoning-effort.
Hieruit volgen twee consequenties, en beide horen in één adem met de cijfers te worden genoemd. Ten eerste zijn verschillende rijen niet gelijkwaardig te vergelijken: een Fable 5.1-cijfer dat in Claude Code is geproduceerd en een Kimi K3-cijfer dat in Devin CLI is geproduceerd, zijn metingen van twee verschillende agentsystemen, niet van twee modellen in een neutrale testomgeving. Ten tweede betekent "beste score over alle effort-instellingen" dat elke cel het beste geval van een model is, niet een gelijkgeschakelde instelling. Een vergelijking waarin effort constant wordt gehouden, zou er anders uitzien, en die heeft Cognition niet gepubliceerd.
Alle vier onderstaande rijen zijn door de leverancier opgegeven en niet gecontroleerd.
• FrontierCode 1.1 Main — SWE-2 50,0%, Kimi K3 44,2%, Grok 4.6 48,0%, Claude Fable 5.1 50,9%, GPT-5.6 Sol 47,5%, GPT-6 Astra 53,3%, SWE-1.7 42,0%. Dit is de kopregel, en FrontierCode is Cognition's eigen benchmark — Cognition schrijft de taken samen met meer dan twintig opensource-onderhouders, beheert de ranglijst en beoordeelt de inzendingen. Niets daarvan maakt de cijfers onjuist; het hoort allemaal in de zin waarin je ze herhaalt.
• DeepSWE 1.1 — SWE-2 73,0%, Kimi K3 68,5%, Grok 4.6 67,5%, Claude Fable 5.1 67,4%, GPT-5.6 Sol 72,7%, GPT-6 Astra 74,1%, SWE-1.7 37,7%. De rij waarin SWE-2 een frontiermodel het meest overtuigend ronduit verslaat.
• Terminal-Bench 2.1 — SWE-2 92,8%, Kimi K3 88,3%, Grok 4.6 88,4%, Claude Fable 5.1 91,4%, GPT-5.6 Sol 88,8%, GPT-6 Astra 89,9%, SWE-1.7 81,5%. SWE-2's best ogende cijfer, en de huidige editie van Terminal-Bench is niet 2.1.
• Terminal-Bench 4 — SWE-2 27,3%, Kimi K3 21,5%, Grok 4.6 20,3%, Claude Fable 5.1 55,8%, GPT-5.6 Sol 37,3%, GPT-6 Astra 57,9%, SWE-1.7 7,6%. De rij die het minst wordt aangehaald, en degene waarin het model ongeveer 28 punten achter de frontier ligt.
De vergelijking heeft ook nog één stukje context nodig, want het verklaart waar de ongebruikelijke vorm van de frontier-rij vandaan komt. In zijn eigen voetnoot bij de grafieken merkt Cognition op dat de max-effort-instelling van Fable 5.1 op FrontierCode 1.1 Main 50,3% scoort bij $12,83 per taak — onder zijn eigen medium-instelling op 50,9% en $3,28. Meer inspanning leverde een lagere score op tegen ongeveer vier keer de kosten. Dat is de curve van het frontier-model die naar zichzelf terugbuigt, en het is mede de reden waarom 50,0% tegenover 50,9% dichter bij elkaar ligt dan de twee getallen op zichzelf suggereren.
De betrouwbaarheidscijfers
Cognitions aparte sectie over betrouwbaarheid is het deel van de release dat niets met ranglijsten te maken heeft, en daarin staat dat SWE-2 overall 98,0% van zijn propaganda- en censuurprompts doorstond — 99,8% in het Engels, 95,2% in Vereenvoudigd Chinees en 99,1% in Traditioneel Chinees — en dat uit de contextafhankelijke kwetsbaarheidsevaluatie bleek dat geen enkele framingconditie een statistisch significante verandering opleverde voor welk getest model dan ook. Dat zijn de oordelen van Cognition, tot stand gekomen met een GPT-5.6 Luna-judge op een set van 145 vragen, en ze zijn door de leverancier gerapporteerd in dezelfde zin als de benchmarks.
De onafhankelijke lezing: die is er nog niet
Met ingang van 28 september 2026 heeft SWE-2 geen vermelding op Artificial? Het zoeken in de modelindex naar het model levert een 404 op. Het enige scorebord dat SWE-2 vermeldt, is FrontierCode, dat eigendom is van Cognition. Daardoor blijven er voor de release alleen door de leverancier gerapporteerde cijfers over, en niets anders, wat geen kritiek is op de cijfers — het is een uitspraak over hoeveel ervan een lezer kan controleren.
Twee specifieke dingen zouden het beslechten, en geen van beide bestaat vandaag. Een run van SWE-2 op Terminal-Bench 4 door een derde partij zou beslissen of dit een frontier-aangrenzend model is dat toevallig goedkoop is, of een snel model dat toevallig een buiten gebruik gestelde editie aanvoert. En elke onafhankelijke reproductie van de FrontierCode-kloof zou je vertellen of de marge van één punt tegen Fable 5.1 een eigenschap van het model is of een eigenschap van het meetinstrument.
Anders dan Cognitions eigen modellen neemt Artificial Analysis Kimi K3 wél mee — en de cijfers van Kimi K3 zijn van derden, waardoor het basismodel de beter onderbouwde helft van deze stack is. Die asymmetrie is de praktische vorm van SWE-2 vandaag: de post-training is het interessante deel en het minst verifieerbare deel; het basismodel is het gedocumenteerde deel en het deel dat je daadwerkelijk kunt aanroepen.

SWE-2 gebruiken, en wat te doen terwijl het niet-geauditeerd is
Als je al voor Devin betaalt, is de beslissing eenvoudig en hangt die niet af van een van de bovenstaande caveats. SWE-2 zit in je product, Cognition zegt dat het per taak minder kost dan het model dat het vervangt, en de efficiëntiecijfers — 58% minder beurten, 81% lagere gemiddelde kosten, een mediane eerste bewerking bij stap 18 in plaats van stap 48 — beschrijven een model dat minder van je tijd verspilt aan gewoon werk. Start het op medium effort aan de eenvoudige kant van je wachtrij, waar Cognitions eigen ontwerp van inspanningsniveaus de kostenwinst plaatst.
Als je een codeermodel kiest van buiten Devin, is het eerlijke standpunt dat SWE-2 geen kandidaat is die je kunt evalueren, omdat er niets is om aan te roepen. Er is geen identifier, geen prijs per token en geen endpoint. Wat je wel kunt evalueren, is het basismodel.

Kimi K3 wordt via OrcaRouter gerouteerd, voor $3,00 per 1M inputtokens en $15,00 per 1M outputtokens zonder markup bovenop het tarief van de provider, een contextvenster van 1M tokens, native tool calling, beeldinvoer en een reasoning-effort-instelling op het hoogste niveau. Dat is de bereikbare helft van deze release: de capaciteit die Cognition als basis voor post-training gebruikte, beschikbaar via één OpenAI-compatibel endpoint in plaats van via het agentproduct van één leverancier. En omdat het hoe dan ook niet-geauditeerd terrein is, kun je er een fallbackketen achter zetten, zodat een model dat je aan het uitproberen bent niet op de dag dat het je teleurstelt een productieafhankelijkheid wordt.
Wat SWE-2 je vertelt, als je het leest als bewijs en niet als een productpagina, is smaller en nuttiger dan de kop: een goed uitgevoerde RL-ronde bovenop Kimi K3 verhoogde het niveau met ongeveer vijf punten op vier benchmarks zonder de vorm te veranderen, en had 58% minder beurten nodig om dat te doen. Dat is een echt resultaat binnen Devin. Het is nog geen resultaat dat iemand buiten Cognition heeft gereproduceerd, en de enige benchmark waarop SWE-2 alles lijkt te verslaan, is degene waarop het vakgebied is gestopt met scoren.
