Scheda del titolo per Cognition SWE-2 che mostra un sottotitolo recitante «Un post-train di Kimi K3, 50,0% su FrontierCode 1.1 Main a un costo inferiore del 64%», con tre schede: FrontierCode 1.1 Main 50,0%, vs Claude Fable 5.1 50,9%, e Costo per rollout inferiore del 64%.
Guides & Insights

Cognition SWE-2: Coding adiacente alla frontiera con il 64% di sconto, e la trappola dei benchmark sottostante

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Cognition SWE-2 è stato rilasciato questa settimana con un numero fatto per viaggiare: 50,0% su FrontierCode 1.1 Main, a un punto da Claude Fable 5.1 al 50,9%, per il 64% in meno di costo. Il modello è un post-train di Kimi K3 di Moonshot AI — la base open-weight da 2,8 trilioni di parametri — e Cognition afferma che il suo apprendimento per rinforzo ha aggiunto 5–6 punti su diversi benchmark. Entrambi i numeri sono dichiarati dal fornitore stesso, e nessuno dei due è stato riprodotto in modo indipendente. Il secondo, però, è l'affermazione che dovrebbe cambiare il modo in cui leggi il primo, perché "più cinque o sei" finisce per descrivere quasi tutto ciò che SWE-2 fa, compresi i punti in cui perde malamente.

Non è una critica. È la cosa più utile di questa pubblicazione, ed è la parte che quasi nessuna delle coperture del lancio dice apertamente.

Cosa ha effettivamente rilasciato Cognition

SWE-2 è il modello di coding di Devin, non un modello API generico con un listino prezzi. È stato rilasciato disponibile a partire da oggi in Devin Desktop e CLI, stando alle parole di Cognition stessa, con il rollout in corso su Devin Web e Fusion. La copertura di terze parti data l'annuncio al 10 settembre 2026; la firma sul post del blog di Cognition riporta 09.11.26. In ogni caso risale a pochi giorni fa. I pesi sono proprietari e non esiste una tariffa pubblicata per token. Se vuoi usare SWE-2, lo usi all'interno di Devin.

La base è Kimi K3, un modello Mixture-of-Experts da 2,8 trilioni di parametri con circa 104 miliardi di parametri attivi per token — circa tre volte la dimensione della base di SWE-1.7. Cognition osserva che K3 era già stato pesantemente addestrato con RL per il coding agentico prima di arrivare a quel punto, e che il suo stesso RL "trova ancora un margine sostanziale". Ciò rispecchia il pattern di SWE-1.7, che è stato post-addestrato su una base Kimi allo stesso modo.

Ecco il dettaglio che conta più di qualsiasi singolo punteggio di benchmark: FrontierCode è il benchmark di Cognition. L'azienda scrive i task — con oltre 20 maintainer open-source, più di 40 ore per task, e ogni maintainer che definisce cosa significa "mergeable" nel proprio repository — gestisce la classifica e valuta le sottomissioni. È un lavoro serio di progettazione della valutazione, ed è anche uno strumento interno. Cognition riporta il migliore punteggio di ciascun modello tra le varie impostazioni di reasoning-effort, e secondo la sua stessa appendice metodologica i modelli open-weight di confronto, incluso Kimi K3, sono stati eseguiti all'interno della Devin CLI di Cognition. Niente di tutto ciò rende sbagliati i numeri. Tutto ciò va inserito nella frase in cui li ripeti.

Two-column scoreboard headed 'Cognition SWE-2 vs Claude Fable 5.1'. Left column Cognition SWE-2: FrontierCode 1.1 Main 50.0%, Terminal-Bench 2.1 92.8%, Terminal-Bench 4 27.3%, Cost per rollout 64% lower, Base model Kimi K3 2.8T, Independent eval none yet. Right column Claude Fable 5.1: FrontierCode 1.1 Main 50.9%, Terminal-Bench 2.1 91.4%, Terminal-Bench 4 55.8%, Cost per rollout baseline, Base model proprietary, Independent eval third-party scored.

Leggere onestamente la tabella di benchmark

Quattro benchmark, tutti riportati dai fornitori. Ecco cosa dice effettivamente ciascuno, una riga per voce.

• FrontierCode 1.1 Main — SWE-2 50,0%, contro Kimi K3 44,2%, Grok 4.6 48,0%, GPT-5.6 Sol 47,5%, Claude Fable 5.1 50,9%, GPT-6 Astra 53,3%, SWE-1.7 42,0%. A un punto dalla frontiera, davanti a tutto il resto della tabella.

• DeepSWE 1.1 — SWE-2 73,0%, davanti a Claude Fable 5.1 al 67,4% e a Grok 4.6 al 67,5%, dietro GPT-6 Astra al 74,1%. Questa è la riga in cui SWE-2 batte in modo più credibile e nettamente un modello di frontiera.

• Terminal-Bench 2.1 — SWE-2 92,8%, il punteggio più alto nella tabella di Cognition, davanti a Claude Fable 5.1 al 91,4% e GPT-6 Astra all'89,9%. Questo è il numero che compare nella maggior parte dei titoli di lancio.

• Terminal-Bench 4 — SWE-2 27,3%, contro Claude Fable 5.1 al 55,8% e GPT-6 Astra al 57,9%. Un divario di circa 28 punti, e la riga che viene citata meno di tutte.

L'obiezione ovvia è che tutti calano su Terminal-Bench 4 — è un successore più difficile e con un orizzonte più lungo, quindi è ovvio che i punteggi scendano. La parte interessante è di quanto, e il calo non è proporzionale. Passando da Terminal-Bench 2.1 a 4, Claude Fable 5.1 perde circa 35,6 punti e GPT-6 Astra circa 32,0. SWE-2 perde circa 65,5, e la sua base Kimi K3 circa 66,8. Quindi sul lavoro agentico a lungo orizzonte, SWE-2 non si limita a stare sotto i modelli di frontiera — degrada circa due volte più in fretta di loro quando il compito si protrae a lungo.

Se Terminal-Bench 4 sia la versione "live" è una cosa che vale la pena dire chiaramente: è l'edizione attuale, e 2.1 è quella superata. La riga in cui SWE-2 è in testa è quella del benchmark ritirato. La riga in cui è indietro è quella attuale. Entrambi i fatti sono veri, e la copertura del lancio tendeva a sceglierne uno.

"Kimi K3 più cinque" — l'euristica che prevede i punteggi che nessuno ha pubblicato

Metti a confronto i quattro benchmark con il modello base di SWE-2 stesso e ne emerge qualcosa di quasi meccanico. Rispetto a Kimi K3, SWE-2 guadagna 5,8 punti su FrontierCode 1.1 Main, 4,5 su DeepSWE 1.1, 4,5 su Terminal-Bench 2.1 e 5,8 su Terminal-Bench 4.

Quattro benchmark, quattro divari, tutti tra 4,5 e 5,8. Il post-addestramento ha spostato il livello, non la forma. Laddove K3 è forte, SWE-2 è forte con circa cinque in più. Laddove K3 è debole — Terminal-Bench 4 è il caso evidente — SWE-2 è debole con circa cinque in più.

Questo ti fornisce una previsione operativa per qualsiasi attività che Cognition non ha valutato con benchmark, cioè la maggior parte di esse. Cerca le prestazioni di Kimi K3 sul tuo carico di lavoro, aggiungi cinque punti e ottieni una stima di SWE-2 migliore di quella che ti darà qualsiasi numero di punta. Spiega anche la vera tesi del rilascio: Cognition non sostiene di aver superato la frontiera. Sostiene di aver spostato verso l'esterno l'intera curva costo-prestazioni, rimanendo a una distanza fissa dietro il miglior modello su qualunque asse si misuri.

Il 64% è reale, ma non puoi comprarlo

"64% più economico di Claude Fable 5.1" è un'affermazione vera riguardo a una misurazione specifica — e la misurazione è la media dei dollari statunitensi spesi per rollout su FrontierCode, non un prezzo per token. Non esiste una tariffa per token per SWE-2 perché non esiste un'API SWE-2. L'affermazione sui costi descrive quanto costa un'attività all'interno di Devin, che raggruppa il modello, l'harness, lo scaffolding e lo stack di serving di Cognition in un'unica fattura.

Questa distinzione conta davvero. Non puoi confrontare il costo di SWE-2 con un prezzo per token di un altro fornitore, perché non sono la stessa unità. E non puoi portare SWE-2 altrove: pesi proprietari, un solo fornitore, un solo prodotto agente. Il dato "fino al 70% di costo in meno" in alcune analisi è il valore più alto dell'intervallo che Cognition cita tra i benchmark; il dato di FrontierCode 1.1 Main è 64%.

I numeri sull'efficienza sono, semmai, il dato più concreto, e anche questi sono dichiarati dal fornitore. SWE-2 a sforzo medio supera il punteggio FrontierCode di SWE-1.7 usando il 58% in meno di turni e costando in media l'81% in meno. I passaggi medi per esecuzione scendono da 127 su SWE-1.7 a 53 con sforzo medio (80 con sforzo alto, 98 con sforzo massimo), e la mediana della prima modifica reale al codice passa dal passaggio 48 al passaggio 18. Questa è una risposta diretta alla critica secondo cui SWE-1.7 esplorava troppo i compiti semplici, ed è il tipo di miglioramento che si vede in fattura molto prima di un divario di un punto in un benchmark.

Screenshot of Cognition's official SWE-2 announcement blog post, headed 'Introducing SWE-2: Pushing the Pareto Frontier', bylined 09.11.26, showing the opening claim of 50.0% on FrontierCode 1.1 Main within one point of Fable 5.1 while being 64% cheaper, and a cost-versus-solve-rate Pareto chart labelling the medium, high and max effort levels.

Il trucco di addestramento è la vera notizia

Togli il posizionamento in classifica e qui c’è un pezzo di ingegneria davvero innovativo, ed è per questo che il rilascio vale la pena di essere letto anche se non aprirai mai Devin.

Cognition ha addestrato tutti e tre i livelli di sforzo di ragionamento — medio, alto e massimo — in unasingola sessione di RL. Il meccanismo è una penalità di costo lineare per livello di sforzo, ciascuna calibrata per corrispondere alla pendenza della curva di Pareto costo-prestazioni del modello base stesso in quel punto. L'argomentazione di Cognition sul perché la penalità debba essere lineare è il punto interessante: solo una penalità lineare mantiene l'obiettivo di addestramento una funzione del costo medio e del tasso di risoluzione soltanto, anziché qualcosa che dipende dalla forma della distribuzione.

L'approccio usuale addestra i livelli di sforzo separatamente, oppure vi aggiunge un checkpoint più economico in seguito. Addestrarli insieme in un'unica esecuzione è ciò che consente all'azienda di affermare di aver fatto avanzare l'intera frontiera anziché un solo punto su di essa. Modifiche di supporto: una baseline di ricompensa ponderata per la lunghezza, la triplicazione del numero di ambienti RL, overlay di aderenza alle istruzioni e un volano che utilizza checkpoint SWE-2 precedenti per irrobustire i verificatori contro il reward hacking. Sul lato serving, kernel NVFP4 e FP8 con addestramento consapevole della quantizzazione, un modello draft di decodifica speculativa DSpark riaddestrato per lunghezze di accettazione maggiori del 15%, e un ritardatore di prefill che vale un 10–20% sul throughput per GPU al costo di un peggior tempo al primo token.

Se esegui il post-training, quella ricetta è la parte trasferibile di questa release. Se non lo fai, la lezione è più semplice: il motivo per cui SWE-2 è economico non è che sia un modello più piccolo. È che il costo del suo utilizzo è stato scritto nella funzione di ricompensa.

Se vuoi la capacità di Kimi K3 al di fuori di Devin

SWE-2 non è su OrcaRouter, e non lo sarà — pesi proprietari, nessuna API, distribuzione solo tramite Devin. Il suo modello di base è una situazione diversa. Kimi K3 è instradato su OrcaRouter come kimi/kimi-k3, a $3,00 per 1M di token in input e $15,00 per 1M di token in output, senza alcun ricarico rispetto alla tariffa del provider, con una finestra di contesto da 1M di token, invocazione nativa degli strumenti, input di immagini e profondità di ragionamento controllata tramite un parametro di primo livello reasoning_effort invece delle impostazioni di campionamento.

Questa è la versione onesta della conclusione pratica di questo rilascio. SWE-2 ti mostra come appare un passaggio di RL ben eseguito sopra K3 al vertice della sua gamma — un incremento reale da 4,5 a 5,8 punti, oltre a notevoli guadagni di efficienza, a un costo reale. Quello che non ti dà è un modello che puoi chiamare. Se vuoi indirizzare la capacità sottostante verso il tuo codice, il tuo harness o la tua pipeline, K3 è la parte di questo stack che puoi effettivamente raggiungere, ed è raggiungibile tramite un unico endpoint compatibile con OpenAI.

È anche la metà più sicura della scommessa, finché i numeri non sono verificati. I benchmark di SWE-2 sono di Cognition stessa e nessuno al di fuori dell'azienda li ha riprodotti. Quelli di Kimi K3 sono quelli su cui si basa effettivamente il confronto — e se passi attraverso OrcaRouter puoi mettergli dietro una catena di fallback, così un modello che stai testando non diventa una dipendenza di produzione il giorno in cui ti delude.

Screenshot of the OrcaRouter model page for Kimi K3, showing model ID kimi/kimi-k3, input $3.00 per 1M tokens, output $15.00 per 1M tokens, cache read $0.300, 1M-token context, text and image input, p50 time-to-first-token of 9.85 seconds, and 2,739.4M tokens of traffic over 7 days.

Chi dovrebbe agire, e cosa risolverebbe la questione

Se paghi già per Devin, SWE-2 è chiaramente una buona notizia: sta arrivando nel tuo prodotto, costa meno per attività rispetto a ciò che sostituisce, e i numeri sull'efficienza suggeriscono che sprecherà meno turni sul lavoro facile. Provalo prima nella parte semplice della tua coda — il design basato sui livelli di effort significa che è nel livello medio che si trova il vantaggio di costo.

Se stai scegliendo dall'esterno un modello per il coding, aspetta una valutazione indipendente. Non ce n'è ancora una: Artificial Analysis non ha alcuna voce per SWE-2, e la classifica FrontierCode è uno strumento di Cognition stessa. Tre cose risolverebbero la questione. Un'esecuzione di SWE-2 da parte di terzi su Terminal-Bench 4, che è la riga che decide se si tratta di un modello adiacente alla frontiera o di uno veloce. Qualsiasi riproduzione indipendente del divario di FrontierCode. E un prezzo per token, che richiederebbe che Cognition venda il modello al di fuori di Devin — l'unico cambiamento che renderebbe il 64% confrontabile con qualsiasi altro prezzo ti venga quotato.

Fino ad allora, il riepilogo equo è quello che il divario del modello di base già ti offre. SWE-2 è Kimi K3 più cinque punti, a un costo che Cognition ha progettato nella funzione di ricompensa. È un vero risultato nell'addestramento e un affare davvero buono all'interno di Devin. Non è ancora un modello di frontiera, e l'unico benchmark in cui sembra battere tutto è quello che ha smesso di contare.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno