
Cognition SWE-2: chi lo realizza, in quale harness viene eseguito e cosa dicono davvero i numeri
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 316 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 196 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
Cognition SWE-2 è un modello di coding realizzato da Cognition, l'azienda dietro Devin, ed è servito all'interno di Devin anziché tramite un'API del modello: il post di lancio di Cognition stesso afferma che SWE-2 è disponibile prima in Devin Desktop e Devin CLI, con un rilascio successivo su Devin Web e Fusion. È stato post-addestrato a partire da Kimi K3, il modello da 2,8 trilioni di parametri di Moonshot AI. Questa è l'intera risposta alla domanda che la maggior parte delle persone si sta effettivamente ponendo quando arriva qui, e vale la pena affermarla prima di ogni altra cosa, perché una quota misurabile delle ricerche che portano a questa pagina aggiunge una quarta parola — Devin — e attribuisce il modello a Devin anziché a Cognition. Devin è l'agente che Cognition vende. SWE-2 è il modello che Cognition ha addestrato per funzionare al suo interno.
Questa pagina è una pagina di riferimento, non un resoconto di lancio. SWE-2 è stato rilasciato il 10 settembre 2026, che ormai è più di una settimana fa; la data serve a collocare il modello nel tempo, non a riportare un evento. Quanto segue è ciò che è documentato, chi lo ha documentato e ciò che nessuno ha ancora verificato.
Chi produce SWE-2, e perché l'attribuzione continua a slittare
La confusione non è infondata. Cognition non vende SWE-2 come un laboratorio vende un modello API. Non esiste una scheda del modello con una finestra di contesto, nessun prezzo per token pubblicato, nessun identificatore da passare nel corpo di una richiesta. Esiste un prodotto — Devin — e il modello arriva come parte di esso. La prosa di Cognition stessa rafforza la fusione: il post di lancio è scritto dal punto di vista di Devin, la tabella di benchmark non è spiegata per chiunque non abbia già letto il precedente lavoro FrontierCode dell'azienda, e la riga sulla disponibilità nomina Devin quattro volte e Cognition una — nella firma.
Quindi, in parole povere: Cognition produce SWE-2.Cognition produce Dev. Le due cose non sono la stessa cosa, ma al momento non puoi avere l'una senza l'altra. Non si tratta nemmeno di un caso isolato di denominazione. Cognition ha pubblicato una serie di modelli di ingegneria del software con il prefisso SWE — SWE-1.5, SWE-1.6 e ora SWE-2, con un checkpoint SWE-1.6 Preview nel mezzo — accanto a strumenti più mirati come SWE-grep e SWE-check. Il prefisso è l'abbreviazione usata dall'azienda per ingegneria del software, e precede di circa un anno tutti i modelli citati in questo paragrafo.
Il nome: un modello, non un benchmark
Questa è la seconda ragione per cui chi cerca attribuisce SWE-2 al proprietario sbagliato, e merita un paragrafo a sé anziché una nota a piè di pagina.
SWE-bench è un benchmark. È una valutazione indipendente mantenuta dal team di SWE-bench, ospitata su swebench.com, e viene distribuita in diverse edizioni: il set originale di 2.294 istanze tratte da issue reali di GitHub, più i sottoinsiemi Verified, Lite, Multilingual e Multimodal. Viene utilizzato per valutare gli agenti di coding in generale, Devin incluso — Cognition ha pubblicato un technical report su Devin su SWE-bench già a marzo 2024, che si trova ancora sul suo blog.
SWE-2 è un modello. Non è un'edizione di SWE-bench, e non è l'abbreviazione di nulla del genere. Non esiste SWE-bench 2: la famiglia pubblicata comprende SWE-bench, Verified, Lite, Multilingual e Multimodal, e la numerazione di versione esistente appartiene ai sottoinsiemi del benchmark, non a un successore numerato. Il benchmark di riferimento di Cognition per questi modelli si chiama FrontierCode, che è uno strumento del tutto diverso e, come spiega la sezione successiva, di proprietà di Cognition.
Se sei arrivato qui aspettandoti una seconda generazione della valutazione SWE-bench, è tutto qui il fraintendimento.
Data di rilascio e come viene distribuito SWE-2
Il post di annuncio di Cognition riporta una firma del 10 settembre 2026, e i dati strutturati della pagina stessa indicano il timestamp di pubblicazione come 2026-09-10. Entrambi concordano. SWE-2 era disponibile in Devin Desktop e Devin CLI in quella data, con Devin Web e Fusion a seguire.
Questa è la superficie di distribuzione, ed è l'intera superficie di distribuzione. Non ci sono pesi aperti — nulla su Hugging Face da Cognition per questo modello — e nessun endpoint ospitato dal fornitore che accetti un identificatore SWE-2. Se il tuo harness è il tuo, SWE-2 non è un componente che puoi installarvi oggi. Se il tuo harness è Devin, SWE-2 è già davanti a te.
Per chiunque abbia bisogno dell'envelope del modello base anziché di quello di SWE-2, Kimi K3 è una cosa separata e meglio documentata, ed è instradato su OrcaRouter come kimi/kimi-k3 — un'unica API per oltre 200 modelli al prezzo di listino del provider, senza ricarichi. Questo qui conta per una ragione specifica: la capacità sottostante da cui Cognition è partita è raggiungibile in modo indipendente, anche se il modello post-addestrato non lo è.
L'involucro: cosa documenta Cognition, e cosa no
Una pagina di riferimento dovrebbe essere onesta riguardo alla forma delle proprie evidenze, ed è qui che quelle di SWE-2 sono più esili.
• Sforzo di ragionamento — tre livelli documentati: medium, high e max. Cognition scrive che i livelli si comportano diversamente per progettazione: medium passa all'azione prima e gestisce lavoro semplice e intermedio, mentre high e max pianificano di più, esplorano di più la codebase e spendono di più in verifica.
• Distribuzione — Devin Desktop e Devin CLI al lancio, Devin Web e Fusion in roll-out graduale. Nessuna API, nessun peso, nessun percorso self-host.
• Modello di base — Kimi K3, descritto da Cognition come un modello da 2,8T di parametri che era già stato sottoposto a un ampio RL per il coding agentico. Il paper su Kimi K3 assegna a quella base una finestra di contesto di 1M di token e una visione nativa.
• Finestra di contesto, output massimo, modalità, numero di parametri post-addestrati — non pubblicati per SWE-2. L'annuncio di Cognition non dice nulla su nessuno di essi, e nessun'altra pagina di Cognition colma la lacuna.
La distinzione in quell'ultima riga non è pedanteria. La finestra da un milione di token di Kimi K3 è un fatto relativo a Kimi K3. Cognition non dice che SWE-2 la erediti, e il post-addestramento con una ricetta diversa è esattamente il tipo di cambiamento che può alterare ciò che un modello accetta. Se ti serve un numero di finestra di contesto per la pianificazione, il numero che puoi verificare appartiene al modello di base, e dovresti considerare quello di SWE-2 come sconosciuto anziché presumere che i due coincidano.

Il listino prezzi, nell'unica valuta in cui Cognition fa preventivi
Non esiste un prezzo per token per SWE-2, perché non esiste un endpoint SWE-2. La rivendicazione di costo di Cognition è espressa diversamente: afferma che SWE-2 si colloca entro un punto da Claude Fable 5.1 su FrontierCode 1.1 Main — 50,0% contro 50,9% — pur essendo il 64% più economico. Leggi attentamente l'unità di misura. Il 64% è la media dei dollari statunitensi spesi per rollout su FrontierCode, una cifra a livello di attività che raggruppa il modello, l'harness, lo scaffolding e lo stack di servizio di Cognition in un'unica fattura. Non è una tariffa per token e non può essere confrontata con una.
Il listino prezzi che esiste davvero è quello di Devin. Sulla pagina dei prezzi di Devin, consultata il 28 settembre 2026: Free a 0 $, Pro a 20 $ al mese, Max a 200 $ al mese, Teams a 80 $ al mese più 40 $ per ogni postazione sviluppatore completa. La riga SWE-2 si trova in Pro e reca una data — "Uso gratuito di SWE-2 — Gratuito in Devin Desktop e CLI fino al 10 ottobre 2026". Si tratta di una finestra promozionale a cui restano circa due settimane, ed è l'unico dato di SWE-2 su quella pagina che sia davvero legato a una scadenza temporale: il costo del modello all'interno di Devin dopo il 10 ottobre non è indicato lì.
I numeri di efficienza di Cognition meritano di essere citati accanto alla dichiarazione sui costi, e sono dichiarati dal fornitore come tutto il resto in questa pagina. Su FrontierCode 1.1 Main, SWE-2 con impegno medio ottiene un punteggio superiore a SWE-1.7, pur impiegando il 58% di turni in meno e costando in media l'81% in meno. Il numero medio di passaggi per esecuzione scende da 127 su SWE-1.7 a 53 con impegno medio, 80 con impegno alto e 98 con impegno massimo, e la mediana della prima modifica reale al codice passa dal passaggio 48 al passaggio 18.
I benchmark, con l'harness allegato
I punteggi di ingegneria del software sono insolitamente sensibili allo scaffold in cui sono stati prodotti, quindi un numero senza il suo harness non è un numero. Cognition dichiara la propria politica sull'harness nell'appendice metodologica dell'annuncio: i risultati vengono riportati da fonti pubbliche laddove ne esista una e, in caso contrario, eseguiti sul framework di valutazione interno di Cognition utilizzando l'harness per cui ciascun modello è stato principalmente sviluppato — Claude Code per i modelli Anthropic, Codex per i modelli OpenAI, Grok Build per i modelli xAI e Devin CLI per i modelli open-weight. Per ogni modello, Cognition riporta il punteggio migliore tra le varie impostazioni di sforzo di ragionamento.
Ne derivano due conseguenze, ed entrambe vanno dette insieme ai numeri. Primo, diverse righe non sono omogenee: un dato di Fable 5.1 prodotto in Claude Code e un dato di Kimi K3 prodotto in Devin CLI sono misurazioni di due sistemi di agenti diversi, non di due modelli in un ambiente neutrale. Secondo, "miglior punteggio tra le impostazioni di effort" significa che ogni cella è il caso migliore di un modello, non un'impostazione abbinata. Un confronto che mantenesse costante l'effort apparirebbe diverso, e Cognition non ne ha pubblicato uno.
Tutte e quattro le righe seguenti sono dichiarate dal fornitore e non verificate.
• FrontierCode 1.1 Main — SWE-2 50.0%, Kimi K3 44.2%, Grok 4.6 48.0%, Claude Fable 5.1 50.9%, GPT-5.6 Sol 47.5%, GPT-6 Astra 53.3%, SWE-1.7 42.0%. Questa è la riga di apertura, e FrontierCode è il benchmark di Cognition stessa — Cognition scrive i task insieme a più di 20 manutentori open-source, gestisce la classifica e valuta le candidature. Nulla di tutto ciò rende sbagliati i numeri; tutto ciò va inserito nella frase in cui li ripeti.
• DeepSWE 1.1 — SWE-2 73.0%, Kimi K3 68.5%, Grok 4.6 67.5%, Claude Fable 5.1 67.4%, GPT-5.6 Sol 72.7%, GPT-6 Astra 74.1%, SWE-1.7 37.7%. La riga in cui SWE-2 batte più credibilmente un modello di frontiera, nettamente.
• Terminal-Bench 2.1 — SWE-2 92.8%, Kimi K3 88.3%, Grok 4.6 88.4%, Claude Fable 5.1 91.4%, GPT-5.6 Sol 88.8%, GPT-6 Astra 89.9%, SWE-1.7 81.5%. Il numero più bello di SWE-2, e l'edizione attuale di Terminal-Bench non è la 2.1.
• Terminal-Bench 4 — SWE-2 27.3%, Kimi K3 21.5%, Grok 4.6 20.3%, Claude Fable 5.1 55.8%, GPT-5.6 Sol 37.3%, GPT-6 Astra 57.9%, SWE-1.7 7.6%. La riga citata meno di tutte, e quella in cui il modello si colloca circa 28 punti dietro la frontiera.
Il confronto necessita anche di un ulteriore elemento di contesto, perché spiega da dove deriva la forma insolita della riga della frontiera. La nota a piè di pagina di Cognition ai propri grafici rileva che l'impostazione di massimo sforzo di Fable 5.1 su FrontierCode 1.1 Main ottiene il 50,3% a 12,83 $ per attività — al di sotto della sua stessa impostazione media al 50,9% e 3,28 $. Maggiore sforzo ha prodotto un punteggio inferiore a circa quattro volte il costo. È la curva del modello di frontiera che si ripiega su se stessa, ed è parte del motivo per cui 50,0% contro 50,9% è più vicino di quanto i due numeri da soli suggeriscano.
I numeri di affidabilità
La sezione separata sull'affidabilità di Cognition è la parte del rilascio che non ha nulla a che fare con le classifiche, e riporta che SWE-2 ha superato il 98,0% dei suoi prompt di propaganda e censura nel complesso — 99,8% in inglese, 95,2% in cinese semplificato e 99,1% in cinese tradizionale — e che la sua valutazione della vulnerabilità dipendente dal contesto non ha rilevato alcuna condizione di inquadramento in grado di produrre un cambiamento statisticamente significativo per nessuno dei modelli testati. Quelli sono i giudizi di Cognition, prodotti con un giudice GPT-5.6 Luna su un set di 145 domande, e sono dichiarati dal fornitore nello stesso senso in cui lo sono i benchmark.
La lettura indipendente: non ce n'è ancora una.
Al 28 settembre 2026, SWE-2 non ha alcuna voce su Artificial Analysis. Cercando il nome nell'indice dei modelli non si ottiene nulla, e una richiesta diretta alla pagina del modello restituisce un 404. L'unica classifica che riporta SWE-2 è FrontierCode, che appartiene a Cognition. Questo lascia la release con numeri dichiarati dal fornitore e nulla più, il che non è una critica ai numeri — è un'affermazione su quanto di essi un lettore possa verificare.
Due cose specifiche lo risolverebbero, e nessuna delle due esiste oggi. Un'esecuzione di SWE-2 su Terminal-Bench 4 condotta da terzi deciderebbe se questo sia un modello vicino alla frontiera che per caso costa poco, oppure un modello veloce che per caso guida un'edizione ritirata. E qualsiasi riproduzione indipendente del divario di FrontierCode ti direbbe se il margine di un punto su Fable 5.1 è una proprietà del modello o una proprietà dello strumento.
A differenza dei modelli propri di Cognition, Artificial Analysis include Kimi K3 — e i dati di Kimi K3 sono di terze parti, il che rende il modello base la metà meglio supportata da evidenze di questo stack. Questa asimmetria è la forma concreta di SWE-2 oggi: il post-train è la parte interessante e la meno verificabile; la base è la parte documentata e quella che puoi effettivamente chiamare.

Usare SWE-2 e cosa fare mentre non è ancora sottoposto a revisione
Se paghi già per Devin, la decisione è facile e non dipende da nessuna delle avvertenze di cui sopra. SWE-2 è nel tuo prodotto, Cognition afferma che costa meno per attività rispetto al modello che sostituisce, e i dati di efficienza — 58% in meno di turni, 81% in meno di costo medio, una prima modifica mediana al passo 18 invece che al passo 48 — descrivono un modello che spreca meno del tuo tempo nelle attività ordinarie. Avvialo a impegno medio sulla parte semplice della tua coda, che è dove la progettazione dei livelli di impegno di Cognition stessa posiziona il vantaggio di costo.
Se stai scegliendo un modello di programmazione al di fuori di Devin, la posizione onesta è che SWE-2 non è un candidato che puoi valutare, perché non c'è nulla da chiamare. Non esiste un identificatore, né un prezzo per token, né un endpoint. Quello che puoi valutare è il modello di base.

Kimi K3 è instradato su OrcaRouter, a 3,00 $ per 1M di token di input e 15,00 $ per 1M di token di output, senza alcun ricarico rispetto alla tariffa del provider, una finestra di contesto di 1M di token, tool calling nativo, input di immagini e un controllo di primo livello dello sforzo di ragionamento. Questa è la metà raggiungibile di questo rilascio: la capacità su cui Cognition ha fatto post-training, disponibile tramite un unico endpoint compatibile con OpenAI anziché tramite il prodotto agent di un singolo fornitore. E poiché in ogni caso si tratta di territorio non verificato, puoi mettere una catena di fallback alle sue spalle, così che un modello che stai provando non diventi una dipendenza di produzione il giorno in cui ti delude.
Ciò che SWE-2 ti dice, se lo leggi come prova invece che come pagina di prodotto, è più circoscritto e più utile di quanto dica il titolo: una passata di RL ben eseguita sopra Kimi K3 ha spostato il livello di circa cinque punti su quattro benchmark senza cambiarne la forma, e ha impiegato il 58% in meno di turni per farlo. Questo è un risultato reale all'interno di Devin. Non è ancora un risultato che qualcuno al di fuori di Cognition abbia riprodotto, e l'unico benchmark in cui SWE-2 sembra battere tutto è quello su cui il settore ha smesso di assegnare punteggi.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
