
Cognition SWE-2: Codificação Adjacente à Fronteira com 64% de Desconto, e a Armadilha de Benchmark Subjacente
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 por 1M de tokens
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Cognition SWE-2 foi lançado esta semana com um número feito para circular: 50,0% no FrontierCode 1.1 Main, a um ponto do Claude Fable 5.1 com 50,9%, por 64% menos dinheiro. O modelo é um pós-treino do Kimi K3 da Moonshot AI — a base de pesos abertos de 2,8 trilhões de parâmetros — e a Cognition afirma que seu aprendizado por reforço adicionou 5–6 pontos em vários benchmarks. Ambos os números são do próprio fornecedor, e nenhum foi reproduzido de forma independente. O segundo, porém, é a afirmação que deve mudar a forma como você lê o primeiro, porque "mais cinco ou seis" acaba descrevendo quase tudo o que o SWE-2 faz, inclusive os lugares onde ele perde feio.
Isso não é uma crítica. É a coisa mais útil deste lançamento, e é a parte que quase nenhuma das coberturas de lançamento diz em voz alta.
O que a Cognition realmente lançou
O SWE-2 é o modelo de programação da Devin, não um modelo de API de uso geral com uma tabela de preços. Ele foi lançado disponível a partir de hoje no Devin Desktop e na CLI, nas palavras da própria Cognition, com implantação em andamento no Devin Web e no Fusion. A cobertura de terceiros data o anúncio em 10 de setembro de 2026; a assinatura no próprio post do blog da Cognition indica 09.11.26. De qualquer forma, tem apenas alguns dias. Os pesos são proprietários e não há tabela de preços por token publicada. Se você quiser usar o SWE-2, você o usa dentro do Devin.
A base é o Kimi K3, um modelo Mixture-of-Experts de 2,8 trilhões de parâmetros, com aproximadamente 104B parâmetros ativos por token — cerca de três vezes o tamanho da base do SWE-1.7. A Cognition observa que o K3 já tinha sido intensamente treinado com RL para codificação agêntica antes de chegar lá, e que seu próprio RL "ainda encontra margem substancial". Isso espelha o padrão do SWE-1.7, que também foi pós-treinado sobre uma base Kimi.
Aqui está o detalhe que importa mais do que qualquer pontuação individual de benchmark: FrontierCode é o benchmark da Cognition. A empresa escreve as tarefas — com mais de 20 mantenedores de código aberto, mais de 40 horas por tarefa, cada mantenedor definindo o que "mesclável" significa em seu próprio repositório —, administra o ranking e avalia as submissões. É um trabalho sério de design de avaliação, e também é um instrumento interno. A Cognition relata a melhor pontuação de cada modelo em diferentes configurações de esforço de raciocínio e, de acordo com seu próprio apêndice de metodologia, os modelos de comparação de pesos abertos, incluindo o Kimi K3, foram executados dentro da Devin CLI da Cognition. Nada disso torna os números errados. Tudo isso pertence à frase em que você os repete.

Lendo a tabela de benchmark honestamente
Quatro benchmarks, todos reportados pelos fornecedores. Aqui está o que cada um realmente diz, uma linha por linha.
• FrontierCode 1.1 Main — SWE-2 50,0%, contra Kimi K3 44,2%, Grok 4.6 48,0%, GPT-5.6 Sol 47,5%, Claude Fable 5.1 50,9%, GPT-6 Astra 53,3%, SWE-1.7 42,0%. A um ponto da fronteira, à frente de todo o resto na tabela.
• DeepSWE 1.1 — SWE-2 73,0%, à frente do Claude Fable 5.1 com 67,4% e do Grok 4.6 com 67,5%, atrás do GPT-6 Astra com 74,1%. Esta é a linha em que o SWE-2 supera de forma mais credível um modelo de fronteira.
• Terminal-Bench 2.1 — SWE-2 92,8%, a pontuação mais alta na tabela da Cognition, à frente do Claude Fable 5.1 com 91,4% e do GPT-6 Astra com 89,9%. Este é o número na maioria das manchetes de lançamento.
• Terminal-Bench 4 — SWE-2 27,3%, contra Claude Fable 5.1 com 55,8% e GPT-6 Astra com 57,9%. Uma diferença de aproximadamente 28 pontos, e a linha menos citada.
A objeção óbvia é que todos apresentam queda no Terminal-Bench 4 — é um sucessor mais difícil e de horizonte mais longo, então é claro que as pontuações caem. A parte interessante é em quanto, e a queda não é proporcional. Passando do Terminal-Bench 2.1 para o 4, o Claude Fable 5.1 perde cerca de 35,6 pontos e o GPT-6 Astra cerca de 32,0. O SWE-2 perde cerca de 65,5, e seu modelo base Kimi K3 cerca de 66,8. Portanto, em trabalho agêntico de horizonte longo, o SWE-2 não fica apenas abaixo dos modelos de fronteira — ele se degrada aproximadamente duas vezes mais rápido do que eles quando a tarefa se estende.
Se o Terminal-Bench 4 é a versão "live" é algo que vale a pena afirmar claramente: ele é a edição atual, e a 2.1 é a substituída. A linha em que o SWE-2 lidera é o benchmark descontinuado. A linha em que ele fica atrás é o atual. Ambos os fatos são verdadeiros, e a cobertura do lançamento tendia a escolher um.
"Kimi K3 mais cinco" — a heurística que prevê as pontuações que ninguém publicou
Coloque os quatro benchmarks lado a lado com o próprio modelo base do SWE-2 e algo quase mecânico aparece. Em comparação com o Kimi K3, o SWE-2 ganha 5,8 pontos no FrontierCode 1.1 Main, 4,5 no DeepSWE 1.1, 4,5 no Terminal-Bench 2.1 e 5,8 no Terminal-Bench 4.
Quatro benchmarks, quatro lacunas, todas entre 4,5 e 5,8. O pós-treinamento deslocou o nível, não a forma. Onde o K3 é forte, o SWE-2 é forte com cerca de cinco pontos a mais. Onde o K3 é fraco — Terminal-Bench 4 sendo o caso claro — o SWE-2 é fraco com cerca de cinco pontos a mais.
Isso lhe dá uma previsão útil para qualquer tarefa que a Cognition não avaliou por benchmark, que são a maioria delas. Consulte o desempenho do Kimi K3 na sua carga de trabalho, some cinco pontos e você terá uma estimativa melhor do SWE-2 do que qualquer um dos números de manchete lhe dará. Isso também explica a tese real do lançamento: a Cognition não está alegando ter superado a fronteira. Está alegando ter deslocado toda a curva de custo-desempenho para fora, permanecendo a uma distância fixa atrás do melhor modelo em qualquer eixo que você meça.
Os 64% são reais, mas você não pode comprá-los.
"64% mais barato que o Claude Fable 5.1" é uma afirmação verdadeira sobre uma medição específica — e a medição é a média de dólares americanos gastos por rollout no FrontierCode, não um preço por token. Não existe tarifa por token para o SWE-2 porque não existe uma API do SWE-2. A alegação de custo descreve quanto custa uma tarefa dentro do Devin, que agrupa o modelo, o harness, o scaffolding e o stack de serving da Cognition em uma única fatura.
Essa distinção tem peso. Não dá para comparar o custo do SWE-2 com um preço por token de outro fornecedor, porque não são a mesma unidade. E não dá para levar o SWE-2 para outro lugar: pesos proprietários, um fornecedor, um produto de agente. O número de "até 70% menos custo" em algumas matérias é o topo da faixa que a Cognition cita em benchmarks; o número do FrontierCode 1.1 Main é 64%.
Os números de eficiência são, se é que são algo, a história mais prática, e também são reportados pelo fornecedor. O SWE-2 em esforço médio supera a pontuação FrontierCode do SWE-1.7, usando 58% menos turnos e custando, em média, 81% menos. A média de passos por execução cai de 127 no SWE-1.7 para 53 em esforço médio (80 em alto, 98 em máximo), e a mediana da primeira edição real de código passa do passo 48 para o passo 18. Isso é uma resposta direta à crítica de que o SWE-1.7 explorava demais tarefas simples, e é o tipo de melhoria que aparece na sua fatura muito antes de uma diferença de um ponto em um benchmark.

O truque de treinamento é a verdadeira notícia
Deixe de lado o posicionamento no ranking e há aqui uma peça de engenharia genuinamente inédita, e é por isso que o lançamento vale a pena ser lido mesmo que você nunca abra o Devin.
A Cognition treinou todos os três níveis de esforço de raciocínio — médio, alto e máximo — em uma única execução de RL. O mecanismo é uma penalidade de custo linear por nível de esforço, cada uma ajustada para corresponder à inclinação da própria curva de Pareto de custo-desempenho do modelo base naquele ponto. O argumento da Cognition sobre por que a penalidade precisa ser linear é a parte interessante: apenas uma penalidade linear mantém o objetivo de treinamento como uma função apenas do custo médio e da taxa de resolução, em vez de algo que depende da forma da distribuição.
A abordagem usual treina níveis de esforço separadamente, ou acopla um checkpoint mais barato depois. Treiná-los juntos em uma única execução é o que permite à empresa alegar que avançou a fronteira inteira, e não apenas um ponto dela. Mudanças de apoio: uma linha de base de recompensa ponderada por comprimento, a triplicação do número de ambientes de RL, sobreposições de seguimento de instruções e um ciclo virtuoso que usa checkpoints anteriores do SWE-2 para blindar os verificadores contra hacking de recompensa. No lado de serving, kernels NVFP4 e FP8 com treinamento ciente de quantização, um modelo draft de decodificação especulativa DSpark retreinado para comprimentos de aceitação 15% maiores e um mecanismo de atraso de prefill que rende 10–20% de throughput por GPU ao custo de pior tempo até o primeiro token.
Se você faz pós-treinamento, essa receita é a parte transferível deste lançamento. Se não faz, a conclusão é mais simples: o motivo de o SWE-2 ser barato não é o fato de ser um modelo menor. É que o custo de executá-lo foi embutido na função de recompensa.
Se você quiser a capacidade do Kimi K3 fora do Devin
O SWE-2 não está no OrcaRouter, e não estará — pesos proprietários, sem API, distribuição exclusiva pela Devin. Seu modelo base é uma situação diferente. O Kimi K3 é roteado no OrcaRouter como kimi/kimi-k3, a US$ 3,00 por 1M de tokens de entrada e US$ 15,00 por 1M de tokens de saída, sem acréscimo sobre a tarifa do provedor, uma janela de contexto de 1M de tokens, chamada nativa de ferramentas, entrada de imagem e profundidade de raciocínio controlada por meio de um parâmetro reasoning_effort de nível superior em vez de configurações de amostragem.
Essa é a versão honesta da conclusão prática deste lançamento. O SWE-2 mostra como é uma passada de RL bem executada sobre o K3 no topo de sua faixa — um ganho genuíno de 4,5 a 5,8 pontos, além de grandes ganhos de eficiência, a um custo real. O que ele não oferece é um modelo que você possa chamar. Se você quer a capacidade subjacente apontada para o seu próprio código, seu próprio harness ou seu próprio pipeline, o K3 é a parte desta stack que você realmente consegue alcançar, e ele é acessível por meio de um único endpoint compatível com a OpenAI.
É também a metade mais segura da aposta enquanto os números não são auditados. Os benchmarks do SWE-2 são da própria Cognition e ninguém fora da empresa os reproduziu. Os do Kimi K3 são aqueles em que a comparação realmente se baseia — e, se você rotear pelo OrcaRouter, pode colocar uma cadeia de fallback por trás dele, para que um modelo que você está testando não se torne uma dependência de produção no dia em que o decepcionar.

Quem deveria agir, e o que resolveria isso
Se você já paga pelo Devin, o SWE-2 é simplesmente uma boa notícia: ele está sendo implementado no seu produto, é mais barato por tarefa do que o que substitui, e os números de eficiência sugerem que ele desperdiçará menos turnos em trabalhos fáceis. Experimente-o na parte mais simples da sua fila primeiro — o design de nível de esforço significa que o médio é onde está a vantagem de custo.
Se você está escolhendo um modelo de programação de fora, aguarde uma avaliação independente. Ainda não existe nenhuma: a Artificial Analysis não tem entrada para o SWE-2, e o ranking do FrontierCode é um instrumento da própria Cognition. Três coisas resolveriam isso. Uma execução do SWE-2 por terceiros no Terminal-Bench 4, que é a linha que decide se este é um modelo adjacente à fronteira ou um modelo rápido. Qualquer reprodução independente da diferença do FrontierCode. E um preço por token, o que exigiria que a Cognition vendesse o modelo fora do Devin — a única mudança que tornaria os 64% comparáveis a qualquer outra coisa que lhe seja cotada.
Até então, o resumo justo é o que a lacuna do modelo base já lhe dá. O SWE-2 é o Kimi K3 mais cinco pontos, a um custo que a Cognition projetou na função de recompensa. Isso é uma conquista real em treinamento e um negócio genuinamente bom dentro do Devin. Ainda não é um modelo de fronteira, e o único benchmark em que parece superar tudo é aquele que parou de contar.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
