
Cognition SWE-2: quem o faz, em qual harness ele roda e o que os números realmente dizem
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 316 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 196 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Cognition SWE-2 é um modelo de codificação feito pela Cognition, a empresa por trás do Devin, e é disponibilizado dentro do Devin, e não por meio de uma API de modelo: o próprio post de lançamento da Cognition diz que o SWE-2 está disponível primeiro no Devin Desktop e no Devin CLI, com implantação gradual no Devin Web e no Fusion. Ele é pós-treinado a partir do Kimi K3, o modelo de 2,8 trilhões de parâmetros da Moonshot AI. Essa é a resposta completa à pergunta que a maioria das pessoas está de fato fazendo quando chega aqui, e vale a pena afirmá-la antes de qualquer outra coisa, porque uma parcela mensurável das buscas que levam a esta página acrescenta uma quarta palavra — Devin — e atribui o modelo ao Devin, e não à Cognition. O Devin é o agente que a Cognition vende. O SWE-2 é o modelo que a Cognition treinou para rodar dentro dele.
Esta página é uma página de referência, e não uma matéria de lançamento. O SWE-2 foi lançado em 10 de setembro de 2026, que já passou há mais de uma semana; a data está aqui para situar o modelo no tempo, não para noticiar um evento. O que segue é o que está documentado, quem o documentou e o que ninguém verificou ainda.
Quem desenvolve o SWE-2, e por que a atribuição continua mudando
A confusão não é descabida. A Cognition não vende o SWE-2 como um laboratório vende um modelo de API. Não há um cartão de modelo com uma janela de contexto, nem um preço por token publicado, nem um identificador que você possa passar no corpo de uma requisição. Há um produto — Devin — e o modelo chega como parte dele. A própria prosa da Cognition reforça essa fusão: o post de lançamento é escrito do ponto de vista do Devin, a tabela de benchmark não é explicada para quem ainda não leu o trabalho anterior da empresa sobre o FrontierCode, e a linha de disponibilidade menciona Devin quatro vezes e Cognition uma vez — na assinatura.
Então, claramente: A Cognition cria o SWE-2. A Cognition cria o Devin. Os dois não são a mesma coisa, mas, atualmente, não se pode ter um sem o outro. Isso também não é um acidente de nomenclatura isolado. A Cognition lançou uma série de modelos de engenharia de software sob o prefixo SWE — SWE-1.5, SWE-1.6, SWE-1.7 e agora SWE-2, com um checkpoint SWE-1.6 Preview no caminho — ao lado de ferramentas mais específicas como SWE-grep e SWE-check. O prefixo é a abreviação da empresa para engenharia de software e antecede em cerca de um ano todos os modelos deste parágrafo.
O nome: um modelo, não um benchmark
Esta é a segunda razão pela qual os pesquisadores atribuem o SWE-2 ao proprietário errado, e ela merece um parágrafo próprio em vez de uma nota de rodapé.
O SWE-bench é um benchmark. É uma avaliação independente mantida pela equipe do SWE-bench, hospedada em swebench.com, e é disponibilizado em várias edições: o conjunto original de 2.294 instâncias extraídas de issues reais do GitHub, além dos subconjuntos Verified, Lite, Multilingual e Multimodal. É usado para pontuar agentes de programação em geral, inclusive o Devin — a Cognition publicou um relatório técnico sobre o Devin no SWE-bench em março de 2024 que ainda está no blog dela.
SWE-2 é um modelo. Não é uma edição do SWE-bench, nem é uma abreviação de uma. Não existe SWE-bench 2: a família publicada abrange SWE-bench, Verified, Lite, Multilingual e Multimodal, e a numeração de versões existente pertence aos subconjuntos do benchmark, não a um sucessor numerado. O benchmark de referência da Cognition para esses modelos chama-se FrontierCode, que é um instrumento completamente diferente e, como explica a próxima seção, um que pertence à Cognition.
Se você veio aqui esperando uma segunda geração da avaliação SWE-bench, é exatamente nisso que consiste todo o mal-entendido.
Data de lançamento e como o SWE-2 é distribuído
O post de anúncio da Cognition traz uma assinatura datada de 10 de setembro de 2026, e os próprios dados estruturados da página indicam o carimbo de data e hora de publicação como 2026-09-10. Ambos concordam. O SWE-2 estava disponível no Devin Desktop e na Devin CLI nessa data, com o Devin Web e o Fusion vindo em seguida.
Essa é a superfície de distribuição, e é toda a superfície de distribuição. Não há pesos abertos — nada no Hugging Face da Cognition para este modelo — e nenhum endpoint hospedado por fornecedor que aceite um identificador SWE-2. Se o seu harness é o seu próprio, o SWE-2 não é um componente que você possa instalar nele hoje. Se o seu harness é o Devin, o SWE-2 já está diante de você.
Para quem precisa do envelope do modelo base em vez do de SWE-2, o Kimi K3 é uma coisa separada e melhor documentada, e é roteado no OrcaRouter como kimi/kimi-k3 — uma API para mais de 200 modelos pelo preço de tabela do provedor, sem markup. Isso importa aqui por um motivo específico: a capacidade subjacente da qual a Cognition partiu é acessível de forma independente, embora o modelo pós-treinado não seja.
O envelope: o que a Cognition documenta, e o que não documenta
Uma página de referência deve ser honesta quanto à forma de sua própria evidência, e é aí que a do SWE-2 é mais tênue.
• Esforço de raciocínio — três níveis documentados: medium, high e max. A Cognition escreve que os níveis se comportam de forma diferente por design: o medium entra em ação mais cedo e dá conta de trabalho simples e intermediário, enquanto o high e o max planejam mais, exploram mais a base de código e gastam mais com verificação.
• Distribuição — Devin Desktop e Devin CLI no lançamento, Devin Web e Fusion em implementação gradual. Sem API, sem pesos, sem caminho de auto-hospedagem.
• Modelo base — Kimi K3, descrito pela Cognition como um modelo de 2,8 trilhões de parâmetros que já havia passado por um extenso RL para codificação agêntica. O artigo do Kimi K3 confere a essa base uma janela de contexto de 1M de tokens e visão nativa.
• Janela de contexto, saída máxima, modalidades, contagem de parâmetros pós-treinados — não publicados para o SWE-2. O anúncio da Cognition não diz nada sobre nenhum deles, e nenhuma outra página da Cognition preenche essa lacuna.
A distinção nessa última linha não é pedantismo. A janela de um milhão de tokens do Kimi K3 é um fato sobre o Kimi K3. A Cognition não diz que o SWE-2 a herda, e o pós-treinamento com uma receita diferente é exatamente o tipo de mudança que pode alterar o que um modelo aceita. Se você precisa de um número de janela de contexto para planejamento, o número que você consegue verificar pertence ao modelo base, e você deve tratar o do SWE-2 como desconhecido em vez de presumir que os dois coincidem.

A tabela de preços, na única moeda em que a Cognition faz cotações
Não há preço por token para o SWE-2, porque não existe endpoint do SWE-2. A alegação de custo da Cognition é expressa de forma diferente: ela diz que o SWE-2 fica a um ponto de distância do Claude Fable 5.1 no FrontierCode 1.1 Main — 50,0% contra 50,9% — ao mesmo tempo que é 64% mais barato. Leia a unidade com atenção. Os 64% são a média de dólares americanos gastos por rollout no FrontierCode, um valor em nível de tarefa que agrupa o modelo, o harness, o scaffolding e a stack de serving da Cognition em uma única fatura. Não é uma tarifa por token, e não pode ser comparada a uma.
A tabela de preços que de fato existe é a da Devin. Na página de preços da Devin, consultada em 28 de setembro de 2026: Grátis a US$ 0, Pro a US$ 20 por mês, Max a US$ 200 por mês, Teams a US$ 80 por mês mais US$ 40 por assento de desenvolvedor integral. A linha do SWE-2 fica no Pro e traz uma data — “Uso gratuito do SWE-2 — Grátis no Devin Desktop e na CLI até 10 de outubro de 2026.” Essa é uma janela promocional com aproximadamente duas semanas restantes, e é o único número do SWE-2 naquela página que é genuinamente sensível ao tempo: o custo do modelo dentro do Devin após 10 de outubro não é informado ali.
Vale a pena citar os números de eficiência da Cognition ao lado da alegação de custo, e eles são relatados pelo fornecedor, como tudo o mais nesta página. No FrontierCode 1.1 Main, o SWE-2 em esforço médio pontua acima do SWE-1.7, embora use 58% menos turnos e custe, em média, 81% menos. O número médio de passos por execução cai de 127 no SWE-1.7 para 53 no médio, 80 no alto e 98 no máximo, e a mediana da primeira edição real de código passa do passo 48 para o passo 18.
Os benchmarks, com o harness anexado
As pontuações de engenharia de software são excepcionalmente sensíveis ao scaffold em que foram produzidas, de modo que um número sem seu harness não é um número. A Cognition declara sua política de harness no apêndice de metodologia do anúncio: os resultados são reportados a partir de fontes públicas quando existe uma e, caso contrário, executados na estrutura de avaliação interna da Cognition usando o harness para o qual cada modelo foi primariamente desenvolvido — Claude Code para modelos Anthropic, Codex para modelos OpenAI, Grok Build para modelos xAI e Devin CLI para modelos de pesos abertos. Para cada modelo, a Cognition reporta a melhor pontuação entre as configurações de esforço de raciocínio.
Duas consequências decorrem disso, e ambas vêm no mesmo fôlego que os números. Primeiro, várias linhas não são diretamente comparáveis: um valor do Fable 5.1 produzido no Claude Code e um valor do Kimi K3 produzido no Devin CLI são medições de dois sistemas de agentes diferentes, não de dois modelos em um ambiente neutro. Segundo, "melhor pontuação entre as configurações de esforço" significa que cada célula é o melhor caso de um modelo, não uma configuração equiparada. Uma comparação que mantivesse o esforço constante seria diferente, e a Cognition não publicou uma.
As quatro linhas abaixo são informadas pelo fornecedor e não auditadas.
• FrontierCode 1.1 Main — SWE-2 50,0%, Kimi K3 44,2%, Grok 4.6 48,0%, Claude Fable 5.1 50,9%, GPT-5.6 Sol 47,5%, GPT-6 Astra 53,3%, SWE-1.7 42,0%. Esta é a linha de destaque, e o FrontierCode é o próprio benchmark da Cognition — a Cognition escreve as tarefas com mais de 20 mantenedores de código aberto, administra a tabela de classificação e avalia as submissões. Nada disso torna os números errados; tudo isso pertence à frase em que você os repete.
• DeepSWE 1.1 — SWE-2 73,0%, Kimi K3 68,5%, Grok 4.6 67,5%, Claude Fable 5.1 67,4%, GPT-5.6 Sol 72,7%, GPT-6 Astra 74,1%, SWE-1.7 37,7%. A linha em que o SWE-2 vence de forma mais credível um modelo de fronteira de forma absoluta.
• Terminal-Bench 2.1 — SWE-2 92,8%, Kimi K3 88,3%, Grok 4.6 88,4%, Claude Fable 5.1 91,4%, GPT-5.6 Sol 88,8%, GPT-6 Astra 89,9%, SWE-1.7 81,5%. O número mais impressionante do SWE-2, e a edição atual do Terminal-Bench não é a 2.1.
• Terminal-Bench 4 — SWE-2 27,3%, Kimi K3 21,5%, Grok 4.6 20,3%, Claude Fable 5.1 55,8%, GPT-5.6 Sol 37,3%, GPT-6 Astra 57,9%, SWE-1.7 7,6%. A linha menos citada, e aquela em que o modelo fica cerca de 28 pontos atrás da fronteira.
A comparação também precisa de mais um elemento de contexto, porque ele explica de onde vem o formato incomum da linha de fronteira. A própria nota de rodapé da Cognition em seus gráficos observa que a configuração de esforço máximo do Fable 5.1 no FrontierCode 1.1 Main obtém 50,3% a US$ 12,83 por tarefa — abaixo de sua própria configuração média, com 50,9% e US$ 3,28. Mais esforço comprou uma pontuação menor a um custo cerca de quatro vezes maior. É a curva do modelo de fronteira dobrando-se sobre si mesma, e isso é parte do motivo pelo qual 50,0% contra 50,9% é mais próximo do que os dois números sozinhos sugerem.
Os números de confiabilidade
A seção separada de confiabilidade da Cognition é a parte do lançamento que não tem nada a ver com classificações, e informa que o SWE-2 passou em 98,0% de seus prompts de propaganda e censura no total — 99,8% em inglês, 95,2% em chinês simplificado e 99,1% em chinês tradicional — e que sua avaliação de vulnerabilidade dependente de contexto não encontrou nenhuma condição de enquadramento que produzisse uma mudança estatisticamente significativa para qualquer modelo testado. Esses são os julgamentos da Cognition, produzidos com um juiz GPT-5.6 Luna em um conjunto de 145 perguntas, e são relatados pelo fornecedor no mesmo sentido em que os benchmarks são.
A leitura independente: ainda não existe nenhuma.
Em 28 de setembro de 2026, o SWE-2 não tem entrada no Artificial Analysis. Buscar o nome no índice de modelos não retorna nada, e uma solicitação direta à página do modelo retorna 404. O único placar que traz o SWE-2 é o FrontierCode, que pertence à Cognition. Isso deixa o lançamento com números relatados pelo fornecedor e nada mais, o que não é uma crítica aos números — é uma constatação sobre quanto deles um leitor pode verificar.
Duas coisas específicas resolveriam a questão, e nenhuma delas existe hoje. Uma execução de terceiros do SWE-2 no Terminal-Bench 4 decidiria se este é um modelo próximo da fronteira que por acaso é barato ou um modelo rápido que por acaso lidera uma edição aposentada. E qualquer reprodução independente da diferença do FrontierCode diria se a margem de um ponto contra o Fable 5.1 é uma propriedade do modelo ou uma propriedade do instrumento.
Ao contrário dos próprios modelos da Cognition, a Artificial Analysis inclui o Kimi K3 — e os números do Kimi K3 são de terceiros, o que torna o modelo base a metade com melhores evidências desta pilha. Essa assimetria é a forma prática do SWE-2 hoje: o pós-treino é a parte interessante e a menos verificável; a base é a parte documentada e aquela que você pode realmente chamar.

Usando o SWE-2, e o que fazer enquanto ele não é auditado
Se você já paga pelo Devin, a decisão é fácil e não depende de nenhuma das ressalvas acima. O SWE-2 está no seu produto, a Cognition diz que ele custa menos por tarefa do que o modelo que substitui, e os números de eficiência — 58% menos turnos, 81% menos custo médio, uma mediana de primeira edição no passo 18 em vez do passo 48 — descrevem um modelo que desperdiça menos do seu tempo em trabalho comum. Inicie-o com esforço médio na parte mais simples da sua fila, que é onde o próprio design de níveis de esforço da Cognition coloca o ganho de custo.
Se você está escolhendo um modelo de codificação de fora do Devin, a posição honesta é que o SWE-2 não é um candidato que você possa avaliar, porque não há nada para chamar. Não há identificador, nem preço por token, nem endpoint. O que você pode avaliar é o modelo base.

O Kimi K3 é roteado no OrcaRouter, a US$ 3,00 por 1M de tokens de entrada e US$ 15,00 por 1M de tokens de saída, sem markup sobre a tarifa do provedor, uma janela de contexto de 1M de tokens, chamada nativa de ferramentas, entrada de imagens e um controle de esforço de raciocínio de alto nível. Essa é a metade alcançável deste lançamento: a capacidade a partir da qual a Cognition fez o pós-treinamento, disponível por meio de um único endpoint compatível com a OpenAI, em vez do produto de agente de um único fornecedor. E, como é território não auditado de qualquer forma, você pode colocar uma cadeia de fallback por trás dele, para que um modelo que você está testando não se torne uma dependência de produção no dia em que ele decepcionar você.
O que o SWE-2 lhe diz, se você o ler como evidência e não como uma página de produto, é mais restrito e mais útil do que a manchete: uma passada de RL bem executada sobre o Kimi K3 elevou o patamar em cerca de cinco pontos em quatro benchmarks sem alterar o formato, e exigiu 58% menos turnos para isso. Esse é um resultado real dentro do Devin. Ainda não é um resultado que alguém fora da Cognition tenha reproduzido, e o único benchmark em que o SWE-2 parece superar tudo é aquele que a área parou de pontuar.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
