
Cognition SWE-2: quién lo desarrolla, en qué arnés de pruebas se ejecuta y qué dicen realmente los números
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 316 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 196 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
Cognition SWE-2 es un modelo de programación creado por Cognition, la empresa detrás de Devin, y se sirve dentro de Devin en lugar de a través de una API de modelos: la propia publicación de lanzamiento de Cognition dice que SWE-2 está disponible primero en Devin Desktop y Devin CLI, con despliegue posterior a Devin Web y Fusion. Está post-entrenado a partir de Kimi K3, el modelo de 2,8 billones de parámetros de Moonshot AI. Esa es toda la respuesta a la pregunta que la mayoría de la gente se hace en realidad cuando llega aquí, y merece la pena decirla antes que nada, porque una parte medible de las búsquedas que llevan a esta página añaden una cuarta palabra —Devin— y atribuyen el modelo a Devin en lugar de a Cognition. Devin es el agente que vende Cognition. SWE-2 es el modelo que Cognition entrenó para ejecutarse dentro de él.
Esta página es una página de referencia más que una historia de lanzamiento. SWE-2 se lanzó el 10 de septiembre de 2026, una fecha que ya ha quedado más de una semana atrás; la fecha está aquí para fijar el modelo en el tiempo, no para informar de un evento. Lo que sigue es lo que está documentado, quién lo documentó y lo que nadie ha comprobado todavía.
¿Quién fabrica SWE-2 y por qué la atribución sigue a la deriva?
La confusión no es descabellada. Cognition no vende SWE-2 como un laboratorio vende un modelo de API. No hay una ficha de modelo con una ventana de contexto, ni un precio por token publicado, ni un identificador que puedas pasar en el cuerpo de una solicitud. Hay un producto —Devin— y el modelo llega como parte de él. La propia prosa de Cognition refuerza esa fusión: la publicación de lanzamiento está escrita desde el punto de vista de Devin, la tabla de benchmarks queda sin explicación para cualquiera que no haya leído ya el trabajo anterior de la empresa sobre FrontierCode, y la línea de disponibilidad nombra a Devin cuatro veces y a Cognition una —en la firma—.
Entonces, en pocas palabras: Cognition hace SWE-2. Cognition hace Devin. No son lo mismo, pero actualmente no se puede tener uno sin el otro. Tampoco se trata de un accidente de nombres puntual. Cognition ha lanzado una serie de modelos de ingeniería de software bajo el prefijo SWE — SWE-1.5, SWE-1.6, SWE-1.7 y ahora SWE-2, con un checkpoint de SWE-1.6 Preview en el camino — junto con herramientas más específicas como SWE-grep y SWE-check. El prefijo es la forma abreviada que usa la empresa para ingeniería de software, y es anterior a todos los modelos de este párrafo por aproximadamente un año.
El nombre: un modelo, no un benchmark
Esta es la segunda razón por la que quienes buscan atribuyen SWE-2 al propietario equivocado, y merece su propio párrafo en lugar de una nota al pie.
SWE-bench es un benchmark. Es una evaluación independiente mantenida por el equipo de SWE-bench, alojada en swebench.com, y se distribuye en varias ediciones: el conjunto original de 2.294 instancias extraído de problemas reales de GitHub, más los subconjuntos Verified, Lite, Multilingual y Multimodal. Se utiliza para puntuar agentes de programación en general, incluido Devin — Cognition publicó un informe técnico sobre Devin en SWE-bench ya en marzo de 2024 que todavía sigue en su blog.
SWE-2 es un modelo. No es una edición de SWE-bench, ni es la abreviatura de una. No existe SWE-bench 2: la familia publicada abarca SWE-bench, Verified, Lite, Multilingual y Multimodal, y la numeración de versiones que existe pertenece a los subconjuntos del benchmark, no a un sucesor numerado. El benchmark de referencia de Cognition para estos modelos se llama FrontierCode, que es un instrumento completamente distinto y, como explica la siguiente sección, uno que Cognition posee.
Si viniste aquí esperando una segunda generación de la evaluación SWE-bench, ese es todo el malentendido.
Fecha de lanzamiento y cómo se distribuye SWE-2
La publicación de anuncio de Cognition lleva una firma del 10 de septiembre de 2026, y los propios datos estructurados de la página indican que la marca temporal de publicación es 2026-09-10. Ambos coinciden. SWE-2 estaba disponible en Devin Desktop y Devin CLI en esa fecha, y Devin Web y Fusion llegaron después.
Esa es la superficie de distribución, y es toda la superficie de distribución. No hay pesos abiertos —nada en Hugging Face de Cognition para este modelo— ni ningún endpoint alojado por el proveedor que acepte un identificador SWE-2. Si tu harness es propio, SWE-2 no es un componente que puedas instalar en él hoy. Si tu harness es Devin, SWE-2 ya está frente a ti.
Para quien necesite la envolvente del modelo base en lugar de la de SWE-2, Kimi K3 es algo aparte y mejor documentado, y se enruta en OrcaRouter como kimi/kimi-k3 — una API para más de 200 modelos al precio de lista del proveedor sin recargo. Eso importa aquí por una razón específica: la capacidad subyacente de la que partió Cognition es accesible de forma independiente, aunque el modelo post-entrenado no lo es.
El alcance: lo que Cognition documenta y lo que no
Una página de referencia debería ser honesta sobre la forma de su propia evidencia, y aquí es donde la de SWE-2 es más escasa.
• Esfuerzo de razonamiento — tres niveles documentados: medio, alto y máximo. Cognition escribe que los niveles se comportan de manera diferente por diseño: el medio pasa a la acción antes y se encarga del trabajo simple e intermedio, mientras que alto y máximo planifican más, exploran más el código base y dedican más a la verificación.
• Distribución — Devin Desktop y Devin CLI en el lanzamiento; Devin Web y Fusion, en despliegue gradual. Sin API, sin pesos, sin ruta de autoalojamiento.
• Modelo base — Kimi K3, descrito por Cognition como un modelo de 2,8 T de parámetros que ya había pasado por un extenso RL para codificación agéntica. El artículo de Kimi K3 le otorga a esa base una ventana de contexto de 1 millón de tokens y visión nativa.
• Ventana de contexto, salida máxima, modalidades, recuento de parámetros post-entrenados — no se han publicado para SWE-2. El anuncio de Cognition no dice nada sobre ninguno de ellos, y ninguna otra página de Cognition llena ese vacío.
La distinción en esa última fila no es pedantería. La ventana de un millón de tokens de Kimi K3 es un hecho sobre Kimi K3. Cognition no dice que SWE-2 la herede, y el post-entrenamiento con una receta diferente es exactamente el tipo de cambio que puede alterar lo que un modelo acepta. Si necesitas una cifra de ventana de contexto para planificar, la cifra que puedes verificar pertenece al modelo base, y deberías tratar la de SWE-2 como desconocida en lugar de asumir que ambas coinciden.

La tarifa, en la única moneda en la que cotiza Cognition
No hay un precio por token para SWE-2, porque no existe un endpoint de SWE-2. La afirmación de coste de Cognition está expresada de otra forma: dice que SWE-2 queda a menos de un punto de Claude Fable 5.1 en FrontierCode 1.1 Main —50,0 % frente a 50,9 %— y que además es un 64 % más barato. Lee la unidad con atención. Ese 64 % es el gasto medio en dólares estadounidenses por rollout en FrontierCode, una cifra a nivel de tarea que agrupa en una sola factura el modelo, el harness, el scaffolding y la pila de servicio de Cognition. No es una tarifa por token, y no puede compararse con una.
La tarifa que sí existe es la de Devin. En la página de precios de Devin, consultada el 28 de septiembre de 2026: Free a $0, Pro a $20 al mes, Max a $200 al mes, Teams a $80 al mes más $40 por asiento de desarrollador completo. La línea de SWE-2 figura en Pro y lleva una fecha: "Uso gratuito de SWE-2: gratis en Devin Desktop y CLI hasta el 10 de octubre de 2026". Es una ventana promocional a la que le quedan aproximadamente dos semanas, y es la única cifra de SWE-2 en esa página que es realmente sensible al tiempo: el costo del modelo dentro de Devin después del 10 de octubre no se indica ahí.
Los números de eficiencia de Cognition merecen citarse junto a la afirmación sobre el coste, y están reportados por el proveedor como todo lo demás en esta página. En FrontierCode 1.1 Main, SWE-2 con esfuerzo medio obtiene una puntuación superior a SWE-1.7 mientras usa un 58 % menos de turnos y cuesta un 81 % menos en promedio. El número medio de pasos por ejecución cae de 127 en SWE-1.7 a 53 en medio, 80 en alto y 98 en máximo, y la mediana de la primera edición real de código pasa del paso 48 al paso 18.
Los benchmarks, con el arnés adjunto
Las puntuaciones de ingeniería de software son inusualmente sensibles al andamiaje con el que se produjeron, por lo que una cifra sin su arnés no es una cifra. Cognition expone su política de arneses en el apéndice de metodología del anuncio: los resultados se reportan a partir de fuentes públicas cuando existe una y, en caso contrario, se ejecutan en el marco de evaluación interno de Cognition usando el arnés para el que se desarrolló principalmente cada modelo — Claude Code para los modelos de Anthropic, Codex para los modelos de OpenAI, Grok Build para los modelos de xAI y Devin CLI para los modelos de pesos abiertos. Para cada modelo, Cognition reporta la mejor puntuación entre las distintas configuraciones de esfuerzo de razonamiento.
De ahí se derivan dos consecuencias, y ambas deben mencionarse en la misma frase que las cifras. En primer lugar, varias filas no son comparables en igualdad de condiciones: una cifra de Fable 5.1 obtenida en Claude Code y una cifra de Kimi K3 obtenida en Devin CLI son mediciones de dos sistemas de agentes distintos, no de dos modelos en un entorno neutro. En segundo lugar, «mejor puntuación entre los distintos ajustes de esfuerzo» significa que cada celda es el mejor caso de un modelo, no un ajuste equiparable. Una comparación que mantuviera constante el esfuerzo sería distinta, y Cognition no publicó ninguna.
Las cuatro filas a continuación son reportadas por el proveedor y no están auditadas.
• FrontierCode 1.1 Main — SWE-2 50,0 %, Kimi K3 44,2 %, Grok 4.6 48,0 %, Claude Fable 5.1 50,9 %, GPT-5.6 Sol 47,5 %, GPT-6 Astra 53,3 %, SWE-1.7 42,0 %. Esta es la fila destacada, y FrontierCode es el benchmark propio de Cognition: Cognition redacta las tareas junto con más de 20 mantenedores de código abierto, gestiona la tabla de clasificación y califica las entregas. Nada de eso hace que las cifras sean incorrectas; todo ello pertenece a la frase en la que las repites.
• DeepSWE 1.1 — SWE-2 73,0 %, Kimi K3 68,5 %, Grok 4.6 67,5 %, Claude Fable 5.1 67,4 %, GPT-5.6 Sol 72,7 %, GPT-6 Astra 74,1 %, SWE-1.7 37,7 %. La fila en la que SWE-2 supera de forma más creíble a un modelo de frontera sin más.
• Terminal-Bench 2.1 — SWE-2 92,8 %, Kimi K3 88,3 %, Grok 4.6 88,4 %, Claude Fable 5.1 91,4 %, GPT-5.6 Sol 88,8 %, GPT-6 Astra 89,9 %, SWE-1.7 81,5 %. El número más favorable de SWE-2, y la edición actual de Terminal-Bench no es la 2.1.
• Terminal-Bench 4 — SWE-2 27,3 %, Kimi K3 21,5 %, Grok 4.6 20,3 %, Claude Fable 5.1 55,8 %, GPT-5.6 Sol 37,3 %, GPT-6 Astra 57,9 %, SWE-1.7 7,6 %. La fila que menos se cita, y aquella en la que el modelo se sitúa unos 28 puntos por detrás de la frontera.
La comparación también necesita una pieza más de contexto, porque explica de dónde viene la forma inusual de la fila de la frontera. La propia nota al pie de Cognition en sus notas señala que el ajuste de esfuerzo máximo de Fable 5.1 en FrontierCode 1.1 Main obtiene un 50.3% a $12.83 por tarea —por debajo de su propio ajuste medio, con un 50.9% y $3.28. Más dinero compró una puntuación más baja a aproximadamente cuatro veces el coste. Esa es la curva del modelo de frontera replegándose sobre sí misma, y es parte de por qué un 50.0% frente a un 50.9% está más cerca de lo que sugieren los dos números por sí solos.
Los números de confiabilidad
La sección separada de confiabilidad de Cognition es la parte del lanzamiento que no tiene nada que ver con las tablas de clasificación, e informa que SWE-2 aprobó el 98,0 % de sus prompts de propaganda y censura en general —99,8 % en inglés, 95,2 % en chino simplificado y 99,1 % en chino tradicional—, y que su evaluación de vulnerabilidad dependiente del contexto no encontró ninguna condición de encuadre que produjera un cambio estadísticamente significativo para ningún modelo evaluado. Esos son juicios de Cognition, producidos con un juez GPT-5.6 Luna sobre un conjunto de 145 preguntas, y están reportados por el proveedor en el mismo sentido en que lo están los benchmarks.
La lectura independiente: todavía no hay una
A 28 de septiembre de 2026, SWE-2 no tiene entrada en Artificial Analysis. Buscar el nombre en el índice de modelos no devuelve nada, y una solicitud directa a la página del modelo da un 404. El único ranking que incluye a SWE-2 es FrontierCode, que pertenece a Cognition. Eso deja el lanzamiento con cifras reportadas por el proveedor y nada más, lo cual no es una crítica a las cifras, sino una afirmación sobre qué parte de ellas puede comprobar quien lee.
Dos cosas concretas lo resolverían, y ninguna de las dos existe hoy. Una ejecución de SWE-2 por terceros en Terminal-Bench 4 decidiría si se trata de un modelo cercano a la frontera que resulta ser barato o de uno rápido que resulta liderar una edición retirada. Y cualquier reproducción independiente de la brecha de FrontierCode te diría si el margen de un punto frente a Fable 5.1 es una propiedad del modelo o una propiedad del instrumento.
A diferencia de los modelos propios de Cognition, Artificial Analysis sí incluye Kimi K3 — y las cifras de Kimi K3 son de terceros, lo que convierte al modelo base en la mitad mejor respaldada por evidencia de este stack. Esa asimetría es la forma práctica que tiene SWE-2 hoy: el postentrenamiento es la parte interesante y la menos verificable; el modelo base es la parte documentada y la que realmente se puede invocar.

Uso de SWE-2 y qué hacer mientras no está auditado
Si ya pagas por Devin, la decisión es fácil y no depende de ninguna de las salvedades anteriores. SWE-2 está en tu producto, Cognition dice que cuesta menos por tarea que el modelo al que reemplaza, y las cifras de eficiencia —58 % menos turnos, 81 % menos coste medio, una primera edición mediana en el paso 18 en lugar del paso 48— describen un modelo que desperdicia menos de tu tiempo en el trabajo ordinario. Inícialo con esfuerzo medio en el extremo simple de tu cola, que es donde el propio diseño de niveles de esfuerzo de Cognition sitúa la ventaja de coste.
Si estás eligiendo un modelo de codificación desde fuera de Devin, la postura honesta es que SWE-2 no es un candidato que puedas evaluar, porque no hay nada que llamar. No hay identificador, ni precio por token, ni endpoint. Lo que sí puedes evaluar es el modelo base.

Kimi K3 se enruta en OrcaRouter, a 3,00 $ por 1 millón de tokens de entrada y 15,00 $ por 1 millón de tokens de salida, sin margen adicional sobre la tarifa del proveedor, una ventana de contexto de 1 millón de tokens, llamadas a herramientas nativas, entrada de imágenes y un control de esfuerzo de razonamiento de nivel superior. Esa es la mitad alcanzable de este lanzamiento: la capacidad a partir de la cual Cognition hizo el post-entrenamiento, disponible a través de un único endpoint compatible con OpenAI en lugar del producto de agente de un proveedor. Y como es territorio no auditado en cualquier caso, puedes poner una cadena de respaldo detrás de él, para que un modelo que estés probando no se convierta en una dependencia de producción el día que te decepcione.
Lo que SWE-2 te dice, si lo lees como evidencia en lugar de como una página de producto, es más acotado y más útil que el titular: una pasada de RL bien ejecutada sobre Kimi K3 movió el nivel unos cinco puntos en cuatro benchmarks sin cambiar la forma, y necesitó un 58 % menos de turnos para lograrlo. Ese es un resultado real dentro de Devin. Todavía no es un resultado que alguien fuera de Cognition haya reproducido, y el único benchmark donde SWE-2 parece superarlo todo es aquel en el que el campo ha dejado de puntuar.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
