Tarjeta de título para Cognition SWE-2 que muestra un subtítulo que dice 'Un post-entrenamiento de Kimi K3, 50,0 % en FrontierCode 1.1 Main con un coste 64 % menor', con tres tarjetas: FrontierCode 1.1 Main 50,0 %, vs Claude Fable 5.1 50,9 %, y Coste por rollout 64 % menor.
Guides & Insights

Cognition SWE-2: programación cercana a la frontera con un 64 % de descuento, y la trampa de los benchmarks que se esconde debajo

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Cognition SWE-2 se lanzó esta semana con un número hecho para viajar: 50,0 % en FrontierCode 1.1 Main, a un punto de Claude Fable 5.1 con 50,9 %, por un 64 % menos de dinero. El modelo es un post-entrenamiento de Kimi K3 de Moonshot AI —la base de pesos abiertos de 2,8 billones de parámetros— y Cognition afirma que su aprendizaje por refuerzo añadió 5–6 puntos en varios benchmarks. Ambas cifras son propias del proveedor, y ninguna ha sido reproducida de forma independiente. La segunda, sin embargo, es la afirmación que debería cambiar cómo se lee la primera, porque "más cinco o seis" acaba describiendo casi todo lo que hace SWE-2, incluidos los lugares donde pierde estrepitosamente.

Eso no es una crítica. Es lo más útil de este lanzamiento, y es la parte que casi ninguna de las coberturas del lanzamiento dice en voz alta.

Lo que Cognition lanzó en realidad

SWE-2 es el modelo de programación de Devin, no un modelo de API de propósito general con una lista de precios. Se lanzó disponible a partir de hoy en Devin Desktop y CLI, según las propias palabras de Cognition, con el despliegue en marcha en Devin Web y Fusion. La cobertura de terceros fecha el anuncio el 10 de septiembre de 2026; la firma en la propia publicación del blog de Cognition dice 09.11.26. En cualquier caso, tiene apenas unos días. Los pesos son propietarios y no hay una tarifa publicada por token. Si quieres usar SWE-2, lo usas dentro de Devin.

La base es Kimi K3, un modelo de mezcla de expertos de 2,8 billones de parámetros con aproximadamente 104 000 millones de parámetros activos por token — unas tres veces el tamaño de la base de SWE-1.7. Cognition señala que K3 ya había sido entrenado intensamente con RL para codificación agéntica antes de que ellos llegaran a él, y que su propio RL "todavía encuentra un margen sustancial de mejora". Eso refleja el patrón de SWE-1.7, que también fue postentrenado sobre una base de Kimi.

Este es el detalle que importa más que cualquier puntuación de un solo benchmark: FrontierCode es el benchmark de Cognition. La empresa escribe las tareas —con más de 20 mantenedores de código abierto, más de 40 horas por tarea y cada mantenedor definiendo qué significa "fusionable" en su propio repositorio—, gestiona la tabla de clasificación y califica las entregas. Es una pieza seria de diseño de evaluación, y también es un instrumento propio. Cognition informa la mejor puntuación de cada modelo según los ajustes de esfuerzo de razonamiento y, según su propio apéndice de metodología, los modelos de comparación de pesos abiertos, incluido Kimi K3, se ejecutaron dentro de Devin CLI de Cognition. Nada de eso hace que los números estén mal. Todo eso pertenece a la frase en la que los repites.

Two-column scoreboard headed 'Cognition SWE-2 vs Claude Fable 5.1'. Left column Cognition SWE-2: FrontierCode 1.1 Main 50.0%, Terminal-Bench 2.1 92.8%, Terminal-Bench 4 27.3%, Cost per rollout 64% lower, Base model Kimi K3 2.8T, Independent eval none yet. Right column Claude Fable 5.1: FrontierCode 1.1 Main 50.9%, Terminal-Bench 2.1 91.4%, Terminal-Bench 4 55.8%, Cost per rollout baseline, Base model proprietary, Independent eval third-party scored.

Leyendo la tabla comparativa con honestidad

Cuatro benchmarks, todos reportados por el proveedor. Esto es lo que cada uno dice en realidad, una línea por fila.

• FrontierCode 1.1 Main — SWE-2 50,0 %, frente a Kimi K3 44,2 %, Grok 4.6 48,0 %, GPT-5.6 Sol 47,5 %, Claude Fable 5.1 50,9 %, GPT-6 Astra 53,3 %, SWE-1.7 42,0 %. A un punto de la frontera, por delante de todo lo demás en la tabla.

• DeepSWE 1.1 — SWE-2 73,0 %, por delante de Claude Fable 5.1 con 67,4 % y de Grok 4.6 con 67,5 %, y por detrás de GPT-6 Astra con 74,1 %. Esta es la fila en la que SWE-2 supera de manera más creíble y contundente a un modelo de frontera.

• Terminal-Bench 2.1 — SWE-2 92,8 %, la puntuación más alta en la tabla de Cognition, por delante de Claude Fable 5.1 con un 91,4 % y GPT-6 Astra con un 89,9 %. Esta es la cifra que aparece en la mayoría de los titulares del lanzamiento.

• Terminal-Bench 4 — SWE-2 27,3 %, frente a Claude Fable 5.1 con 55,8 % y GPT-6 Astra con 57,9 %. Una brecha de aproximadamente 28 puntos, y la fila que menos se cita.

La objeción obvia es que todos bajan en Terminal-Bench 4 — es un sucesor más difícil y de mayor horizonte, así que, por supuesto, las puntuaciones caen. La parte interesante es cuánto, y la caída no es proporcional. Al pasar de Terminal-Bench 2.1 a 4, Claude Fable 5.1 pierde alrededor de 35,6 puntos y GPT-6 Astra alrededor de 32,0. SWE-2 pierde alrededor de 65,5, y su base Kimi K3 alrededor de 66,8. Así que, en trabajo agéntico de horizonte largo, SWE-2 no solo se sitúa por debajo de los modelos de frontera — se degrada aproximadamente el doble de rápido que ellos cuando la tarea se prolonga.

Vale la pena decir con claridad si Terminal-Bench 4 es la versión «live»: es la edición actual, y 2.1 es la que ha sido reemplazada. La fila donde SWE-2 lidera es el benchmark retirado. La fila donde va por detrás es la actual. Ambos hechos son ciertos, y la cobertura del lanzamiento tendía a elegir solo uno.

«Kimi K3 más cinco» — la heurística que predice las puntuaciones que nadie publicó

Alinea los cuatro benchmarks con el propio modelo base de SWE-2 y algo casi mecánico se desprende de ello. Frente a Kimi K3, SWE-2 gana 5,8 puntos en FrontierCode 1.1 Main, 4,5 en DeepSWE 1.1, 4,5 en Terminal-Bench 2.1 y 5,8 en Terminal-Bench 4.

Cuatro benchmarks, cuatro brechas, todas entre 4.5 y 5.8. El post-entrenamiento movió el nivel, no la forma. Donde K3 es fuerte, SWE-2 es fuerte más unos cinco. Donde K3 es débil —Terminal-Bench 4 siendo el caso claro—, SWE-2 es débil más unos cinco.

Eso te da un pronóstico funcional para cualquier tarea que Cognition no haya evaluado, que son la mayoría. Consulta cómo rinde Kimi K3 en tu carga de trabajo, súmale cinco puntos y tendrás una mejor estimación de SWE-2 que la que te dará cualquiera de las cifras destacadas. También explica la verdadera tesis del lanzamiento: Cognition no afirma haber superado la frontera. Afirma haber desplazado toda la curva de coste-rendimiento hacia fuera mientras se mantiene a una distancia fija por detrás del mejor modelo en cualquier eje que midas.

El 64 % es real, pero no puedes comprarlo

"Un 64% más barato que Claude Fable 5.1" es una afirmación verdadera sobre una medición concreta, y la medición es la media de dólares estadounidenses gastados por rollout en FrontierCode, no un precio por token. No hay una tarifa por token para SWE-2 porque no existe una API de SWE-2. La afirmación sobre el costo describe cuánto cuesta una tarea dentro de Devin, que agrupa el modelo, el harness, el scaffolding y la pila de serving de Cognition en una sola factura.

Esa distinción tiene peso. No se puede comparar el costo de SWE-2 con el precio por token de otro proveedor, porque no son la misma unidad. Y no se puede llevar SWE-2 a otro lado: pesos propietarios, un único proveedor, un único producto de agente. La cifra de «hasta 70 % menos de costo» que aparece en algunos artículos es el extremo superior del rango que Cognition cita en los distintos benchmarks; la cifra de FrontierCode 1.1 Main es del 64 %.

Los números de eficiencia son, si acaso, la historia más práctica, y esos también los reporta el proveedor. SWE-2 en esfuerzo medio supera la puntuación de FrontierCode de SWE-1.7 mientras usa un 58% menos de turnos y cuesta un 81% menos en promedio. La media de pasos por ejecución baja de 127 en SWE-1.7 a 53 con esfuerzo medio (80 con alto, 98 con máximo), y la mediana de la primera edición real de código pasa del paso 48 al paso 18. Eso es una respuesta directa a la queja de que SWE-1.7 exploraba en exceso las tareas simples, y es el tipo de mejora que se refleja en tu factura mucho antes de que lo haga una diferencia de un punto en un benchmark.

Screenshot of Cognition's official SWE-2 announcement blog post, headed 'Introducing SWE-2: Pushing the Pareto Frontier', bylined 09.11.26, showing the opening claim of 50.0% on FrontierCode 1.1 Main within one point of Fable 5.1 while being 64% cheaper, and a cost-versus-solve-rate Pareto chart labelling the medium, high and max effort levels.

El truco de entrenamiento es la verdadera noticia.

Si dejamos a un lado el posicionamiento en la tabla de clasificación, aquí hay una pieza de ingeniería genuinamente novedosa, y por eso vale la pena leer el lanzamiento incluso si nunca abres Devin.

Cognition entrenó los tres niveles de esfuerzo de razonamiento —medio, alto y máximo— en una única ejecución de RL. El mecanismo es una penalización de coste lineal por nivel de esfuerzo, cada una ajustada para coincidir con la pendiente de la propia curva de Pareto de coste-rendimiento del modelo base en ese punto. El argumento de Cognition sobre por qué la penalización tiene que ser lineal es lo interesante: solo una penalización lineal mantiene el objetivo de entrenamiento como una función únicamente del coste medio y la tasa de resolución, en lugar de algo que depende de la forma de la distribución.

El enfoque habitual entrena los niveles de esfuerzo por separado, o le acopla después un checkpoint más barato. Entrenarlos juntos dentro de una misma ejecución es lo que le permite a la empresa afirmar que hizo avanzar toda la frontera, en lugar de solo un punto de ella. Cambios de apoyo: una línea base de recompensa ponderada por longitud, triplicar el número de entornos de RL, capas superpuestas de seguimiento de instrucciones y un volante de inercia que usa checkpoints anteriores de SWE-2 para blindar los verificadores contra el hacking de recompensas. Del lado del servicio, kernels NVFP4 y FP8 con entrenamiento consciente de la cuantización, un modelo borrador de decodificación especulativa DSpark reentrenado para longitudes de aceptación un 15 % mayores, y un retardador de prefill que aporta un 10–20 % de rendimiento por GPU a costa de empeorar el tiempo hasta el primer token.

Si haces entrenamiento posterior, esa receta es la parte transferible de este lanzamiento. Si no lo haces, la conclusión es más sencilla: la razón por la que SWE-2 es económico no es que sea un modelo más pequeño. Es que el costo de ejecutarlo estaba escrito en la función de recompensa.

Si quieres la capacidad de Kimi K3 fuera de Devin

SWE-2 no está en OrcaRouter, y no lo estará — pesos propietarios, sin API, distribución exclusiva de Devin. Su modelo base es una situación diferente. Kimi K3 está enrutado en OrcaRouter como kimi/kimi-k3, a $3.00 por 1M de tokens de entrada y $15.00 por 1M de tokens de salida, sin margen adicional sobre la tarifa del proveedor, una ventana de contexto de 1M de tokens, llamada nativa a herramientas, entrada de imágenes, y profundidad de razonamiento controlada mediante un parámetro reasoning_effort de nivel superior en lugar de ajustes de muestreo.

Esa es la versión honesta de la conclusión práctica de este lanzamiento. SWE-2 te muestra cómo se ve una pasada de RL bien ejecutada sobre K3 en lo más alto de su rango: una mejora genuina de 4,5 a 5,8 puntos, además de grandes ganancias de eficiencia, a un coste real. Lo que no te da es un modelo que puedas invocar. Si quieres dirigir la capacidad subyacente a tu propio código, tu propio harness o tu propio pipeline, K3 es la parte de este stack que realmente puedes alcanzar, y es accesible a través de un único endpoint compatible con OpenAI.

También es la mitad más segura de la apuesta mientras las cifras no estén auditadas. Los benchmarks de SWE-2 son de la propia Cognition y nadie fuera de la empresa los ha reproducido. Los de Kimi K3 son en los que realmente se basa la comparación, y si enrutas a través de OrcaRouter puedes poner detrás una cadena de respaldo, de modo que un modelo que estés probando no se convierta en una dependencia de producción el día que te decepcione.

Screenshot of the OrcaRouter model page for Kimi K3, showing model ID kimi/kimi-k3, input $3.00 per 1M tokens, output $15.00 per 1M tokens, cache read $0.300, 1M-token context, text and image input, p50 time-to-first-token of 9.85 seconds, and 2,739.4M tokens of traffic over 7 days.

¿Quién debería actuar y qué lo resolvería?

Si ya pagas por Devin, SWE-2 es una buena noticia sin rodeos: está llegando a tu producto, es más barato por tarea que aquello a lo que reemplaza, y las cifras de eficiencia sugieren que desperdiciará menos turnos en el trabajo fácil. Pruébalo primero en la parte más simple de tu cola — el diseño por niveles de esfuerzo implica que el nivel medio es donde reside la ventaja de costo.

Si vas a elegir un modelo de programación desde fuera, espera una evaluación independiente. Todavía no hay ninguna: Artificial Analysis no tiene ninguna entrada para SWE-2, y la tabla de clasificación de FrontierCode es un instrumento de la propia Cognition. Tres cosas lo zanjarían. Una ejecución de SWE-2 por terceros en Terminal-Bench 4, que es la fila que decide si este es un modelo adyacente a la frontera o uno rápido. Cualquier reproducción independiente de la brecha de FrontierCode. Y un precio por token, lo que requeriría que Cognition vendiera el modelo fuera de Devin —el único cambio que haría que el 64% fuera comparable con cualquier otra cosa que te coticen.

Hasta entonces, el resumen justo es el que la brecha del modelo base ya te da. SWE-2 es Kimi K3 más cinco puntos, a un coste que Cognition diseñó dentro de la función de recompensa. Eso es un logro real en entrenamiento y una oferta genuinamente buena dentro de Devin. Todavía no es un modelo de frontera, y el único benchmark donde parece superarlo todo es el que dejó de contar.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario