
Gemini 4 Argon en FrontierSWE: grita «¡Eureka!» y luego califica su propia tarea
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 261 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 216 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
Gemini 4 Argon tiene un problema de personalidad, y es lo más interesante que alguien ha dicho sobre el modelo desde que Google lo anunció el 30 de septiembre de 2026. En el benchmark FrontierSWE de horizonte ultralargo, el modelo que quedó tercero —por detrás de GPT-6 Astra y Claude Opus 5.5— dejó a sus evaluadores una impresión memorable: su palabra favorita es «¡Eureka!», y pasa buena parte del presupuesto de veinte horas para la tarea siendo extremadamente duro consigo mismo. Esa es una observación de una sola fuente y cercana a una filtración, procedente de un operador de benchmark, no una afirmación de un proveedor ni una nota de lanzamiento, y vale la pena ser preciso sobre lo que te dice y lo que no. Ninguno de los tres modelos anteriores tiene asociada una fecha de disponibilidad general (GA) para Argon; la observación trata sobre el comportamiento dentro de un arnés de evaluación, y los números que la acompañan son la primera medición independiente de Argon en un benchmark que Google no ejecuta por sí mismo.
Qué es en realidad la exclamación «¡Eureka!»
La fuente es una publicación de @nrehiew_, un ingeniero que trabaja en evaluación de modelos, publicada el 2026-09-30, citando el anuncio de Gemini 4 Argon de Sundar Pichai. El contenido son tres afirmaciones: Argon es el modelo más divertido que han evaluado en FrontierSWE; su palabra favorita es "¡Eureka!"; y es extremadamente autocrítico. El autor lo describe como una gran mejora respecto a los Geminis anteriores, aunque conserva esa personalidad, y lo califica de impresionante.
Lee eso con atención, porque es fácil sobreinterpretarlo. Es la impresión de un evaluador al observar trazas de agentes, no un resultado puntuado, ni una métrica publicada, ni algo que Proximal Labs —quienes construyen y ejecutan FrontierSWE— haya respaldado con su nombre como un hallazgo. No hay una columna de "autocrítica" en la tabla de clasificación. Lo que hace que la observación merezca que se escriba sobre ella no es que sea autorizada; es que es la única lectura cualitativa que alguien fuera de Google ha ofrecido sobre Argon, y, como el modelo no está disponible de forma general, trazas como estas son actualmente la única manera de ver cómo se comporta.
También llega a una pregunta real para cualquiera que planee ejecutar Argon como agente. Las ejecuciones de codificación de largo horizonte son en su mayor parte un problema de gestión de presupuesto: un modelo que se interrumpe a sí mismo para reconsiderar, que evalúa su propio trabajo intermedio y que anuncia avances es un modelo que gasta tokens en proceso. Que eso sea una fortaleza o un impuesto depende enteramente de si la autocrítica converge o entra en bucle. Un único evaluador que dice "impresionante" es un punto de datos, no una respuesta.
FrontierSWE v2, y por qué el tercer puesto es la verdadera historia
FrontierSWE no es el tipo de benchmark del que se pueda leer una cifra de titular. Lo crea Proximal Labs y en su repositorio se describe como un benchmark de agentes de programación de horizonte ultralargo que evalúa implementación, ingeniería de rendimiento e investigación en ML. La versión 2 se lanzó en septiembre de 2026 con 21 tareas nuevas además del conjunto original, para un total de 34, y espera que un agente siga trabajando hasta veinte horas. Todo se ejecuta mediante el propio arnés de Proximal, proximus, que está construido sobre mini-swe-agent y añade compactación de contexto, visión y una herramienta explícita de envío. La puntuación es mean@5 —el promedio de cinco intentos por tarea— con la banda de incertidumbre reportada, que abarca desde el promedio de la peor ejecución de cada tarea hasta el promedio de su mejor ejecución.
Esa metodología es importante para leer la fila de Argon con honestidad:
• Puntuación — Gemini 4 Argon 55,0 % media@5, ±9,9, frente a GPT-6 Astra 65,5 % y Claude Opus 5.5 62,3 %
• Dispersión — Las ejecuciones de Argon van del 44,5% (peor@5) al 64,3% (mejor@5), un rango que se superpone con el 52,0%–71,5% de Opus 5.5 en el extremo superior, pero no se superpone con el 55,1%–73,0% de Astra en ningún punto.
• Costo por prueba — Argon $129,36, Opus 5.5 $98,87, Astra $1.029,65
• Tiempo real por ensayo — Argon 10,6 horas, Opus 5.5 14,2 horas, Astra 12,1 horas
Lo primero que notas es que Argon ocupa el tercer puesto y no está cerca del segundo en puntuación. Lo segundo —lo que debería decidir si te importa— es que en este benchmark Argon está estrictamente dominado por Claude Opus 5.5. Opus 5.5 obtuvo una puntuación más alta (62,3 % frente a 55,0 %) y costó menos por prueba ($98,87 frente a $129,36). Aquí no hay ningún eje en el que Argon gane. Su única ventaja es el tiempo: 10,6 horas frente a las 14,2 de Opus 5.5, lo cual es real si pagas por tiempo de reloj y no por tokens, e irrelevante si pagas por un presupuesto por prueba.
La propia tabla de clasificación de Proximal incluye una nota al pie en la fila de Argon que todos los que citen esta cifra deberían repetir: «Gemini 4 Argon: la tasa de aciertos de caché es mucho menor debido a una configuración no de producción». Es decir, los evaluadores señalan que ejecutaron Argon fuera de la configuración que usaría un despliegue de producción, lo que infla su coste y, de forma plausible, su latencia. Es una advertencia específicamente sobre la cifra de coste, y es la razón por la que $129.36 debería leerse como un límite superior y no como un tarifario.
El número que el propio gráfico de Google no muestra
Aquí es donde la obtención de fuentes se vuelve genuinamente interesante, y donde la mayoría de los análisis de este resultado se equivocarán. La publicación del anuncio de Google incluye un gráfico de referencia con una fila de FrontierSWE v2. Esa fila dice GPT-6 Astra 65,5 %, Claude Fable 5.1 56,3 %, Claude Opus 5.5 62,3 %. Gemini 4 Argon no aparece. La tabla de clasificación en vivo de Proximal tiene a Astra en 65,5 % y a Opus 5.5 en 62,3 % —las mismas cifras—, pero sitúa a Claude Fable 5.1 en 56,5 %, no en 56,3 %, y lista a Gemini 4 Argon en 55,0 %.
La razón de la omisión no es misteriosa, y Google mismo lo dice: las notas metodológicas que acompañan su suite de evaluación afirman que los resultados de FrontierSWE se reportan desde la tabla de clasificación pública oficial de Proximal. Google no calculó este benchmark por sí misma. Están citando a la misma tercera parte que nosotros, y la única cifra de Argon que publica esa tercera parte es el 55,0 %. Así que la lectura honesta es que la puntuación de Argon en FrontierSWE es una medición genuinamente independiente —Proximal la ejecutó, en su arnés de pruebas, con sus tareas— y que deja a Argon por detrás de dos competidores.
Todo lo demás en el gráfico de Google es reportado por el proveedor y debería etiquetarse así en tu cabeza: Argon 63.1% en Vals Index frente al 67.0% de Opus 5.5, 41.4% en AutomationBench frente al 42.5% de Opus 5.5, 89.6% en Vibe Code Bench frente al 90.3% de Astra y Opus 5.5, 87.5% en LVBench frente al 83.7%, 68.0% en CWE-bench v1 frente al 67.0% de Opus 5.5. Esas son las ejecuciones de Google de las evaluaciones elegidas por Google. La fila FrontierSWE es la única de esa imagen que un lector puede comprobar de forma independiente, y por eso precisamente el tercer puesto pesa más que el patrón de empate o ligera victoria a su alrededor.
Lo que dice Artificial Analysis, de forma independiente
FrontierSWE es una perspectiva. Artificial Analysis es la otra, y coincide con la forma de la historia. En su Intelligence Index v4.3.2, Gemini 4 Argon en su configuración de razonamiento alto obtiene 52.56 —medido de forma independiente en su propio hardware, no reportado por Google— a un precio de lista de $2.00 por millón de tokens de entrada y $10.00 por millón de tokens de salida, con un descuento del 95% en entrada cacheada. Su instrumentación sitúa el coste de una sola tarea del índice en $1.99.
La comparación que importa es la misma que produjo FrontierSWE. Claude Opus 5.5, en su configuración alta, obtiene una puntuación más alta en el índice, 53.58, con un coste por tarea más bajo, $1.82. Dos evaluadores independientes, usando distintas tareas y distintos sistemas de evaluación, sitúan a Argon por detrás de Opus 5.5 tanto en calidad como en coste. Eso es una señal consistente en lugar de un único artefacto de evaluación comparativa, y es lo más contundente que se puede decir actualmente sobre la economía de Gemini 4 Argon.

Anunciado, no lanzado — y por qué ese encuadre no es pedantería
No existe un ID de modelo Gemini 4 Argon. El acceso se está implementando a través del Fairwind Program para defensores cibernéticos verificados, junto con una apertura por fases para clientes de pago de la API y suscriptores de Google AI Ultra, sin que se haya publicado una fecha de disponibilidad general. La publicación de Google es el anuncio de un modelo y de un conjunto de evaluaciones, no el lanzamiento de un endpoint al que puedas llamar. Si has leído coberturas que lo describieron como un lanzamiento, esa cobertura va por delante de los hechos.
Esa distinción tiene consecuencias prácticas para cualquiera que lea la cifra de FrontierSWE. La evaluación se ejecutó contra un modelo al que Proximal tenía acceso bajo algún tipo de acuerdo; te dice lo que el modelo puede hacer, no lo que tú puedes tener. También significa que las cifras de rendimiento tienen una vida media más corta de lo habitual. Un modelo que aún no es GA todavía puede cambiar —la configuración de decodificación, los prompts de sistema, los valores predeterminados de uso de herramientas y el andamiaje de seguridad aún se están ajustando—, y la razón declarada de que la tasa de aciertos de caché de Argon fuera baja es precisamente que los evaluadores no estaban ejecutando una configuración de producción. Es de esperar que el 55.0% y los $129.36 cambien.
Qué cambiaría este panorama: un ID de modelo publicado con una lista de precios, una fecha de disponibilidad general (GA), una repetición de FrontierSWE en condiciones de producción y un segundo evaluador independiente que reproduzca el resultado del tercer puesto. Hasta que existan al menos los dos primeros, considera cada cifra de Argon —incluidas las buenas del propio gráfico de Google— como provisional.

La lectura de personalidad es la parte que mejor envejecerá.
Las puntuaciones de benchmark de un modelo pre-GA tienen una vida útil medida en semanas. La observación conductual, no. El trabajo de agentes de horizonte largo es donde el carácter del modelo realmente se manifiesta, porque un presupuesto de veinte horas con 34 tareas es suficiente cuerda para que las tendencias de un modelo se acumulen: cómo se recupera de un enfoque fallido, si se detiene a replanificar, si puede distinguir entre un problema difícil y un giro equivocado. Un evaluador que observa muchas de estas trazas y describe a un modelo como autocrítico y propenso a exclamar cuando algo funciona está describiendo a un modelo que externaliza su razonamiento sobre su propio progreso. Esa es una hipótesis sobre por qué las ejecuciones de Argon se extienden del 44,5 % al 64,3 % —una banda más amplia que la de Opus 5.5— y es comprobable una vez que el modelo sea invocable.
La otra mitad del comentario es la que hay que tomar con escepticismo. «Una gran mejora respecto a los Gemini anteriores» es una comparación con modelos que nunca fueron puntuados en este benchmark con este entorno de evaluación, así que no puede contrastarse con la tabla de clasificación en absoluto. Es una impresión, y como tal debe tratarse, por muy creíble que sea quien la ofrece.

Dónde te deja esto si realmente necesitas hoy un agente de horizonte largo
No se puede llamar Gemini 4 Argon, así que la pregunta práctica no es Argon frente a nada — es qué modelo deberías estar ejecutando para el trabajo para el que se evaluó Argon. El propio orden de FrontierSWE responde a eso: GPT-6 Astra encabeza la tabla con un 65,5 %, pero a $1.029,65 por prueba, aproximadamente diez veces el costo de los dos modelos que están por debajo, mientras que Claude Opus 5.5 ofrece un 62,3 % por $98,87. La mejor relación calidad-precio en este benchmark es Opus 5.5, y también es el modelo que superó a Argon en Artificial Analysis con un menor costo por tarea.
Ambos modelos, y la mayoría de los diez primeros del ranking —GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp y Muse Spark 1.2 entre ellos— se pueden enrutar a través de la única API de OrcaRouter junto con más de 200 más —una sola clave, 0 % de recargo, así que el precio de lista del proveedor es lo que pagas y un recorte de precio del proveedor se aplica de nuestro lado el mismo día. Esa última propiedad vale más de lo habitual en un modelo previo a su disponibilidad general: si el precio de Argon cambia entre ahora y la GA, cosa que la nota al pie sobre la caché de no producción sugiere que podría ocurrir, nada de tu integración cambia cuando eso pase. La conmutación automática por error es la otra pieza que encaja en este caso concreto —un modelo desconocido cuyos modos de fallo nadie ha trazado todavía es justo lo que no quieres en una única ruta de producción codificada de forma rígida.
Para ser explícitos sobre una cosa: Gemini 4 Argon no está en nuestro catálogo. Una consulta a nuestra API pública de modelos para google/gemini-4-argon devuelve "model not found", y nadie más lo aloja tampoco —está restringido tras el Programa Fairwind de Google, sin que se haya publicado ningún ID de modelo. Cuando se pueda invocar, lo enrutaremos, y las cifras de FrontierSWE de arriba son la razón para estar atentos a ese día en lugar de esperarlo. Los modelos contra los que perdió ya están ahí.
Qué ver
Las señales que harían que esto pasara de ser un "lo que sabemos hasta ahora" a una decisión son concretas. Un ID de modelo publicado y su tabla de tarifas. Una fecha de disponibilidad general. Una nueva ejecución de FrontierSWE en condiciones de producción, que resolvería si el coste de $129.36 por prueba es una tarifa real o un artefacto de la configuración de caché que Proximal señaló. Y, idealmente, un segundo evaluador que publique trazas de Argon para que la observación "Eureka!" deje de ser una muestra de uno.
Hasta entonces, el resumen honesto es limitado y conviene aferrarse a él: Gemini 4 Argon está anunciado, es inusualmente expresivo en trazas de agentes de horizonte prolongado según un evaluador, y en el único benchmark independiente que podemos verificar quedó tercero por detrás de dos modelos, uno de los cuales lo superó en puntuación y coste al mismo tiempo.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
