
Gemini 4 Argon vs Claude Opus 5.5: La división de benchmarks que nadie esperaba
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Gemini 4 Argon y Claude Opus 5.5 no se ponen de acuerdo sobre quién es mejor, y la discrepancia no es ruido. En el Intelligence Index de Artificial Analysis, los dos están a cinco puntos de distancia a favor de Opus 5.5. En el Vals Index —la tabla de impacto económico ponderada por el PIB— Gemini 4 Argon ocupa el número uno y Claude Opus 5.5 ocupa el número tres, por detrás tanto de Argon como de Claude Sonnet 5.5. Ambas tablas midieron los mismos dos modelos en la misma semana. Eso es todo el artículo: cuál deberías elegir depende de si tu trabajo se parece más a una pregunta de examen o a un martes en un bufete de abogados, y de si tienes acceso a la API de Argon, que a día de hoy casi nadie tiene.
Google anunció Gemini 4 Argon el 30 de septiembre de 2026 en una publicación de DeepMind atribuida a Koray Kavukcuoglu, vicepresidente sénior de Google DeepMind y arquitecto jefe de IA. Anthropic lanzó Claude Opus 5.5 ocho días antes, el 22 de septiembre de 2026. Uno de esos es una versión de disponibilidad general (GA) a la que puedes llamar esta tarde. El otro es un despliegue por fases dirigido a una cohorte designada de defensores cibernéticos más los propios ingenieros de Google, con la intención declarada de llegar a "clientes de pago de la API y suscriptores de Google AI Ultra" tan pronto como las salvaguardas estén listas y sin fecha asociada a eso.
La respuesta en una línea, antes del detalle.
Si necesitas hoy el mejor razonamiento general medido y lo necesitas en una clave de producción, Claude Opus 5.5 está disponible en OrcaRouter ahora mismo y Gemini 4 Argon no está en ninguna API pública. Si estás creando para agentes de finanzas, legal, impuestos o codificación que se puntúan por producción económica por dólar, los números de Argon son mejores y su precio es una quinta parte del de Opus 5.5 por tarea en el único tablero que mide exactamente eso. Si estás en ciberseguridad defensiva para infraestructura crítica, Argon tiene un programa al que puedes postularte y la respuesta podría ser sí.
De dónde viene realmente cada número
Dos comités de índices, dos metodologías, y vale la pena ser precisos sobre cuál es cuál, porque los dos bandos se citarán mutuamente pasándose por alto durante meses.
• Artificial Analysis Intelligence Index v4.3 — Claude Opus 5.5 con 57,6 y Gemini 4 Argon con 52,6, ambos tomados de Artificial Analysis el 2026-09-30. Es un compuesto de diez evaluaciones, deliberadamente generalista en cuanto a tareas, y es la tabla que la mayoría de la gente cita como «el» ranking.
• Vals Index, actualizado el 2026-09-29 — Gemini 4 Argon primero con 68,90 % (±0,97), Claude Sonnet 5.5 segundo con 67,04 % (±0,92), Claude Opus 5.5 tercero con 66,97 % (±0,89). Vals pondera las tareas financieras, de programación, jurídicas y fiscales según la proporción de cada sector en el PIB de EE. UU., por lo que un modelo mediocre en rompecabezas pero excelente en revisión de contratos y trabajo con hojas de cálculo puntúa bien aquí.
Una brecha de cinco puntos en AA es real y no es pequeña. Una brecha de dos puntos en Vals también es real, y con los intervalos de confianza impresos en la tabla de clasificación, el 68,90 ±0,97 de Argon frente al 66,97 ±0,89 de Opus 5.5 es una separación de aproximadamente 1,5 errores estándar — mejor que lanzar una moneda al aire, pero lejos de ser abrumadora. Ninguna de las dos tablas está equivocada. Están midiendo trabajos diferentes.

Una salvedad sobre la configuración, y va en contra de interpretar la brecha de AA como una comparación pura de modelos. Artificial Analysis sitúa a Gemini 4 Argon en su alta configuración de esfuerzo y a Claude Opus 5.5 en «Razonamiento adaptable, esfuerzo máximo, reserva predeterminada». Esos no son el mismo punto en las dos escalas de esfuerzo, así que el titular de 57,6 frente a 52,6 no es una comparación homogénea con presupuestos de razonamiento igualados. Es el número que publican ambas páginas, y es el número que hay que citar si se quiere ser justo con Anthropic, pero no es un experimento controlado.
El costo por tarea es donde la brecha se vuelve incómoda
Artificial Analysis también publica un desglose de lo que costó ejecutar su conjunto de índices, y aquí los dos modelos no están ni cerca.
• Coste por tarea de indexación — Gemini 4 Argon $1.99 frente a Claude Opus 5.5 $5.98.
• Coste de ejecutar toda la suite de índices — Gemini 4 Argon $2,407 frente a Claude Opus 5.5 $8,708.
• Precio de lista por millón de tokens: Gemini 4 Argon, $2 de entrada / $10 de salida (tarifa introductoria indicada por Google, con la entrada en caché al 95 % de descuento, es decir, $0.10) frente a Claude Opus 5.5, $4 de entrada / $20 de salida.
• Rendimiento — Gemini 4 Argon: 48,9 tokens de salida por segundo, primer token tras 2,79 segundos; Claude Opus 5.5: 92,2 tokens de salida por segundo, pero con una latencia del primer token de 702 segundos en el mismo banco de pruebas, lo que es el impuesto del razonamiento extendido quedando a la vista.
• Coste de Vals por ejecución — Gemini 4 Argon $15,68 frente a Claude Opus 5.5 $32,14 en el mismo conjunto de tareas ponderado por PIB.
Hay un detalle que conviene señalar en lugar de minimizar: la tabla de clasificación de Vals enumera las tarifas de Argon como $4 de entrada / $20 de salida, mientras que el anuncio de Google indica $2 de entrada / $10 de salida para el período introductorio. La lectura más probable es que Vals muestra una tarifa de lista estándar y Google muestra una promocional, pero eso es una inferencia y no una declaración publicada por ninguna de las dos partes. Si tu presupuesto depende de esa cifra, pregúntale a Google.
Lo que Argon afirma y lo que se ha comprobado

La publicación de Google está densa en cifras y todas ellas están reportadas por el proveedor. Ninguna ha sido reproducida de forma independiente que yo haya podido encontrar, y los tableros independientes anteriores miden cosas diferentes de las que Google eligió destacar. Expresado como afirmaciones del propio Google:
• DeepSWE v1.1 — 77.9%, descrito como un nuevo estado del arte en la ingeniería de software de largo horizonte del mundo real.
• Comprensión de video largo de LVBench — 91,7 %, descrito como estado del arte.
• AutomationBench (el benchmark de Zapier para tareas empresariales de extremo a extremo) — puesto n.º 1 con 51,3 %.
• Remediación de vulnerabilidades de CWE-bench v1 — empatado en el primer puesto con un 68 %, sobre la base del resultado de Gemini 3.8 Flash Cyber en el panel v0.
• Gray Swan Indirect Prompt Injection — descrito como líder, sin cifra publicada en la entrada.
• Vals Finance Agent v2 y el Harvey's Legal Agent Benchmark — descritos como líderes, igualmente sin una cifra impresa en el anuncio.
Las dos familias de afirmaciones que sí cuentan con respaldo independiente son las más dignas de confianza: Vals confirma la posición en el índice con una cifra y un intervalo, y Artificial Analysis confirma un índice de 52,6 y el precio. Las anécdotas de productividad interna —una mejora del 40 % sobre una línea base publicada en una subrutina cuántica, más de 300 TiB de memoria liberada en toda la flota de Google por agentes Argon— son resultados internos de la empresa sin prueba externa, y deben leerse como tales.
Qué es Opus 5.5, si has estado viviendo bajo una roca
Claude Opus 5.5 es el buque insignia de Anthropic: contexto de 1M de tokens, salida máxima de 128K, entrada multimodal en texto, imagen y archivo, pensamiento extendido, uso de herramientas y salidas estructuradas. Sucedió a Claude Opus 5 el 22 de septiembre de 2026 y podría decirse que el titular de su lanzamiento fue el recortede precio: la gama bajó en lugar de subir, a $4/$20 con lecturas en caché a $0.20. Hoy se puede enrutar en OrcaRouter exactamente a esa tarifa, con el precio de lista del proveedor trasladado con margen cero, y un cambio de precio del proveedor llega a nuestro lado el mismo día en que llega al suyo.
En las puntuaciones a nivel de tarea que ambos modelos tienen, el panorama es un auténtico vaivén en lugar de una barrida:
• Terminal-Bench 4.0 — Claude Opus 5.5 59,6 % frente a Gemini 4 Argon 57,1 %.
• SciCode — Claude Opus 5.5 66,9% frente a Gemini 4 Argon 61,8%.
• Humanity's Last Exam — Claude Opus 5.5 61,4 % frente a Gemini 4 Argon 57,1 %.
• Razonamiento de contexto largo — Claude Opus 5.5 84,7 % frente a Gemini 4 Argon 79,7 %.
• CritPt — Claude Opus 5.5 31,7 % frente a Gemini 4 Argon 27,1 %.
• Omnisciencia — Claude Opus 5.5 46,4 frente a Gemini 4 Argon 42,4.
• GDPval — Claude Opus 5.5 1.846 frente a Gemini 4 Argon 1.611.
• AutomationBench-AA — Gemini 4 Argon 77,5 % frente a Claude Opus 5.5 69,5 %. Esta es la única puntuación de tarea cara a cara en la que Argon gana claramente, y también es la familia de tareas más cercana a lo que recompensa el Vals Index.
Así que el patrón es consistente: Opus 5.5 va por delante en la escala de razonamiento de corte académico, y Argon va por delante en la ejecución de tareas de extremo a extremo. Eso ya no es una contradicción entre los dos rankings. Es el mismo hallazgo expresado dos veces.
La capacidad que nadie está comparando
El techo de salida de Gemini 4 Argon es de 1,000,000 de tokens en una sola trayectoria, frente a los 64K de la generación anterior. Claude Opus 5.5 limita la salida a 128K. Ambos mantienen una ventana de contexto de 1M de tokens, pero contexto y salida son presupuestos distintos, y este es el mayor salto en una sola especificación del anuncio.
Que eso importe depende por completo de lo que ejecutes. Un techo de salida de 128K es generoso para chat, revisión de código, extracción estructurada y pasos de agente. Es un muro infranqueable para generar todo un conjunto de parches de migración, un informe de auditoría completo o un documento extenso de una sola pasada: los flujos de trabajo con los que Google eligió ilustrar el lanzamiento. Si tu canalización encadena veinte llamadas para mantenerse por debajo de un límite, el techo de Argon te ahorrará latencia y código de orquestación. Si no lo hace, estás pagando por un margen que no vas a usar.
La disponibilidad es la variable decisiva, no la calidad
Esta es la parte de la comparación que no tiene ningún punto de referencia adjunto y que importa más que todos ellos.
Gemini 4 Argon no está disponible de forma general. La publicación de Google dice que se está implementando para defensores cibernéticos de confianza a través del Fairwind Program, que la empresa participa en el proceso voluntario del gobierno de EE. UU. de acceso a modelos antes de su lanzamiento, y que el acceso más amplio para desarrolladores, empresas y consumidores llegará "lo antes posible", comenzando con clientes de pago de API y suscriptores de Google AI Ultra. No hay identificador de modelo, ni endpoint, ni cuota publicada, ni fecha. No está en nuestro catálogo y tampoco está en la API pública de nadie más, así que todavía no existe una página de precios para Argon.
Claude Opus 5.5 llega hoy. En OrcaRouter es anthropic/claude-opus-5.5, al que se accede a través del mismo endpoint compatible con OpenAI que los otros más de 200 modelos del catálogo, con conmutación automática por error entre proveedores cuando una ruta se degrada, y un DSL de enrutamiento para los casos en los que quieras enviar parte del tráfico a Opus 5.5 y el resto a otro destino con la misma clave. Sin un segundo contrato, sin un segundo SDK.

La recomendación práctica para el próximo mes no tiene nada de glamuroso: construye sobre Opus 5.5, mantén el nombre de tu modelo en un valor de configuración en lugar de en un literal de cadena, y pon un modelo barato detrás de tu ruta de reintentos para que un pico de latencia en una ejecución de 702 segundos hasta el primer token no se lleve tu producto por delante. Ese último punto no es teórico: la latencia hasta el primer token de Opus 5.5 en el harness de AA es de once minutos, y que eso sea un artefacto del harness o que el modelo realmente piense durante más tiempo que cualquier otro anterior, tu presupuesto de timeout debería fijarlo esa cifra, no el marketing.
¿Qué cambiaría este veredicto?
Tres cosas, en orden de probabilidad. La disponibilidad general de Argon con un precio publicado, lo que haría que el argumento del coste fuera inmediatamente accionable y pondría a prueba si $2/$10 sobrevive al contacto con tráfico real. Una ejecución independiente y reproducible de DeepSWE v1.1 y CWE-bench v1 fuera de Google, que o bien confirmaría las afirmaciones del proveedor o bien las desmentiría. O una configuración de Artificial Analysis de Argon en su ajuste de esfuerzo máximo, que resolvería si la brecha de cinco puntos en el índice es una diferencia de capacidad o un artefacto de los ajustes de esfuerzo.
Hasta que uno de esos se materialice, el resumen honesto es que Opus 5.5 es el modelo mejor verificado y Argon es la afirmación con mejor precio. Cuál de esos puedes usar realmente hoy no es una decisión reñida.
Claude Opus 5.5 ya está disponible en OrcaRouter a la tarifa de lista del proveedor, sin recargo, junto con el resto del catálogo; si quieres medir su rendimiento con tu propia carga de trabajo en lugar de con una tabla de clasificación, anthropic/claude-opus-5.5 es el id que debes usar para llamarlo, y cambiar a otro modelo más adelante es un cambio de una sola línea en la misma clave.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
