
GPT-6 vs Gemini 4 Argon: Casi un empate entre un modelo en una lista de precios y otro en una lista de espera
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
El par de modelos más cercano en el tablero de frontera actual no es un par que puedas comprar. Gemini 4 Argon obtiene 52,6 en el Intelligence Index v4.3.2 de Artificial Analysis. GPT-6 Astra, el buque insignia de OpenAI, obtiene 52,7. Esa es una diferencia de una décima de punto en diez evaluaciones, y ambas cifras provienen de la misma revisión de la misma suite. Es el emparejamiento más ajustado en la cima de la tabla del conjunto.
Hay una simetría en ese número y ninguna en absoluto en la disponibilidad. Google anunció Gemini 4 Argon el 30 de septiembre de 2026, a un precio introductorio declarado de 2,00 dólares por millón de tokens de entrada y 10,00 dólares por millón de salida, y se lanzará primero a un grupo designado de defensores cibernéticos mediante un programa al que Google llama Fairwind. No tiene un identificador de modelo de API publicado, ni fecha de disponibilidad general, ni un endpoint que un cliente pueda llamar hoy. GPT-6 Astra se puede comprar desde el 3 de septiembre de 2026 y, a partir del 7 de octubre de 2026, la familia GPT-6 es también a la que ChatGPT dirige a más de 1200 millones de usuarios semanales, con GPT-6 Sol, no Astra, impulsando los niveles de pago de ese despliegue.
Así que la comparación es real, pero asimétrica de una manera que cambia cómo debería leerse. Los números de Argon describen un modelo en un despliegue controlado. Los de GPT-6 describen un producto con una lista de precios. Todo lo que sigue mantiene la salvedad de "si pudieras comprarlo", y nada de lo que sigue responde a "¿deberías cambiar?", porque todavía no hay nada a lo que cambiarse.
¿Qué se sabe realmente sobre la contraparte que existe?
Empieza por el lado que existe, porque la comparación solo tiene una mitad práctica. GPT-6 se lanza en tres niveles, y aquí solo importan dos:
• GPT-6 Astra — el modelo insignia, id del modelo gpt-6-astra, lanzado el 3 de septiembre de 2026, contexto de 1,050,000 tokens, salida de 128,000 tokens, entrada de texto/imagen/archivo, esfuerzo de bajo a máximo, $10.00 por millón de tokens de entrada y $50.00 de salida, con reprecio a $20.00/$75.00 para toda la solicitud por encima de 272,000 tokens de entrada
• GPT-6 Sol — el nivel intermedio, lanzado el 22 de septiembre de 2026, mismos límites de contexto y de salida, $2.00/$10.00 con el tramo de contexto largo de $4.00/$15.00, y el modelo que OpenAI puso en ChatGPT Plus, Pro, Business y Enterprise el 7 de octubre de 2026
• GPT-6 Luna — el nivel económico a $0.10/$0.50, que da servicio a ChatGPT Free y Go
La parte de Argon en esa lista ocupa una sola línea. El anuncio de Google dio un precio introductorio, un encuadre de capacidades —programación del mundo real, trabajo del conocimiento empresarial y ciberdefensa— y un plan de despliegue. No dio una cadena de modelo, una ventana de contexto, una salida máxima, una tarifa de entrada en caché, un calendario de deprecación ni una fecha para un acceso más amplio. La ausencia de un identificador de modelo es la que tiene relevancia práctica: cualquier ejemplo de código que veas en línea que cite una cadena de modelo de Gemini 4 Argon no es más que una conjetura, porque no hay ninguna cadena que citar.
La única medición totalmente comparable, y lo que esconde
Un solo medidor te permite comparar Argon con un modelo GPT-6 sin ningún "si" de por medio, porque Artificial Analysis ejecutó ambos: el costo de producir una respuesta final en la suite de evaluación.
• Coste por tarea de indexación completada — Gemini 4 Argon $1,99 frente a GPT-6 Astra $3,26, una diferencia de 1,6× a favor de Argon
• Tokens de salida generados en toda la suite — Gemini 4 Argon 112,8 M frente a GPT-6 Astra 108,8 M, prácticamente a la par
• Índice de inteligencia, v4.3.2 — Gemini 4 Argon 52,6 frente a GPT-6 Astra 52,7, un empate técnico
• Precio indicado — $2,00 de entrada y $10,00 de salida por 1 M en Argon, como tarifa introductoria frente a la tarifa habitual de $10,00/$50,00 de Astra
• Ventana de contexto — GPT-6 Astra 1.050.000 tokens frente a la de Argon, no publicada
Vuelve a leer esa primera línea, porque es la única sorpresa en esta página. Las tarifas anunciadas de Argon son una quinta parte de las de Astra, y su coste por tarea en la misma suite es un 39% menor. Un modelo que obtiene la misma puntuación que el insignia, con una quinta parte de la tarifa de entrada, sería la noticia del trimestre, si se le puede llamar así.

La segunda línea es la razón por la que la primera línea es menos dramática de lo que parece, y va en sentido contrario al argumento habitual sobre la verbosidad. Argon y Astra escribieron casi exactamente la misma cantidad de tokens para producir casi exactamente la misma puntuación. No hay una brecha de verbosidad que explique la diferencia de costos — la diferencia de $1.27 proviene del tarifario, no de que un modelo divague. Eso la convierte en una comparación más limpia que la mayoría de este lote, y hace que la disponibilidad faltante sea lo único que se interpone entre Argon y una recomendación directa.
La propia tabla de Google no es la independiente
Google publicó una tabla de lanzamiento para Argon comparándolo con GPT-6 Astra en diecinueve benchmarks. Si se lee esa tabla por sí sola, Argon gana catorce, Astra gana cuatro y uno es un empate. Es un resultado llamativo y debería tratarse con cuidado: cada número de ella proviene de Google, seleccionado y ordenado por Google, y nada de ello ha sido reproducido de forma independiente. Es el argumento de Google a favor de Argon, que es para lo que sirve una tabla de lanzamiento, y en una comparación debería figurar como una afirmación etiquetada de un proveedor, no como evidencia.
Compáralo con la prueba independiente y el panorama cambia de carácter. En la batería de Artificial Analysis, ambos están empatados en 52,6 y 52,7 —una ventaja mucho menor de lo que implica un 14 a 4, y en una batería que ningún proveedor armó. El resumen honesto es que Argon es plausiblemente el igual de Astra y posiblemente mejor en ingeniería de software, que la tabla del proveedor imagina una brecha mucho mayor que la que encuentra la independiente, y que hasta que alguien ajeno a Google lo ejecute en algo que no sean tareas de Google, nada de esto queda resuelto.

Por qué un modelo no lanzado merece igualmente una sección
Porque el patrón de despliegue de Google es en sí mismo información, y señala hacia dónde va el próximo lanzamiento de la gama Pro. Google se pasó 2026 lanzando modelos de la gama Flash —la línea Flash 3.5, 3.6 y 3.8, las variantes Lite, un Flash 3.8 ajustado para ciberseguridad— mientras la gama Pro se quedó en Gemini 3.1 Pro Preview, un modelo que ha estado en vista previa desde febrero de 2026 sin compromiso de disponibilidad general ni fecha de retirada. Argon es el primer movimiento en la cúspide de la línea en siete meses, y salió primero hacia los defensores en lugar de hacia los desarrolladores.
Esa secuenciación es una decisión coherente: la ciberseguridad es la carga de trabajo donde un modelo de frontera con uso agéntico de herramientas y autonomía de largo horizonte tiene el valor más claro y medible, y también es la carga de trabajo donde un proveedor quiere una cohorte controlada antes del lanzamiento general. No es evidencia de que el modelo no esté listo. Es evidencia de que Google está tratando la disponibilidad general como una decisión posterior en lugar de una del día del lanzamiento, que es exactamente lo que el identificador de modelo ausente y la fecha ausente dicen de otra manera.
Para quien construye, la consecuencia es simple: no puedes planificar en torno a Argon. Sí puedes planificar en torno a GPT-6 Astra o GPT-6 Sol, porque ambos tienen identificadores, endpoints, tarifas y un proveedor que ya ha publicado una política de retirada para la línea. Un modelo sin identificador es un modelo para el que no puedes escribir un adaptador.
¿Qué cambiaría esta comparación?
Tres cosas, y cualquiera de ellas convierte el artículo anterior en una cuestión resuelta. La primera es un identificador de modelo —una cadena real servida desde la API de Google, porque ese es el punto en el que un adaptador se vuelve escribible y una estimación de integración se vuelve significativa. La segunda es una fecha de disponibilidad general, que es lo que distingue una vista previa de un producto y es la única fecha que el anuncio de Argon omitió por completo. La tercera es un benchmarking independiente en tareas que Google no eligió; un conjunto ensamblado por el proveedor es una afirmación, y un conjunto ensamblado por otra persona es una medición.
Hasta que existan los tres, el papel de Argon en una comparación es como un techo más que como una opción. Sus cifras te indican hacia dónde se dirige el nivel Gemini Pro y te dan una idea de cuánto margen de precio tiene Google en la gama alta. No te dicen sobre qué construir.
Qué hacer mientras Argon espera
Si la razón por la que estás aquí es que los números de Argon se ven bien, lo útil es probar la misma clase de carga de trabajo contra el modelo que realmente puedes llamar hoy y, para ingeniería de software y trabajo agéntico de horizonte largo, eso significa GPT-6 Astra. Está en el catálogo de OrcaRouter con el propio patrón de precios de traspaso de Google — los $10.00/$50.00 del proveedor con el nivel de contexto largo de $20.00/$75.00, con un 0 % de margen, de modo que un cambio de tarifa del proveedor te llega el mismo día en lugar de en el siguiente ciclo de facturación. GPT-6 Sol a $2.00/$10.00 también está ahí, y para la mayoría de las cargas de trabajo es la mejor compra: obtiene 47.6 frente a los 52.7 de Astra, y cuesta aproximadamente un tercio por tarea completada.
La capa de enrutamiento es lo que hace que el calendario de despliegue de un proveedor sea sobrevivible. Cuando Argon reciba un identificador, no tiene por qué convertirse en un proyecto de migración: una regla de enrutamiento puede enviarle una parte de tu tráfico, o usar la configuración de fusión de modelos para ejecutar un panel y comparar respuestas, mientras que GPT-6 Astra o Sol sigue siendo el predeterminado por detrás. La conmutación por error automática cubre el caso que más importa aquí — un modelo en un despliegue controlado es exactamente el tipo de ruta que puede verse limitada por tasa o retirada sin previo aviso, y una ruta de respaldo hace que eso se convierta en una solicitud lenta en lugar de una interrupción del servicio.

Lo que no hay que hacer es poner en marcha un plan de migración en torno a una tabla de lanzamiento para un modelo sin endpoint. La diferencia con GPT-6 Astra es de una décima de punto y la diferencia de precio es real, pero ninguna de las dos justifica reconstruir una integración para algo a lo que no puedes enviar una solicitud.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
