
Gemini 4 Argon vs. GPT-6 Astra: un empate técnico en el índice y una bajada de precio de dos tercios
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 144 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Dos modelos de frontera, separados por 0,11 puntos en el Índice de Inteligencia de Artificial Analysis. Gemini 4 Argon obtiene 52,56. GPT-6 Astra obtiene 52,67. Si tuvieras que elegir entre ellos según la capacidad general medida, podrías lanzar una moneda al aire, y la diferencia entre las dos puntuaciones es menor que el intervalo de confianza de cualquiera de las dos. Esa es una situación genuinamente rara en un mercado donde los diez mejores modelos abarcan unos quince puntos en total, y hace que esta sea la más fácil de analizar de las comparativas de Gemini 4 Argon, porque el argumento de capacidad se acaba antes de empezar y todo lo que queda es economía y acceso.
Sin embargo, los dos no son gemelos. Argon fue anunciado el 30 de septiembre de 2026 por Google DeepMind y se está desplegando por fases, empezando por defensores cibernéticos de confianza en el Fairwind Program. GPT-6 Astra se lanzó a principios de septiembre —nuestra ficha de catálogo lo fecha el 4 de septiembre de 2026 y Artificial Analysis lo registra el 3 de septiembre de 2026— y es una ruta activa a la que puedes llamar esta tarde a $10 de entrada y $50 de salida por millón de tokens, con una ventana de contexto de 1.050.000 tokens y un límite de salida de 128.000 tokens. Uno de estos modelos tiene un precio contra el que ya se te puede facturar hoy.
Dónde una diferencia de 0,11 puntos es real y dónde es ruido
Un índice es un compuesto, así que dos modelos que empatan en el compuesto pueden diferir de manera significativa en sus partes. Aquí las partes coinciden en su mayoría, con tres excepciones que vale la pena mencionar.
• Terminal-Bench 4.0 — GPT-6 Astra 59,1 % frente a Gemini 4 Argon 57,1 %. Astra lidera, por un estrecho margen.
• Razonamiento en contextos largos — GPT-6 Astra 80.7% Gemini 4 Argon 79.7%.
• GPQA Diamond — GPT-6 Astra 96,1 %. Argon no publica ninguna cifra en este ranking.
• CritPt — GPT-6 Astra 31,7 % frente a Gemini 4 Argon 27,1 %.
• SciCode — Gemini 4 Argon 61,8 % frente a GPT-6 Astra 56,5 %.
• Humanity's Last Exam — Gemini 4 Argon 57,1 % frente a GPT-6 Astra 54,7 %.
• AutomationBench-AA — Gemini 4 Argon 77.5% frente a GPT-6 Astra 68.5%.
• GDPval — Gemini 4 Argon 1.611 frente a GPT-6 Astra 1.542.
• Omnisciencia — GPT-6 Astra 43,4 frente a Gemini 4 Argon 42,4.
• ITBench-SRE — GPT-6 Astra 48,6 % frente a ninguna cifra publicada de Argon.
• Velocidad de salida — GPT-6 Astra: 51,2 tokens por segundo frente a Gemini 4 Argon: 48,9. En la práctica, al mismo nivel.
• Latencia del primer token en el arnés de índice — Gemini 4 Argon 2,8 segundos frente a GPT-6 Astra 320,2 segundos.
Astra mantiene ventajas en el razonamiento científico de opción múltiple, en problemas de física de puntos críticos y en el benchmark SRE. Argon mantiene ventajas en la programación científica, en el conjunto de tareas de extremo a extremo más difíciles y en el trabajo valorado por el PIB. Ninguna de las dos ventajas es lo suficientemente grande como para ser la base de una migración por sí sola.

La línea de latencia es otro asunto. 320 segundos hasta el primer token son cinco minutos y medio de silencio antes de que se emita algo, frente a menos de tres segundos para Argon. Ambos miden lo mismo —el tiempo hasta el primer fragmento en las ejecuciones del índice de Artificial Analysis—, así que la comparación es válida. El razonamiento de Astra siempre está activado y se puede configurar desde un esfuerzo bajo hasta uno máximo; una ejecución con esfuerzo máximo en una tarea difícil de verdad piensa durante minutos antes de hablar. Que eso sea un defecto depende por completo de tu interfaz. Para un trabajo por lotes no cuesta nada. Para cualquier cosa con un usuario mirando un indicador de carga, es la diferencia más visible para el usuario entre estos dos modelos, mayor que cualquier diferencia de benchmarks en la página.
El paso de precio, que es el verdadero tema
Aquí es donde se rompe el empate, y se rompe de una manera que es fácil de modelar mal porque la tarjeta de tarifas de Astra tiene tres niveles que se parecen entre sí.
• Estándar, hasta 272.000 tokens de entrada — GPT-6 Astra $10,00 de entrada / $50,00 de salida, lecturas en caché a $1,00 y escrituras en caché a $12,50.
• Contexto largo, por encima de 272,000 tokens de entrada — GPT-6 Astra $20.00 de entrada / $75.00 de salida, lecturas en caché a $2.00. Toda la solicitud se vuelve a tarificar con la tarifa superior, no solo el excedente: 2× en entrada y 1.5× en salida.
• Modo rápido — 2× la tarifa estándar aplicable, es decir, $20.00 de entrada / $100.00 de salida. Esta es la cifra de $100 que se cita como si fuera la tarifa de contexto largo; no lo es.
• Gemini 4 Argon — $2.00 de entrada / $10.00 de salida, tarifa plana sobre la base introductoria, entrada en caché a $0.10, sin escalón publicado y sin nivel rápido publicado.
Así que Argon es cinco veces más barato en entrada y cinco veces más barato en salida que el nivel estándar de Astra, y diez veces más barato en entrada por encima de 272K. Dos mediciones de coste independientes señalan lo mismo desde una dirección distinta: Artificial Analysis sitúa a Argon en 1,99 $ por tarea de índice frente a los 3,26 $ de Astra, y 2.407 $ por ejecutar el índice completo frente a los 5.324 $ de Astra. La ratio por tarea es menor que la ratio por token por la misma razón que lo era frente a DeepSeek —Argon ejecuta menos tokens para terminar—, pero sigue siendo de 1,6×.
El tablero de Vals ponderado por el PIB cuenta una tercera versión de la misma historia: Argon primero con 68.90% y $15.68 por ejecución, Astra sexto con 63.13% y $18.46. Astra es más caro y obtiene una puntuación más baja allí. El material de Google deja claro que el precio es una tarifa introductoria, que es una palabra que significa que puede moverse, y la lectura honesta es que la ventaja de precio de Argon es real y que su permanencia no está garantizada.
Dos hechos de arquitectura que deciden más que los benchmarks

Primero, el techo de salida. Gemini 4 Argon genera hasta 1.000.000 de tokens en una sola trayectoria —el anuncio de Google lo señala como una ampliación desde 64K en la generación anterior. GPT-6 Astra se limita a 128.000. Ambos mantienen una ventana de contexto de alrededor de un millón de tokens, así que esto se trata puramente de cuánto puede escribir el modelo de una sola vez. Para la generación de texto extenso, cambios de código de parche completo o redacción de documentos en una sola pasada, esa es una diferencia de ocho veces en lo que puede producir una sola llamada. Para chat, extracción y pasos breves de agentes, ambos techos son efectivamente infinitos y la diferencia no te cuesta nada.
Modalidad, en segundo lugar, y aquí la ventaja va en sentido contrario en un aspecto. GPT-6 Astra acepta texto, imágenes y archivos. Gemini 4 Argon acepta texto, imágenes, video y archivos, y el material de lanzamiento de Google se apoya específicamente en la comprensión de video largo —una cifra de LVBench del 91,7 % que reporta el proveedor—. Si tu pipeline ingiere video, Astra no es un sustituto. El audio tampoco aparece en la lista publicada de modalidades de Argon, así que no asumas que la actualización lo incluye.
Qué hacer realmente
Astra está disponible y Argon no, y eso resuelve la mayoría de las decisiones para el próximo mes. La ruta concreta que no desperdicia trabajo: construye sobre GPT-6 Astra si tu carga de trabajo necesita un modelo de razonamiento siempre activo con una sólida precisión científica y un historial agéntico comprobado; mantén el nombre de tu modelo en la configuración y configura los tiempos de espera de tu cliente a partir del comportamiento medido de Astra, no del optimismo; una ejecución de cinco minutos hasta el primer token activará un tiempo de espera predeterminado de 60 segundos, y un flujo que se corta a los 300 segundos parece una interrupción. Si eres sensible a los costos por encima de 272 K tokens de entrada, modela explícitamente el reajuste de precios antes de comprometerte, porque el escalón duplica la entrada y aumenta la salida en un 50 % en un solo umbral.

El término medio interesante es que no tienes que elegir un único predeterminado. Astra y Argon —cuando Argon se lance— son el mismo tipo de modelo orientado al mismo tipo de trabajo, lo que los convierte en socios naturales de conmutación por error en lugar de competidores por el mismo puesto. En OrcaRouter, openai/gpt-6-astra está disponible al precio de lista del proveedor sin ningún recargo, en el mismo endpoint compatible con OpenAI que más de 200 otros modelos, con conmutación por error automática entre proveedores y un DSL de enrutamiento para expresar una configuración de principal y respaldo en una sola clave. Cuando Argon se una al catálogo con el id que publique Google, el cambio es una cadena: sin un segundo contrato, sin trabajo de integración y sin reconstruir lo que hayas construido en torno a Astra mientras tanto.
¿Qué rompería el empate de forma permanente?
Un precio de Argon publicado tras el periodo introductorio, y una reproducción independiente de las afirmaciones agénticas de Google —la cifra del 77,9 % en DeepSWE v1.1 y el resultado del 68 % en CWE-bench v1 proceden ambas del proveedor y ninguna cuenta con una ejecución externa que las respalde. Cualquiera de las dos podría mover a Argon al alza o a la baja de forma significativa, porque una ventaja de 0,11 puntos en el índice no es un colchón frente a una desventaja de coste de 1,6× si la ventaja de coste resulta ser temporal, y no es un déficit si Google mantiene la tarifa introductoria y el nivel de contexto largo de Astra muerde con más fuerza de la esperada en producción.
Por ahora: según la capacidad general medida, estos dos son el mismo modelo en dos envoltorios. Astra es el que tiene una ruta activa, un escalón de precio conocido y una pausa de pensamiento de cinco minutos. Argon es el que tiene una tarjeta más barata y ningún endpoint. El empate es real, y uno de sus lados es comprable.
