
Gemini 4 Argon vs. GPT-6 Sol: un quinto del precio, cuatro veces la factura
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 219 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Ejecuta la suite de índices de Artificial Analysis en Gemini 4 Argon y factura $2,407. Ejecuta la misma suite en GPT-6 Sol y factura $1,546. Mismo índice, mismas tareas, misma semana. Los dos modelos tienen precios de lista idénticos — $2.00 por millón de tokens de entrada y $10.00 por millón de tokens de salida, Argon como una tarifa introductoria declarada de Google y Sol como la tarifa estándar de OpenAI — y sin embargo, el costo final de realizar un trabajo idéntico difiere en un 56%, a favor del modelo que obtiene cinco puntos menos. Esa brecha es la razón principal por la que vale la pena escribir esta comparación, y no tiene nada que ver con el tarifario.
Google anunció Gemini 4 Argon el 30 de septiembre de 2026, calificándolo como la próxima era de la inteligencia de frontera, con un precio de $2 de entrada y $10 de salida, con la entrada en caché al 95 % de descuento, y se está desplegando para defensores cibernéticos de confianza a través del Fairwind Program. GPT-6 Sol está disponible de forma general desde el 22 de septiembre de 2026, cuando OpenAI lanzó el nivel intermedio de la línea GPT-6 a $2 de entrada y $10 de salida con un 90 % de descuento en caché. Uno se puede comprar hoy en un endpoint compatible con OpenAI y el otro no lo puede comprar nadie fuera de una cohorte designada, que es la bifurcación práctica de este artículo. Pero la inversión de costos anterior se mantiene incluso si dejas de lado la disponibilidad por completo, y entender por qué es la parte útil.
La inversión, dicha claramente
Artificial Analysis publica tanto un Índice de Inteligencia como un desglose de lo que costó ejecutar ese índice. Leídos en conjunto, dicen lo siguiente:
• Índice de Inteligencia — Gemini 4 Argon 52.6 frente a GPT-6 Sol 47.5. Una diferencia de cinco puntos, medida con Argon registrado en su alta configuración de esfuerzo y Sol en máxima, por lo que la comparación es generosa con Sol más que con Argon.
• Precio de lista por millón de tokens — idéntico. $2.00 de entrada / $10.00 de salida en ambos. Las lecturas de caché son la única diferencia: $0.10 en Argon, $0.20 en Sol.
• Costo por tarea de indexación — Gemini 4 Argon $1.99 frente a GPT-6 Sol $1.05. Argon cuesta aproximadamente el doble por tarea a pesar de costar lo mismo por token.
• Coste de ejecutar la suite completa — Gemini 4 Argon $2,407 frente a GPT-6 Sol $1,546.
• Velocidad de salida medida — GPT-6 Sol 77,0 tokens por segundo frente a Gemini 4 Argon 48,9, una diferencia de 1,6× que se manifiesta tanto en latencia como en gasto.
Hay una línea en esa lista que explica todas las demás, y no es el precio. Es el recuento de tokens. En las tareas propias del índice, Gemini 4 Argon generó aproximadamente 561.000 tokens de salida por tarea; GPT-6 Sol generó aproximadamente 282.000. Argon piensa el doble de tiempo para responder a la misma pregunta y, a una tarifa idéntica por token, eso es exactamente el doble de factura.

Por qué los tokens son el precio
Esta es la corrección que conviene internalizar antes de que alguien presupueste una migración, porque la intuición va en la dirección equivocada. Cuando un modelo tiene el mismo precio que su competidor y consume el doble de tokens de salida para terminar, el precio por token no es el precio. El precio es el precio por token multiplicado por la cantidad de tokens que el modelo decida gastar, y ese segundo factor es una propiedad del modelo, no de la lista de tarifas.
El margen por tarea varía enormemente, lo que empeora las cosas — no puedes aplicar un multiplicador fijo y seguir adelante:
• Terminal-Bench 4.0 — Argon: 165.330 tokens de salida por tarea frente a los 97.372 de Sol. Argon cuesta 6,78 $ por tarea aquí frente a los 4,00 $ de Sol, aunque Argon obtiene 57,1 % frente al 43,9 % de Sol.
• CritPt — Argon 109.533 tokens frente a los 31.848 de Sol. Una proporción de tokens de 3,4× en una tarea en la que Sol de hecho obtiene una puntuación superior, 30,9% frente a 27,1%.
• GDPval — Argon 74.571 tokens frente a los 41.567 de Sol, por $1,82 por tarea frente a $1,32.
• Omniscience — una proporción de tokens de 938 frente a 2.662 a favor de Argon, a $0.010 por tarea frente a los $0.027 de Sol. La única familia de tareas en la que la dirección se invierte.
• Razonamiento de contexto largo — Argon 2.197 tokens frente a los 954 de Sol, y la única tarea de la suite en la que Sol gana claramente en puntuación, 83,7% frente a 79,7%.
CritPt es el que resulta instructivo. Un modelo que quema tres veces y media los tokens para producir una respuesta ligeramente peor en la misma pregunta no es una historia de capacidad; es una historia de hábitos de gasto. El razonamiento de Argon se alarga, y en algunas formas de tareas esa longitud se convierte en puntuación y en otras simplemente se convierte en dólares. El 52.6 del índice y el 47.5 de Sol son el agregado, y los agregados ocultan exactamente esto.
De dónde vienen realmente los cinco puntos
Dado que la brecha de índice y la brecha de costo apuntan en direcciones opuestas, vale la pena saber qué tareas impulsan cada una.
• Terminal-Bench 4.0 — Gemini 4 Argon 57,1 % frente a GPT-6 Sol 43,9 %. La mayor victoria individual de Argon, y la familia de tareas más cercana a la codificación agéntica de horizonte largo.
• Omnisciencia — Gemini 4 Argon 42.4 frente a GPT-6 Sol 27.1. Una diferencia de quince puntos en cobertura factual, la mayor brecha proporcional de la suite.
• AutomationBench-AA — Gemini 4 Argon 77,5 % frente a GPT-6 Sol 61,6 %.
• SciCode — Gemini 4 Argon 61,8 % frente a GPT-6 Sol 57,6 %.
• Humanity's Last Exam — Gemini 4 Argon 57,1 % frente a GPT-6 Sol 47,9 %.
• GDPval — Gemini 4 Argon 1.611 frente a GPT-6 Sol 1.487.
• ApexAgents / AA-Briefcase — GPT-6 Sol 1.482,78 Elo frente a los 1.493,84 de Argon, una diferencia de 11 puntos que está dentro de los intervalos de confianza publicados y debería considerarse un empate.
• Razonamiento de contexto largo — GPT-6 Sol 83,7 % frente a Gemini 4 Argon 79,7 %. La única victoria clara de Sol.
• CritPt — GPT-6 Sol 30,9 % frente a Gemini 4 Argon 27,1 %. Sol gana otra vez, por un estrecho margen.
Así que la conclusión no es «Argon es mejor». Es que Argon es mejor en las dos cosas con las que abrían sus materiales de lanzamiento —la ejecución de tareas empresariales de extremo a extremo y la ingeniería de software de horizonte largo—, y Sol está a la par o por delante en la escala de razonamiento de corte académico y en mantener la coherencia a lo largo de un contexto extenso. Para un lector cuya carga de trabajo es un pipeline de recuperación con un prompt de 400K tokens, Sol es a la vez el mejor modelo y el más barato, lo cual es una posición inusual y cómoda.
Las diferencias de especificaciones que perduran más allá de la discusión sobre los benchmarks
• Salida máxima — Gemini 4 Argon 1.000.000 de tokens en una sola trayectoria, que Google describe como la mayor de la industria y un aumento respecto al límite de 64K de la generación anterior. GPT-6 Sol 128.000 tokens.
• Ventana de contexto — la ficha del proveedor de GPT-6 Sol indica aproximadamente 1,050,000 tokens; la de Argon es 1,000,000. Artificial Analysis midió Sol en 872,000 tokens a través de su harness, que es una medición del harness y no una cifra de la ficha — trate la ficha como la especificación y el número del harness como lo que el evaluador realmente puso a prueba.
• Modalidades de entrada: ambas aceptan texto, imágenes y archivos. El material de lanzamiento de Argon también se apoya en la comprensión de videos largos, donde Google afirma un 91,7 % en LVBench y lo describe como lo más avanzado; esa es una cifra reportada por el proveedor y ningún panel independiente la reproduce todavía.
• Entrada de video — Suave. Artificial Analysis grafica a Argon con la entrada de video deshabilitada y menciona el video explícitamente en el lanzamiento, mientras que la ficha de Sol no incluye video en absoluto. Si el video es fundamental en tu pipeline, ninguna de las dos fichas lo resuelve, y deberías probar antes de definir la arquitectura.
• Esfuerzo de razonamiento — Sol expone en la API un esfuerzo configurable (de none a max, con medium como valor predeterminado) y se representó en el gráfico con max. Argon se representó en el gráfico con high; nadie ha publicado la misma suite con su ajuste más alto.
El límite de salida de 1M de tokens es el que podría cambiar de verdad una arquitectura, y no solo un presupuesto. Todo lo que actualmente divides en una docena de llamadas encadenadas para no superar un tope de 128K —un conjunto de parches de varios archivos, un informe de auditoría completo, un documento largo en una sola pasada— pasa a ser una sola llamada con menos lugares donde un bucle de agente pueda perder el estado. Si eso vale el doble del coste por tarea depende enteramente de si tienes esa carga de trabajo. Si la tienes, probablemente valga la pena. Si tus llamadas son de clasificar y devolver, es dinero gastado en un margen que nadie va a ocupar.
El ajuste de esfuerzo que nadie igualó, y por qué importa
Una salvedad merece su propio párrafo porque va en contra de interpretar la brecha de cinco puntos en el índice como una diferencia pura de capacidad. Artificial Analysis sitúa a Gemini 4 Argon en su alta configuración de esfuerzo de razonamiento y a GPT-6 Sol en máximo. No son el mismo peldaño en las dos escaleras, y la dirección de la discrepancia es interesante: Sol se ejecutó en su configuración más costosa y Argon en una intermedia.
A continuación se presentan dos lecturas y los datos no pueden separarlas. O bien Argon con max obtendría una puntuación superior a 52,6 —pero también consumiría más de 561.000 tokens por tarea y costaría más de 1,99 $—, o bien obtendría aproximadamente la misma puntuación, lo que significaría que el dial de esfuerzo no hace mucho en esta suite. No hay ninguna ejecución publicada que lo resuelva. Cualquiera que cite 52,6 como el techo de Argon está citando una configuración, no un modelo, y la configuración es la que su proveedor eligió publicar primero.
La misma lógica se aplica al 47.5 de Sol, excepto en la dirección opuesta: max está en la parte superior de su escalera, por lo que la cifra está más cerca de un techo que de un suelo. Una pelea justa con el mismo esfuerzo podría reducir la brecha, y también podría invertir la comparación de costos, ya que los tokens que max quema son los tokens que cuestan $10 por millón.
La bifurcación de disponibilidad, que decide la respuesta real
Gemini 4 Argon no está disponible de forma general. El anuncio de Google dice que se está desplegando para un conjunto de defensores cibernéticos de confianza a través del Fairwind Program, que la compañía participa en el proceso voluntario de acceso a modelos previo al lanzamiento del gobierno de EE. UU., y que el acceso general para desarrolladores, empresas y consumidores llegará "lo antes posible", comenzando con los clientes de pago de la API y los suscriptores de Google AI Ultra. No hay identificador de modelo, ni endpoint, ni cuota, ni fecha. No está en ninguna API pública, incluida la nuestra; consulta el catálogo y da 404, porque todavía no existe allí.
GPT-6 Sol es un producto que se puede invocar. En OrcaRouter es openai/gpt-6-sol, en el mismo endpoint compatible con OpenAI que los más de 200 modelos del catálogo, al precio de lista de OpenAI traspasado con cero margen de beneficio, por lo que los $2/$10 anteriores y el tramo de contexto largo de 272.000 tokens a $4/$15 son lo que realmente pagas, en lugar de lo que afirma una tabla de tarifas. La conmutación automática por error entre proveedores cubre el caso en que la ruta se degrada a mitad de la ejecución, y el DSL de enrutamiento permite que una sola aplicación envíe su tráfico barato de clasificación a un modelo más pequeño y su tráfico de razonamiento complejo a Sol sin un segundo SDK.

Ese último arreglo es la respuesta honesta a esta comparación para la mayoría de los equipos. El argumento de costo a favor de Argon es real pero condicional a una carga de trabajo donde domina el trabajo de agentes de horizonte largo; el argumento de costo en contra es real en cualquier otra carga de trabajo; y de todos modos no puedes comprarlo este mes. La jugada económica es construir ahora el arnés de evaluación —tus propios prompts, tu propia puntuación, ejecutados contra Sol con algunos ajustes de esfuerzo— para que cuando Argon llegue a los clientes de pago de la API tengas una respuesta medida a una pregunta que todos los demás responderán desde una tabla de clasificación.
¿Qué lo resolvería?
Tres cosas, en orden de cuánto inclinarían el veredicto. La disponibilidad general de Argon a un precio real, no introductorio — la palabra «introductorio» significa que los $2/$10 pueden cambiar, y la propia secuencia de Google pone primero a los clientes de pago de la API, así que la primera tarifa publicada tras el lanzamiento es la que hay que vigilar. Una ejecución publicada de Artificial Analysis de Argon con su ajuste de esfuerzo máximo, que indicaría si 52.6 es un techo o está a un pelo de él. Y una reproducción independiente de la cifra de DeepSWE v1.1 — Google afirma un 77.9% y lo califica de nuevo estado del arte; es reportado por el proveedor y, a día de hoy, no ha sido reproducido fuera de Google.
Hasta entonces, la división es nítida y ligeramente irónica. GPT-6 Sol es el modelo mejor verificado, el más rápido, el más barato por tarea terminada y el que puedes llamar esta tarde. Gemini 4 Argon es el modelo con mayor puntuación en la tabla que su proveedor eligió publicar, aproximadamente el doble de caro de usar en la práctica, y aún no está a la venta. Elegir entre ellos no es un juicio sobre la capacidad. Es un juicio sobre cuál de esas dos frases describe tu mes.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
