Tarjeta de título principal que dice "Gemini 4 Argon vs GPT-6 Sol — un quinto del precio, cuatro veces la factura", con chips que dicen "Argon $2 / $10", "Sol $2 / $10" y "Coste por tarea de índice $1,99 vs $1,05", y una línea de pie de página que dice "Cifras de Argon reportadas por el proveedor; cifras de índice según Artificial Analysis, consultado el 2026-10-01". El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Gemini 4 Argon vs. GPT-6 Sol: un quinto del precio, cuatro veces la factura

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Ejecuta la suite de índices de Artificial Analysis en Gemini 4 Argon y factura $2,407. Ejecuta la misma suite en GPT-6 Sol y factura $1,546. Mismo índice, mismas tareas, misma semana. Los dos modelos tienen precios de lista idénticos — $2.00 por millón de tokens de entrada y $10.00 por millón de tokens de salida, Argon como una tarifa introductoria declarada de Go​ogle y Sol como la tarifa estándar de Open​AI — y sin embargo, el costo final de realizar un trabajo idéntico difiere en un 56%, a favor del modelo que obtiene cinco puntos menos. Esa brecha es la razón principal por la que vale la pena escribir esta comparación, y no tiene nada que ver con el tarifario.

Google anunció Gemini 4 Argon el 30 de septiembre de 2026, calificándolo como la próxima era de la inteligencia de frontera, con un precio de $2 de entrada y $10 de salida, con la entrada en caché al 95 % de descuento, y se está desplegando para defensores cibernéticos de confianza a través del Fairwind Program. GPT-6 Sol está disponible de forma general desde el 22 de septiembre de 2026, cuando OpenAI lanzó el nivel intermedio de la línea GPT-6 a $2 de entrada y $10 de salida con un 90 % de descuento en caché. Uno se puede comprar hoy en un endpoint compatible con OpenAI y el otro no lo puede comprar nadie fuera de una cohorte designada, que es la bifurcación práctica de este artículo. Pero la inversión de costos anterior se mantiene incluso si dejas de lado la disponibilidad por completo, y entender por qué es la parte útil.

La inversión, dicha claramente

Artificial Analysis publica tanto un Índice de Inteligencia como un desglose de lo que costó ejecutar ese índice. Leídos en conjunto, dicen lo siguiente:

• Índice de Inteligencia — Gemini 4 Argon 52.6 frente a GPT-6 Sol 47.5. Una diferencia de cinco puntos, medida con Argon registrado en su alta configuración de esfuerzo y Sol en máxima, por lo que la comparación es generosa con Sol más que con Argon.

• Precio de lista por millón de tokens — idéntico. $2.00 de entrada / $10.00 de salida en ambos. Las lecturas de caché son la única diferencia: $0.10 en Argon, $0.20 en Sol.

• Costo por tarea de indexación — Gemini 4 Argon $1.99 frente a GPT-6 Sol $1.05. Argon cuesta aproximadamente el doble por tarea a pesar de costar lo mismo por token.

• Coste de ejecutar la suite completa — Gemini 4 Argon $2,407 frente a GPT-6 Sol $1,546.

• Velocidad de salida medida — GPT-6 Sol 77,0 tokens por segundo frente a Gemini 4 Argon 48,9, una diferencia de 1,6× que se manifiesta tanto en latencia como en gasto.

Hay una línea en esa lista que explica todas las demás, y no es el precio. Es el recuento de tokens. En las tareas propias del índice, Gemini 4 Argon generó aproximadamente 561.000 tokens de salida por tarea; GPT-6 Sol generó aproximadamente 282.000. Argon piensa el doble de tiempo para responder a la misma pregunta y, a una tarifa idéntica por token, eso es exactamente el doble de factura.

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Sol. The Gemini 4 Argon column reads: AA Intelligence Index 52.6, price $2 in / $10 out per million tokens, cost per index task $1.99, output tokens per task 561K, output speed 48.9 tok/s, max output 1M tokens. The GPT-6 Sol column reads: AA Intelligence Index 47.5, price $2 in / $10 out, cost per index task $1.05, output tokens per task 282K, output speed 77.0 tok/s, max output 128K tokens. A footer line reads that the prices are vendor list prices and the index figures are per Artificial Analysis, read 2026-10-01.

Por qué los tokens son el precio

Esta es la corrección que conviene internalizar antes de que alguien presupueste una migración, porque la intuición va en la dirección equivocada. Cuando un modelo tiene el mismo precio que su competidor y consume el doble de tokens de salida para terminar, el precio por token no es el precio. El precio es el precio por token multiplicado por la cantidad de tokens que el modelo decida gastar, y ese segundo factor es una propiedad del modelo, no de la lista de tarifas.

El margen por tarea varía enormemente, lo que empeora las cosas — no puedes aplicar un multiplicador fijo y seguir adelante:

• Terminal-Bench 4.0 — Argon: 165.330 tokens de salida por tarea frente a los 97.372 de Sol. Argon cuesta 6,78 $ por tarea aquí frente a los 4,00 $ de Sol, aunque Argon obtiene 57,1 % frente al 43,9 % de Sol.

• CritPt — Argon 109.533 tokens frente a los 31.848 de Sol. Una proporción de tokens de 3,4× en una tarea en la que Sol de hecho obtiene una puntuación superior, 30,9% frente a 27,1%.

• GDPval — Argon 74.571 tokens frente a los 41.567 de Sol, por $1,82 por tarea frente a $1,32.

• Omniscience — una proporción de tokens de 938 frente a 2.662 a favor de Argon, a $0.010 por tarea frente a los $0.027 de Sol. La única familia de tareas en la que la dirección se invierte.

• Razonamiento de contexto largo — Argon 2.197 tokens frente a los 954 de Sol, y la única tarea de la suite en la que Sol gana claramente en puntuación, 83,7% frente a 79,7%.

CritPt es el que resulta instructivo. Un modelo que quema tres veces y media los tokens para producir una respuesta ligeramente peor en la misma pregunta no es una historia de capacidad; es una historia de hábitos de gasto. El razonamiento de Argon se alarga, y en algunas formas de tareas esa longitud se convierte en puntuación y en otras simplemente se convierte en dólares. El 52.6 del índice y el 47.5 de Sol son el agregado, y los agregados ocultan exactamente esto.

De dónde vienen realmente los cinco puntos

Dado que la brecha de índice y la brecha de costo apuntan en direcciones opuestas, vale la pena saber qué tareas impulsan cada una.

• Terminal-Bench 4.0 — Gemini 4 Argon 57,1 % frente a GPT-6 Sol 43,9 %. La mayor victoria individual de Argon, y la familia de tareas más cercana a la codificación agéntica de horizonte largo.

• Omnisciencia — Gemini 4 Argon 42.4 frente a GPT-6 Sol 27.1. Una diferencia de quince puntos en cobertura factual, la mayor brecha proporcional de la suite.

• AutomationBench-AA — Gemini 4 Argon 77,5 % frente a GPT-6 Sol 61,6 %.

• SciCode — Gemini 4 Argon 61,8 % frente a GPT-6 Sol 57,6 %.

• Humanity's Last Exam — Gemini 4 Argon 57,1 % frente a GPT-6 Sol 47,9 %.

• GDPval — Gemini 4 Argon 1.611 frente a GPT-6 Sol 1.487.

• ApexAgents / AA-Briefcase — GPT-6 Sol 1.482,78 Elo frente a los 1.493,84 de Argon, una diferencia de 11 puntos que está dentro de los intervalos de confianza publicados y debería considerarse un empate.

• Razonamiento de contexto largo — GPT-6 Sol 83,7 % frente a Gemini 4 Argon 79,7 %. La única victoria clara de Sol.

• CritPt — GPT-6 Sol 30,9 % frente a Gemini 4 Argon 27,1 %. Sol gana otra vez, por un estrecho margen.

Así que la conclusión no es «Argon es mejor». Es que Argon es mejor en las dos cosas con las que abrían sus materiales de lanzamiento —la ejecución de tareas empresariales de extremo a extremo y la ingeniería de software de horizonte largo—, y Sol está a la par o por delante en la escala de razonamiento de corte académico y en mantener la coherencia a lo largo de un contexto extenso. Para un lector cuya carga de trabajo es un pipeline de recuperación con un prompt de 400K tokens, Sol es a la vez el mejor modelo y el más barato, lo cual es una posición inusual y cómoda.

Las diferencias de especificaciones que perduran más allá de la discusión sobre los benchmarks

• Salida máxima — Gemini 4 Argon 1.000.000 de tokens en una sola trayectoria, que Google describe como la mayor de la industria y un aumento respecto al límite de 64K de la generación anterior. GPT-6 Sol 128.000 tokens.

• Ventana de contexto — la ficha del proveedor de GPT-6 Sol indica aproximadamente 1,050,000 tokens; la de Argon es 1,000,000. Artificial Analysis midió Sol en 872,000 tokens a través de su harness, que es una medición del harness y no una cifra de la ficha — trate la ficha como la especificación y el número del harness como lo que el evaluador realmente puso a prueba.

• Modalidades de entrada: ambas aceptan texto, imágenes y archivos. El material de lanzamiento de Argon también se apoya en la comprensión de videos largos, donde Google afirma un 91,7 % en LVBench y lo describe como lo más avanzado; esa es una cifra reportada por el proveedor y ningún panel independiente la reproduce todavía.

• Entrada de video — Suave. Artificial Analysis grafica a Argon con la entrada de video deshabilitada y menciona el video explícitamente en el lanzamiento, mientras que la ficha de Sol no incluye video en absoluto. Si el video es fundamental en tu pipeline, ninguna de las dos fichas lo resuelve, y deberías probar antes de definir la arquitectura.

• Esfuerzo de razonamiento — Sol expone en la API un esfuerzo configurable (de none a max, con medium como valor predeterminado) y se representó en el gráfico con max. Argon se representó en el gráfico con high; nadie ha publicado la misma suite con su ajuste más alto.

El límite de salida de 1M de tokens es el que podría cambiar de verdad una arquitectura, y no solo un presupuesto. Todo lo que actualmente divides en una docena de llamadas encadenadas para no superar un tope de 128K —un conjunto de parches de varios archivos, un informe de auditoría completo, un documento largo en una sola pasada— pasa a ser una sola llamada con menos lugares donde un bucle de agente pueda perder el estado. Si eso vale el doble del coste por tarea depende enteramente de si tienes esa carga de trabajo. Si la tienes, probablemente valga la pena. Si tus llamadas son de clasificar y devolver, es dinero gastado en un margen que nadie va a ocupar.

El ajuste de esfuerzo que nadie igualó, y por qué importa

Una salvedad merece su propio párrafo porque va en contra de interpretar la brecha de cinco puntos en el índice como una diferencia pura de capacidad. Artificial Analysis sitúa a Gemini 4 Argon en su alta configuración de esfuerzo de razonamiento y a GPT-6 Sol en máximo. No son el mismo peldaño en las dos escaleras, y la dirección de la discrepancia es interesante: Sol se ejecutó en su configuración más costosa y Argon en una intermedia.

A continuación se presentan dos lecturas y los datos no pueden separarlas. O bien Argon con max obtendría una puntuación superior a 52,6 —pero también consumiría más de 561.000 tokens por tarea y costaría más de 1,99 $—, o bien obtendría aproximadamente la misma puntuación, lo que significaría que el dial de esfuerzo no hace mucho en esta suite. No hay ninguna ejecución publicada que lo resuelva. Cualquiera que cite 52,6 como el techo de Argon está citando una configuración, no un modelo, y la configuración es la que su proveedor eligió publicar primero.

La misma lógica se aplica al 47.5 de Sol, excepto en la dirección opuesta: max está en la parte superior de su escalera, por lo que la cifra está más cerca de un techo que de un suelo. Una pelea justa con el mismo esfuerzo podría reducir la brecha, y también podría invertir la comparación de costos, ya que los tokens que max quema son los tokens que cuestan $10 por millón.

La bifurcación de disponibilidad, que decide la respuesta real

Gemini 4 Argon no está disponible de forma general. El anuncio de Google dice que se está desplegando para un conjunto de defensores cibernéticos de confianza a través del Fairwind Program, que la compañía participa en el proceso voluntario de acceso a modelos previo al lanzamiento del gobierno de EE. UU., y que el acceso general para desarrolladores, empresas y consumidores llegará "lo antes posible", comenzando con los clientes de pago de la API y los suscriptores de Google AI Ultra. No hay identificador de modelo, ni endpoint, ni cuota, ni fecha. No está en ninguna API pública, incluida la nuestra; consulta el catálogo y da 404, porque todavía no existe allí.

GPT-6 Sol es un producto que se puede invocar. En OrcaRouter es openai/gpt-6-sol, en el mismo endpoint compatible con OpenAI que los más de 200 modelos del catálogo, al precio de lista de OpenAI traspasado con cero margen de beneficio, por lo que los $2/$10 anteriores y el tramo de contexto largo de 272.000 tokens a $4/$15 son lo que realmente pagas, en lugar de lo que afirma una tabla de tarifas. La conmutación automática por error entre proveedores cubre el caso en que la ruta se degrada a mitad de la ejecución, y el DSL de enrutamiento permite que una sola aplicación envíe su tráfico barato de clasificación a un modelo más pequeño y su tráfico de razonamiento complejo a Sol sin un segundo SDK.

A capture of the OrcaRouter model page for openai/gpt-6-sol, listed by OpenAI with a 2026-09-22 date, a 1M-token context window, a 128K-token maximum output, text, image and file input, and pricing of $2.00 per million input tokens and $10.00 per million output tokens.

Ese último arreglo es la respuesta honesta a esta comparación para la mayoría de los equipos. El argumento de costo a favor de Argon es real pero condicional a una carga de trabajo donde domina el trabajo de agentes de horizonte largo; el argumento de costo en contra es real en cualquier otra carga de trabajo; y de todos modos no puedes comprarlo este mes. La jugada económica es construir ahora el arnés de evaluación —tus propios prompts, tu propia puntuación, ejecutados contra Sol con algunos ajustes de esfuerzo— para que cuando Argon llegue a los clientes de pago de la API tengas una respuesta medida a una pregunta que todos los demás responderán desde una tabla de clasificación.

¿Qué lo resolvería?

Tres cosas, en orden de cuánto inclinarían el veredicto. La disponibilidad general de Argon a un precio real, no introductorio — la palabra «introductorio» significa que los $2/$10 pueden cambiar, y la propia secuencia de Google pone primero a los clientes de pago de la API, así que la primera tarifa publicada tras el lanzamiento es la que hay que vigilar. Una ejecución publicada de Artificial Analysis de Argon con su ajuste de esfuerzo máximo, que indicaría si 52.6 es un techo o está a un pelo de él. Y una reproducción independiente de la cifra de DeepSWE v1.1 — Google afirma un 77.9% y lo califica de nuevo estado del arte; es reportado por el proveedor y, a día de hoy, no ha sido reproducido fuera de Google.

Hasta entonces, la división es nítida y ligeramente irónica. GPT-6 Sol es el modelo mejor verificado, el más rápido, el más barato por tarea terminada y el que puedes llamar esta tarde. Gemini 4 Argon es el modelo con mayor puntuación en la tabla que su proveedor eligió publicar, aproximadamente el doble de caro de usar en la práctica, y aún no está a la venta. Elegir entre ellos no es un juicio sobre la capacidad. Es un juicio sobre cuál de esas dos frases describe tu mes.

A capture of the Artificial Analysis model page for Gemini 4 Argon (High), dated September 2026 and credited to Google, marked a proprietary model. It reports an Artificial Analysis Intelligence Index score of 53, pricing of $2.00 per million input tokens and $10.00 per million output tokens with a 95% cache discount, an average cost of $1.99 per task on the Intelligence Index, a 1M-token context window, and text and image input.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario