Una tarjeta destacada generada para GPT-6.1 Sol vs Gemini 4 Argon titulada «A medio punto de distancia, y solo uno de ellos está a la venta», con dos tarjetas informativas que dicen «GPT-6.1 Sol: Intelligence Index 51,8; $0,72 por tarea de índice, disponible ahora» y «Gemini 4 Argon: Intelligence Index 52,6; $1,99 por tarea de índice, solo con Fairwind Program, sin endpoint», un pie de página que dice «Las cifras de índice y de costo por tarea según Artificial Analysis, Intelligence Index v4.3.2; Gemini 4 Argon está anunciado pero no está disponible de forma general», y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

GPT-6.1 Sol vs Gemini 4 Argon: a medio punto de distancia, y solo uno de ellos está a la venta

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Todo lo que puedes comparar entre GPT-6.1 Sol y Gemini 4 Argon es medible, y nada de eso es accionable, porque solo uno de los dos modelos se puede comprar. Gemini 4 Argon se anunció el 30 de septiembre de 2026 en una publicación de DeepMind atribuida a Koray Kavukcuoglu, con un precio introductorio declarado de $2.00 por millón de tokens de entrada y $10.00 por millón de tokens de salida, y se está desplegando primero para una cohorte designada de defensores cibernéticos a través del Fairwind Program. No tiene identificador de modelo, ni endpoint de API, ni una tarifa publicada por token contra la que se te pueda facturar, ni una página a la que puedas acceder como cliente. GPT-6.1 Sol se lanzó el 29 de septiembre de 2026 a $2.00 y $10.00 y ya está disponible. En el Artificial Analysis Intelligence Index, los dos están a 0,8 puntos de distancia —Argon 52,6, Sol 51,8—, lo que convierte a este en el emparejamiento más reñido de este lote y, solo según el índice, un empate técnico. En la métrica que decide los despliegues reales, uno de estos modelos no es candidato en absoluto.

Esa asimetría no es un tecnicismo, y tampoco es una exclusiva. Es el hecho que debería regir cómo se lee la comparación: los números de Argon describen un modelo en un despliegue controlado a una única cohorte, y los de GPT-6.1 Sol describen un producto en una lista de precios. Compararlos sigue mereciendo la pena —Argon es con lo que el proveedor actualmente lidera, y sus mediciones dicen algo real sobre dónde queda la cima de la línea Gemini—, pero toda conclusión tiene que incluir la frase «si se pudiera comprar», y ninguna incluye la frase «¿deberías cambiar?».

El índice permite exactamente una comparación, y es casi un empate.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, credited to OpenAI and dated 2026-09-29, showing the model identifier, text, image and file input with text output, a 1,050,000-token context window with a 128K maximum output, and a rate row reading $2.00 input and $10.00 output per million tokens alongside a 4.54-second median time to first token and a 284.2M seven-day traffic figure.

Ambos modelos aparecen en {{1}}Artificial Analysis{{/1}}, y ambos incluyen una puntuación y un desglose de lo que costó producir esa puntuación.

• Índice de Inteligencia, v4.3.2 — Gemini 4 Argon 52,6 vs GPT-6.1 Sol 51,8, una diferencia de 0,8 puntos

• Costo por tarea de indexación — Gemini 4 Argon $1.99 vs GPT-6.1 Sol $0.72, una diferencia de 2.8× por esos 0.8 puntos

• Costo de ejecutar la suite completa — Gemini 4 Argon $2,407 frente a GPT-6.1 Sol $1,082

• Tokens de salida emitidos en esa suite — Gemini 4 Argon 110M frente a GPT-6.1 Sol 67M, una diferencia de verbosidad de 1,6×

• Precio introductorio indicado: $2.00 por entrada y $10.00 por salida por millón de tokens en ambos, con entrada en caché con un 95% de descuento en Argon

• Ventana de contexto — GPT-6.1 Sol, 1.050.000 tokens; el de Argon no está publicado

La cuarta línea explica la segunda. Una diferencia de costo por tarea de 2,8× con tarifas publicadas casi idénticas proviene de escribir 1,6× tantos tokens a un precio de salida comparable, más lo que cueste el volumen de razonamiento que hay detrás. Argon no es un modelo caro según su ficha. Es hablador en la evaluación, y la cuenta se salda en la salida.

Las configuraciones difieren, y la dirección de la diferencia favorece al modelo más barato. Artificial Analysis sitúa a Gemini 4 Argon en su ajuste de esfuerzo alto y a GPT-6.1 Sol al máximo, así que Sol se mide en su ajuste más costoso y Argon en algo por debajo de su techo. Por lo tanto, la diferencia de 0,8 puntos es la versión generosa de la comparación para Sol: si se le da a Argon su ajuste máximo, la diferencia probablemente se amplía; si se le da a Sol un ajuste inferior, su costo cae aún más. Ninguno de los dos cambios altera la línea de disponibilidad, que es la única línea que cierra una decisión de despliegue.

Interpretar siquiera una diferencia de 0,8 puntos

Una diferencia de menos de un punto en un compuesto de diez evaluaciones no es una clasificación. Son dos modelos en la misma banda.

Lo que el índice no publica para Argon es el detalle de los componentes que haría legible la banda: qué evaluaciones gana, dónde es débil, cómo se comporta en las subpuntuaciones que componen el compuesto. La página de GPT-6.1 Sol contiene esas filas; la de Argon contiene un titular y un coste. Una comparación basada únicamente en el titular puede decir que los dos están a la par y nada más, y debería decir exactamente eso en lugar de fabricar un ganador a partir de un margen de 0,8 puntos.

Hay un dato externo que vale la pena añadir, y apunta en la dirección contraria. En una evaluación de programación de terceros que circuló después del anuncio, Argon quedó en tercer lugar, por detrás de GPT-6 Astra y Claude Opus 5.5: un resultado sólido para un modelo en un despliegue controlado, y coherente con un 52.6 en la puntuación compuesta. También es una única observación de una única evaluación, publicada en los primeros días de un anuncio, lo que lo convierte en una evidencia más que en un historial consolidado. Etiquétalo y sigue adelante.

Para qué son realmente las dos tarjetas de precios

La tasa indicada para Argon merece más atención que la fila del índice, porque contiene dos números.

La tarifa introductoria es de $2.00 de entrada y $10.00 de salida, con la entrada en caché al 95 % de descuento, lo que, en una tarjeta, haría que Argon tuviera una equiparación de precio en igualdad de condiciones con GPT-6.1 Sol. La propia nota al pie del proveedor afirma que, tras un período introductorio que no define, la tarifa pasa a ser de $4.00 por millón de tokens de entrada y $20.00 por millón de tokens de salida. Ese segundo par no es hipotético —es el número publicado al que se espera que se estabilice el modelo— y coincide exactamente con el precio de lista de la frontera actual, en lugar de quedar por debajo. Una comparación que cita solo el par introductorio está citando un número promocional de un modelo que aún no está disponible de forma general, lo que supone dos grados de provisionalidad en una sola línea.

La tarjeta de GPT-6.1 Sol es el tipo opuesto de objeto. $2.00 y $10.00 son la tarifa vigente, no una promoción; el escalón de contexto largo a $4.00 / $15.00 por encima de 272,000 tokens de prompt está publicado y se aplica a un límite definido; la entrada en caché a $0.10 está activa hoy y es facturable. No hay nada en ella que requiera una nota al pie sobre un período que el proveedor se niega a definir.

Esa es la esencia que hay detrás de la línea de disponibilidad. No se trata de que Argon sea un modelo peor —el índice dice que ambos están a la par—, sino de que una de estas dos tarjetas es un compromiso y la otra, una intención.

El propio despliegue es la comparación

A screenshot of the Gemini model family page on Google DeepMind's own site, headed 'Our next era of frontier intelligence' with a Gemini 4 Argon card and a Read blog link, captured October 7, 2026. The page carries no model identifier, no endpoint and no per-token price for Argon.

El Fairwind Program es la parte del anuncio de Argon que una comparación técnica tiende a omitir, y es la parte que más importa aquí.

El proveedor está poniendo el modelo en manos de una cohorte designada de defensores cibernéticos primero, antes que todos los demás, sin una fecha anunciada para una apertura general, sin lista de espera para desarrolladores y sin ningún identificador publicado que un cliente pueda fijar. Es una forma legítima de lanzar un modelo de frontera y no es inusual para una capacidad de esta clase. También significa que toda afirmación sobre el costo, la latencia, el rendimiento y la fiabilidad de Argon en tráfico real está actualmente sin medir: no hay tráfico de producción que medir. Existe la propia ejecución de benchmark del proveedor, y existe el índice compuesto de Artificial Analysis, y entre ambos son la evaluación de un laboratorio y el conjunto de pruebas de un evaluador. Ese es todo el registro.

El historial de GPT-6.1 Sol tiene ocho días de antigüedad y es escaso de una manera distinta: una única configuración independiente, ningún corpus de profesionales y un producto en producción cuyos modos de fallo aún no están documentados en ninguna parte. Ninguno de los dos modelos está bien respaldado por evidencia. Sin embargo, uno de ellos tiene una factura.

Entonces, ¿para qué es esta comparación?

Tres usos, y ninguno de ellos es una decisión de compra.

Primero, calibración. Si estás siguiendo en qué punto se sitúa Argon frente a GPT-6.1 Sol, 52,6 frente a 51,8 con una diferencia de coste por tarea de 2,8× es la respuesta actual, y dice que la línea Gemini 4 es competitiva en capacidad mientras aún está definiendo sus condiciones comerciales. Ojo con que la tarifa introductoria sea reemplazada por el par de $4.00 / $20.00, lo que convertiría una igualación de precios en un sobreprecio sin cambios en la capacidad.

Segundo, una posición de espera. Un modelo que se anuncia, se mide y no se puede enrutar es el caso más claro que existe para mantener una abstracción entre tu aplicación y tu elección de modelo. A ambos modelos de este artículo se puede llegar de la misma manera desde nuestro lado de la valla: GPT-6.1 Sol está en OrcaRouter a su propio $2.00 / $10.00 con entrada en caché a $0.10 y sin nada añadido, así que hoy se puede construir una carga de trabajo contra él al precio de lista del proveedor. Si y cuando Argon obtenga un identificador y una lista de precios, evaluarlo debería ser un cambio de configuración en lugar de una reescritura — y hasta entonces, la cantidad correcta de ingeniería que se debe invertir en Argon es la cantidad que mantiene eso cierto.

Tercero, una lista de seguimiento falsable. Cualquiera de los siguientes convertiría esto de un artículo de lo que sabemos hasta ahora en una comparación comprable: un identificador de modelo en la documentación para desarrolladores, una entrada en su índice de tarjetas de modelo, una publicación de disponibilidad general con tarifas por token publicadas, o que Artificial Analysis publique una segunda configuración con un nivel de esfuerzo diferente. Hasta que uno de esos se materialice, un artículo que afirme que Argon es más barato, más rápido o mejor que GPT-6.1 Sol en producción está describiendo un modelo que nadie fuera de una cohorte ha ejecutado.

A generated scoreboard titled 'GPT-6.1 Sol vs Gemini 4 Argon — the scoreboard' showing two columns on six shared rows: Intelligence Index 51.8 against 52.6 on v4.3.2; cost per index task $0.72 against $1.99; suite cost $1,082 against $2,407; output tokens on the suite 67M against 110M; index effort setting max against high; availability purchasable now against a controlled rollout with no endpoint or identifier. A footer reads 'Index and cost figures per Artificial Analysis v4.3.2; GPT-6.1 Sol pricing per OpenAI; Gemini 4 Argon figures describe an announced model that is not yet generally available.'

El cierre honesto es una sola frase, y trata de la forma de la pregunta más que de la puntuación. Gemini 4 Argon y GPT-6.1 Sol están lo bastante parejos en la única tabla independiente en la que ambos aparecen como para que el índice no pueda elegir entre ellos; lo que decide entre ellos es que uno está disponible y el otro es una promesa, y una promesa no es algo hacia lo que enrutar tráfico de producción. Sigue a Argon, adopta Sol si el precio y las modalidades encajan con tu trabajo, y mantén la abstracción lo bastante fina como para que, el día en que Argon sea real, sea una línea de configuración en lugar de un proyecto.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario