Tarjeta de título principal que dice «Gemini 4 Argon — a qué se asocia el nombre», con una única tarjeta resaltada para Gemini 4 Argon y, debajo, una lista de los artefactos que sí existen para él —publicación de anuncio, página de familia, tabla de benchmarks del proveedor, metodología de evaluaciones— junto a una lista tachada de los artefactos que no, que dice: sin ID de modelo, sin endpoint de API, sin tarjeta de modelo, sin ventana de contexto publicada, sin fecha de disponibilidad general, y una línea de pie de página que dice «Cifras de índice según Artificial Analysis, revisión v4.3.2; Argon no se puede invocar en ninguna API pública».
Guides & Insights

Gemini 4 Argon: qué ha anunciado Google y a qué se debe el nombre

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Gemini 4 Argon es el único Gemini 4 que hay. Esa frase suena trivial hasta que le pones precio, y ponerle precio es para lo que sirve esta página. Goog​le anunció Gemini 4 Argon el 30 de septiembre de 2026, en una publicación de DeepMind atribuida a Koray Kavukcuoglu; es un nombre de modelo real en una página propia real, ha sido medido por Artificial Analysis en un Intelligence Index de 52.56 en la revisión v4.3.2, y se sitúa dentro de medio punto de GPT-6 Astra con 52.67 y Claude Fable 5.1 con 53.35 — mientras se sitúa cinco puntos por debajo de Claude Opus 5.5 con 57.62 y Claude Sonnet 5.5 con 56.00, y dentro de un punto de GPT-6.1 Sol con 51.83. Lo que no tiene es lo que todos esos rivales tienen: un identificador de modelo que se puede poner en una solicitud.

Así que la respuesta honesta en una línea a «qué es Gemini 4 Aruba» es que es un modelo que Google ha anunciado y evaluado con benchmarks pero que no ha hecho invocable, que el nombre está asociado a un despliegue restringido más que a un producto, y que «Gemini 4» por sí solo no está asociado a nada en absoluto. Ambas mitades de esa frase se pueden comprobar desde una terminal, por lo que esta página las comprueba en lugar de afirmarlas.

El nombre es real. El producto no.

Empieza con lo que realmente devuelve una verificación de entidad. A fecha de 8 de octubre de 2026, la página de la familia de Google en deepmind.google/models/gemini/ presenta a Gemini 4 Argon como su tarjeta principal, bajo el eslogan “Nuestra próxima era de inteligencia de frontera”, con texto de capacidades que menciona ingeniería de software, trabajo de conocimiento empresarial en los ámbitos legal y financiero, y ciberseguridad defensiva. La publicación del anuncio existe en la dirección blog.google/innovation-and-ai/models-and-research/gemini-models/. Hay una página de familia de modelos. Hay una tabla de benchmarks de proveedores de diecinueve filas. Hay un PDF de metodología de evaluaciones de cinco páginas. Eso es un rastro documental sustancial, y es más de lo que consigue una filtración.

Ahora enumera lo que le falta, porque la lista de lo que falta es el artículo.

• Un ID de modelo — la lista de modelos de la API de Gemini no contiene ninguna aparición de “argon” ni ninguna aparición de “gemini-4”. Los identificadores más recientes que reconoce la documentación de Google son la familia 3.8.

• Un endpoint o un precio contra el que se te pueda facturar — los $2 de entrada / $10 de salida por millón de tokens que aparecen en el anuncio son una tarifa introductoria para un despliegue que aún no ha llegado a los clientes de pago.

• Una ficha de modelo o ficha de sistema — el índice de fichas de modelo de DeepMind no tiene ninguna fila de Argon, y la ruta de la ficha de modelo de la familia devuelve 404.

• Una ventana de contexto — Google publicó un límite de salida de 1 millón de tokens, frente a un techo anterior de 64K, y no publicó el lado de entrada de ese par. Artificial Analysis registra 1M para el modelo que midió.

• Una fecha de disponibilidad general — el anuncio describe un despliegue por fases sin fechas en ninguna etapa posterior a la primera.

• Un número de parámetros, que Google no ha publicado para ningún Gemini.

El despliegue que Google describe se lleva a cabo en tres etapas de duración no especificada. Primero, una cohorte con nombre de defensores cibernéticos a través del Fairwind Program. Segundo, clientes de pago de la API y suscriptores de Google AI Ultra. Tercero, desarrolladores, empresas y consumidores. Solo la primera etapa está activa en algún sentido que un lector pueda verificar, y Google no le asigna fecha a las etapas dos y tres. Eso no es una nota al pie. Es la diferencia entre un modelo y una cuenta atrás.

A screenshot of Google's Gemini 4 Argon announcement post, showing the headline and the byline for Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, above the intro pricing line of $2 per million input tokens and $10 per million output tokens with cached input at 95 percent off, and the line stating an output limit of 1 million tokens, up from the previous 64K ceiling.

Lo que afirma la propia tabla de Google, y quién lo midió en realidad

La página de familia de Google incluye una tabla comparativa de cuatro columnas con Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1 y Claude Opus 5.5. Vale la pena leerla, y vale la pena leerla con la procedencia a la vista, porque Google revela esa procedencia en el PDF de metodología y esa revelación cambia cuánto puede aportar la tabla.

Las afirmaciones, atribuidas a Google: Argon lidera en Vals Index con 68.9 frente a 67.0 de Opus 5.5 y 65.8 de Fable 5.1; en AutomationBench con 51.3 frente a 42.5, 31.4 y 41.4; en Vals Finance Agent v2 con 65.4; en Harvey's Legal Agent Benchmark con 19.6 frente a 3.8, 6.7 y 5.4 —una diferencia de cuatro a cinco veces—; en DeepSWE v1.1 con 77.9 frente a 74.2, 67.4 y 74.1; en Vibe Code Bench con 91.9, un margen de 1.6 puntos; en LABBench 2 con 88.8 frente a 73.1, 68.6 y 85.4; en RiemannBench con 76.0; en ambas filas de GraphWalks, 99.7 en ≤128k y 84.2 en 256k–1M; en Agent's Last Exam con 39.5; en Terminal-Bench Science 0.1 con 57.6; en Chartography con 71.6; y en LVBench con 91.7 como estado del arte.

Y pierde, en la propia página de Google: FrontierSWE v2 con 55,0 frente al 65,5 de Astra y el 62,3 de Opus 5.5; Terminal-bench 4.0 con 57,4 frente al 66,4 de Opus 5.5; PostTrainBench con 45,3 frente al 49,3 de Opus 5.5; y OSWorld-2.0 con 69,2 frente al 72,6 de Astra. CWE-bench v1 empata en 68,0 con Astra.

La línea de procedencia importa más que cualquier fila individual. La metodología de Google indica que los resultados son pass@1, de un solo intento, con los ajustes de pensamiento más altos y —de manera crítica— que las cifras que no son de Gemini en esa tabla son los números autoinformados de los propios proveedores, con GPT-6 Astra, Claude Fable 5.1 y Claude Opus 5.5 tomados con el pensamiento máximo cuando este estaba disponible. Una tabla de proveedor cuyas columnas de competidores son los comunicados de prensa de los competidores es un documento útil, pero no es una comparación controlada. Cada una de esas filas está reportada por Google, y algunas de ellas son Google reportando lo que otro reportó. Interpreta los márgenes, no solo los valores, en consecuencia.

Un modelo, tres números de índice y por qué todos son correctos

La posición independiente de Argon es más interesante que una cifra aislada, porque la cifra se mueve según dónde se lea, y ese movimiento no es un error.

Artificial Analysis mide a Gemini 4 Argon (High) en 52.56 en la revisión v4.3.2 de su Intelligence Index. Ese mismo índice sitúa a Claude Opus 5.5 en 57.62, a Claude Sonnet 5.5 en 56.00, a Claude Fable 5.1 en 53.35, a GPT-6 Astra en 52.67, a GPT-6.1 Sol en 51.83 y a Gemini 3.8 Flash en 40.93. En el orden mostrado en la tabla de clasificación, los diez mejores modelos aproximadamente se concentran en unos seis puntos del índice, y Argon queda dentro de ese pelotón, no por debajo.

Entonces un lector ve un segundo número —53— en la visualización redondeada de la tabla de clasificación, y un tercero si lo compara con una configuración diferente de un modelo hermano, y concluye que una de las fuentes está equivocada. Ninguna lo está. El 53 redondeado es la misma medición que 52.56. Lo que difiere entre configuraciones es el esfuerzo de razonamiento: Artificial Analysis mide cada modelo en varios niveles de esfuerzo, y un mismo modelo en un nivel de esfuerzo superior puede diferenciarse en varios puntos. Por eso la tabla de clasificación incluye a Opus 5.5 cuatro veces por separado, con 58, 56, 54 y 51. Argon aparece una sola vez, con esfuerzo alto, porque esa es la única configuración que Google ha puesto a disposición para medir. Si Google lanza un nivel de Argon con pensamiento máximo, esa fila se moverá, y lo honesto que hay que decir al respecto hoy es que todavía no se ha movido.

Otras tres cifras independientes de Argon merecen tenerse en cuenta, todas de Artificial Analysis y todas medidas en la configuración (High). La velocidad de salida es de 60,69 tokens por segundo de mediana. El tiempo hasta el primer token de respuesta es de 2,92 segundos de mediana. El coste por tarea del Intelligence Index —la puntuación del índice normalizada frente al gasto de tokens necesario para obtenerla— es de 1,99 $. Ese último número es el que conviene retener, porque es donde la posición de Argon se vuelve incómoda: Opus 5.5 obtiene cinco puntos más y cuesta 5,98 $ por tarea del índice, así que Argon es tres veces más barato por unidad de capacidad medida. Pero GPT-6.1 Sol obtiene medio punto menos y cuesta 0,72 $, lo que equivale aproximadamente a un tercio de la cifra de Argon. Argon no es la opción con mejor relación calidad-precio dentro de su propia banda del índice. Es el punto medio de ella.

Existen dos lecturas independientes más que un lector cuidadoso no debería confundir entre sí. Artificial Analysis registra la cifra de AutomationBench de Argon como una parcial puntuación de 0,7751 en una escala de 0 a 1, mientras que la tabla de Google informa 51,3 de 100 en el tablero de AutomationBench. No son la misma métrica, y ponerlas una al lado de la otra es exactamente el tipo de comparación que produce un número inventado. La misma precaución se aplica a las agrupaciones de trabajo del conocimiento de la tabla del proveedor: “liderar en el trabajo del conocimiento” es el resumen de Google de su propia tabla.

Qué página de “Gemini 4” estás buscando en realidad

Esta es la confusión que genera el nombre, y vale la pena aclararla en un solo lugar, porque el blog ya ha escrito sobre cinco cosas diferentes de “Gemini 4” y no son variantes de un mismo artículo.

• Si quieres la fecha de lanzamiento y la cronología de despliegue — cuándo se anunció Argon, qué es el despliegue por etapas y qué hicieron los tableros de arena con él — ese es el artículo sobre la fecha de lanzamiento, que es la pieza que posee la cronología y las lecturas de Text Arena y Code Arena.

• Si quieres saber “¿Es Gemini 4 Argon un nivel o un modelo?”, y si existe un Gemini 4 Ultra — el artículo de posicionamiento por niveles, que descifra la escala a partir de las propias rutas de Google y explica por qué la ruta de Ultra termina en una página de suscripción.

• Si quieres la propia cuestión del nombre, el argumento de que, de “Gemini 4” y “Gemini 4 Argon”, exactamente uno es un modelo y el otro es un prefijo de generación sin ID de modelo, sin endpoint y sin precio — ese es el cara a cara de los dos nombres de Google.

• Si quieres el resultado en tercer lugar de FrontierSWE v2 y la observación de autocrítica que lo acompañó, esa es la pieza de evaluación de FrontierSWE.

• Si quieres comparar Argon con un rival concreto en cifras, en el sitio hay trece páginas de comparación que cubren la banda frontera, y son el lugar adecuado para una lectura comparativa de dos modelos.

Lo que ninguna de ellas es, y lo que esta página es, es el pilar: el único lugar que dice qué es la entidad, qué significa y qué no significa cada cifra asociada a ella, y qué puedes hacer realmente con ella hoy. La página relacionada “Gemini 4 vs Gemini 4 Argon” ya expone el argumento sobre el nombre en su totalidad, y esta página no lo repetirá. Todo lo que aparece a continuación es nuevo.

A screenshot of the Artificial Analysis page for Gemini 4 Argon, showing the model name and the line reading released September 2026, a proprietary reasoning model with a 1M token context window, and the statement that it is available via API through 1 provider — with the provider count identifiable in artificial analysis's own hosting panel rather than named in this description.

La presión que todavía no nos ha dicho nada

Dos de las señales más fuertes en la historia de Argon apuntan a un lanzamiento inminente para desarrolladores, y ninguna de ellas es evidencia de que dicho lanzamiento haya ocurrido.

La primera es que las propias interfaces API de Google han seguido adelante sin Argon. La entrada más reciente del registro de cambios de la API de Gemini es 6 de octubre de 2026 — Gemini Nano Banana 2.1 disponible de forma general, bajo el identificador gemini-nano-banana-2.1. En otras palabras, en los ocho días transcurridos desde que se anunció Argon, Google ha elegido una convención de nomenclatura para un modelo de Gemini en producción y ha lanzado un identificador GA para un modelo diferente, y el espacio de nombres de gemini-4 sigue vacío. Un modelo cuyo despliegue es real deja una marca en el registro de cambios. Este no ha dejado ninguna.

El segundo es el encuadre de seguridad nacional. Google afirma que está “participando activamente en el proceso voluntario del gobierno de EE. UU. para el acceso al modelo antes de su lanzamiento”, y la primera etapa de despliegue es una cohorte designada de ciberdefensores. Eso es consistente con un lanzamiento escalonado en el que la audiencia de capacidades de frontera recibe el modelo antes que la API pública, y es igualmente consistente con que el modelo simplemente no esté listo para el tráfico general. Nada en el encuadre te dice cuál. Cualquiera que diga que eso te lo dice está leyendo los posos del té, y Google no ha puesto fecha a la etapa de la API para zanjarlo.

Lo que puedes llamar hoy en día, y lo que no

Esta es la parte de la página que se actualiza más rápido, por lo que lleva su fecha. Al 8 de octubre de 2026, la API de modelos de OrcaRouter devuelve HTTP 404 para google/gemini-4-argon. No está en nuestras rutas. Tampoco lo está google/gemini-4, ni google/gemini-4-argon-high, ni google/gemini-4-pro — ninguno de esos identificadores se resuelve, porque ninguno de ellos existe como modelo invocable en ningún lugar.

¿Qué hay en nuestras rutas hoy, del mismo proveedor, y cuánto cuesta cada una según el precio de lista del proveedor?

• google/gemini-3.8-flash — lanzado el 2026-09-02, con una ventana de contexto de 1.048.576 tokens y una salida máxima de 65.536 tokens, a $0,75 de entrada y $3,75 de salida por millón de tokens. Este es el modelo con el que, con el tiempo, compararán a Argon quienes tengan una tarjeta de crédito, y es lo más parecido a una carga de trabajo afín a Argon que puedes ejecutar esta tarde.

• google/gemini-3.6-flash — lanzado el 2026-07-21, a $0.75 y $3.75.

• google/gemini-3.5-flash — publicado el 2026-05-23, a $1.50 y $9.00.

• google/gemini-3.5-flash-lite — lanzado el 2026-07-21, a $0.30 y $2.50.

• google/gemini-3.1-flash-lite — a $0.25 y $1.50.

• google/gemini-3.1-pro-preview — lanzado el 2026-02-19, a $2.00 y $12.00. Este es el único Gemini de la categoría Pro que puedes invocar, y está tres generaciones y media por detrás de la entrada más reciente de la línea Flash.

Todos esos se ejecutan con la misma clave que los modelos frontera de Claude y OpenAI de la misma banda del índice —Claude Opus 5.5, Claude Sonnet 5.5, Claude Fable 5.1, GPT-6 Astra y GPT-6.1 Sol están todos en las mismas rutas—, lo que significa que lo interesante de la posición de Argon se puede poner a prueba sin Argon. Si quieres saber qué se siente al hacer trabajo de conocimiento de unos 52 puntos de índice a una quinta parte del precio, puedes medirlo hoy frente a google/gemini-3.8-flash con 40.93, y si quieres lo más alto de la banda puedes medir Claude Opus 5.5 con 57.62 el mismo día, en la misma cuenta, sin un segundo contrato y sin cambiar una línea de código. Esa es la forma práctica de todo el artículo: una sola API para más de 200 modelos, 0 % de recargo sobre el precio de lista del proveedor que se repercute, de modo que una rebaja de precios de un proveedor te llega el mismo día en que se aplica, y conmutación automática entre proveedores ante fallos para el día en que un modelo del que dependes deja de responder. Describimos esto aquí porque es cierto del Gemini 3.8 Flash al que puedes llamar, no porque diga nada sobre Argon. Argon no es uno de ellos.

Si quieres Argon en sí, hoy tus opciones son la cohorte de ciberdefensores de Fairwind y esperar. La propia API de Google no lo está sirviendo, y nosotros tampoco, y ninguna vía de terceros puede servir un modelo que no tiene un identificador al que dirigirse.

Las preguntas abiertas, y exactamente qué las cerraría

Hay cuatro puntos sin resolver, y cada uno tiene un detonante concreto y verificable. Mantener esa lista corta es lo esencial: una página como esta solo es útil mientras siga siendo refutable.

• ¿Argon obtiene un identificador de API de Gemini? Vigila la lista de modelos de la API por si aparece algún ID con el prefijo gemini-4. En cuanto aparezca uno, la cuestión de los precios se vuelve real y la tarifa introductoria de $2 / $10 se convierte en una cifra que se te puede facturar, en lugar de una cifra en una entrada de blog. También vigila si la tarifa introductoria sobrevive siquiera a la etapa de la API, y si pasa a $4 / $20 o a otra cosa.

• ¿Cambia la configuración medida? Argon se mide en un nivel de pensamiento y obtiene una puntuación de 52.56. Si Google expone una configuración de mayor esfuerzo, esa fila se mueve; los pares a los que persigue figuran todos con entre dos y cuatro niveles de esfuerzo, así que el que Argon figure una sola vez es un hecho sobre la disponibilidad, no sobre el techo del modelo.

• ¿Sobreviven las afirmaciones legales y financieras a una ejecución independiente?Harvey’s Legal Agent Benchmark con 19.6 frente al 3.8 de un competidor, y Vals Finance Agent v2 con 65.4 liderando el campo, son los dos márgenes relativos más grandes en la tabla de Google. También son las dos filas con más probabilidades de ser reejecutadas por alguien que no trabaja para Google. Un margen de cuatro a cinco veces en un benchmark de dominio es o la frase más importante del anuncio o una diferencia de harness, y la forma de averiguarlo es estar atento a una segunda ejecución.

• ¿Existe un hermano? La publicación del anuncio de Argon no nombra una familia, no adelanta un Pro ni adelanta un Ultra. Una segunda gemini-4-* ruta, una segunda columna o una entrada en la ficha del modelo darían la vuelta a esa lectura en un día. La pieza sobre el posicionamiento por niveles enumera los falsadores en su totalidad.

El resultado final

Gemini 4 Argon es un auténtico modelo de frontera con una auténtica tabla de benchmarks y una auténtica puntuación de índice de 52.56 de Artificial Analysis — y no es un producto, en el sentido específico de que no existe para él ningún identificador de modelo, endpoint, tarjeta de modelo, ventana de contexto ni fecha de disponibilidad general, y tanto la documentación de Google como los servicios de medición de terceros coinciden en que exactamente un proveedor lo aloja. El “Gemini 4” de su nombre es una etiqueta de generación; el “Argon” es la parte que lleva el modelo adjunto. Si este mes estás eligiendo algo sobre lo que construir, la decisión no involucra a Argon: involucra a Gemini 3.8 Flash, al que puedes llamar hoy por $0.75 / $3.75, y a los modelos de frontera de la misma banda del índice que se acceden con la misma clave. Vuelve a leer esta página cuando aparezca un identificador gemini-4 en la lista de la API. Hasta entonces, todo lo relacionado con Argon es una afirmación que Google hizo sobre un modelo al que nadie fuera de la primera cohorte puede acceder.

A single-column comparison scoreboard titled "Gemini 4 Argon vs Gemini 3.8 Flash — the scoreboard", with the left column headed Gemini 4 Argon showing rows reading Artificial Analysis Index: 52.6, Context window: 1M (output limit 1M), Price: $2 in / $10 out intro, Cost per Index task: $1.99, Callable via API: No — gated rollout, and Supplier count: 1, and the right column headed Gemini 3.8 Flash showing the same six dimension labels with Artificial Analysis Index: 40.9, Context window: 1,048,576, Price: $0.75 in / $3.75 out, Cost per Index task: $1.24, Callable via API: Yes, and Supplier count: on our routes, with a footer line reading "Argon index, price and cost-per-task figures per Artificial Analysis, v4.3.2 revision; Argon availability verified 2026-10-08."

Comparados en este artículo3

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario