Tarjeta de título principal que dice "Gemini 4 Argon — ¿qué peldaño de la escalera de Gemini 4?", con una escalera vertical de cinco peldaños clasificados que enumera Claude Opus 5.5 con 57.6, Gemini 4 Argon con 52.6, GPT-6 Astra con 52.7, Gemini 3.8 Flash con 40.9 y Gemini 3.1 Pro Preview con 29.7, una insignia que dice "No hay Gemini 4 Ultra — la página de Ultra redirige a un plan de suscripción", y una línea de pie de página que dice "Cifras del índice según Artificial Analysis, revisión v4.3.2; Argon no es invocable en ninguna API pública."
Guides & Insights

El peldaño de Gemini 4 Argon en la escalera de Gemini 4 — y por qué no hay un G4 Ultra

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La respuesta corta a la pregunta que dio origen a este artículo es que Gemini 4 Argon es el modelo principal de Google y no su nivel superior, porque el nivel por encima de él aún no existe — y posiblemente no en la forma que cualquiera espera. Google ha publicado exactamente un modelo Gemini 4, Argon, y la única página propia en su propio dominio bajo la ruta /models/gemini/ultra/ no es una página de modelo en absoluto: redirige a los planes de suscripción de Google AI. Esa redirección es el dato más útil de este artículo, y se puede comprobar en una línea desde una terminal. Todo lo demás aquí trata sobre dónde se sitúa realmente Argon una vez que dejas de leer su precio como una etiqueta de nivel y empiezas a leerlo como un número.

Dos cosas son ciertas a la vez y son fáciles de confundir. Argon es el G​emini más capaz que existe, y Argon no es un modelo de nivel frontera. Lidera todos los modelos de G​oogle que se han lanzado, por un margen lo suficientemente amplio como para que la comparación no sea realmente una comparación, y se sitúa en el Índice de Inteligencia de Artificial Analysis a una fracción de punto de dos buques insignia de la competencia que a su vez están cinco puntos completos por detrás del líder actual. G​oogle le puso un precio como si estuviera un escalón por debajo de la frontera, y la medición independiente está de acuerdo. Así que el precio no es una decisión de marketing que subestime el modelo. Es una declaración precisa sobre el modelo.

Esto es un artículo de "lo que sabemos hasta ahora". Gemini 4 Argon se anunció el 30/09/2026 en una publicación de Google DeepMind atribuida a Koray Kavukcuoglu, y se está desplegando primero para un grupo selecto de ciberdefensores a través del Fairwind Program de Google — no para desarrolladores, ni para empresas, ni para consumidores, ni para nadie que tenga una tarjeta de crédito. No tiene ID de modelo en la Gemini API, ni endpoint, ni un precio publicado por token contra el que se le pueda facturar. Los identificadores de modelo, el rendimiento y la fiabilidad medidos con tráfico real no existen para él, lo que significa que la medición que aparece a continuación es la ejecución de benchmark de un laboratorio y nada más. Cuando una cifra proviene de Google, se etiqueta como de Google; cuando proviene de Artificial Analysis, se etiqueta como suya. Nada de lo que aparece aquí debe interpretarse como una afirmación de que Argon sea un producto que se pueda comprar.

La escalera que Google lanzó de verdad, leída en sus propias páginas

La forma más rápida de responder “dónde encaja Argon en la gama Gemini 4” es dejar de preguntar por la gama y empezar a enumerar los modelos para los que Google publica páginas. Una gama es un concepto de marketing; una página es un hecho. Esto es lo que resuelven las rutas de primera parte a fecha de 1 de octubre de 2026.

• deepmind.google/models/gemini/pro/ devuelve 200 y su título es «Gemini 3.1 Pro — Google DeepMind». El espacio Pro en el propio sitio de Google sigue siendo un modelo de la generación 3.1.

• deepmind.google/models/gemini/flash/ devuelve 200 y su título es «Gemini 3.8 Flash — Google DeepMind». La ranura de Flash se ha movido tres veces — 3.5, 3.6, 3.7, 3.8 —, mientras que la ranura de Pro no se ha movido en absoluto.

• deepmind.google/models/gemini/argon/ devuelve un error 404. Argon no tiene una ruta propia por modelo. Su página de inicio es la página de la familia en deepmind.google/models/gemini/, que es donde Google publica el modelo con el que lidera en ese momento.

• deepmind.google/models/gemini/ultra/ devuelve 302 y aterriza en one.google.com/about/google-ai-plans/, la página de suscripción para consumidores. Lo mismo ocurre con la ruta anterior deepmind.google/technologies/gemini/ultra/. Un “Ultra” en la ruta de modelos de Google es un nivel de facturación, no un checkpoint.

• deepmind.google/models/gemini/nano/ devuelve un 301 a la página de la familia Gemini. Tampoco hay un espacio para Nano como página de modelo independiente.

• deepmind.google/models/gemini/model-cards/ — el índice que Google mantiene de cada ficha de modelo que ha publicado — no contiene ninguna entrada para Argon ni ninguna entrada con “Gemini 4” en el nombre. Sus filas de Gemini más recientes son 3.8 Flash, 3.8 Audio, 3.7 Flash, 3.6 Flash, 3.5 Flash, 3.5 Flash-Lite y 3.1 Pro. El índice de fichas es el documento que cambia más lentamente en este conjunto, así que su silencio no es prueba de que Argon nunca vaya a tener una ficha; es prueba de que el papeleo no se ha puesto al día con el anuncio.

• deepmind.google/models/, el índice de modelos, enumera “Gemini 4 Argon” como la tarjeta insignia con el eslogan “Nuestra próxima era de inteligencia de frontera”, justo encima de “Gemini 3.8 Flash — Ideal para abordar tareas agénticas complejas a escala”. Dos tarjetas Gemini, con una generación de diferencia, en ese orden.

Si se juntan esas piezas, la forma de la escalera no es ambigua. La superficie pública de modelos de Google tiene actualmente una entrada en el peldaño de Gemini 4, una entrada en el peldaño de Gemini 3.8, un peldaño Pro obsoleto tres generaciones y media por detrás, y nada por encima de nada de eso. La palabra “Ultra” en el dominio de Google remite a una suscripción. No hay página de Gemini 4 Pro, ni página de Gemini 4 Flash, ni página de Gemini 4 Ultra, ni ficha de modelo de Gemini 4. Google anunció un modelo, no una familia.

¿Existe un Gemini 4? La evidencia, y qué lo falsaría

Esto merece su propia sección porque es la parte de la pregunta que con más probabilidad recibirá una respuesta distinta dentro de una semana, y porque la respuesta honesta tiene fecha de caducidad.

La evidencia negativa es concreta, no vaga. Un 302 en la ruta Ultra hacia la página de planes de suscripción no es una señal débil; es una redirección que el propio equipo web de Google configuró. Varios blog.google patrones de URL para una publicación de Gemini 4 Ultra devuelven 404: la ruta de productos, la ruta innovation-and-ai models-and-research y la ruta de anuncio simple. El nombre Ultra tiene precedente aquí, y ese precedente juega en contra de un Gemini 4 Ultra. El anuncio original de Gemini de Google presentó Gemini 1.0 «optimizado para tres tamaños diferentes: Ultra, Pro y Nano», y describió Gemini Ultra como «nuestro modelo más grande y más capaz». Una publicación de lanzamiento que nombra tres tamaños es lo que parece el anuncio de una familia. La publicación de Argon nombra un solo modelo y ningún hermano. Google retiró más tarde el nombre de modelo Ultra en favor de niveles numéricos y trasladó la palabra al lado del negocio dedicado a las suscripciones, donde ahora designa el plan de consumo más alto. Una página de modelo que redirige a una página de planes es lo que parece un nombre de modelo retirado cuando el sitio de marketing se ha limpiado a su alrededor.

Tampoco hay nada en el anuncio que prometa un hermano mayor. La publicación de lanzamiento de Argon describe a Argon como “nuestro nuevo modelo de frontera” y describe el despliegue por fases, el trabajo de salvaguardas y los despliegues internos, y se detiene. No dice “el primero de la familia Gemini 4”, no adelanta un Pro ni un Ultra, y no nombra un sucesor. El propio enfoque de Google trata a Argon como el producto en sí, no como el pequeño.

Lo que falsearía la conclusión es fácil de enunciar y merece la pena vigilar, porque cualquiera de estos la daría vuelta en un día.

• Un 200 en deepmind.google/models/gemini/ultra/ que renderiza una página de modelo en lugar de la página de planes, o una nueva models/gemini/ ruta secundaria que aparezca junto a pro y flash.

• Una fila de Gemini 4 Ultra que aparece en el índice de tarjetas de modelo, que es como Google confirma históricamente que un modelo existe como artefacto documentado.

• Un segundo ID de modelo en la API de Gemini en el gemini-4-* espacio de nombres. Argon actualmente no tiene ninguno, por lo que un ID Pro o Ultra sería la primera evidencia de que la familia es real.

• Una entrada en la lista de modelos de Artificial Analysis, o una tabla de benchmarks en la página de la familia con una cuarta columna. Ambas siguen los lanzamientos de Google lo suficientemente de cerca como para ser tempranas.

• Una publicación de anuncio de Google I/O, Cloud Next o DeepMind que use la palabra «family» sobre Gemini 4. La publicación de Argon no lo hace.

Hasta que ocurra al menos uno de esos, un artículo que afirme que viene un Gemini 4 Ultra es una predicción disfrazada de reportaje. Trátalo en consecuencia, incluso si proviene de nosotros.

A two-column comparison scoreboard titled "Gemini 4 Argon vs Gemini 3.8 Flash — the scoreboard", with the left column showing Gemini 4 Argon at AA Intelligence Index 52.6, 1M context window, $2 input per million tokens, $10 output per million tokens, $1.99 cost per Index task and 142,374 output tokens per Index task, and the right column showing Gemini 3.8 Flash at AA Intelligence Index 40.9, 1M context window, $0.75 input, $3.75 output, $1.24 cost per Index task and 154,230 output tokens per Index task, with a footer reading "Both columns' Index, price, context, cost-per-task and token-use figures per Artificial Analysis, v4.3.2 revision."

Leer la escalera de precios como una declaración de niveles

El precio es la única parte de esto que Google publicó a propósito, con una nota al pie, y es la declaración más clara de la intención en cuanto a niveles en todo el lanzamiento. El precio introductorio de Argon es de $2 por millón de tokens de entrada y $10 por millón de tokens de salida, con la entrada en caché a un 95 % de descuento, y la propia nota al pie número uno de Google dice que, después de un periodo introductorio que no pudo definir, «se aplicará el precio de $4 por 1 M de tokens de entrada y $20 por 1 M de tokens de salida».

Contrasta esos dos pares con el campo y la afirmación sobre el nivel se escribe sola.

• $4 / $20 es el precio de lista de Claude Opus 5.5. La tarifa posterior a la introducción de Google para Argon coincide exactamente con la tarifa del actual líder de la frontera, para un modelo que mide cinco puntos por detrás.

• $2 / $10 es la franja promocional que ocupan tanto GPT-6 Sol como Claude Sonnet 5.5. La tarifa introductoria de Argon es la misma de $2 / $10, lo que sitúa el precio de lanzamiento de Argon en la misma franja que un Sol de gama media en lugar de en la franja de vanguardia.

• $10 / $50 es donde se sitúan tanto Claude Fable 5.1 como GPT-6 Astra. Argon cuesta un quinto del precio de entrada de Fable 5.1 y un quinto de su precio de salida, y su puntuación está dentro de 0,8 puntos de la suya.

• $0.75 / $3.75 es Gemini 3.8 Flash. Argon es 2,7× eso en entrada y 2,7× en salida — un aumento limpio, no un precipicio.

Así que Google ha fijado el precio de Argon como el de un modelo que se ubica por debajo de $10/$50 y por encima de $0.75/$3.75, con un punto de reposo final en $4/$20. Nada en esa escalera dice “frontera”. Dice “lo más alto de la banda media, con una cifra destacada que se asentará a la misma tarifa que el líder cobra hoy, por menos capacidad”. Esa es una elección comercial defendible. No es el precio de un modelo posicionado dos niveles por delante de todo lo demás.

Un punto estructural que conviene retener: el escalón de precio de Argon es un escalón real, definido en una nota al pie y sin fecha. Las familias Sonnet 5.5 y GPT-6 hacen algo similar con tramos de contexto largo, y Sol pasa a $4/$15 más allá de 272K. El escalón de Argon se basa en el tiempo, no en la longitud del contexto —el mismo $2/$10 se aplica en toda la ventana de 1M y solo el calendario cambia la tarifa. Esa es una forma inusual y hace que cualquier comparación de costos con Argon sea un ejercicio de dos columnas: qué período y qué uso.

Dónde se sitúa Argon frente a los rivales, según los números que existen

Artificial Analysis publicó una medición de Gemini 4 Argon con la suficiente rapidez como para que sea la única lectura independiente disponible. En la revisión vigente al 1 de octubre —v4.3.2—, Argon obtiene 52 en el Intelligence Index, configurado con un esfuerzo de razonamiento alto. Los modelos que lo rodean no son una muestra aleatoria del conjunto.

• Claude Opus 5.5 se sitúa en 57.62, medido con el máximo esfuerzo y con fallback. Eso es poco más de cinco puntos por encima de Argon, y es lo más alto de la tabla en la actualidad.

Claude Fable 5.1 se sitúa en 53.35, medido con esfuerzo máximo con fallback. Argon está 0.79 por detrás.

• GPT-6 Astra se sitúa en 52,67, medido al máximo. Argon está 0,11 por detrás.

• Claude Sonnet 5.5 se sitúa en 55,98, también máximo con fallback. Se trata de un modelo de gama media que supera a Argon por 3,4 puntos, y es la cifra que debería preocupar a cualquiera que recurra a “Gemini 4 Argon es el segundo mejor modelo del mundo”.

• GPT-6 Sol se sitúa en 47,63, medido al máximo, en una ventana de contexto de 872K. Argon está 4,9 por delante.

• Gemini 3.8 Flash se sitúa en 40.93 con esfuerzo alto. Argon le saca 11.6 de ventaja.

• Gemini 3.1 Pro Preview se sitúa en 29,72. Argon le lleva 22,8 puntos de ventaja, lo que constituye la afirmación más clara de hasta qué punto el nivel Pro que Google está lanzando se ha quedado atrás respecto a su propia investigación.

Tres cosas se desprenden de esa lista. Primero, Argon está a la par de los dos rivales, Fable 5.1 y Astra, y claramente por detrás de dos modelos de Anthropic: Opus 5.5 y, de forma más incómoda, Sonnet 5.5. Segundo, la diferencia entre Argon y el mejor modelo que Google ha lanzado es el mayor salto generacional de la línea actual, con diferencia. Tercero, el planteamiento de la señal de que “la frontera está al menos dos niveles por delante” es correcto en esencia, pero ligeramente equivocado en geometría: hay un nivel de modelos claramente por delante de Argon (Opus 5.5 con 57.6) y un segundo modelo en un nivel más barato que también está por delante de él (Sonnet 5.5 con 56.0), lo cual es un problema más agudo que estar dos peldaños por debajo en una escalera en la que Argon de hecho sí está.

El enfoque de comparación de precios de la pregunta original —“los precios sugieren que este es su equivalente a Sol/Sonnet”— resulta ser más o menos acertado respecto al precio de lanzamiento y equivocado respecto al precio final. Argon abre con la tarifa de Sol y de Sonnet 5.5 y acaba estableciéndose en la de Opus 5.5. Está tarifado como un modelo de gama media que pretende llegar a tener precio de modelo de frontera, aunque no mide a la altura de ninguno de los dos.

El panorama del costo por tarea es donde Argon es más fuerte y donde el relato de niveles adquiere una segunda dimensión. En la tarea Index, Argon cuesta $1.99 y emite 142,374 tokens de salida. Opus 5.5 cuesta $5.98 y emite 338,099. Sonnet 5.5 cuesta $7.62 por 599,849. Fable 5.1 cuesta $7.63 por 187,455. Astra cuesta $3.26 por 68,691. Gemini 3.8 Flash cuesta $1.24 por 154,230. Argon es la forma más barata de comprar una puntuación adyacente a la frontera, y es más barato que el modelo Flash que está por encima en puntuación por menos de un dólar por tarea.

Las configuraciones de esfuerzo son el asterisco sobre todo lo anterior, y el modelo no las reporta de manera uniforme. Argon se mide en alto; Opus 5.5, Fable 5.1 y Sonnet 5.5 en máximo con fallback; Astra y Sol en máximo. Una ejecución con esfuerzo alto y una con esfuerzo máximo no son la misma medición, y la propia escala de esfuerzo de Anthropic mueve a un modelo varios puntos entre configuraciones. Si Argon, medido con esfuerzo máximo, obtiene una puntuación significativamente por encima de 52.6, el argumento de los niveles cambia. Aún nadie ha publicado esa ejecución.

Lo que afirma la propia tabla de Google y en qué se diferencia de la independiente.

La página de la familia Gemini incluye una tabla de rendimiento elaborada por Google con cuatro columnas —Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1 y Claude Opus 5.5— y diecinueve filas de benchmarks. Es el conjunto de afirmaciones más detallado que Google ha publicado para este modelo, y todos sus datos son reportados por el proveedor. Leerla cotejándola con el Index independiente resulta instructivo precisamente porque los dos no coinciden en cuanto a la configuración del campo.

• En la tabla de Google, Argon gana trece de las diecinueve filas de forma absoluta o empata en el primer puesto, incluyendo Vals Index Knowledge work con 68.9, AutomationBench con 51.3, Harvey’s Legal Agent Benchmark con 19.6, DeepSWE v1.1 con 77.9, LABBench 2 con 88.8, GraphWalks con 99.7 para la banda ≤128K y 84.2 para la banda de 256K–1M, Agent’s Last Exam con 39.5, LVBench con 91.7 y Chartography con 71.6.

• Claude Opus 5.5 gana las filas que se leen como ingeniería sostenida: FrontierSWE v2 con 62,3 frente a los 55,0 de Argon, Terminal-bench 4.0 con 66,4 frente a 57,4, Terminal-Bench Science 0.1 con 63,3 frente a 57,6, y PostTrainBench con 49,3 frente a 45,3.

• GPT-6 Astra obtiene 68.1 en Terminal-Bench Science 0.1 y 72.6 en el subconjunto offline de OSWorld-2.0, y empata con Argon en CWE-bench v1 con 68.0. Claude Fable 5.1 pierde en todas las filas excepto en un empate compartido en Vibe Code Bench.

• En el índice independiente, el orden es Opus 5.5 primero, luego Sonnet 5.5, después Fable 5.1 y, a continuación, Argon y Astra prácticamente a la par. La tabla de Google no tiene ninguna columna de Sonnet 5.5, que es la omisión más trascendental de la tabla: las cuatro columnas de la tabla son una selección, y el modelo que supera a Argon en el índice a un precio más bajo no está entre ellas.

Nada de eso hace que la tabla de Google sea deshonesta. Las tablas de benchmarks de proveedores se seleccionan, no se muestrean, y la de todos los laboratorios también lo es. La convierte en una afirmación en lugar de una medición, y significa que la cuestión del nivel no puede resolverse a partir de ella. El único punto en el que la tabla es realmente determinante para este artículo es el negativo: diecinueve filas, cuatro columnas y ninguna quinta columna para un Ultra.

A screenshot of Google DeepMind's Gemini 4 Argon page scrolled to its Performance section, showing the Performance heading and the line “Frontier performance in complex workflows” above the vendor-reported benchmark table, whose four model columns are Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, with rows running from Vals Index and AutomationBench down through FrontierSWE v2 and Terminal-bench 4.0 to GraphWalks and Agent's Last Exam.

Lo único de Argon que no es en absoluto una cuestión de nivel

Cada argumento de nivel anterior asume que Argon es un modelo al que tarde o temprano podrás llamar. Vale la pena separar eso de la cuestión de posicionamiento, porque ambas cosas tienen respuestas distintas y solo una de ellas tiene que ver con la capacidad.

El límite de tokens de salida de Argon es de 1 millón de tokens, frente a los 64K anteriores, y Google lo afirma directamente. Ese es un techo de salida, no una ventana de contexto. La distinción importa porque ambos se confunden constantemente en la cobertura de este lanzamiento, y porque un límite de salida de 1M es una afirmación de ingeniería distinta de una ventana de contexto de 1M: el primero trata de cuánto puede durar una sola trayectoria, el segundo de cuánto se le puede dar al modelo de una vez. Google ha sido explícito sobre el límite de salida y ha guardado silencio sobre la ventana de contexto. Artificial Analysis también registra 1.000.000 de tokens para el contexto de Argon, pero ese es el campo del rastreador y no una declaración de Google, así que trata las dos cifras como provenientes de salas distintas aunque se lean igual.

Lo que inequívocamente no está disponible es el acceso. Argon no está disponible de forma general, no está en la Gemini API bajo ningún identificador y no está en ningún catálogo de terceros. Está disponible para defensores cibernéticos verificados a través del Fairwind Program y para los propios ingenieros de Google, y la siguiente etapa que Google menciona —“comenzando con clientes de pago de la API y suscriptores de Google AI Ultra”— no tiene fecha asociada. No puedes hacer benchmark con tu propia carga de trabajo. Por lo tanto, cada cifra de este artículo es la medición de otra persona de un modelo que no puedes usar.

¿Qué haría subir a Argon un peldaño?

Un juicio de nivel es una instantánea, y hay alrededor de cinco cosas que cambiarían este, en orden aproximado de cuánto importarían.

• Una ejecución de máximo esfuerzo medida de forma independiente. Argon es actualmente una medición de alto esfuerzo de 52,56. Las propias escalas de esfuerzo de Anthropic mueven a un modelo varios puntos entre configuraciones y, si el modelo de Google se comporta de forma similar al máximo, la posición real de Argon frente a Fable 5.1 y Astra es mejor de lo que dice este artículo. Este es el cambio más probable de todos.

• Una segunda fuente de medición. Un tracker es una medición. Un segundo laboratorio independiente que puntuara Argon con su propio harness haría más por la afirmación del tier que cualquier fila adicional de benchmark de Google.

• Un Gemini 4 Pro. Si Google abre el escalón Pro de la generación 4 por debajo de Argon, la gama se convierte en una familia con forma, la posición de Argon deja de ser «la única» y pasa a ser «la cima de tres», y todos los argumentos de este artículo sobre una familia ausente necesitan reescribirse. Merece la pena seguirlo, y está más cerca que la cuestión del Ultra.

• Un precio que no da un salto. Si el periodo introductorio simplemente nunca expira —Google no ha definido cuándo termina—, el precio efectivo en reposo de Argon es de $2/$10 en lugar de $4/$20, y su ventaja de costo por tarea frente a Opus 5.5 se amplía de aproximadamente 3× a aproximadamente 6×. Eso es un acontecimiento comercial, no de capacidad, pero cambia el aspecto que tiene una decisión de adquisición.

• Una tarjeta de modelo, una tarjeta de sistema o una página de metodología de evaluación de Argon. La tabla de rendimiento enlaza a una página de metodología en el dominio de Google; una tarjeta de modelo completa dejaría constancia de la ventana de contexto, la configuración de despliegue y la envolvente de seguridad, y sería el primer artefacto que permitiría a alguien ajeno a la cohorte Fairwind comprobar las cifras de Google en lugar de leerlas.

Por el contrario, lo que con mayor probabilidad haría bajar a Argon no es un benchmark en absoluto. Es el reportaje de Bloomberg del 30 de septiembre, que citó a empleados de Google con acceso al modelo diciendo que funciona peor en el trabajo real de lo que sugieren sus puntuaciones. Esa afirmación no está verificada por nadie fuera de Google y no es una medición, pero es el tipo de afirmación que un segundo benchmark independiente confirmaría o desmentiría. Hasta entonces, permanece en el registro como una acusación con un medio nombrado y fuentes anónimas, y pertenece a la discusión de niveles porque un modelo cuya brecha entre benchmark y campo está en disputa no puede ser promovido solo con benchmarks.

Qué significa esto si vas a elegir un modelo este mes

Dejando a un lado el argumento de posicionamiento, el panorama práctico es lo bastante sencillo como para que baste un párrafo. Gemini 4 Argon es el mejor Gemini que Google ha creado y no está disponible para ti, así que los modelos de Google entre los que realmente puedes elegir hoy son los que ya se han lanzado: Gemini 3.8 Flash, que obtiene 40.93 en el Index a $0.75/$3.75, y Gemini 3.1 Pro Preview, que obtiene 29.72 a $2/$12. Si necesitas un Gemini ahora mismo, esa es la elección real, y Argon no forma parte de ella.

Si eliges entre proveedores en lugar de dentro de Google, nada del anuncio de Argon cambia la decisión de hoy. Lo más alto del Index es Claude Opus 5.5 con 57.62, seguido de cerca por Claude Sonnet 5.5 con 55.98, a una quinta parte de la tarifa en entrada y la mitad en salida. Gemini 4 Argon, con 52.56, no tiene ruta hacia tu aplicación, así que no es un candidato, por buena que acabe siendo la puntuación.

A screenshot of Google's own Google AI plans page, showing the three consumer Google AI plans side by side — Google AI Plus at $4.99/mo with 400 GB storage, Google AI Pro at $19.99/mo with 5 TB storage, and Google AI Ultra from $99.99/mo starting at 20 TB of storage — each with a “View plan benefits” link, illustrating that “Ultra” on Google's domain names a subscription plan rather than a Gemini model.

OrcaRouter es una única API por delante de más de 200 modelos con los precios de lista de los proveedores transferidos sin margen alguno y conmutación por error automática entre proveedores, lo que significa que la decisión de cambiar de modelo no requiere recablear nada: el id del cuerpo de la solicitud es todo el cambio. Los modelos de Google que hoy están en nuestro catálogo son los que Google realmente ha lanzado — google/gemini-3.8-flash, google/gemini-3.6-flash, google/gemini-3.5-flash y google/gemini-3.1-pro-preview. Gemini 4 Argon no es uno de ellos y no lo será mientras no tenga un identificador de modelo público ni una tarifa publicada, así que nadie debería interpretar ninguna afirmación de enrutamiento en nada de lo anterior. Cuando Google ponga Argon en una API con un ID, se convertirá en una cuestión de enrutamiento. Hasta entonces, la versión honesta de la respuesta de OrcaRouter es que todavía no aplica, y lo útil que hace el catálogo para esta decisión concreta es permitirte consultar el precio de los modelos que realmente se pueden invocar uno junto a otro sin abrir cuatro cuentas para averiguarlo.

El resultado final

Gemini 4 Argon es el buque insignia de Google, no su modelo de frontera. Mide 52,56 en el índice v4.3.2 de Artificial Analysis con esfuerzo alto —a la par de Claude Fable 5.1 y GPT-6 Astra, cinco puntos por detrás de Claude Opus 5.5, y por detrás de Claude Sonnet 5.5, un modelo más barato de un laboratorio rival. Google lo puso a un precio introductorio de $2/$10, que pasa a $4/$20, lo que deja su tarifa final exactamente en la de Claude Opus 5.5 por una capacidad mediblemente menor. Su ventaja de 11,6 puntos sobre Gemini 3.8 Flash es la mayor brecha generacional en la propia gama de Google, y es la evidencia más sólida de que la generación Gemini 4 es un verdadero salto adelante y no un mero cambio de etiqueta.

Sobre la pregunta que dio origen a todo esto: no existe un Gemini 4 Ultra. La ruta Ultra de Google en su propio dominio redirige a una página de planes de suscripción, el índice de fichas de modelos no incluye ninguna entrada de Gemini 4, todos los patrones de URL de anuncio para una publicación de Gemini 4 Ultra dan 404, y la publicación de lanzamiento anuncia un modelo sin prometer una familia. Eso es un hallazgo real y es evidencia de primera mano, no una inferencia, pero también es un hecho con una vida media corta: un solo 200 en una ruta lo revierte, y el escalón Pro de la generación Gemini 4 es el que tiene más probabilidades de aparecer primero.

Dos salvedades para extraer de este artículo. Cada número de Argon que aparece aquí es la medición que alguien más hizo de un modelo que nadie fuera de una cohorte verificada de ciberdefensores puede invocar, y la propia tabla de diecinueve filas de Google es una afirmación más que una medición —útil en lo que es, y no un sustituto del Index independiente. Y el veredicto justo sobre la cuestión de los niveles es provisional: Argon se mide con esfuerzo alto, no máximo, y una ejecución con esfuerzo máximo es la forma más barata posible de que este artículo esté equivocado.

Comparados en este artículo4

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario