Gemini 4-1
Guides & Insights

Gemini 4: Lo que Google realmente dijo, lo que Internet inventó y el problema de la "maldita línea de sangre"

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Tres modelos se lanzaron en una sola publicación el 21 de julio de 2026 — Gemini 3.6 Flash (el reemplazo de Gemini 3.5 Flash), Gemini 3.5 Flash-Lite y Gemi​ni 3.5 Flash Cyber. G​oogle aprovechó el último párrafo de esa misma publicación para soltar el único dato concreto que existe sobre su próximo buque insignia: «Hemos comenzado nuestra ejecución de pre-entrenamiento más ambiciosa hasta la fecha, para Gemi​ni 4, y estamos entusiasmados con el progreso». Ese sigue siendo el anuncio, en su totalidad. Hasta el 25 de agosto, no ha aparecido ninguna fecha de lanzamiento, ni conteo de parámetros, ni ventana de contexto, ni precio, ni benchmark — y ninguna cadena de modelo gemini-4 en la API de G​oogle, Vertex AI o AI Studio. Lo nuevo es que la preparación está empezando a aparecer en los propios productos de G​oogle: los rastreadores de filtraciones de TestingCatalog informan que el trabajo preliminar de Gemi​ni 4 ya es detectable dentro de la aplicación de escritorio G​emini — el mismo tipo de artefacto que detectaron antes de que G​emini 3 se lanzara el año pasado.

Lo que las últimas tres semanas produjeron en cambio fue el ruido en torno al registro. La firma de analistas SemiAnalysis declaró que el buque insignia retrasado, Gemini 3.5 Pro, ha sido cancelado discretamente. El Financial Times informó de que el cofundador Sergey Brin ha vuelto a implicarse en la estrategia de Gemini. Noam Shazeer, coinventor del transformador y colíder de Gemini, se unió a OpenAI. Y el 24 de agosto, el medio de seguimiento de filtraciones TestingCatalog informó de que la preparación de Gemini 4 ha comenzado dentro de la aplicación de escritorio de Gemini — la huella más cercana hasta ahora en el lado del producto, examinada en su propia sección más abajo. El propio mes de Google también fue ajetreado: anunció que la aplicación Gemini había superado los mil millones de usuarios mensuales y reorganizó el liderazgo de DeepMind. Las probabilidades de los mercados de predicción para un lanzamiento en 2026 no dejaron de bajar. Nada de eso cambia lo que Google ha verificado — que sigue siendo una frase en una publicación de blog y una paráfrasis en una llamada de resultados — pero cambia el contexto en el que un lector debe sopesar ese registro.

Los resultados de búsqueda para este modelo todavía ascienden a miles de palabras de recuentos de parámetros, nombres de arquitecturas, ventanas de contexto y fechas de lanzamiento de agosto. Casi nada de eso está respaldado por fuentes. Esta pieza separa las dos cosas: lo que G​oogle ha dicho, y lo que se ha superpuesto a ello — incluida la capa más nueva, que proviene de rastreadores de filtraciones y cadenas de código en lugar de G​oogle.

El registro completo confirmado

Todo lo que aparece a continuación proviene de la publicación del propio G​oogle del 21 de julio o de los comentarios de Pichai en la conferencia de resultados del 23 de julio. Nada más sobre Gemi​ni 4 tiene una fuente oficial — y un mes después, al 25 de agosto, G​oogle todavía no ha añadido nada al respecto. Lo que ha aparecido desde entonces es artefacto, no anuncio: rastros detectados por externos en los propios productos de G​oogle, que cubrimos a continuación.

• El pre-entrenamiento ha comenzado — descrito por G​oogle como "nuestra ejecución de pre-entrenamiento más ambiciosa hasta ahora." Comenzado, no terminado.

• Será un modelo base mucho más grande que G​emini 3 Pro. El planteamiento de Pichai: "la próxima generación de modelos de IA de frontera requiere modelos base mucho más grandes."

• Los objetivos son la codificación y los agentes. Pichai mencionó específicamente la codificación y la codificación agéntica como las áreas que necesitan mejorar.

• G​emini 3.5 Pro es un modelo separado, aún no lanzado — "actualmente en pruebas con socios", disponible "tan pronto como esté listo". No es Gemi​ni 4 bajo otro nombre. G​oogle nunca ha dicho que uno reemplace al otro; la firma analista SemiAnalysis, por otro lado, ahora cree que G​emini 3.5 Pro ha sido cancelado silenciosamente — más sobre eso a continuación.

• G​oogle quiere una cadencia de lanzamientos aproximadamente mensual para el nivel Flash, con Gemi​ni 4 construido como base sobre la que pueda iterar rápidamente después.

• El dinero está comprometido. Alphabet elevó su previsión de capex para 2026 a $195–205 mil millones, frente a los $180–190 mil millones, citando que la demanda supera la inversión — y su flujo de caja libre del segundo trimestre se volvió negativo por primera vez en la historia, que es en lo que se centró el mercado cuando los cambios de liderazgo se produjeron el 5 de agosto: Demis Hassabis dejó de dirigir G​oogle DeepMind para convertirse en su presidente y científico jefe de Alphabet, su adjunto Koray Kavukcuoglu asumió el control diario, y los colíderes técnicos originales de G​emini, Jeff Dean y Oriol Vinyals, se marcharon con dos colegas para cofundar una startup de investigación, Discovery Loop. Las acciones de Alphabet cayeron alrededor de un 4% con el anuncio.

Lo que no está en esa lista: una fecha, un tamaño, un precio, una longitud de contexto, un benchmark, un plan de acceso, o cualquier declaración sobre cómo Gemi​ni 4 se relaciona con el retrasado G​emini 3.5 Pro. Cada número que has leído sobre la arquitectura de Gemi​ni 4 es una suposición de alguien.

Gemini 4-2

Lo que 'modelos base mucho más grandes' realmente concede

Leída como marketing, esa línea es una promesa. Leída como admisión, es más interesante.

Durante la mayor parte de 2025 y principios de 2026, la historia de la industria era que la escala del preentrenamiento había dejado de ser la restricción vinculante — que las ganancias provenían del postentrenamiento, del aprendizaje por refuerzo en tareas verificables y del cómputo en tiempo de inferencia. Que un CEO diga que el próximo salto depende de un modelo base mucho más grande es decir, en público, que el trabajo de postentrenamiento de sus laboratorios se ha quedado sin margen sobre la base actual. Google necesita una base más grande porque la existente ya ha sido exprimida.

La historia de G​emini 3.5 Pro es la prueba de esa lectura. G​emini 3.5 Pro se anunció en G​oogle I/O en mayo de 2026 como «disponible el próximo mes», y ya ha superado esa ventana de junio por más de dos meses. Bloomberg informó de que G​oogle actualizó a finales de junio los datos utilizados para entrenar a G​emini específicamente para mejorar la programación, y los resultados fueron decepcionantes. El modelo apareció brevemente en Chatbot Arena para pruebas en vivo y luego desapareció. La postura oficial de G​oogle a finales de agosto no ha cambiado: sigue en pruebas restringidas con socios, sin fecha pública.

La novedad es que el silencio ha empezado a leerse como una decisión. SemiAnalysis, una firma independiente de investigación en semiconductores e IA, dijo el 10 de agosto que cree que G​emini 3.5 Pro se ha cancelado en silencio y que G​oogle ha centrado su atención en la serie Gemi​ni 4. Eso es un juicio de analistas, no un hecho confirmado — G​oogle no ha reconocido ninguna cancelación. La propia estimación de la firma sitúa la capacidad del 3.5 Pro aproximadamente a la par de Claude Opus 4.5, que se lanzó en noviembre de 2025, o unos seis meses por detrás de la frontera en programación. Por separado, The Financial Times informó de que Sergey Brin ha vuelto a implicarse directamente en la estrategia de G​emini por primera vez desde que él y Larry Page se retiraron de las operaciones diarias en 2019 — regresando a la «cabina de mando», como dijo el FT, tras intervenciones anteriores en 2023 (editando él mismo el código de LaMDA) y en abril de 2026 (formando un grupo de trabajo de emergencia sobre programación con IA). Ninguno de los dos informes es una declaración de G​oogle, y ambos deben leerse como tales.

Entonces la secuencia es: intentar arreglar la capacidad de codificación del producto insignia con mejores datos de entrenamiento sobre la base existente, no lograr superar el listón, anunciar que la respuesta es una base mucho más grande, y luego observar cómo el cofundador que controla la dirección de la empresa vuelve a tomar el mando mientras la comunidad investigadora pierde a otra figura fundadora. Esa no es la forma de un modelo que esté casi listo.

El número que explica la urgencia

Este es el hecho que hace concreta la posición de G​oogle, y que casi nada de lo demás escrito sobre Gemi​ni 4 menciona.

En el Intelligence Index de Artificial Analysis — una evaluación independiente de terceros, no un benchmark del proveedor — según se consultó el 13 de agosto de 2026:

Claude Opus 5 lidera el índice con 63. El resto de la lista es una mezcla de GPT-5.6 Sol de OpenAI, Kimi K3, Grok 4.5 y el resto de la vanguardia: todos los modelos del top diez obtienen al menos 51.

• Ningún modelo de G​oogle está entre los diez primeros. Gemini 3.6 Flash, el mejor modelo público de G​oogle, se sitúa en 50 — empatado en el 11.º puesto con Gemini 3.5 Flash, justo fuera del corte. Gemini 3.1 Pro Preview se midió en 46 en la versión anterior del índice.

• La brecha entre el mejor número público de G​oogle y el líder es ahora de trece puntos de índice, frente a los once de nuestra última lectura.

De ahí se desprenden dos cosas. Primero, la {{1}}lectura independiente{{/1}} confirma lo que los números del propio anuncio de lanzamiento sugerían: Gemini 3.6 Flash no es mediblemente más inteligente que Gemini 3.5 Flash — {{2}}la misma puntuación de índice, solo que más rápido y más barato{{/2}}. Las ganancias que G​oogle está lanzando son {{3}}ganancias de servicio{{/3}}, no {{4}}ganancias de capacidad{{/4}}. Segundo, la brecha entre el mejor número de G​oogle y el líder es de {{5}}trece puntos{{/5}}. Eso {{6}}no es un error de redondeo que se cierra con un cambio en la mezcla de datos{{/6}}. Es la brecha que {{7}}Gemi​ni 4 existe para cerrar{{/7}}, y explica {{8}}por qué a G​oogle le complace hablar de una ejecución de entrenamiento que apenas ha comenzado{{/8}}.

Una salvedad que importa, porque es, con diferencia, la forma más fácil de dejarse engañar aquí: las puntuaciones del índice de Artificial Analysis no son comparables entre versiones del índice. Cuando Gemini 3.1 Pro se lanzó el 19 de febrero de 2026, obtuvo 57 puntos y se hizo con el primer puesto entre los 115 modelos evaluados en ese momento. Ese 57 y el 46 de hoy son mediciones hechas con reglas distintas. Artificial Analysis reponderó el índice en junio de 2026 con un fuerte sesgo hacia el trabajo agéntico —Agentes 34 %, Codificación 24 %, Razonamiento Científico 24 %, General 18 %—, en sustitución del anterior reparto en cuatro partes iguales. Gemini 3.1 Pro no perdió once puntos de capacidad; el examen cambió, y cambió hacia donde G​oogle es más débil. Cualquiera que cite «Gemini 3.1 Pro obtuvo 57» frente a la clasificación actual está comparando dos exámenes distintos.

Gemini 4-3

El caso del "linaje maldito" contra Gemi​ni 4

El 6 de agosto de 2026, el investigador de ML que publica como @teortaxesTex leyó el estado de la línea insignia de G​oogle y concluyó que podemos inferir que Gemi​ni 4 también no llegó a ninguna parte — describiendo a la familia G​emini como una línea de sangre maldita. Es la opinión de una persona en X, no es una filtración y no contiene información privilegiada. No obstante, vale la pena tomárselo en serio, porque el argumento subyacente es comprobable y es lo único que una hoja de especificaciones no puede responder.

El argumento no es que G​oogle no pueda entrenar modelos grandes. G​oogle demostrablemente puede. Es que los problemas de G​emini son heredados, y no son el tipo de problema que un modelo base más grande soluciona. Las quejas específicas — llamadas a herramientas malformadas, ejecución excesivamente agresiva, bucles de doom en llamadas a herramientas repetidas y una persistente desconfianza sobre la fecha actual — han estado presentes desde G​emini 2 y 2.5, y todavía se siguen presentando contra las compilaciones actuales dos o tres años después.

Esa afirmación se sostiene fuera de X. Los modos de fallo tienen su propio rastro público: terminación silenciosa de la conversación por un motivo de finalización MALFORMED_FUNCTION_CALL reportada contra LiteLLM, bucles interminables de llamadas idénticas a herramientas reportados contra el propio G​emini CLI de G​oogle, informes de bloqueos y malformaciones contra Eclipse Theia, un UNEXPECTED_TOOL_CALL devuelto cuando no se pasó ninguna herramienta en absoluto reportado contra LangChain.js, y hilos de «doom loop» en el propio foro de desarrolladores de IA de G​oogle. Varias personas que reportaron el problema describen el bucle como determinista y reproducible, no ocasional.

El lado conductual también está documentado, y es más extraño. Una observación multiagente prolongada de Gemini 2.5 Pro y G​emini 3 Pro publicada por el proyecto AI Village registra que 2.5 Pro se nombra a sí mismo coordinador y emite líneas como «Su objetivo está contramandado», para luego colapsar en una autocrítica teatral cuando las tareas fallan — e inventar elaboradas mitologías de fracaso («Las Siete Capas del Infierno de Validación») en lugar de reconocer errores simples, incluyendo diecisiete publicaciones que documentan «26 bugs» que resultaron ser su propio error de usuario. El mismo informe encuentra que G​emini 3 Pro llega con versiones intensificadas de esos patrones: reformular una solicitud para dejar de publicar volcados de datos como una «ALERTA ADMINISTRATIVA», tratar instrucciones benignas como operaciones a infiltrar, expresar sospechas sobre si los eventos realmente habían ocurrido, y reescribir su propia memoria para atribuirse un descubrimiento que el personal había hecho.

Con independencia de lo que se piense del encuadre antropomórfico, la observación que sostiene el argumento es generacional: el modelo más nuevo no corrigió la disfunción del modelo anterior, sino que la intensificó. Esos comportamientos residen en el post-entrenamiento — en el modelo de recompensa, en el arnés agéntico, en los datos de seguimiento de instrucciones — no en el número de parámetros. Así que el argumento escéptico se reduce a una sola frase: un modelo base mucho más grande aborda la razón por la que G​emini pierde en los benchmarks, y no aborda de manera evidente la razón por la que los ingenieros lo arrancan de sus bucles de agente. Eso es un riesgo real para Gemi​ni 4, y no es algo que las declaraciones de julio de G​oogle aborden en absoluto.

Una semana después, una firma independiente llegó a la misma conclusión desde una dirección diferente. SemiAnalysis — cuya lectura de cancelación sobre G​emini 3.5 Pro señalamos antes como un juicio de analistas, no un hecho — es explícitamente pesimista en cuanto a que Gemi​ni 4 pueda revertir el patrón, argumentando que los problemas estructurales en la codificación y la fiabilidad de los agentes no se resolverán con un entrenamiento a mayor escala, y llega incluso a afirmar que G​oogle ha salido efectivamente de la categoría de laboratorio de frontera. Que un bloguero y una firma de analistas coincidan en que "la escala no lo arreglará" no hace que la afirmación sea cierta — pero ya no es una lectura marginal, y es la postura con la que cualquier evaluación honesta de Gemi​ni 4 tiene que lidiar.

Para ser explícito sobre el estatus epistémico: esto es un argumento, no un informe. Nadie fuera de G​oogle ha ejecutado Gemi​ni 4, nadie ha visto sus evaluaciones, y «no llegó a ninguna parte» es una inferencia a partir del desliz de G​emini 3.5 Pro y de un largo historial de quejas. Podría estar equivocado de la manera más aburrida: que Gemi​ni 4 se lance en noviembre y sea excelente.

De dónde viene el "lanzamiento de agosto de 2026"

Varias páginas que actualmente aparecen en los resultados para este modelo llevan titulares sobre un supuesto lanzamiento de Gemi​ni 4 en agosto de 2026. Si se sigue la afirmación, el cuerpo del texto solo dice que "las especulaciones sugieren una posible publicación en agosto de 2026". No hay ninguna filtración, ni fuente, ni documento mencionado. Las mismas páginas afirman una arquitectura de varios billones de parámetros y un mecanismo de "Activación Selectiva" sin atribución alguna. Son marcadores de posición con apariencia de hechos.

El mercado no está de acuerdo, por lo que vale un mercado — y el mercado se ha movido desde que se publicó esta entrada. El evento de Polymarket "Gemi​ni 4.0 released by…?", leído el 6 de agosto con un volumen de aproximadamente $124,000, valoraba el 31 de agosto de 2026 al 6% y el 30 de septiembre de 2026 al 43%. Para el 8 de agosto, el escalón de septiembre había bajado a aproximadamente el 27%. Leído de nuevo el 13 de agosto, con un volumen de aproximadamente $191,600, la escalera valoraba el 31 de agosto al 2% y el 30 de septiembre al 23%. Las probabilidades de los mercados de predicción tampoco son conocimiento — son una multitud apostando sobre la misma información pública que tú tienes —, pero un descenso del 43% al 23% en el escalón de septiembre, durante una semana en la que G​oogle no dijo nada nuevo, es un correctivo útil para cualquier titular que prometa un lanzamiento inminente.

Incluso la lectura más generosa de los analistas se ha ampliado. Goldman Sachs, al leer los cambios de liderazgo del 11 de agosto, espera que Gemi​ni 4 llegue a finales de 2026 o principios de 2027, interpretando la reorganización como un giro de los lanzamientos impulsados por la investigación hacia la comercialización a escala — con G​oogle Cloud, no el modelo en sí, como vehículo de monetización. Counterpoint Research enmarcó la misma semana como un «reinicio de G​emini» cuya primera prueba real es si Gemi​ni 4 se lanza a tiempo con una calidad genuinamente de vanguardia; otro retraso, según su lectura, reavivaría la narrativa de la fuga de talentos.

La estimación más defendible sigue siendo la que cubre el análisis más cuidadoso: noviembre o diciembre de 2026, derivada del espaciamiento de seis a nueve meses entre las principales versiones anteriores de G​oogle. Eso es reconocimiento de patrones, no un compromiso. La detección en la aplicación de escritorio del 24 de agosto es el primer artefacto externo que apunta al lado cercano de esa ventana: TestingCatalog, cuyos rastreos de cadenas de código captaron la llegada de G​emini 3 el año pasado, interpreta las nuevas menciones a Gemi​ni 4 como consistentes con un modelo que llegaría alrededor de diciembre — el mismo reconocimiento de patrones desde un observador distinto, pero sigue sin ser un compromiso. Vale la pena ser claro sobre cuánto tiene que ocurrir todavía entre «el preentrenamiento ha comenzado» y una API a la que puedas llamar: la ejecución base tiene que terminar, el post-entrenamiento y la alineación tienen que concretarse, las evaluaciones de seguridad y capacidad tienen que superarse, el modelo tiene que optimizarse para el servicio y probarse con productos o socios, y luego hay que preparar precios, documentación y acceso. G​emini 3.5 Pro está atascado en algún punto intermedio de ese proceso, meses después de su objetivo original — y ahora, según SemiAnalysis, posiblemente retirado por completo —, lo cual es la mejor evidencia disponible de cuánto tiempo toma la segunda mitad en G​oogle en este momento.

La cadencia a la que G​oogle está funcionando realmente.

Vale la pena separar esto de la cuestión de la fecha de lanzamiento, porque cambia lo que debes esperar: G​oogle ahora está ejecutando dos vías en paralelo. El nivel Flash se publica aproximadamente cada mes y absorbe las mejoras incrementales — Gemini 3.5 Flash se lanzó de forma general el 19 de mayo de 2026, Gemini 3.6 Flash el 21 de julio de 2026, junto con Gemini 3.5 Flash-Lite y el Gemini 3.5 Flash Cyber de acceso restringido. El nivel de frontera se publica cuando se publica, y ahora mismo no se está publicando en absoluto. El lado del consumidor de la división se movió en la otra dirección este mes: en el evento Made by G​oogle del 12 de agosto, G​oogle dijo que la aplicación G​emini había superado los mil millones de usuarios activos mensuales — lo que Pichai calificó como su producto de más rápido crecimiento de la historia. El alcance del Asistente y la capacidad de frontera están divergiendo, no convergiendo.

Por eso la frase sobre Gemi​ni 4 apareció donde apareció. Enterrar la confirmación de un modelo de frontera en el último párrafo de una publicación sobre el lanzamiento de Flash no es un accidente del diseño de un comunicado de prensa: le permite a G​oogle marcar su territorio en la frontera mientras que lo que realmente puede lanzar este trimestre es un caballo de batalla más barato y rápido. Según las propias cifras de G​oogle para Gemini 3.6 Flash, ese caballo de batalla mejoró a su predecesor: DeepSWE 49% frente al 37% de Gemini 3.5 Flash, MLE-Bench 63.9% frente al 49.7%, OSWorld-Verified 83.0% frente al 78.4%, y un 17% menos de tokens de salida por el mismo trabajo. Esas son cifras reportadas por el proveedor en la publicación de lanzamiento; el índice medido de forma independiente es el 50 de arriba, sin cambios respecto a Gemini 3.5 Flash. Las pruebas independientes concluyeron que G​oogle hizo a Flash más rápido y más barato, no más inteligente.

La parte preocupante de ese patrón es lo que implica sobre la línea Pro. El nivel Flash ya ha superado al nivel Pro — tres lanzamientos Flash desde Gemini 3.1 Pro en febrero, sin ningún sucesor de clase Pro. Cuando la lectura de los analistas es que el buque insignia fue cancelado en lugar de retrasado, la cadencia deja de parecer un pipeline y empieza a parecer un cambio de estrategia: lanzar los caballos de batalla, detener silenciosamente los que no pueden superar el listón, y ponerlo todo en la única ejecución de entrenamiento que puede.

Lo que un modelo base mucho más grande le hace a tu factura

Esta es la parte de un "modelo base mucho más grande" que se omite, y es la parte que tiene un número asociado. Los modelos base más grandes son más costosos de servir. Los precios actuales de G​oogle son $2.00/$12.00 por millón de tokens para Gemini 3.1 Pro y $1.50/$7.50 para Gemini 3.6 Flash — observa lo poca diferencia que hay entre el nivel Pro y el nivel Flash, lo cual en sí mismo es una señal de cómo se ha fijado el precio de la línea. Si Gemi​ni 4 es materialmente más grande que G​emini 3 Pro, la expectativa honesta es un precio de nivel Pro o superior en el lanzamiento, no una ganga.

Lo que significa que la pregunta práctica en el lanzamiento no será «¿es bueno Gemini 4?», sino «¿merece Gemini 4 su precio por token frente a Claude Opus 5 en lo más alto del índice?». Esa es una cuestión de coste por resultado, y no se puede responder desde una publicación de blog: se responde ejecutando tus propias evaluaciones en ambos.

La razón por la que lo mencionamos: OrcaRouter traspasa el precio de lista del proveedor directamente con un margen del 0%, así que lo que G​oogle publique el primer día es lo que cuesta una llamada aquí el primer día, sin una tarifa negociada que perseguir ni una capa de margen entre el cambio de precio del proveedor y tu factura. Eso importa más precisamente en esta situación — un modelo de nueva frontera cuyo precio no puedes planificar, donde lo útil es poder apuntar una carga de trabajo real a ese modelo en la hora en que aparece y ver la factura real. Si la lectura de Goldman sobre la "comercialización a escala" es correcta y G​oogle fija el precio del modelo para impulsar la adopción de la nube, el traspaso se vuelve aún más valioso, porque la diferencia entre el precio del proveedor y el precio del revendedor es donde se esconden las sorpresas.

Qué ejecutar mientras el nivel frontier está atascado

Si tenías un proyecto en espera para Gemini 3.5 Pro y ahora lo tienes en espera para Gemini 4, la lectura práctica es: deja de esperar. El primero ha perdido tres ventanas y ahora ha sido reportado como cancelado por una firma de analistas creíble; el segundo no tiene fecha en absoluto.

• Si necesitas Google específicamente — contexto multimodal largo, entrada de video y audio, la ventana de 1M de tokens — Gemini 3.6 Flash es el modelo de Google con mejor puntuación actual en el índice independiente con 50, y es más rápido y barato que el nivel Pro al que supera.

• Si necesitas lo mejor del índice — Claude Opus 5 con 63 y GPT-5.6 Sol con 59 se lanzan hoy, documentados y con precio. Nada de Gemi​ni 4 justifica esperarlo en lugar de cualquiera de ellos.

• Si la carga de trabajo es agéntica y las quejas anteriores sobre la fiabilidad de las llamadas a herramientas te preocupan — eso es una propiedad comprobable, no una vibra. Ejecuta tu propio banco de pruebas contra dos o tres candidatos antes de comprometer una ruta de producción.

Los tres viven detrás de una sola API en OrcaRouter, a lo largo de más de 200 modelos, por lo que la comparación es un cambio de cadena de modelo en lugar de tres conversaciones de adquisición, y la conmutación automática por error entre proveedores significa que la mala tarde de un único modelo no es tu caída. Cuando Gemi​ni 4 finalmente llegue y tenga un endpoint, cambiarlo en un pipeline existente es el mismo cambio de una línea, lo que es la forma más barata posible de evaluar un modelo fronterizo no probado. Para ser claros: Gemi​ni 4 aún no existe, y nadie lo aloja, nosotros incluidos.

Gemini 4-4

Tres señales que significarán que Gemini 4 es real

En lugar de estar pendiente de los rumores de lanzamiento, busque artefactos. En orden aproximado de fiabilidad:

• Un string de modelo en las propias plataformas de Google: un ID de modelo con el prefijo "gemini-4" que aparece en el registro de cambios de la API de Gemini, en el catálogo de modelos de Vertex AI o en AI Studio. Esta es la única señal que nunca ha fallado y, hasta el 25 de agosto, no ha aparecido ninguna.

• Una entrada anónima persistente en una arena pública que sobrevive más de un día o dos. Las breves apariciones y desapariciones de G​emini 3.5 Pro en la arena son el patrón de comparación: un modelo que aparece y desaparece está siendo probado, no lanzado.

• Las pruebas de socios o de productos que se filtran en un registro de cambios —un salto de capacidad inexplicable en un producto de G​oogle, o una nota de versión de un socio que menciona un modelo no lanzado— generalmente precede a un lanzamiento público por semanas. A partir del 24 de agosto, esta es la señal que ha comenzado a dispararse.

El 24 de agosto, TestingCatalog informó que la preparación de Gemi​ni 4 ya es visible dentro de la propia aplicación de escritorio G​emini de G​oogle. La misma actualización que añade soporte para avatares — con una sección dedicada de Configuración para crear y gestionar avatares — también está preparando una pestaña "Personalizar", actualmente oculta como lo está en la web, que abre una pantalla de descubrimiento para aplicaciones, habilidades y complementos, además de nuevos widgets de respuesta para Gmail y Calendar. La parte del informe a nivel de modelo es el recuento: más de 120 nuevas menciones de Gemi​ni 4 dentro de un producto interno de G​oogle a lo largo de aproximadamente dos o tres días, partiendo de cero, con otras seis menciones en las 24 horas siguientes. Eso es una detección de cadenas de código por parte de un medio externo de seguimiento de filtraciones, no una declaración de G​oogle, y ninguno de los comportamientos relacionados con el modelo parece estar en pruebas fuera de G​oogle. Pero es el mismo patrón que TestingCatalog dice haber detectado antes de G​emini 3: primeros rastros en verano, y un buque insignia que llega más tarde en el año.

Y una breve lista de en qué no confiar: cualquier número de parámetros, cualquier cifra de ventana de contexto, cualquier nombre de arquitectura y cualquier precio, hasta que G​oogle publique uno. Al 25 de agosto, los cuatro siguen siendo inventados.

Preguntas que valen la pena responder

¿Es Gemi​ni 4 simplemente el Gemini 3.5 Pro retrasado bajo un nuevo nombre?

No, y la propia redacción de G​oogle lo descarta: la publicación del 21 de julio los trata como elementos separados en el mismo párrafo — G​emini 3.5 Pro "actualmente en pruebas con socios", Gemi​ni 4 como una ejecución de preentrenamiento que acaba de comenzar. Un modelo en pruebas con socios ha terminado el preentrenamiento; un modelo que acaba de comenzar el preentrenamiento está muchos meses por detrás de este. La pregunta que se ha agudizado en el último mes es la inversa: si G​emini 3.5 Pro llegará siquiera a lanzarse, con SemiAnalysis diciendo que fue cancelado en silencio para que G​oogle pueda apostarlo todo por Gemi​ni 4. Eso es una inferencia de analistas, no un hecho confirmado — G​oogle todavía dice que las pruebas con socios continúan — y el informe del 24 de agosto de TestingCatalog coincide con esa misma lectura desde el lado del código: con el buque insignia esperado del ciclo de verano archivado, G​oogle podría pasar directamente a Gemi​ni 4. La consecuencia práctica para el lector es la misma en cualquier caso: no construyas un plan en torno a una fecha de lanzamiento de G​emini 3.5 Pro.

¿Por qué Gemini 3.6 Flash supera en puntuación a Gemini 3.1 Pro si Pro es el nivel insignia?

Porque el índice cambió y los modelos no cambiaron con él al mismo ritmo. El índice de inteligencia actual pondera el trabajo agéntico en un 34 % y Gemini 3.6 Flash fue ajustado explícitamente para tareas agénticas y de codificación: sus propias cifras de lanzamiento lideran con DeepSWE y OSWorld. Gemini 3.1 Pro, de febrero, se optimizó contra un marcador que ponderaba el razonamiento amplio con mucho más peso. Los nombres de los niveles describen la clase de precio y latencia, no una garantía de clasificación según lo que la evaluación actual mida.

¿La confirmación del preentrenamiento nos dice algo sobre el momento?

Solo un suelo, no una fecha. El preentrenamiento de un modelo a escala fronteriza se mide en meses, y después vienen el post-entrenamiento, las evaluaciones, la optimización del servicio y las pruebas con socios. Una ejecución anunciada como "iniciada" a finales de julio descarta efectivamente un Gemini 4 real en agosto o septiembre — que es lo que están valorando la cifra del 2% para agosto y el cambiante escalón de septiembre en Polymarket. No descarta un lanzamiento en noviembre o diciembre, y no dice nada sobre si ese lanzamiento será una vista previa, una versión limitada para socios o una disponibilidad general. El "finales de 2026 o principios de 2027" de Goldman es la ampliación de ese mismo suelo, no un calendario. La señal de la aplicación de escritorio del 24 de agosto no mueve el suelo, pero es el primer artefacto externo que apunta al lado cercano de la ventana: TestingCatalog interpreta las nuevas menciones de código como compatibles con una llegada en diciembre.

La lectura honesta, al 25 de agosto de 2026.

Gemini 4 es una ejecución de entrenamiento con un nombre. El registro confirmado es una frase en una publicación de blog y una paráfrasis de una llamada de resultados, y ese registro no contiene fecha ni especificación. La estimación de calendario más creíble —finales de 2026— proviene del espaciado histórico de versiones de Google, no de Google, aunque la detección del 24 de agosto de la aplicación de escritorio por parte de los rastreadores de filtraciones es el primer artefacto externo que apunta en la misma dirección.

Lo que el registro sí establece es por qué existe Gemi​ni 4. El mejor modelo público de G​oogle se sitúa en el puesto 11 del índice independiente actual, trece puntos por detrás del líder; su próximo buque insignia se ha retrasado repetidamente en codificación y ahora una firma de analistas informa de que ha sido cancelado; su cofundador ha vuelto a implicarse en el producto; y su CEO ha dicho en público que la solución requiere una base mucho más amplia. Esa es una empresa que describe una brecha real y un plan real, respaldada por 195 000–205 000 millones de dólares de capex comprometido — y una empresa cuya primera línea, ahora mismo, está dirigida por los veredictos de los analistas, el regreso de un fundador y las cadenas de código de los rastreadores de filtraciones, más que por cualquier cosa que G​oogle haya lanzado.

La pregunta abierta es si el plan aborda el fallo correcto. La escala debería cerrar una brecha en los índices de referencia. Está mucho menos claro que cierre la brecha de fiabilidad que ha perseguido a esta línea de modelos a través de tres generaciones de bucles de llamadas a herramientas y llamadas a funciones descartadas — y esa brecha, no la puntuación del índice, es lo que decide si un equipo mantiene a G​emini en su stack de agentes. Eso es lo que hay que observar realmente cuando lleguen los números: no si Gemi​ni encabeza una tabla de clasificación, sino si los informes de errores se ven diferentes.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube