
GPT-6 vs Gemini 3.1 Pro: el nivel Pro de Google no ha lanzado un nuevo modelo desde febrero
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Gemini 3.1 Pro has been on Google's price list for seven and a half months and has never left preview. It was announced on 19 February 2026, it is still served under an endpoint named Gemini 3.1 Pro Preview, and as of today there is no general-availability commitment and no shutdown date — the two dates that would tell you where the model sits in its own vendor's plan. GPT-6 Sol, by contrast, shipped on 22 September 2026, and on 7 October 2026 it became the model behind the paid tiers of ChatGPT's global rollout to more than 1.2 billion weekly users.
So the headline comparison is not between two flagship tiers. It is between a shipping product and an open-ended preview, and that difference turns out to be worth more than the benchmark gap does. Put them side by side on Artificial Analysis's Intelligence Index v4.3.2 and Google's seven-month-old preview scores 29.7 against GPT-6 Sol's 47.6 while charging 1.25× more per completed index task — $1.30 against $1.04. Both of those numbers are real, and both need a caveat attached before you spend money on them.
Lo que hace que esto valga la pena leer en lugar de descartarlo es que la preview sí gana cosas. Supera a GPT-6 Sol en GPQA Diamond, en el uso de herramientas agéntico de τ²-Bench y en una medición de contexto largo, además de aceptar audio y video como entrada, algo que GPT-6 Sol no hace. Una preview de siete meses que aún gana dos de cuatro combates no es un modelo para descartar. Es un modelo cuyo ciclo de vida, no su capacidad, es el problema.
Las cifras, y la advertencia de revisión que tiene que acompañarlas
Artificial Analysis vuelve a ejecutar su suite y republica las puntuaciones bajo la revisión actual del índice, lo que significa que un mismo modelo puede tener dos números diferentes según cuándo lo consultes. Para Gemini 3.1 Pro, esa variación es inusualmente amplia: coberturas anteriores de este modelo reportaban 57 en una revisión más antigua, mientras que la página tal como está hoy reporta 29.7 en v4.3.2. Ambas cifras son genuinas y ambas se encuentran en el mismo sitio web.
Eso importa porque solo se pueden restar cifras de la misma revisión. El 29.7 y el 47.6 son el par que hay que usar aquí, ya que ambos provienen de v4.3.2 — la misma ejecución que puntúa a Claude Opus 5.5 con 57.6 y a GPT-6 Astra con 52.7. La lectura de la misma ejecución, una línea por dimensión:
• Índice de Inteligencia, v4.3.2 — GPT-6 Sol 47,6 vs Gemini 3.1 Pro 29,7
• Costo por tarea de índice completada — Gemini 3.1 Pro $1,30 vs GPT-6 Sol $1,04; el modelo más antiguo es 25 % más caro por respuesta finalizada
• Precio de entrada — $2,00 por 1M en ambos, iguales en el precio principal
• Precio de salida — GPT-6 Sol $10,00 vs Gemini 3.1 Pro $12,00; Sol es 17 % más barato
• Cláusula de contexto largo — GPT-6 Sol vuelve a tarifar toda la solicitud a $4,00/$15,00 por encima de 272.000 tokens de entrada; Gemini 3.1 Pro pasa a $4,00/$18,00 por encima de 200.000
• Ventana de contexto — GPT-6 Sol 1.050.000 tokens vs Gemini 3.1 Pro 1.048.576, prácticamente a la par
• Salida máxima — GPT-6 Sol 128.000 tokens vs Gemini 3.1 Pro 65.536; Sol es casi el doble
• Modalidades de entrada — GPT-6 Sol texto, imagen, archivo vs Gemini 3.1 Pro texto, imagen, audio, video, PDF

Dos líneas de ahí merecen ampliarse porque invierten la lectura obvia. La línea de coste por tarea dice que la tarifa que parece más barata corresponde al modelo que resulta más caro por trabajo terminado: la tarifa de salida de 12 $ de Gemini 3.1 Pro, sumada a su volumen de razonamiento, hace más trabajo del que sugiere su tarifa de entrada destacada de 2 $. Y el tramo de contexto largo merece releerse en ambos lados: el tramo de Gemini 3.1 Pro empieza en 200.000 tokens, por debajo de los 272.000 de GPT-6 Sol, pero recotiza la salida a 18,00 $ allá donde Sol la recotiza a 15,00 $. Ninguna de las dos es una tarifa plana, y los puntos de cruce no coinciden.
Donde la vista previa todavía gana
Google's model is not a relic. Pull the evaluations both cards carry:
• GPQA Diamond — Gemini 3.1 Pro 94,1% frente a GPT-6 Sol, no se ha publicado ninguna cifra comparable en esta revisión
• Uso de herramientas agénticas en τ²-Bench — Gemini 3.1 Pro 95,6% frente a GPT-6 Sol, no publicado en el mismo tablero
• Recuperación de contexto largo — Gemini 3.1 Pro 82,0% frente a GPT-6 Sol 83,7%, una diferencia de 1,7 puntos
• SciCode — Gemini 3.1 Pro 58,7% frente a GPT-6 Sol 57,6%, prácticamente a la par
• Terminal-Bench 4.0 — Gemini 3.1 Pro 4,0% frente a GPT-6 Sol 43,9%; la única categoría en la que la versión preliminar no es competitiva

Un 94,1 % en GPQA Diamond y una puntuación del 95,6 % en uso de herramientas agénticas son cifras de frontera, no heredadas, y son la razón de que la brecha de 17,9 puntos en el índice exagere la distancia práctica. El índice es un compuesto de diez evaluaciones, y las pérdidas de Gemini 3.1 Pro se concentran donde la suite está fuertemente ponderada hacia la ingeniería de software — Terminal-Bench 4.0 con un 4,0 % es un valor atípico catastrófico junto a su 58,7 % en SciCode y su 73,8 % en Terminal-Bench 2.1. Un modelo que puntúa cerca de lo más alto en un benchmark agéntico y cerca de lo más bajo en su sucesor te está hablando de su fecha de entrenamiento, no de su techo.
La entrada de audio y video es la otra ventaja concreta, y es una puerta, no un gradiente. Si tu pipeline toma como entrada la grabación de una reunión o una captura de pantalla, Gemini 3.1 Pro puede entrar y GPT-6 Sol no. Ninguna cantidad de liderazgo en índices sustituye eso.
Lo que te cuesta, concretamente, que algo "siga en versión preliminar"
El estado de vista previa no es una etiqueta cosmética, y los costos son del tipo que solo aparecen después de que has construido sobre algo.
A preview endpoint carries no general-availability commitment, which means the vendor has not promised the model will still be there on a schedule you can plan around. It also carries no shutdown date, which sounds like the good version of that — nothing is being retired — but reads the other way too: Google has not published a lifecycle for a model that has been in this state since February while shipping Flash-tier models through the same period. Gemini 3.8 Flash, Gemini 3.5 Flash-Lite, the 3.6 and 3.8 Flash line: the Pro tier stayed where it was, and the successor arrived instead as Gemini 4 Argon, which Google announced on 30 September 2026 in a phased rollout to a named cohort of security partners with no general-availability date attached either.
That is the pattern this comparison is really about. If you build a durable pipeline on Gemini 3.1 Pro Preview, you are building on a model whose own vendor has not said when it will graduate, replace or retire it. GPT-6 Sol's position is the opposite: it is a generally available API product with a published rate card, and since 7 October 2026 it is also the default in the app most of your colleagues use. Vendor-reported and as yet unreproduced, OpenAI says that in ChatGPT GPT-6 composes answers using text, graphics, charts and interactive controls through a capability it calls Intelligent UI, answers that need web search begin 44% sooner than GPT-5.6 Instant, and the Extra High effort level begins responding as fast as GPT-5.6 at Medium. None of that changes an API integration. All of it is why GPT-6 is now the ambient default and the preview is not.
También hay una versión sencilla del argumento. Estás pagando un 25% más por tarea finalizada, con una puntuación de capacidad más baja, por un modelo cuyo ciclo de vida no está declarado. El contraargumento es real —obtienes GPQA Diamond al 94,1% y entrada de audio—, pero es un argumento específico para una carga de trabajo específica, no una razón general para preferir el modelo anterior.
Probar una vista previa sin apostar por ella
The mistake to avoid with a model in Gemini 3.1 Pro's position is to treat "should we use it" as a single binary decision. It is not. Both Gemini 3.1 Pro Preview and GPT-6 Sol sit on OrcaRouter's catalogue behind one OpenAI-compatible endpoint and one key, at 0% markup over provider list price — so the preview is something you can put in a real request path, measure against your own workloads, and keep or drop without a second vendor contract or a code change.
La conmutación por error automática es lo que hace que eso sea seguro para un modelo en un ciclo de vida de vista previa. Dirija el tráfico de audio y video a Gemini 3.1 Pro, donde es el único de los dos que puede aceptar la entrada; dirija el tráfico de ingeniería de software y de salidas largas a GPT-6 Sol; y configure el respaldo para que, si el endpoint de vista previa queda obsoleto, se le limita la tasa o se le cambia el precio de forma silenciosa, la solicitud recaiga en un modelo de disponibilidad general en lugar de fallar. Esa es la estructura que se gana una vista previa de siete meses: no la evitación, sino un camino que no dependa de ella.
Si quieres ir más allá, el DSL de enrutamiento compone varios modelos en una sola llamada lógica, de modo que una solicitud puede probarse con Gemini 3.1 Pro y GPT-6 Sol y la respuesta seleccionarse según tus propios criterios en lugar de los de un único proveedor. La fusión de modelos hace lo mismo en la dirección opuesta —un panel de modelos que responde a una misma pregunta—, lo cual es una forma razonable de averiguar dónde merece la pena pagar por las fortalezas específicas de una vista previa antes de comprometer una ruta de producción con ella.

El veredicto, y el número a vigilar
Para trabajo nuevo, GPT-6 Sol es la opción más segura en cuatro de las seis dimensiones que deciden un despliegue, y es más barato por tarea terminada, a la vez que obtiene 17,9 puntos de índice más con la misma revisión. Para cargas de trabajo que necesitan entrada de audio o video, o en las que un 94,1 % en GPQA Diamond es lo que se está comprando, Gemini 3.1 Pro Preview sigue ganando, y la etiqueta de preview es un riesgo que hay que gestionar más que una razón para dar marcha atrás.
El número que hay que vigilar no es el índice. Es la fecha en el nombre del endpoint de Gemini 3.1 Pro. Cuando se quite el sufijo de preview —o cuando Argon alcance la disponibilidad general con un identificador de API real—, esta comparación cambia por completo de forma, y la brecha de siete meses entre la última versión del nivel Pro y hoy pasa a ser aquello de lo que trata el artículo.
Comparados en este artículo3
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
