
Grok 4.7 vs Gemini 3.1 Pro: la clasificación cambió, el modelo no
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
El 19 de febrero de 2026, Artificial Analysis publicó un artículo titulado «Gemini 3.1 Pro Preview: el nuevo líder en IA». Encabezó seis de diez evaluaciones y se situó cuatro puntos por delante de Claude Opus 4.6. Lea hoy la página de ese mismo modelo y el número es 30, en el puesto sesenta y nueve de 200. El proveedor no cambió nada. Lo que cambió fue la regla de medir: Artificial Analysis revisó su Índice de Inteligencia a la v4.3.2 el 19 de septiembre de 2026, volvió a puntuar todos los modelos del catálogo con un conjunto de evaluaciones distinto, y un líder de febrero pasó a ser un jugador de media tabla en septiembre mientras el propio modelo permanecía intacto en vista previa. Ese es el telón de fondo para una comparación con Grok 4.7 —lanzado por el proveedor el 21 de septiembre de 2026— y es la razón por la que este enfrentamiento tiene menos que ver con qué modelo es más inteligente que con en cuál de estos dos puede uno seguir confiando en que sea lo mismo el mes que viene.
Qué es cada uno de estos en realidad
Gemini 3.1 Pro es el modelo más reciente de Google de la gama Pro y nunca ha alcanzado la disponibilidad general. Se lanzó como gemini-3.1-pro-preview el 19 de febrero de 2026, y la tabla de descontinuación de Google todavía lo lista con «sin fecha de cierre anunciada»: una preview que ya lleva siete meses en estado de preview mientras Google lanzaba una escalera Flash por debajo: 3.5 Flash en mayo, 3.6 en julio, 3.7 en agosto y 3.8 en septiembre. No hay ningún modelo Pro con disponibilidad general (GA) más reciente que Gemini 3 Pro. Tiene una ventana de entrada de 1,048,576 tokens y un techo de salida de 65,536 tokens, acepta texto, imágenes, vídeo, audio y PDF como entrada y devuelve texto como salida, y expone un control de nivel de razonamiento en bajo, medio y alto, sin parámetro de presupuesto ni ajuste mínimo. Los pesos son cerrados.
Grok 4.7 tiene un día de vida y también es de pesos cerrados. Mantiene un contexto de 500k tokens —la mitad que el de Gemini— y acepta texto e imágenes, por lo que no puede ingerir video ni audio en absoluto, lo que es la diferencia de capacidad más marcada en esta comparación. Se lista a $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida por debajo de 200k tokens de prompt, subiendo a $4.00 y $12.00 por encima de esa línea, con lecturas en caché a $0.50 y $1.00; xAI también lista una variante más rápida a aproximadamente el doble de velocidad de salida y el doble de precio. No se publica ninguna cifra máxima de salida para él en la documentación consultada aquí.
El gobernante se movió. Esa es la historia.
Ambos modelos obtienen actualmente su puntuación en el Artificial Analysis Intelligence Index v4.3.2, que reemplazó Terminal-Bench 2.1 por Terminal-Bench 4.0 y tau3-Banking por AutomationBench-AA, y reancló la escala Elo de GDPval-AA. El número de cada modelo cambió cuando se lanzó. El de Gemini 3.1 Pro se movió más que la mayoría, porque sus fortalezas de febrero se concentraban en evaluaciones que el nuevo índice retiró o reponderó. Leyendo hoy las dos columnas en paralelo:
• Composite — Grok 4.7 (xhigh): 46 en el Artificial Analysis Intelligence Index v4.3.2. Gemini 3.1 Pro Preview: 30 en la misma revisión, clasificado n.º 69 de 200.
• Contexto largo — Grok 4.7: ventana de 500k, AA-LCR v1.1 77 %. Gemini 3.1 Pro: ventana de 1M —el doble de grande— y un techo de salida de 65K que es aproximadamente la mitad de lo que suele necesitar una sesión agéntica de contexto largo.
• Modalidad de entrada — Grok 4.7: texto e imagen. Gemini 3.1 Pro: texto, imagen, video, audio y PDF. No están ni cerca, y no es una brecha de benchmark — es una brecha de capacidad.
• Velocidad — Grok 4.7: aún no hay mediciones publicadas. Gemini 3.1 Pro: 124,4 tokens de salida por segundo, clasificado en el puesto n.º 39 de 200, con un tiempo hasta el primer token de 63,62 segundos a través de Google AI Studio.
• Precio, nivel estándar — Grok 4.7: $2.00 de entrada / $6.00 de salida por 1M. Gemini 3.1 Pro: $2.00 de entrada / $12.00 de salida. Entrada idéntica, el doble de salida.
• Precio, nivel de contexto largo — Grok 4.7: se duplica a $4.00 / $12.00 con 200k tokens de prompt. Gemini 3.1 Pro: sube a $4.00 / $18.00 en el mismo límite de 200k. Misma entrada, 50% más de salida.
• Madurez — Grok 4.7: un día de vida, los benchmarks del proveedor en gran medida sin reproducir. Gemini 3.1 Pro: siete meses en el mercado, pero aún una versión preliminar sin compromiso de disponibilidad general (GA) ni fecha de desactivación.

El problema de la vista previa ya es un problema real
Una versión preliminar de siete meses sería una rareza más que un riesgo si nada hubiera salido mal con ella. Algo ha salido mal. A partir del 18 de septiembre de 2026, los usuarios comenzaron a informar que Gemini 3.1 Pro había desaparecido del selector de modelos de AI Studio y, al momento de escribir esto, no ha habido respuesta del personal de Google, ni aviso de descontinuación, ni causa declarada: un incidente de disponibilidad sin resolver en lugar de una retirada confirmada. Póngase eso junto al historial de anuncios: Google dijo en I/O en mayo de 2026 que Gemini 3.5 Pro se “lanzaría el mes siguiente”, y reportes de prensa de finales de agosto indicaron que ese modelo se había descartado porque los candidatos internos “no eran lo suficientemente mejores que la serie Flash”. La propia página Pro de Google todavía anuncia “3.5 Pro próximamente”, que es la contradicción en una sola pantalla. Sea cual sea la resolución, la lectura práctica es que Gemini 3.1 Pro es un endpoint de versión preliminar sin fecha de disponibilidad general (GA), sin un sucesor nombrado y con una incógnita sobre su disponibilidad actual.
El riesgo de Grok 4.7 es la imagen especular y de menor magnitud. Tiene un día de vida, así que sus cifras son escasas: Artificial Analysis no ha publicado ninguna medición de velocidad o latencia, y la propia suite de benchmarks de xAI para él no ha sido reproducida de forma independiente. Lo que no está en duda es que el modelo está disponible de forma general, tiene precio, documentación y una identidad estable. Un modelo cuya identidad es estable y cuyas cifras no están probadas es algo mucho más fácil sobre lo que construir que un modelo cuyas cifras están publicadas y cuya disponibilidad no lo está.
Lo que cuesta la división, en la práctica
Supongamos que estás eligiendo para un pipeline de documentos. Con 100k tokens de entrada y 8k de salida, Grok 4.7 cuesta $0.20 de entrada y $0.048 de salida — alrededor de 25 centavos. Gemini 3.1 Pro cuesta $0.20 de entrada y $0.096 de salida — alrededor de treinta centavos. Los dos están dentro de un veinte por ciento entre sí, y si tus documentos son escaneos, PDFs, audio o video, Gemini es el único de los dos que puede siquiera leerlos. Eso no es un argumento de benchmark; termina la comparación para esa carga de trabajo.
Ahora supón que estás eligiendo para un agente de contexto largo. Con 300k de entrada y 8k de salida, Grok 4.7 cuesta $1.20 de entrada y $0.096 de salida, unos $1.30. Gemini 3.1 Pro cuesta $1.20 de entrada y $0.144 de salida, unos $1.35. En la práctica, idénticos, y aquí la ventana de 1M de Gemini y el techo de salida de 65K se convierten en la restricción que lo decide, porque un límite de 65K es donde las ejecuciones agénticas largas se vienen abajo. Ninguno de los dos modelos es la opción barata en esta comparación, y ninguno es caro para los estándares de frontera.

Enrutar alrededor de un objetivo móvil
OrcaRouter ofrece Gemini 3.1 Pro, listado en su propia página de modelo a las tarifas del proveedor — 2,00 $ de entrada y 12,00 $ de salida, con la ventana de 1M y una salida máxima de 65k — porque trasladamos los precios de lista del proveedor con un 0 % de margen. Eso no es una frase de marketing en un caso como este: Google tiene una compilación de vista previa de duración sin precio definido cuya disponibilidad osciló en septiembre, y lo útil que hace un enrutador es mantener la integración estable mientras lo que hay detrás cambia. La conmutación automática por error significa que un endpoint de vista previa que deja de responder se convierte en un evento de enrutamiento en lugar de una caída, y el DSL de enrutamiento te permite componer un modelo multimodal con uno solo de texto en una única llamada — que es exactamente la forma que sugiere este par: Gemini leyendo el vídeo y Grok haciendo el razonamiento sobre su transcripción. Grok 4.7 no está en el catálogo de OrcaRouter a la fecha de este texto; llamarlo hoy implica pasar por la propia API de xAI y por las plataformas de terceros que lo ofrecen.
El patrón que merece la pena construir: conservar Gemini 3.1 Pro para todo lo que tenga que ingerir vídeo, audio o PDF, y tratar su estatus de preview como un riesgo operativo que hay que sortear en lugar de como un motivo para evitarlo. Poner Grok 4.7 en el trabajo de texto e imagen, donde se aplican su menor precio de salida y su mayor puntuación compuesta, y donde el modelo que integres hoy es el modelo que seguirás invocando dentro de seis meses. Lo único que no hay que hacer es leer el puesto sexagésimo noveno del ranking como un veredicto sobre el modelo: es un veredicto sobre una revisión del benchmark, y esa misma revisión que degradó a Gemini 3.1 Pro también degradó a docenas de modelos que Google nunca tocó.
La llamada
En el índice actual, Grok 4.7 supera a Gemini 3.1 Pro por dieciséis puntos, y en precio de salida cuesta la mitad en el nivel estándar y un tercio menos en el nivel de contexto largo. Si tu carga de trabajo es texto e imágenes, eso basta para decidirlo. Si tu carga de trabajo es vídeo, audio o documentos escaneados, Gemini 3.1 Pro es el único candidato de los dos y la comparación termina ahí: estás comprando una capacidad, no una puntuación. La advertencia que debería acompañar a ambos tiene que ver con la procedencia más que con el rendimiento: uno es una vista previa de hace siete meses sin fecha de disponibilidad general y con un incidente de disponibilidad en septiembre a sus espaldas, el otro tiene un día de vida, con una cifra de titular y ninguna reproducción independiente de nada más. Ninguno de los dos es una elección definitiva. Ambos merecen enrutarse en lugar de comprometerse con ellos.

Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
