Tarjeta de título generada para el artículo «Mistral Large 4 vs Gemini 3.1 Pro» que muestra el título en una sans-serif geométrica en negrita, el subtítulo «Ocho meses, dos direcciones» debajo y una fila de tres iconos de línea planos arriba —una página de calendario, una ventana de terminal y un marco de imagen— sobre un fondo blanco con acentos de degradado azul y cian y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Mistral Large 4 vs Gemini 3.1 Pro: ocho meses, dos direcciones

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Gemini 3.1 Pro lleva en el mercado desde el 19 de febrero de 2026 y sigue situándose cerca de lo más alto de todas las tablas generales de capacidades, incluidas aquellas en las que se le compara con modelos lanzados este otoño. Mistral Large 4 tiene tres semanas como máximo —una vista previa anunciada el 6 de octubre de 2026, con sus pesos prometidos para finales de octubre y sin que se mencione ninguna licencia—. En el Intelligence Index de Artificial Analysis, consultado el 6 de octubre, el Gemini 3.1 Pro, de ocho meses de antigüedad, obtiene 29,7 frente al 38,4 del recién llegado. Ese es el punto de partida honesto para esta comparación, y es lo contrario de lo que sugieren las fechas de lanzamiento.

La explicación no es misteriosa. Gemini 3.1 Pro es un buque insignia de la línea de vista previa que Google nunca ha promovido a una versión estable, y la página de Artificial Analysis sobre él está etiquetada como «Gemini 3.1 Pro Preview», la misma página donde un índice inferior aparece junto a un GPQA Diamond de primer nivel. Es un modelo concebido para la amplitud: una ventana de contexto muy grande, un conjunto amplio de modalidades y un razonamiento que es fuerte en preguntas de conocimiento. Mistral Large 4 está construido para un mapa del mundo totalmente distinto, y su precio es acorde a ello.

Lo que es cada uno

Gemini 3.1 Pro es el modelo de razonamiento multimodal de vanguardia de Google, con id de API gemini-3.1-pro-preview, una ventana de contexto de 1.048.576 tokens y un límite de salida de 65.536 tokens. Acepta texto, imágenes, vídeo, audio y archivos. Se sirve desde el catálogo de OrcaRouter a las tarifas propias de Google. La documentación de Google no incluye ningún Gemini 3.1 Pro que no sea preview; el nombre preview es el producto.

Mistral Large 4 es un modelo disperso de mezcla de expertos de 1,05 billones de parámetros, con 49.000 millones de parámetros activos y un codificador de visión dedicado de 1.600 millones de parámetros, que se ofrece como «Mistral Large 4 Preview» bajo el id de API mistral-large-4-0. La documentación de Mistral indica una ventana de contexto de 1 M de tokens; Artificial Analysis registra 524.288 en la configuración que está probando. La salida máxima no se ha publicado. Mistral lo describe como su modelo más grande y más capaz hasta la fecha y afirma que los pesos llegarán a finales de octubre.

Los números, con su procedencia adjunta

Ambos modelos tienen páginas independientes, así que la comparación que aparece a continuación es con el mismo entorno de pruebas y no entre proveedores:

• Índice de Inteligencia v4.3 — Mistral Large 4 Preview 38.4 vs Gemini 3.1 Pro 29.7

• Costo por tarea de indexación — $1.13 vs $1.30

• Razonamiento de contexto largo — 81.3% vs 82.0%

• GPQA Diamond — no publicado para la versión preliminar frente a 94,1%

• Humanity's Last Exam — 35,0 % vs 47,0 %

• Terminal-Bench 4.0 — 26,8 % frente a 4,0 %

• SciCode — 54,2 % vs 58,7 %

• AutomationBench, flujos de trabajo empresariales — 59.9% vs 35.4%

• MMMU-Pro, razonamiento multimodal — 76,4 % vs 82,4 %

• Ventana de contexto — 1 M declarados / 524.288 probados frente a 1.048.576 servidos

• Límite de salida — no publicado vs 65,536 tokens

• Precio por millón, entrada / salida — $1.36 / $4.18 de lista, $0.68 / $2.09 promocional, frente a $2.00 / $12.00 por debajo de 200K tokens y $4.00 / $18.00 por encima

• Pesos — prometidos, licencia sin especificar, vs propietario

A generated two-column scoreboard titled 'Mistral Large 4 vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; GPQA Diamond not published; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Gemini 3.1 Pro': Intelligence Index v4.3 29.7; cost per index task $1.30; Terminal-Bench 4.0 4.0%; GPQA Diamond 94.1%; MMMU-Pro 82.4%; AutomationBench 35.4%.

La fila más llamativa con diferencia es Terminal-Bench 4.0. Gemini 3.1 Pro obtiene un 4,0 % —no es una errata, ni una alucinación de la tabla: refleja un modelo de febrero ejecutado en un arnés de agente de terminal posterior a él. El 26,8 % de Mistral Large 4 es seis veces superior en la misma prueba. Quien haya descartado a Gemini basándose en una cifra antigua de codificación agéntica debería volver a tenerlo en cuenta basándose en su GPQA Diamond, y quien haya descartado a Mistral por su puesto en el índice debería fijarse primero en la fila de terminal.

Donde Gemini 3.1 Pro todavía lleva la mejor mano

Conocimiento y amplitud. Un 94,1 % en GPQA Diamond es la cifra más alta en todo este artículo, en cualquiera de los dos bandos, y es un benchmark científico de nivel de posgrado: no es una cifra a la que un modelo llegue a base de palabrería. Humanity's Last Exam con un 47,0 % frente a un 35,0 %, y una puntuación en SciCode que supera por un margen mínimo al recién llegado, cuentan la misma historia. Si tu carga de trabajo consiste en responder con precisión a preguntas difíciles a partir de un corpus de conocimiento, Gemini 3.1 Pro sigue siendo el modelo más fuerte ocho meses después de su lanzamiento.

La amplitud de modalidades es la segunda ventaja. Gemini 3.1 Pro acepta vídeo y audio, además de texto e imágenes. Mistral Large 4 acepta texto e imágenes. Si tu pipeline ingiere reuniones grabadas, grabaciones de pantalla o audio de sensores, solo uno de estos modelos puede ver la entrada completa.

El límite máximo de salida es el tercero. 65,536 tokens es un límite máximo publicado y garantizado; Mistral no ha publicado ninguno para la preview en absoluto. Nada en una publicación de lanzamiento tiene más probabilidades de morderte en producción que un límite de salida no declarado.

Y la ventana de contexto de Gemini se sirve realmente a 1.048.576 tokens, mientras que el 1M de Mistral es la cifra del proveedor frente a 524.288 leídos de forma independiente. Para una carga de trabajo que vive en el extremo lejano de la ventana, la diferencia entre una cifra declarada y una medida supone una reescritura.

Dónde Mistral Large 4 cambia la decisión

El trabajo agéntico, y en concreto cualquier cosa que toque una terminal, es donde los dos modelos dejan de ser comparables. La propia publicación de lanzamiento de Mistral combina 61,7% en DeepSWE v1.1, 59,4% en SWE-Atlas-QnA y 28,3% en Terminal-Bench 4.0 en un Coding Agent Index de 49,8%, y afirma claramente que se situó por delante de DeepSeek V4 Pro 0813 y Qwen3.8 Max en esa medida combinada. Esas tres cifras son, en palabras de Mistral, números que Artificial Analysis evaluó de forma privada antes de que su harness se hiciera público; aún no están en el índice público y deberían etiquetarse como publicadas por el proveedor hasta que lo estén.

Las pruebas independientes apuntan en la misma dirección. En AutomationBench —657 flujos de trabajo empresariales que abarcan Gmail, Sheets, Slack y Salesforce—, Mistral Large 4 obtiene un 59,9 %, por delante de Kimi K3, MiMo-V2.6-Pro y DeepSeek V4 Pro, y en el mismo entorno de pruebas Gemini 3.1 Pro no aparece en absoluto porque el benchmark es posterior a él. Un estudio humano a ciegas realizado por Surge AI clasificó a Mistral Large 4 Preview en segundo lugar de cinco modelos en calidad de codificación, con 3,74, por delante de GLM-5.3 y Kimi K3 y solo por detrás de Claude Opus 5.

La afirmación sobre ciberseguridad es la más contundente de la publicación de Mistral y merece enunciarse con exactitud: 82 % en la prueba Artificial Analysis Cyber Index, que pide a un modelo reproducir una vulnerabilidad real y luego parchearla, descrita como la más alta de cualquier modelo, con 93 % en los 40 ejercicios de competición de Cybench, y la aseveración de Mistral de que se sitúa entre los cinco primeros puestos a nivel mundial en la clasificación general del Cyber Index mientras lidera los modelos de pesos abiertos desarrollados fuera de China. Esas son cifras citadas por el proveedor en un índice independiente. Su ventaja práctica es que Mistral creó el modelo para que hiciera el trabajo en lugar de negarse a hacerlo.

La línea más barata de la tabla también es de Mistral, pero solo por un margen estrecho: $1.13 por tarea frente a $1.30, una ventaja del 13% que genera la tarifa promocional y que la tarifa estándar borraría. Gemini 3.1 Pro es un modelo de 2026 con precios de 2026, y no resulta caro ejecutar en él una tarea de indexación.

El desempate que nadie mide

Hay dos factores en juego que las tablas no pueden mostrar. El primero es la licencia. Gemini 3.1 Pro es propietario y seguirá siéndolo; Mistral Large 4 es una versión preliminar cuyo principal argumento de venta es que se convertirá en un artefacto descargable que podrás ejecutar bajo tu propia política, en tu propio hardware, conforme a la legislación europea: Mistral lo entrenó con 3.800 GPU Grace Blackwell en sus propios centros de datos y ofrece allí la versión preliminar. Ese argumento no vale nada hasta que aparezca el repositorio y la licencia tenga un nombre. Valdrá muchísimo el día en que eso ocurra.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid with 'Mistral Large 4' listed at v26.10 as 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 carrying an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible.

El segundo es el riesgo operativo. Una versión preliminar que aún se está perfeccionando cambiará bajo tus pies. En Orca, ambos lados de esta comparación son accesibles a través de un único endpoint compatible con OpenAI a los precios de lista del proveedor con 0 % de recargo: Gemini 3.1 Pro está disponible en el catálogo a las tarifas de Google, mientras que Mistral Large 4 debe alcanzarse a través de la API de Mistral y varias plataformas de terceros, ya que no es una ruta que ofrecemos. El DSL de enrutamiento es la pieza útil aquí: envía clasificación y extracción al modelo que sea más barato esa semana, escala el residuo difícil y deja que la conmutación por error automática absorba los malos días de la versión preliminar en lugar de que tu rotación de guardia los absorba.

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the preview model identity, a 1M-token context window, a 65K maximum output, inputs of audio, file, image, text and video with text output, the 2026-02-19 release date, a p-50 time-to-first-token figure of 10.00 seconds, pricing of $2.00 per million input and $12.00 per million output, and a code sample against the api.orcarouter.ai base URL.

El veredicto

Pregunta cuál es la carga de trabajo, no cuál modelo es mejor. Para el trabajo de conocimiento, la entrada de audio y vídeo, un techo de salida garantizado y una ventana de un millón de tokens servida, Gemini 3.1 Pro sigue siendo el modelo más fuerte, y su antigüedad no es un defecto: son ocho meses de otras personas encontrando sus límites. Para la programación agéntica, el trabajo en terminal y las operaciones de seguridad, Mistral Large 4 está por delante por un margen lo bastante amplio como para que el ranking del índice resulte engañoso, y es el único de los dos que podría acabar siendo autoalojable.

El desempate que hay que seguir es finales de octubre. Si los pesos llegan bajo una licencia permisiva, Mistral Large 4 deja de competir con Gemini 3.1 Pro en precio y empieza a competir con él en control, y esa es una pelea diferente. Si llegan bajo una restrictiva, la respuesta de este artículo no cambia mucho — pero la razón sí.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario