
Mistral Large 4 vs Claude Opus 5: La brecha es menor que la diferencia de precio
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 151 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
El único dato comparativo directo que alguien ha publicado para Mistral Large 4 frente a Claude Opus 5 procede de una evaluación humana a ciegas, y está más reñido de lo que sugieren las tablas de benchmarks. Surge AI ocultó la identidad de los modelos y pidió a anotadores profesionales que puntuaran los resultados de código en una escala de 1 a 5; Claude Opus 5 quedó primero con 4,22 y Mistral Large 4 Preview segundo con 3,74, por delante de Kimi K3, GLM-5.3 y GLM-5.2. En el agregado independiente, los dos no son vecinos en absoluto: 50,8 frente a 38,4 en el Índice de Artificial Analysis, consultado el 6 de octubre. Lo que hace que este emparejamiento merezca la pena es que el modelo que puntúa 12 puntos menos cuesta aproximadamente una quinta parte de lo que cuesta ejecutar una tarea en el otro.
Ambas cifras necesitan que se les adjunte su procedencia, porque no son el mismo tipo de número. La evaluación de Surge AI es un estudio humano de terceros que Mistral encargó y publicó: una forma de evidencia más sólida que un benchmark ejecutado por uno mismo, y aun así un estudio cuya publicación controló Mistral. Las puntuaciones del índice son ejecuciones propias de Artificial Analysis, comparables entre sí y, por tanto, la pareja correcta a partir de la cual razonar. Ninguna de las dos te dice sobre qué modelo construir; juntas acotan la cuestión.
Dos productos, no dos generaciones de uno
Claude Opus 5 es un buque insignia de pesos cerrados del proveedor, lanzado el 24 de julio de 2026, servido con una ventana de contexto de 1M de tokens y hasta 128K tokens de salida, a $5 por millón de tokens de entrada y $25 por millón de salida, con lecturas en caché a $0.50. Es el modelo más capaz del proveedor dentro de la línea Opus y está posicionado de lleno para el trabajo agéntico de largo horizonte: mantenerse coherente a lo largo de sesiones de varios pasos con un uso intensivo de herramientas.
Mistral Large 4 es una versión preliminar, anunciada el 6 de octubre de 2026, que Mistral describe como un modelo de mezcla de expertos dispersa de 1,05 billones de parámetros con 49.000 millones de parámetros activos y un codificador de visión de 1.600 millones de parámetros. Su id de API es mistral-large-4-0, es multimodal de forma nativa, y la documentación de Mistral le da una ventana de contexto de 1 millón de tokens, mientras que Artificial Analysis lee 524.288 en la configuración que está probando. Se prometen los pesos para finales de octubre y aún no se ha especificado el nombre de la licencia.
Así que esto no es un modelo más nuevo contra uno más antiguo. Es un modelo de frontera propietario contra un retador que será de pesos abiertos, y ambos tienen precios acordes a ello.

El mismo índice, ambos modelos
Leído el 6 de octubre de sus páginas de Artificial Analysis, en el Intelligence Index v4.3:
• Índice de Inteligencia — Mistral Large 4 Preview 38,4 vs Claude Opus 5 50,8
• Costo por tarea de indexación — $1.13 con Mistral Large 4 Preview frente a $5.86 con Claude Opus 5
• Terminal-Bench 4.0 — 26.8% frente a 49.0%, la mayor brecha individual entre ambos
Humanity's Last Exam — 35,0 % vs 54,9 %
• MMMU-Pro, razonamiento multimodal — 76,4% vs 84,7%
• AutomationBench, flujos de trabajo empresariales — 59,9 % vs 56,6 %, la única fila en la que Mistral Large 4 lidera
• Ventana de contexto — 1M declarado por Mistral y 524.288 en la configuración probada, frente a 1M servido
• Techo de salida — no publicado para la vista previa vs 128K tokens
• Precio por millón, entrada / salida — $1.36 / $4.18 de lista, actualmente $0.68 / $2.09 en promoción, frente a $5.00 / $25.00

El patrón es legible. Opus 5 va por delante en las dos filas más difíciles, las de mayor peso de razonamiento —el trabajo de terminal y el conocimiento abierto—, y también va por delante en comprensión multimodal pese a que a Mistral Large 4 se le vende por su visión. Mistral Large 4 lidera la fila de automatización de flujos de trabajo, que es la fila más cercana a lo que una unidad de negocio le pide realmente a un modelo, y lo hace a un quinto del precio por tarea.
Donde Mistral Large 4 realmente gana
La afirmación más interesante en la publicación de lanzamiento de Mistral no es una puntuación de benchmark. Es que en una de las pruebas del Artificial Analysis Cyber Index —reproducir una vulnerabilidad real en software de código abierto y luego parchearla—, Mistral Large 4 obtiene un 82 %, la que se dice que es la puntuación más alta de cualquier modelo, y que varios modelos cerrados líderes obtienen casi cero en la misma prueba porque rechazan la tarea. Mistral menciona a Claude Opus 5.5 y GPT-6 Astra como ejemplos de ese rechazo.
Esa es una interpretación de un proveedor sobre una cifra citada por el proveedor, y debe leerse así. También es una diferencia operativa real si se sostiene: un modelo que no reproducirá una vulnerabilidad no puede usarse para demostrar que una es real, lo cual es el primer paso de la mayoría de las respuestas a incidentes. Mistral combina el 82% con una puntuación del 93% en los 40 ejercicios de competición de Cybench y una contraafirmación de que su tasa de rechazo ante prompts de ciberseguridad extraídos de JailbreakBench, StrongREJECT y AgentHarm es más alta que la de otros modelos de pesos abiertos — el argumento es que se quiere la capacidad y la disciplina en el mismo modelo en lugar de intercambiar una por la otra.
Más allá de la ciberseguridad, el argumento a favor de Mistral Large 4 se basa en tres cosas que Opus 5 no ofrece. Se entrena y se sirve en infraestructura europea bajo legislación europea, lo que importa a los compradores con obligaciones de residencia de datos. Mistral promete que será descargable —el objetivo de todo el ejercicio, ya que el autodespliegue es lo que elimina el riesgo de acceso durante un incidente que Mistral se esfuerza por describir—. Y es lo bastante barato por tarea como para que usarlo como primera pasada y escalar el residuo difícil a un modelo de frontera sea económicamente sensato en lugar de un error de redondeo.
Dónde Claude Opus 5 todavía justifica su precio
Una brecha de 12 puntos en el índice no es pequeña, y el panorama fila por fila indica dónde está. Terminal-Bench 4.0 es casi el doble —49,0 % frente a 26,8 %—, y el trabajo de terminal es el proxy público más cercano a la codificación agéntica, que es para lo que la mayoría de los equipos están comprando modelos frontera este año. Humanity's Last Exam los separa por 20 puntos. En autonomía de horizonte largo, el diseño de razonamiento adaptativo de Opus 5, su techo de salida de 128K y un contexto servido de 1M son la configuración que quieres si tu carga de trabajo es una sesión de agente de varias horas en lugar de una sola pregunta difícil.
El techo de salida es la diferencia más silenciosa. Mistral no ha publicado una longitud máxima de salida para la preview, y los 128K de Opus 5 suponen un alivio real de las restricciones para la generación de código y los documentos estructurados largos. Si tu pipeline genera archivos en lugar de respuestas, comprueba ese número antes de cambiar, porque es el tipo de brecha que solo aparece en producción.
El costo por tarea es el número al que hay que aferrarse.
Los precios por token favorecen a los modelos baratos y engañan sobre los caros. El propio coste por tarea del índice —el gasto total para completar una tarea de evaluación, con caché y todo— es la cifra que sobrevive al contacto con un presupuesto: 1,13 $ frente a 5,86 $.
Eso no es una licencia para trasladar todo al modelo más barato, porque una tarea que el modelo barato falla es una tarea que pagas dos veces. Es una licencia para dejar de tratar un único modelo de frontera como la única opción. En OrcaRouter, Claude Opus 5 se encuentra en el catálogo al precio de lista del proveedor con 0 % de recargo, en el mismo endpoint compatible con OpenAI que más de 200 otros modelos, que es lo que hace que una canalización de dos modelos sea el trabajo de una tarde en lugar de un segundo contrato con un proveedor. Mistral Large 4 no está en el catálogo hoy — se accede a la vista previa a través de la propia API de Mistral y varias plataformas de terceros. Cuando sus pesos lleguen y un proveedor lo aloje, se aplica la misma regla de traspaso: lo que cobre el proveedor es lo que se te cobra, y un recorte de precio del proveedor aparece en tu factura el mismo día.

Para una preview no probada, la funcionalidad de enrutamiento que más importa es el failover. Enviar una porción del tráfico de producción a Mistral Large 4 mientras Opus 5 retiene el resto significa que una regresión se convierte en un reruteo en lugar de una caída, y aprendes los modos de fallo reales del modelo con tus propios datos en lugar de en una tabla de clasificación.
¿Qué resuelve esto en tres semanas?
Tres hechos siguen sin resolverse, y cada uno de ellos altera la respuesta. Si los pesos llegan bajo una licencia permisiva, Mistral Large 4 se convierte en el único modelo de esta pareja que puedes autoalojar, y el cálculo para los compradores de sectores regulados se inclina con fuerza. Si el precio promocional de 0,68 $ / 2,09 $ vuelve a los 1,36 $ / 4,18 $ de la tarifa oficial, la diferencia por tarea se reduce, pero sigue siendo decisiva. Y si Artificial Analysis traslada las cifras de programación evaluadas de forma privada a su índice público sin cambios, el relato sobre programación pasa a estar verificado por terceros en lugar de publicado por el proveedor en nombre de un tercero.
Hasta entonces: Opus 5 es la opción predeterminada segura para producción y vale su múltiplo de precio para el trabajo agéntico y con uso intensivo de terminal. Mistral Large 4 es la apuesta interesante: lo bastante barato por tarea como para ejecutarse junto a él, lo bastante capaz en automatización y ciberseguridad como para ganarse tráfico hoy, y con la promesa de autodespliegue que ningún modelo cerrado de esta comparación puede igualar.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
