
Qwen 4 Max vs Claude Opus 5: el benchmark que se movió bajo ambos
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen 4 Max se presentó en primicia en la conferencia Yunqi de Hangzhou el 22 de septiembre de 2026 —el nivel insignia de una línea Qwen 4 de cuatro modelos que está anunciada pero aún no lanzada, sin precio, sin ventana de contexto y sin puntuación publicada. Claude Opus 5 está disponible de forma general desde el 24 de julio de 2026 a 5,00 $ por millón de tokens de entrada y 25,00 $ por millón de tokens de salida, y ha sido el objetivo al que apunta cada modelo insignia desde el lanzamiento de Qwen3.8-Max. La forma obvia de escribir esta comparación es una ficha técnica con una columna en blanco. La forma útil es advertir que el 19 de septiembre de 2026, tres días antes del anuncio, Artificial Analysis volvió a puntuar su Intelligence Index y Claude Opus 5 dejó de ser el modelo que encabezaba la lista. Ese único cambio reencuadra a qué tiene que superar Qwen 4 Max.
¿Qué cambió el 19 de septiembre?
Artificial Analysis publicó la revisión del índice v4.3.2 el 19 de septiembre de 2026. Con la revisión actual, Claude Opus 5 obtiene 51 en el Intelligence Index con su máximo esfuerzo de razonamiento —50 con xhigh, 48 con high, 45 con medium y 39 con low— y se sitúa por detrás de Claude Fable 5.1 y GPT-6 Astra, ambos con 53. El coste por tarea en ese índice es de $5.86.
Si eso suena a degradación, no lo es. El modelo no cambió. El índice sí. Nuestra propia cobertura de julio y agosto citaba a Claude Opus 5 con 61 a 63 y en lo más alto de la tabla, y esas cifras eran correctas según las revisiones vigentes en ese momento. Quien todavía las cite sin una fecha de revisión está citando una cifra retirada, y este es el error más común en las comparaciones escritas este mes. La consecuencia práctica es que una afirmación como "Claude Opus 5 es el modelo disponible con la puntuación más alta" ya no es cierta, y una comparación basada en ella se derrumba.
Para el lado de Qwen, la consecuencia es aún más incisiva. Un nivel insignia anunciado en septiembre de 2026 apunta a un objetivo que fue redefinido en septiembre de 2026. Todo lo que Alibaba publique finalmente para Qwen 4 Max se leerá en comparación con una tabla de clasificación en la que 53 es el número a batir, no 63.

La comparación, planteada con honestidad
Un lado de esta tabla está completo y el otro está vacío, y pretender lo contrario sería el modo de fracaso de todo este artículo. Esto es lo que se sabe en realidad:
• Estado — Claude Opus 5 disponible de forma general desde el 24 de julio de 2026, frente a Qwen 4 Max, anunciado el 22 de septiembre de 2026 y sin fecha de lanzamiento
• Precio de entrada — Claude Opus 5 $5.00 por 1M de tokens, frente a Qwen 4 Max no publicado
• Precio de salida — Claude Opus 5 $25.00 por 1M de tokens, frente a Qwen 4 Max, no publicado
• Entrada en caché — Claude Opus 5 $0,50 por 1M de tokens en una lectura de caché, frente a Qwen 4 Max, no publicado
• Contexto — Claude Opus 5, 1M de tokens en el valor predeterminado y en el máximo, frente a Qwen 4 Max, no publicado
• Límite de salida — Claude Opus 5, 128K tokens de forma síncrona y 300K en la Batches API con una cabecera beta, frente a Qwen 4 Max, que no se ha publicado
• Modalidad — Claude Opus 5, entrada de texto, imagen y archivos con salida de texto, frente a Qwen 4 Max, no publicado
• Precios de contexto largo — Claude Opus 5 no tiene recargo, por lo que una solicitud de 900.000 tokens se factura a la misma tarifa por token que una de 9.000 tokens, mientras que la de Qwen 4 Max no se ha publicado.
• Puntuación independiente — Claude Opus 5: 51 en el Artificial Analysis Intelligence Index v4.3.2 con esfuerzo máximo, frente a Qwen 4 Max, para el que no existe ninguna evaluación independiente
• Puntuaciones reportadas por el proveedor — Claude Opus 5 SWE-bench Verified 96,0 %, SWE-bench Pro 79,2 %, OSWorld 2.0 70,6 %, Terminal-Bench 2.1 en torno a mediados de los 80 según el harness, frente a Qwen 4 Max, sin nada reportado
• Control de razonamiento — Claude Opus 5 con pensamiento adaptativo activado de forma predeterminada y una escala de esfuerzo de cinco niveles, frente a Qwen 4 Max, no publicado
Diez filas de "no publicado" no son un recurso retórico. Es el estado de la evidencia, y la conclusión honesta que se deriva de ello es que todavía nadie puede establecer una comparación de capacidades entre estos dos modelos.
La parte de la brecha que no se cerrará
Los precios y el contexto se publicarán tarde o temprano. Una diferencia perdurará tras el lanzamiento, y vale la pena decidir al respecto ahora en lugar de en la semana en que Qwen 4 Max salga al mercado: los dos modelos están concebidos para comprarse de formas distintas.
Claude Opus 5 es un modelo cerrado único, a un precio único de un único proveedor, con un compromiso de retirada publicado de no antes del 24 de julio de 2027. Ese es un objetivo estable para la planificación de capacidad. Qwen 4 Max es el buque insignia de una familia que Alibaba ha lanzado repetidamente a lo largo de un rango de precios mucho más amplio —la generación Qwen 3.8 abarca desde un buque insignia de frontera a 2,00 $ por entrada hasta un nivel Flash muy por debajo— y el nivel de gama alta de la línea Qwen ha sido históricamente el que ha tenido la vida útil más corta antes de que un nivel más barato le cierre la brecha.
La otra diferencia son los pesos abiertos, y apunta en la dirección opuesta. La generación Qwen 3.8 publicó los pesos de su modelo más grande bajo una licencia Qwen personalizada, que es lo que hace posible, siquiera, el ajuste fino, la cuantización y el autoalojamiento. Claude Opus 5 no tiene publicación de pesos y no la tendrá. Si tu carga de trabajo necesita un modelo que puedas ejecutar dentro de tu propio perímetro, o modificar, esa es una ventaja estructural que ninguna revisión de benchmark puede arrebatarle a Alibaba, y es la razón más sólida para interesarse por esta comparación en particular en lugar de tratarla como la de un buque insignia contra otro.

Cómo ejecutar esta comparación hoy
Claude Opus 5 ya está disponible, y OrcaRouter lo enruta como anthropic/claude-opus-5 al precio de lista de Anthropic con un 0 % de recargo — la tarifa del proveedor se aplica sin modificaciones, de modo que las cifras de $5.00 y $25.00 anteriores son lo que se le factura, y no un equivalente con recargo. Eso importa más de lo habitual en un modelo de esta banda de precios: un margen de plataforma del 10 por ciento sobre una tarifa de salida de $25.00 supone $2.50 por millón de tokens, más que el coste total de entrada de la mayoría de las alternativas de pesos abiertos. Junto a él, el catálogo incluye cerca de 200 modelos en un único endpoint compatible con OpenAI, con conmutación automática por error cuando se degrada la ruta de un proveedor y un DSL de enrutamiento para expresar la política de forma explícita en lugar de codificar de forma rígida el nombre de un modelo en su aplicación.
Lo que OrcaRouter no ofrece es Qwen 4 Max, ni ningún nivel de Qwen 4. El catálogo tiene cero entradas para la familia, que es lo que cabría esperar de un modelo anunciado y no lanzado. Cuando los niveles se lancen, aparecerían en el mismo lugar, y hasta entonces el modelo Qwen que vale la pena comparar con Claude Opus 5 es el que realmente puedes llamar: Qwen3.8-Max, disponible de forma general desde el 3 de agosto de 2026 a $2.00 por entrada y $6.00 por salida por millón de tokens, con pesos publicados y una puntuación de inteligencia independiente registrada de 56 a $1.14 por tarea — una cifra obtenida bajo una revisión anterior del índice, así que compárala con el 51 de Claude Opus 5 solo con esa salvedad.
¿Qué hacer con esto antes de que exista una tarjeta de modelo?
No hay veredicto que dar aquí, porque uno de los dos modelos no existe como producto. Lo que se puede decir es que la comparación cambió de forma el 19 de septiembre de 2026 sin que ninguno de los dos proveedores hiciera nada: Claude Opus 5 ya no es el modelo con la puntuación más alta en el índice independiente en el que se apoyan la mayoría de las comparaciones, y ahora se encuentra dos puntos por detrás de otros dos modelos. El lanzamiento de Qwen 4 Max aterrizará en esa tabla, no en la de julio.
Así que la decisión para los próximos meses no es Qwen 4 Max frente a Claude Opus 5. Es Claude Opus 5 frente al modelo Qwen que ya se lanzó —un buque insignia a un quinto del precio de entrada y con pesos publicados—, y esa comparación está disponible ahora, con cifras reales en ambos lados. Vuelve a revisarla cuando Alibaba publique una ficha de modelo, y considera como no verificada cualquier tabla de benchmarks de Qwen 4 Max que veas antes de entonces.

Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
