
Qwen 3.8 vs Claude Opus 4.8: La escala barata se encuentra con el especialista en razonamiento
- metaNUEVOMeta: Muse Spark 1.22026-08-05$1.25 / $4.25 por 1M de tokens · 819 tok/s
- qwenNUEVOQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 por 1M de tokens · 56 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4 Flash 07312026-07-3150Inteligencia69Código
- qwenNUEVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 198 tok/s
- orcaNUEVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNUEVOAnthropic: Claude Opus 52026-07-2461Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2150Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1651Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1557Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligencia77Código
- grokxAI: Grok 4.52026-07-0854Inteligencia72Código
- tencentTencent: Hy32026-07-0641Inteligencia59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencia42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencia39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligencia72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencia52Código57Matemáticas
- z-aiZ.ai: GLM 5.22026-06-1651Inteligencia69Código60Matemáticas
Alibaba presentó en vista previa Qwen3.8-Max en Shanghái el 19 de julio de 2026 como un modelo de 2,4 billones de parámetros diseñado para la escala y la minuciosidad. El Claude Opus 4.8 es un animal muy diferente: un buque insignia premium de razonamiento profundo al que los equipos recurren cuando una tarea tiene muchos pasos y una respuesta incorrecta resulta costosa.
Durante dos semanas, esa comparación era difícil de hacer honestamente, porque Qwen no tenía un precio publicado ni benchmarks publicados. Eso cambió el 3 de agosto de 2026, cuando Qwen3.8-Max alcanzó disponibilidad general con una tarifa de $2 / $6 por millón de tokens y una tabla completa de benchmarks. La pregunta filosófica sigue siendo la misma — escala bruta y apertura frente a fiabilidad de razonamiento — pero ahora hay números en ambos lados.
Una nota para los desarrolladores: la forma más rápida de resolver una pregunta como esta es ejecutar ambos en tus propios flujos de trabajo. OrcaRouter pone 200+ modelos detrás de un único endpoint compatible con OpenAI, para que puedas enfrentar a Qwen 3.8 Max contra Opus 4.8 en la misma tarea sin tener que configurar dos SDKs.
Veredicto TL;DR. Opus 4.8 sigue siendo el especialista en razonamiento: auditado en el grupo superior del Artificial Analysis Intelligence Index y confiable para cadenas agénticas largas, donde una respuesta equivocada dada con confianza cuesta más que la factura de tokens. Sus debilidades son el costo y la verbosidad: AA sitúa su tarifa combinada alrededor de $3.85/1M al máximo esfuerzo, y consume muchos tokens; Grok 4.5 completa según se informa tareas comparables usando aproximadamente 4× menos tokens de salida. Qwen3.8-Max ahora contrarresta con algo que le faltaba en julio: un precio real y bajo de $2 / $6 fijo por 1M de tokens, entrada en caché a $0.25, y una tabla de benchmarks del proveedor liderada por Terminal-Bench 2.1 86.6 y OSWorld-Verified 86.1. También mostró una diligencia agéntica genuina en la única prueba de terceros disponible. Pero sigue sin ser puntuado por ningún evaluador independiente. Opus para razonamiento en el que debes confiar; Qwen para trabajos sensibles al costo y que priorizan la minuciosidad.
Conclusiones clave
• Qwen3.8-Max está disponible de forma general desde el 3 de agosto de 2026 a $2 / $6 por 1M de tokens, con tarifa plana en todo el contexto de 1M de tokens: una tarifa real que reemplaza el descuento temporal de vista previa de julio.
• Opus 4.8 es sustancialmente más caro: Artificial Analysis sitúa su coste combinado cerca de $3.85/1M con el máximo esfuerzo, y es intensivo en tokens — según informes, ~4× más tokens de salida por tarea que Grok 4.5, por lo que las ejecuciones agénticas largas amplían la diferencia.
• Las fuentes discrepan sobre el número AA exacto de Opus 4.8. En AA v4.1, Kimi K3 (57.1) aparece justo por encima, por lo que la afirmación fiable es "grupo superior, por debajo de los líderes Fable 5 / GPT-5.6 Sol" en lugar de una puntuación única y definitiva.
• Qwen ahora tiene cifras de agente, auto-reportadas: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (frente al 40.7 de un predecesor). Ninguna verificada de forma independiente.
• Un dato agéntico de terceros de Qwen es favorable: contra Kimi K3 produjo 354 citas de repositorios a 274, usó 22 solicitudes de puerta de enlace a 53, y registró 0 llamadas fallidas de herramientas a 2 — mientras que obtuvo 80/100 frente a los 83 de Kimi.
• La apertura diverge permanentemente: Qwen promete pesos abiertos dentro de la semana, además de un Qwen3.8-27B de ~17GB de VRAM; Opus 4.8 es cerrado y solo API.
Nota de precisión: todas las cifras de calidad de Qwen3.8-Max son reportadas por Alibaba y no verificadas por terceros. Las cifras de Opus 4.8 se atribuyen a Artificial Analysis y a fuentes nombradas, y pueden diferir de los informes de la propia Anthropic; debido a que los rastreadores discrepan sobre el índice exacto de Opus, indicamos su posición relativa en lugar de un número único. El precio de Qwen corresponde a la tarjeta de tarifas de disponibilidad general (GA) y reemplaza al descuento de la versión preliminar de julio.
Las especificaciones y el precio, lado a lado
Aquí están los datos concretos, cada cifra atribuida a su fuente.
• Fabricante / estado — Qwen3.8-Max: Alibaba; GA (3 de agosto de 2026); Claude Opus 4.8: Anthropic; modelo insignia GA de razonamiento profundo
• Arquitectura — Qwen3.8-Max: ~2.4T total, MoE dispersa (parámetros activos aún no revelados); Opus 4.8: Cerrado; arquitectura no revelada
• Ventana de contexto — Qwen3.8-Max: 1M tokens (983,616 con razonamiento; salida máxima 131,072); Opus 4.8: buque insignia de contexto largo
• AA Intelligence Index — Qwen3.8-Max: Aún sin puntuar; Opus 4.8: Grupo superior, por debajo de los líderes (Artificial Analysis; Kimi K3 con 57.1 reportado justo por encima)
• Fortaleza principal — Qwen3.8-Max: Escalabilidad, minuciosidad, economía de contexto largo; Opus 4.8: Razonamiento profundo de múltiples pasos + fiabilidad agéntica
• Puntuaciones agénticas reportadas por el proveedor — Qwen3.8-Max: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (reportado por Alibaba); Opus 4.8: n/a — la reputación se gana en producción
• Precios (entrada / salida) — Qwen3.8-Max: $2.00 / $6.00 por 1M, fijo; entrada en caché $0.25; Opus 4.8: Premium — AA combinado ~$3.85/1M al máximo esfuerzo
• Eficiencia de tokens — Qwen3.8-Max: Verboso; IFBench 82.8 es su puntuación auto-reportada más baja; Opus 4.8: Pesado en tokens — ~4× más salida que Grok 4.5 (reportado)
• Pesos abiertos — Qwen3.8-Max: Prometido dentro de la semana (sin licencia aún); Opus 4.8: No — cerrado / solo API
Dos cosas enmarcan la comparación, y ambas se movieron el 3 de agosto.
Primero, la brecha de costos ahora es medible en lugar de teórica. En julio, la ventaja de Qwen era un descuento contra el que no se podía presupuestar. Ahora es una tarifa, y la forma de la brecha es inusual: Opus es caro y con alto consumo de tokens, lo que significa que los dos factores se multiplican. Si Opus emite cuatro veces más tokens de salida para la misma tarea y cobra una prima por token, una ejecución agéntica larga puede costar muchas veces más de lo que sugieren las tarifas publicadas. La tarifa de salida de $6 de Qwen, el contexto de 1M a precio fijo y la entrada en caché de $0.25 atacan exactamente esa multiplicación.
Segundo, la columna de benchmarks de Qwen ya no está vacía — y por una vez, parte de ella es directamente relevante. Toda la propuesta de Opus 4.8 es la fiabilidad agéntica, y Alibaba ha publicado ahora cifras agénticas: Terminal-Bench 2.1 86.6 para operación de shell, OSWorld-Verified 86.1 para manejar una GUI real. Estas miden lo correcto. La salvedad es la procedencia, no la relevancia: Alibaba las produjo con su propio entorno de pruebas, y ningún tercero las ha replicado. Mientras tanto, la reputación de Opus se basa en algo más difícil de publicar pero posiblemente más valioso — el uso sostenido en producción en muchos equipos, que es un tipo de evidencia que la tabla de un proveedor no puede fabricar.

Fiabilidad del razonamiento vs exhaustividad bruta
La interesante diferencia entre estos dos no es la calidad de un solo intento — es cómo se comportan cuando una tarea tiene muchos pasos y herramientas reales asociadas.
La reputación de Opus 4.8 se basa en fiabilidad agéntica: largas cadenas de razonamiento en las que realiza un seguimiento del contexto, se recupera de los callejones sin salida y devuelve respuestas en las que puedes actuar sin tener que volver a comprobar cada paso. Esa es la propiedad por la que los equipos pagan un plus, porque en producción el coste de una respuesta errónea pero segura de sí misma en múltiples pasos eclipsa la factura de tokens. La contrapartida es que Opus consume muchos tokens — Grok 4.5 supuestamente completa tareas comparables con aproximadamente 4× menos tokens de salida —, por lo que su fiabilidad conlleva un coste real y continuo.
Qwen 3.8 responde con un tipo diferente de fortaleza: minuciosidad absoluta, y ahora hay un dato de terceros que lo respalda. En una prueba de comprensión de arquitectura realizada por Trilogy AI (Qwen3.8-Max vs Kimi K3), Qwen obtuvo 80/100 frente a los 83 de Kimi — perdiendo en el titular — pero fue el agente más diligente, produciendo 354 citas de repositorio frente a las 274 de Kimi, usando 22 solicitudes de gateway frente a 53, y registrando 0 llamadas fallidas a herramientas frente a 2. Ambos modelos llegaron a la misma conclusión arquitectónica central; Qwen simplemente hizo más trabajo de fundamentación para llegar allí, con un uso de herramientas más limpio.
Ese resultado de cero llamadas a herramientas fallidas es la señal agéntica más alentadora que tiene Qwen, porque las llamadas a herramientas fallidas son lo que realmente rompe a los agentes de producción. También es una sola prueba, en una sola tarea, realizada por un solo evaluador — ni de lejos la base de evidencia que respalda la reputación de Opus.
El costo de la minuciosidad de Qwen fue la latencia y los tokens. Los revisores de la era de vista previa la encontraron "muy buena y muy lenta": más de 30 minutos en la creación de un sitio web, más de una hora en una simulación de póker, el modelo más lento que ese revisor había usado. Ahora se aplican dos salvedades. Eso fue la infraestructura de vista previa, y el servicio de GA es un sistema diferente; la telemetría de 7 días de OrcaRouter actualmente muestra un p50 de tiempo hasta el primer token de 1.64 segundos, aunque el TTFT y el throughput de extremo a extremo en compilaciones de una hora son cantidades diferentes. El hallazgo merece una nueva prueba en lugar de repetición.
También hay una preocupación estructural que vale la pena mencionar: la puntuación más baja reportada por Alibaba es IFBench 82.8, seguimiento de instrucciones bajo restricciones. Para pipelines agénticos que parsean la salida del modelo en cada paso, un modelo que excede el alcance y añade trabajo no solicitado es un lastre, independientemente de lo minucioso que sea. Esto es precisamente donde la disciplina de Opus justifica su prima.

Costo en la práctica: donde la brecha de tokens 4× se hace sentir
Tome una ejecución de agente de varios pasos: 80,000 tokens de entrada de contexto y — esta es la variable clave — diferentes volúmenes de salida, porque se reporta que Opus emite aproximadamente 4× más.
• Qwen3.8-Max con 8,000 tokens de salida: 0.08M × $2 = $0.16, más 0.008M × $6 = $0.048. ≈ $0.21 por ejecución.
• Opus 4.8 a un precio combinado de ~$3.85/1M por 80,000 de entrada + ~32,000 de salida (4× los tokens): aproximadamente $0.43 por ejecución con el precio combinado — y considerablemente más si se cotizan entrada y salida por separado a tarifas de nivel premium.
• A 3,000 ejecuciones/día: Qwen ≈ $630/día; Opus ≈ $1,290/día o más.
• Con la entrada en caché de Qwen a $0.25/1M en un contexto estable, su ejecución baja a ≈ $0.07 — aproximadamente 6 veces más barato que Opus.
El contrapeso honesto es el que siempre se aplica a las comparaciones con Opus: si Opus resuelve una tarea en un solo intento mientras que un modelo más barato necesita dos intentos más revisión humana, el modelo más barato no es realmente más barato. La verbosidad de Opus es en parte el mecanismo de su fiabilidad: razona en voz alta, y eso cuesta tokens. La pregunta para tu carga de trabajo es si estás pagando por una deliberación que necesitas. En razonamientos de alto riesgo y bajo volumen, probablemente sí. En análisis de alto volumen donde de todos modos verificas los resultados, probablemente no.
La apertura y la cuestión del on-premise
Opus 4.8 está cerrado y es solo API, de forma permanente. Qwen3.8-Max puede que no lo esté —se prometen los pesos dentro de la semana—, pero el buque insignia no es un objetivo realista de autoalojamiento: aproximadamente 1,2 TB en 4 bits frente a unos 141 GB por H200 implica ocho o más aceleradores de gama alta, y con el recuento de parámetros activos aún sin revelar, no se puede modelar el rendimiento que esa inversión compraría. Tampoco hay aún texto de licencia, por lo que la usabilidad comercial está formalmente indeterminada.
El simultáneamente anunciado Qwen3.8-27B es la versión práctica para equipos cuyo interés es el control en lugar de la capacidad bruta. También con pesos abiertos, se informa que funciona en aproximadamente 17GB de VRAM — una sola tarjeta de gama alta. Si estás comparando con Opus porque necesitas razonamiento dentro de tu propia red, 27B es el modelo a evaluar; la apertura del buque insignia de 2.4T es mayormente teórica.
Preguntas frecuentes
¿Es Qwen 3.8 mejor que Claude Opus 4.8?
No con la evidencia que existe. Opus 4.8 se sitúa en el clúster superior del índice auditado Artificial Analysis Intelligence Index y está probado en razonamiento agéntico profundo en producción. Qwen3.8-Max tiene una tabla sólida autodeclarada (Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1) y una prueba agéntica favorable de terceros, pero sin puntuación independiente. Qwen gana en precio; Opus gana en prueba y fiabilidad de razonamiento.
¿Por qué el número de referencia de Opus 4.8 se describe de manera tan vaga?
Porque los trackers realmente entran en conflicto. En AA v4.1, Kimi K3 (57.1) se sitúa justo por encima de Opus 4.8, lo que coloca a Opus en el grupo superior pero por debajo de los líderes Fable 5 / GPT-5.6 Sol; sin embargo, distintas fuentes lo reportan de manera diferente, por lo que citar una cifra exacta sería engañoso. Su posición relativa es la afirmación fiable.
¿Cuánto más barato es Qwen 3.8 que Claude Opus 4.8?
Significativamente, y la brecha se amplía en ejecuciones largas. Qwen3.8-Max tiene una tarifa plana de $2 / $6 por 1M, con entrada en caché a $0.25. Artificial Analysis sitúa el costo combinado de Opus cerca de $3.85/1M con esfuerzo máximo, y se informa que Opus consume ~4× más tokens que Grok 4.5 — por lo que la brecha de precios se multiplica con el volumen de salida. En una ejecución típica de varios pasos, Qwen resulta aproximadamente 2–6× más barato dependiendo del almacenamiento en caché.
¿Qwen 3.8 Max salió de la vista previa?
Sí, el 3 de agosto de 2026. Tiene una tarifa publicada y un endpoint compatible con OpenAI y DashScope, por lo que la campaña de créditos Qoder de julio y el marco de descuento del 90% ya no describen cómo se vende.
¿Es Qwen 3.8 fiable para el trabajo agéntico?
Las primeras señales son alentadoras pero escasas. Alibaba reporta Terminal-Bench 2.1 86.6 y OSWorld-Verified 86.1, y en una prueba de terceros registró cero llamadas a herramientas fallidas frente a dos de un rival. En contraste, su puntaje autoinformado más débil es IFBench 82.8 en seguimiento de instrucciones, y los evaluadores de vista previa vieron repetidamente que excedía el alcance — un riesgo real para los pipelines que analizan la salida de cada paso.
¿Puedo auto-alojar Qwen 3.8 para evitar el precio premium de Opus?
Realísticamente, no es el buque insignia. Los pesos están prometidos para esta semana, pero no se ha publicado ninguna licencia, y con ~1.2TB en 4-bit se necesitarían ocho o más GPUs de clase H200. El Qwen3.8-27B, anunciado simultáneamente y que según se informa requiere ~17GB de VRAM, es la opción viable. Opus 4.8 es cerrado, por lo que no hay ninguna vía de autoalojamiento.
¿Cuál debería usar hoy?
Opus 4.8 para trabajo de producción crítico en razonamiento o agéntico {{1}}en el que debes poder confiar{{/1}}, donde una respuesta incorrecta de múltiples pasos es costosa. Qwen3.8-Max para trabajo sensible al costo y que prioriza la minuciosidad {{2}}— especialmente análisis de contexto largo donde su tarifa plana de 1M y su entrada en caché de $0.25 hacen que sea difícil rebatir la relación costo-beneficio.{{/2}}
En resumen
Qwen 3.8 vs Claude Opus 4.8 sigue siendo un contraste de filosofías, pero la economía ya no es hipotética. Qwen3.8-Max llegó a GA con precios reales que subcotizan a Opus por un amplio margen, y la brecha se amplía porque Opus tiene un precio premium y consume muchos tokens. Qwen también publicó cifras de agentes que apuntan directamente al terreno de Opus, y su prueba de agentes de terceros mostró un uso de herramientas más limpio que el de un rival fuerte.
Opus mantiene la ventaja donde siempre la ha tenido: estatus auditado en el clúster superior, y un historial de producción de razonamiento fiable de múltiples pasos que ninguna tabla de proveedores puede sustituir. Las brechas restantes de Qwen son las habituales: sin puntuación independiente, sin recuento divulgado de parámetros activos, sin licencia aún, y una debilidad autoinformada en el seguimiento de instrucciones que importa precisamente en los pipelines agénticos para los que se elige a Opus. Esté atento a dos eventos: la primera puntuación independiente del Intelligence Index, y la llegada de los pesos con una licencia. Hasta entonces, Opus es el modelo en el que confía para decisiones costosas, y Qwen 3.8 es al que deriva el volumen — probado en sus propios flujos de trabajo.

Comparados en este artículo4
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
