Tarjeta de título hero para una comparación de DeepSeek V4 Pro y Qwen3.8 Max, con el subtítulo 'Especialista en razonamiento vs el todoterreno chino'.
Guides & Insights

DeepSeek V4 Pro vs Qwen3.8 Max: Especialista en Razonamiento vs el Todoterreno Chino

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Con diez días de diferencia, los dos modelos más observados de China salieron a la luz: Alibaba presentó Qwen3.8 Max el 3 de agosto de 2026 — un buque insignia de MoE disperso de 2,4 billones de parámetros que presenta como un todoterreno para agentes, trabajo de oficina y comprensión multimodal — y DeepSeek lanzó la versión oficial de DeepSeek V4 Pro el 12 de agosto, su especialista en razonamiento y código con 1,6 T de parámetros totales y un precio de aproximadamente una séptima parte del de Qwen en tokens de salida. Ambos apuntan a los mismos bolsillos de los desarrolladores, pero discrepan sobre para qué sirve un buque insignia. Qwen3.8 Max quiere ser el modelo al que enrutas todo; DeepSeek V4 Pro quiere ser aquel al que escalas lo difícil.

The OrcaRouter DeepSeek V4 Pro model page showing the flagship MoE badge, 1M-token context, 384K max output, per-million pricing and an OpenAI-compatible code sample.

Conclusiones clave

Qwen3.8 Max es el modelo de mayor capacidad bruta en los rankings generales chinos (SuperCLUE #1, julio) y el paquete multimodal/empresarial más potente: entrada de video, herramientas integradas, salida estructurada, todo en una sola API.

• DeepSeek V4 Pro es dramáticamente más barato (~7× en salida), ya tiene pesos abiertos, y ahora ostenta las afirmaciones más altas en codificación/agentes — Terminal-Bench 2.1 con 87.9 frente a los 86.6 reportados por el proveedor de Q​wen.

• Vigila el costo de la verbosidad: ejecuciones independientes muestran que Qwen3.8 Max promedia ~64 turnos y ~$1.14 por tarea agéntica — un problema de costo efectivo que la hoja de especificaciones oculta.

El titular honesto: Qwen3.8 Max es el buque insignia de la «guerra de capacidades» que iguala los precios de los modelos cerrados de EE. UU.; DeepSeek V4 Pro es la refutación en relación calidad-precio.

Dos filosofías en una tabla de especificaciones

• Parámetros totales — Qwen3.8 Max 2.4T (MoE dispersa, ~95B activos) vs DeepSeek V4 Pro 1.6T (MoE, ~49B activos)

• Contexto / salida máxima — ambos con contexto de 1M; Q​wen alcanza un máximo de alrededor de 128–131K de salida frente a los 384K de D​eepSeek.

• Entradas — Q​wen acepta texto, imagen y video; DeepSeek V4 Pro acepta texto e imagen, con nuevo razonamiento nativo de imagen en la compilación oficial.

• Pesos abiertos — DeepSeek V4 Pro: lanzado (MIT); Qwen3.8 Max: prometido para la semana del 10 de agosto, el primer Q​wen de clase Max jamás liberado como código abierto.

• Extras de API — Q​wen incluye herramientas integradas y salida estructurada lista para usar; DeepSeek V4 Pro incluye conmutadores de razonamiento, JSON estructurado, una API de Responses y compatibilidad con Codex.

• Precio — Qwen3.8 Max $2.00 / $6.00 por millón de tokens ($0.25 en caché) vs DeepSeek V4 Pro ~$0.42 / $0.87 ($0.0035 en caché)

Scoreboard contrasting DeepSeek V4 Pro (Terminal-Bench 2.1 87.9 official, output price $0.87 per 1M, 1.6T total params, MIT open weights out now, 384K max output, text+image input) with Qwen3.8 Max (86.6 vendor, $6.00, 2.4T params, weights promised, ~128K max output, text+image+video input).

Dónde gana Qwen3.8 Max

En el eje generalista, Qwen3.8 Max va por delante y los datos independientes coinciden. Artificial Analysis lo sitúa en un Índice de Inteligencia de 58, un Índice de Codificación de 71.8 y un Índice Agéntico de 58 — lo más cerca que cualquier laboratorio chino ha estado de la cima de esa clasificación agéntica. En el ranking de julio en chino de SuperCLUE, ocupa el puesto #1 con 71.48, mientras que DeepSeek-V4-Pro ocupa el #5 con 64.4. Las demostraciones de lanzamiento de Alibaba — una ejecución de codificación autónoma de 16 días, una reproducción de un artículo que superó el resultado AIME24 del artículo original — son la evidencia más sólida de todo el ciclo de lanzamiento de que este es un agente de horizonte largo genuinamente capaz.

Para un desarrollador, las ventajas prácticas están orientadas a la integración: entrada de video, llamada a herramientas integrada, salida estructurada sin configuración y un ecosistema (Model Studio, el conjunto de herramientas de Q​wen) que D​eepSeek no intenta igualar. Si la carga de trabajo es intensiva en documentos, multimodal o necesita una propuesta de integración empresarial, Qwen3.8 Max es el modelo al que el mercado chino está recurriendo actualmente por defecto.

Donde DeepSeek V4 Pro gana

En cuanto a codificación y costo, el V4 Pro oficial es la réplica. D​eepSeek reporta que la versión oficial obtiene 87.9 en Terminal-Bench 2.1 (frente a 72.1 en la vista previa) y 62.7 en DeepSWE — contra los 86.6 de Terminal-Bench reportados por el proveedor de Q​wen. La vista previa ya mantenía un 80.6 en SWE-bench Verified, un 90.1 en GPQA Diamond y un 93.5 en LiveCodeBench, el puntaje número 1 de programación competitiva entre modelos abiertos, y los cambios de la versión oficial se concentran exactamente en las tareas agénticas y de razonamiento donde residen esos números.

Luego está el precio. A $0.42/$0.87 por millón de tokens, DeepSeek V4 Pro es aproximadamente 4.8× más barato en entrada y 6.9× más barato en salida que los $2/$6 de Qwen3.8 Max. D​eepSeek también señaló el 6 de agosto que se acerca un aumento de precio, lo que hace que la tarifa de hoy sea una ventana, no una promesa — más sobre eso a continuación.

An infographic summarizing the official DeepSeek V4 Pro release: Terminal-Bench 2.1 at 87.9 (preview 72.1), DeepSWE 62.7 (preview 12.8), AutomationBench 31.8 (preview 12.8), with native image reasoning, 1M context, 384K output and $0.87 per 1M output.

Haz los cálculos en una tarea agéntica real.

Las ejecuciones agénticas independientes son donde el precio de lista de Qwen deja de ser el precio real. En las tareas agénticas de Artificial Analysis, Qwen3.8 Max promedió ~64 turnos por tarea y costó ~$1.14 por tarea, frente a ~$0.53 para la generación anterior: el modelo es verboso y planifica mucho. Ejecuta la misma forma de tarea en DeepSeek V4 Pro a $0.87 por millón de salida y el costo por tarea resulta aproximadamente un orden de magnitud menor. Si tu producto es un bucle que llama al modelo cien veces al día por usuario, esa diferencia es tu margen.

Salvedades de fiabilidad en ambos lados

La honestidad en el abastecimiento funciona en ambos sentidos aquí. Las pruebas independientes señalaron que la tasa de alucinación de Qwen3.8 Max aumentó del 23% al 40% y que su puntuación AA-Omniscience bajó diez puntos: el modelo se volvió más capaz y menos confiable en la misma versión. La vista previa de D​eepSeek presentaba una tasa documentada del 94% de «respuesta siempre» en AA-Omniscience, lo que significa que tiende a producir una respuesta sepa o no sepa una. Ambas señales importan para la producción; ninguna es descalificante para las cargas de trabajo a las que están dirigidos estos modelos.

Por qué el momento de los pesos abiertos cambia la aritmética de precios

El lanzamiento de pesos abiertos de Qwen3.8 Max, {{1}}cuando llegue{{/1}}, cambiará la economía de este duelo en una semana — {{2}}quienes lo autoalojen consiguen un buque insignia de 2.4T{{/2}} y {{3}}la presión sobre el precio de la API será real{{/3}}. Este es precisamente el escenario donde un {{4}}modelo de precios de pase directo te mantiene honesto{{/4}}. {{5}}OrcaRouter traslada el precio de lista del proveedor con cero margen{{/5}}, así que en el momento en que Alibaba o DeepSeek muevan un precio — {{6}}al alza o a la baja{{/6}} — {{7}}el cambio queda activo en una sola clave el mismo día{{/7}}, {{8}}sin renegociación y sin un segundo contrato que leer{{/8}}. Enruta hacia Qwen3.8 Max o DeepSeek V4 Pro, {{9}}el que tu evaluación actual favorezca{{/9}}, y {{10}}el precio se mantiene en lo que el proveedor cobra realmente{{/10}}.

¿Cuál para tu decisión de API builder?

Elige Qwen3.8 Max cuando el trabajo necesite toda la superficie — entrada multimodal, salida estructurada, herramientas integradas, calidad en chino en lo más alto de los rankings actuales — y tu modelo de costos tolere ejecuciones agénticas verbosas. Elige DeepSeek V4 Pro cuando la tarea sea intensiva en razonamiento o codificación, el volumen de tokens sea alto, los pesos abiertos importen para cumplimiento normativo o autoalojamiento, o la línea presupuestaria sea la restricción vinculante. La lectura más clara de este enfrentamiento es la que las dos propias empresas están señalando: Qwen3.8 Max es el buque insignia contra el que mides todo, y DeepSeek V4 Pro es el que hace que el benchmark parezca caro.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube