Qwen 3.8 vs GPT-5.6: Ahora que ambos tienen etiquetas de precio, ¿cuál gana?
Guides & Insights

Qwen 3.8 vs GPT-5.6: Ahora que ambos tienen etiquetas de precio, ¿cuál gana?

Autor

jinhao song

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Cuando Alibaba presentó Qwen3.8-Max en Shanghái el 19 de julio de 2026, la reacción de la comunidad fue inmediata: este modelo de 2,4 billones de parámetros estaba "supuestamente por delante de GPT-5.6 y solo ligeramente por detrás de Fable 5." El GPT-5.6 de OpenAI en su configuración insignia Sol se sitúa en el puesto #2 del índice independiente Artificial Analysis Intelligence, un punto por debajo de Fable 5, así que era una afirmación atrevida sin cifras publicadas que la respaldaran.

Dos cosas han cambiado desde entonces. Qwen3.8-Max se lanzó a disponibilidad general el 3 de agosto de 2026 con una tarjeta de tarifas real y una tabla de benchmarks real. Y el 31 de julio, OpenAI redujo los precios en toda la familia GPT-5.6: Terra a $2 / $12, Luna a $0.20 / $1.20, con Sol sin cambios en el nivel premium. Así que este enfrentamiento ya no es una afirmación frente a un ranking; son dos modelos con precios y documentación que realmente se pueden comparar.

Una nota para los desarrolladores: la forma más rápida de resolver una afirmación como esta es ejecutar ambos en tus propios prompts. OrcaRouter expone más de 200 modelos detrás de un único endpoint compatible con OpenAI, por lo que puedes enfrentar a Qwen 3.8 Max contra GPT-5.6 en la misma tarea sin necesidad de configurar dos SDKs.

Veredicto TL;DR. Qwen3.8-Max en GA tiene un precio agresivo — $2 / $6 por 1M, fijo por 1M de tokens — lo que lo sitúa al mismo precio de entrada que GPT-5.6 Terra, pero la mitad del costo de salida de Terra, y muy por debajo de Sol. Sus cifras auto-reportadas son sólidas (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6). Pero GPT-5.6 Sol aún gana en los dos aspectos que deciden el uso en producción: es el #2 auditado en el Índice de Inteligencia de Artificial Analysis (~59) y es rápido — hasta 750 tokens/seg en hardware de Cerebras. Qwen3.8-Max sigue sin puntuación de ningún evaluador independiente. Así que Qwen bien podría igualar a GPT-5.6 en calidad one-shot y claramente supera a Terra en precio de salida; GPT-5.6 gana en prueba revisada por pares y en rendimiento, que a menudo es el factor decisivo.

Conclusiones clave

Qwen3.8-Max está disponible de forma general desde el 3 de agosto de 2026 con precios publicados de $2 / $6 por cada 1M de tokens, un precio fijo en todo el contexto de 1M de tokens.

Frente a GPT-5.6 Terra ($2 / $12 después del recorte del 31 de julio de OpenAI), Qwen iguala el precio de entrada y reduce a la mitad el de salida. Frente a Sol, Qwen es drásticamente más barato.

GPT-5.6 Sol está auditado como #2 en el AA Intelligence Index (~59), y Artificial Analysis señala que lidera en los problemas STEM más difíciles. Qwen3.8-Max está aún sin puntuar por AA y LMArena.

La velocidad es el contraste más marcado. GPT-5.6 alcanza hasta 750 tokens/seg en Cerebras. Qwen fue el modelo más lento en las pruebas prácticas preliminares — un hallazgo que precede al servicio GA y necesita volver a probarse.

La tabla de proveedores de Qwen es creíble pero no revisada por pares: GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (frente a los 40.7 de un predecesor).

La apertura los divide permanentemente: Qwen promete pesos abiertos dentro de la semana, además de un Qwen3.8-27B de ~17GB de VRAM; GPT-5.6 es cerrado y solo API.

Nota de precisión: todas las cifras de calidad de Qwen3.8-Max son reportadas por Alibaba y no verificadas por terceros. Las cifras de GPT-5.6 provienen de Artificial Analysis y pueden diferir de los informes propios de OpenAI. Los precios de la familia GPT-5.6 reflejan la reducción de OpenAI del 31 de julio de 2026. Los precios de Qwen corresponden a la tarifa GA y sustituyen al descuento de vista previa de julio.

Las especificaciones y el precio, lado a lado

Aquí están los datos concretos, cada cifra atribuida a su fuente.

• Fabricante / estado — Qwen3.8-Max: Alibaba; GA (3 de agosto de 2026); GPT-5.6 Sol: OpenAI; modelo insignia cerrado (variantes Sol / Terra / Luna)

• Arquitectura — Qwen3.8-Max: ~2.4T en total, MoE dispersa (parámetros activos aún no revelados); GPT-5.6 Sol: cerrado; arquitectura no revelada

• Ventana de contexto — Qwen3.8-Max: 1M tokens (983,616 con razonamiento; salida máxima 131,072); GPT-5.6 Sol: buque insignia de contexto largo

• AA Intelligence Index — Qwen3.8-Max: Aún sin puntuar; GPT-5.6 Sol: ~59 — #2 (Artificial Analysis)

• Fortalezas auditadas — Qwen3.8-Max: ninguna de terceros; GPT-5.6 Sol: lidera los problemas STEM más difíciles (Artificial Analysis)

• Fortalezas reportadas por el proveedor — Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (reportado por Alibaba); GPT-5.6 Sol: n/a

• Velocidad — Qwen3.8-Max: p50 TTFT 1.64s (telemetría de 7 días de OrcaRouter); el modelo más lento en las pruebas prácticas de la vista previa; GPT-5.6 Sol: Hasta 750 tok/s en Cerebras (Artificial Analysis)

• Precios (entrada / salida) — Qwen3.8-Max: $2.00 / $6.00 por 1M, precio fijo; entrada en caché $0.25; GPT-5.6: Terra $2 / $12, Luna $0.20 / $1.20, Sol premium (~1/3 del costo de Fable por AA)

• Pesos abiertos — Qwen3.8-Max: Prometido dentro de la semana (aún sin licencia); GPT-5.6: No — cerrado / solo API

Dos cosas enmarcan esta comparación, y ambas son nuevas desde julio.

Primero, la historia de los precios se volvió genuinamente interesante en lugar de simplemente barata. En julio, la ventaja de Qwen era un descuento imposible de presupuestar. Ahora la comparación es concreta y se divide por niveles. Frente a Terra a $2 / $12, Qwen iguala exactamente la tarifa de entrada y reduce a la mitad la tarifa de salida — una ventaja real para trabajos de alto razonamiento donde la salida domina el gasto. Frente a Luna a $0,20 / $1,20, Qwen es 10× más caro, y Luna es la mejor opción para tareas simples de gran volumen. Frente a Sol, Qwen es mucho más barato. Así que «cuál es más barato» ahora tiene tres respuestas diferentes dependiendo de a qué GPT-5.6 te refieras — y el encuadre honesto es que el recorte del 31 de julio de OpenAI redujo considerablemente la brecha.

En segundo lugar, la fila de velocidad sigue siendo donde estos dos divergen más, y sigue favoreciendo a OpenAI. Artificial Analysis cronometra GPT-5.6 Sol a una velocidad de hasta 750 tokens por segundo en silicio de Cerebras. Nada en los materiales de GA de Alibaba sugiere que Qwen3.8-Max esté diseñado para ese tipo de rendimiento, y el revisor de la época de vista previa que lo llamó el modelo más lento que había usado estaba midiendo exactamente las ejecuciones agénticas largas donde el rendimiento se acumula. Si tu carga de trabajo es interactiva, agéntica o de alto volumen, esa brecha puede decidir el enfrentamiento antes de que la calidad entre en la conversación.

Prueba: qué resuelve y qué no resuelve la tabla de benchmarks de GA

La decisión de Alibaba de publicar cifras en la GA es una mejora real con respecto a la vista previa, donde la afirmación de la comunidad de estar "por delante de GPT-5.6" no se basaba en nada publicado en absoluto. La tabla es sólida: GPQA Diamond 92.6 en ciencia a nivel de posgrado, PaperBench 93.0 sobre la reproducción de resultados de investigación, Terminal-Bench 2.1 86.6 sobre operar un shell real, OSWorld-Verified 86.1 sobre el manejo de una GUI de escritorio. El salto generacional en programación es lo más destacado — FrontierSWE 73.5 contra el 40.7 de su predecesor, y DeepSWE 1.1 56.6 contra 21.6.

Lo que la tabla no hace es resolver la comparación de GPT-5.6, por dos razones.

El primero es la procedencia. Cada cifra fue producida por Alibaba en su propio banco de pruebas. Las tablas de los proveedores se eligen, no se muestrean: un laboratorio publica los benchmarks donde queda bien y omite el resto. La posición #2 de OpenAI en el Intelligence Index, en cambio, fue asignada por un evaluador sin interés en el resultado. Cabe destacar que Artificial Analysis atribuye específicamente a GPT-5.6 Sol el liderazgo en los más difíciles problemas STEM, que es precisamente el territorio que el GPQA Diamond 92.6 de Qwen pretende reclamar. Una de esas afirmaciones ha sido verificada.

El segundo es que la cifra más débil de la propia Alibaba es reveladora. IFBench 82.8 —seguimiento de instrucciones bajo restricciones— es la puntuación más baja de su tabla, y coincide exactamente con la crítica más consistente de la era de vista previa: el modelo entrega en exceso, se sale del alcance y añade cosas que nadie pidió. Eso es encantador en una demo y costoso cuando la salida se factura a $6 por millón de tokens y necesitas un formato exacto. Para pipelines agénticos donde los pasos posteriores parsean la salida, la disciplina de seguimiento de instrucciones importa más que un punto de GPQA.

Para anclar: el predecesor Qwen3.7-Max obtuvo 46 en el Índice de Inteligencia AA frente a los ~59 de GPT-5.6 Sol. Cerrar trece puntos en una generación sería un salto extraordinario. Posible —la propia FrontierSWE de Alibaba, casi duplicándose, sugiere progreso real—, pero hasta que un árbitro publique una cifra, «por delante de GPT-5.6» sigue siendo una afirmación no probada, no un resultado.

El costo en la práctica: un ejemplo desarrollado en todos los niveles

Considere un agente de razonamiento que envía 100,000 tokens de contexto y genera 10,000 tokens de salida por llamada: una forma típica de análisis de documentos o planificación de múltiples pasos.

Qwen3.8-Max: 0.1M × $2 = $0.20, más 0.01M × $6 = $0.06. ≈ $0.26 por llamada.

GPT-5.6 Terra: 0,1M × $2 = $0,20, más 0,01M × $12 = $0,12. ≈ $0,32 por llamada.

GPT-5.6 Luna: 0.1M × $0.20 = $0.02, más 0.01M × $1.20 = $0.012. ≈ $0.03 por llamada.

• A 5,000 llamadas/día: Qwen ≈ $1,300, Terra ≈ $1,600, Luna ≈ $160.

De esto se desprenden dos lecciones. Contra Terra, el ahorro de Qwen es real pero modesto —en torno al 19% en esta configuración— y no se acerca ni de lejos a la ventaja de un orden de magnitud que Qwen disfruta frente a modelos premium como Fable 5 o Sol. Cualquiera que asumiera que OpenAI era estructuralmente caro debería actualizar esa idea: el recorte del 31 de julio hizo la mayor parte del trabajo para neutralizar la propuesta de precios de Qwen en la gama media.

Donde Qwen se destaca claramente es el contexto largo y el almacenamiento en caché. Debido a que la tarifa de $2/$6 es plana en toda la ventana de 1M tokens, un prompt de 900,000 tokens cuesta lo mismo por token que uno corto, mientras que muchos competidores recargan las entradas largas. Y la entrada en caché a $0.25 por 1M reduce el lado de entrada en 8× en cargas de trabajo con contexto repetido: la llamada anterior baja de $0.26 a aproximadamente $0.09 una vez que el contexto está en caché. Si tu agente relee un contexto mayormente estable en cada turno, ahí es donde vive la ventaja duradera — no en la tarifa principal.

Apertura y el hermano 27B

GPT-5.6 nunca podrá autoalojarse. Qwen3.8-Max podría serlo — Alibaba ahora dice que los pesos llegan dentro de la semana — pero el buque insignia no es un objetivo práctico: aproximadamente 1,2 TB en 4 bits frente a unos 141 GB por H200 significa ocho o más aceleradores de gama alta, y con el recuento de parámetros activos aún sin revelar, ni siquiera se puede modelar el rendimiento que eso compra. Tampoco hay todavía texto de licencia, lo que significa que la usabilidad comercial está formalmente indeterminada.

El simultáneamente anunciado Qwen3.8-27B es el lanzamiento más importante para quienes su interés en Qwen se centra en el control y no en la capacidad bruta. También con pesos abiertos, se informa que corre en aproximadamente 17GB de VRAM — una sola tarjeta de gama alta para consumo — lo que lo convierte en una opción genuina local (on-premise) de una forma que el buque insignia de 2.4T nunca lo será. Si estás comparando Qwen con GPT-5.6 porque necesitas residencia de datos, 27B es el modelo a evaluar.

Preguntas frecuentes

¿Es Qwen 3.8 mejor que GPT-5.6?

No según la evidencia existente. La tabla GA de Alibaba es sólida (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6), pero es completamente autodeclarada, y ningún evaluador independiente ha puntuado el modelo. GPT-5.6 Sol ostenta un Índice de Inteligencia #2 auditado (~59), lidera los problemas STEM más difíciles según Artificial Analysis y alcanza hasta 750 tokens/seg. GPT-5.6 gana en evidencia y velocidad.

¿Es cierta la afirmación "Qwen 3.8 está por delante de GPT-5.6"?

Comenzó como un sentimiento de la comunidad y sigue sin verificar. GA trajo la propia tabla de benchmarks de Alibaba, pero ninguna puntuación de terceros: Artificial Analysis y LMArena siguen sin puntuar. El predecesor Qwen3.7-Max obtuvo 46 frente a los ~59 de Sol, por lo que la afirmación necesita un salto generacional muy grande para sostenerse literalmente.

¿Cuál es más barato, Qwen 3.8 o GPT-5.6?

Depende del nivel, y la respuesta cambió el 31 de julio cuando OpenAI recortó los precios. Qwen3.8-Max cuesta $2 / $6 por 1M. GPT-5.6 Terra cuesta $2 / $12: el mismo precio de entrada, el doble de salida, así que Qwen gana ahí. Luna cuesta $0.20 / $1.20, lo que lo hace unas 10 veces más barato que Qwen. Sol es premium, así que Qwen es mucho más barato que Sol.

¿Cuál es más rápido?

GPT-5.6, decididamente en throughput. Artificial Analysis reporta hasta 750 tokens/seg en hardware de Cerebras. Qwen3.8-Max muestra un p50 de tiempo hasta el primer token de 1.64 segundos en la telemetría de 7 días de OrcaRouter, pero los revisores de la era de vista previa lo encontraron muy lento en builds agénticos largos — ese hallazgo es anterior al servicio de disponibilidad general y merece una nueva prueba.

¿Qwen 3.8 Max salió de la vista previa?

Sí, el 3 de agosto de 2026. Ahora tiene una tarifa publicada y un endpoint compatible con OpenAI y DashScope, por lo que el encuadre de julio de una campaña de créditos de Qoder con un 90 % de descuento ya no describe cómo se vende.

¿Puedo autoalojar Qwen 3.8 para evitar los precios de OpenAI?

No es el modelo insignia, siendo realistas. Se prometen los pesos dentro de la semana, pero no se ha publicado ninguna licencia, y con ~1,2 TB en 4 bits necesitarías ocho o más GPUs de clase H200. El Qwen3.8-27B, anunciado simultáneamente y que según se informa requiere ~17 GB de VRAM, es la opción práctica.

¿Cuál debería usar hoy?

GPT-5.6 Sol para cualquier cosa sensible a la latencia, interactiva o crítica para el razonamiento donde la calidad auditada importa. Luna para tareas simples de alto volumen, donde es la más barata por un amplio margen. Qwen3.8-Max donde el contexto largo y el almacenamiento en caché de prompts dominan tu factura: su tarifa plana de 1M de tokens y los $0.25 de entrada en caché son las partes más fuertes de su oferta.

En resumen

Qwen 3.8 vs GPT-5.6 es un enfrentamiento más justo que en julio, y algo menos unilateral en cuanto al precio de lo que los fans de Qwen esperaban. Qwen3.8-Max llegó a GA con precios reales, una tabla de benchmarks autodeclarada y creíble, y una tarifa plana de 1M de tokens además de un caché económico que lo hacen genuinamente atractivo para trabajo de contexto largo. Esas son ventajas estructurales, no promocionales.

Pero el recorte de precios del 31 de julio de OpenAI debilitó el argumento del costo en el nivel intermedio: Terra ahora iguala a Qwen en entrada — y GPT-5.6 todavía posee las dos propiedades decisivas: un ranking #2 auditado por un evaluador sin interés en el resultado, y un rendimiento de hasta 750 tokens/seg que Qwen no ha demostrado siquiera acercarse. Vigila dos eventos: la primera puntuación independiente del Intelligence Index para Qwen3.8-Max, y la llegada de los pesos con una licencia. Hasta entonces, enruta según la forma: GPT-5.6 cuando importan la velocidad y la prueba, Qwen cuando la longitud de contexto y los aciertos de caché dominan la factura, y verifica con tus propios prompts.

Comparados en este artículo4

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube