
GPT-6 vs Qwen 3.8 Max: uno acepta video, el otro escribe más largo
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
GPT-6 Sol y Qwen3.8 Max cobran la misma tarifa de entrada —2,00 USD por millón de tokens, ambos— y luego divergen en dos ejes que una tabla de precios por sí sola no deja ver. Qwen3.8 Max, disponible de forma general desde el 3 de agosto de 2026, es el único de los dos que acepta video: sus modalidades de entrada son texto, imagen y video, mientras que GPT-6 Sol admite texto, imagen y archivo. GPT-6 Sol, que el proveedor lanzó el 22 de septiembre de 2026, es el único de los dos con un límite máximo de salida publicado, 128.000 tokens, y el único con una superficie de consumo detrás: el despliegue del 7 de octubre en ChatGPT que puso el modelo ante más de 1200 millones de usuarios semanales.
Así que la cuestión de clasificación no es cuál es más fuerte. Es si tu entrada es video y si tu salida es larga.
El video es la primera bifurcación
La mayoría de las comparaciones de modelos se reducen a precio y benchmark, y esta tiene una diferencia estructural contundente que deja esos factores en segundo plano. Si tu pipeline ingiere video —metraje de vigilancia, reuniones grabadas, material deportivo o de conferencias, reels de demostración de productos—, Qwen3.8 Max puede tomar el clip dentro de la solicitud. Su ficha enumera el video como una modalidad de entrada junto con texto e imagen, hasta la ventana de un millón de tokens, lo que para video significa muestreo de fotogramas más transcripción en una sola llamada en lugar de una etapa de extracción separada. GPT-6 Sol no puede. Sus modalidades son texto, imagen y archivo; no hay entrada de video en la ficha, y ninguna cantidad de ingeniería de prompts lo sustituye.
Esa única línea decide la preselección para un pipeline de vídeo, y no se ve en una tarjeta de tarifas. Donde los dos modelos son verdaderamente intercambiables es en el trabajo de texto e imagen, y ahí es donde se aplica la comparación de precios y benchmarks que aparece a continuación.
Una nota de honestidad sobre la afirmación del video: la modalidad está documentada, pero el esquema no. Ninguno de los dos proveedores detalla en la entrada de su catálogo la resolución, la velocidad de fotogramas ni los límites de duración de los clips, así que «admite video» significa que el tipo de entrada existe, no que cualquier clip en particular vaya a ingerirse con la calidad que necesitas. Pruébalo con tu propio material antes de basarte en ello.
El lado de salida va al revés
Dale la vuelta a la solicitud y la ventaja se invierte. GPT-6 Sol publica un máximo de salida de 128.000 tokens por respuesta. La ficha de Qwen3.8 Max publica una ventana de contexto, pero ninguna cifra de salida máxima, así que un sistema que presupuesta contra un límite de salida estricto no puede deducirla de los datos del proveedor — la misma laguna que aparece en varias fichas de plataformas de alojamiento y que conviene tratar como desconocida en lugar de ilimitada.
Lo que se publica es la asimetría de precios del lado de la salida, y es lo contrario de lo que cuenta la historia del video. Qwen3.8 Max cobra $6.00 por millón de tokens de salida frente a los $10.00 de GPT-6 Sol: un descuento del 40% en cada token que escribe el modelo. Una carga de trabajo intensiva en salida, como la generación de textos largos o la serialización de un gran artefacto estructurado, es considerablemente más barata en Qwen3.8 Max por unidad de trabajo, y eso es cierto independientemente de que el precio de entrada sea idéntico.
Ten en cuenta también que la ficha de Qwen3.8 Max incluye una única tarifa de entrada, sin un nivel de contexto largo documentado, mientras que GPT-6 Sol vuelve a tarificar toda la solicitud por encima de 272.000 tokens de entrada a $4.00 de entrada y $15.00 de salida. La página del modelo de OpenAI indica la regla explícitamente: los prompts por encima de ese umbral se cobran al doble de las tarifas de entrada y caché, y a 1,5 veces la de salida por toda la solicitud. Con un prompt de más de 272.000 tokens, la tarifa de entrada efectiva de GPT-6 Sol se duplica a $4.00, mientras que la de Qwen3.8 Max se mantiene en $2.00, invirtiendo de nuevo el aparente empate en la entrada.
Lo que dice la junta independiente
Artificial Analysis incluye ambos modelos, y el índice compuesto sitúa a GPT-6 Sol por delante, mientras que varias pruebas individuales van en la dirección opuesta. Todas las cifras que aparecen a continuación son del evaluador, no de un proveedor.
• Índice de Inteligencia: GPT-6 Sol 47,6; Qwen3.8 Max 45,4 — GPT-6 Sol va por delante por unos dos puntos
• Índice de programación: Qwen3.8 Max 76,2 con un puesto entre los diez primeros; el perfil de programación de GPT-6 Sol es comparable, pero la entrada de Qwen ocupa un puesto más alto
• GPQA Diamond: Qwen3.8 Max 92,8 %, la cifra de GPT-6 Sol es la más alta de las dos en la misma familia de pruebas
• Humanity's Last Exam: Qwen3.8 Max 43,1 %, GPT-6 Sol 47,9 %
• Recuperación en contexto largo: Qwen3.8 Max 80,3 %, GPT-6 Sol 83,7 %
• SciCode: Qwen3.8 Max 52,1 %, GPT-6 Sol 57,6 %
• Uso agéntico de herramientas: Qwen3.8 Max 88,8 % en terminal-bench v2.1 y 47,8 % en tau-banking, ambos sólidos
El patrón es que GPT-6 Sol gana en los compuestos de razonamiento general y en las pruebas de ciencia y recall, mientras que Qwen3.8 Max es el modelo más preciso para programación y uso de herramientas. Aplican dos advertencias, y no son decorativas. Primero, estos valores de índice se evaluaron en fechas distintas, así que dos puntos entre revisiones quedan dentro de la variación que produce una nueva ejecución, no constituyen una brecha consolidada. Segundo, las cifras publicadas de Qwen3.8 Max son las ejecuciones del evaluador sobre el modelo tal como lo sirve el endpoint de Alibaba, y el proveedor también lanzó una instantánea con fecha, Qwen3.8 Max (0902), el 2 de septiembre de 2026 a la misma tarifa de $2.00 / $6.00; si vas a fijar una instantánea, confirma cuál estás invocando antes de citar una puntuación.

Qué añade el lanzamiento de OpenAI del 7 de octubre
El lanzamiento de ChatGPT es un hecho de distribución más que un hecho de capacidad, pero cambia lo que un lector entiende por «GPT-6». El 7 de octubre de 2026, OpenAI comenzó a implementar GPT-6 en ChatGPT bajo la capacidad Intelligent UI, con la pestaña Chat llegando primero a Plus, Pro, Business y Enterprise, y Free y Go a partir del 8 de octubre; la disponibilidad para empresas depende de la configuración de administrador del lugar de trabajo. Los modelos que impulsan Work y Codex no se modificaron.
Dos detalles importan para esta comparación. La experiencia de ChatGPT funciona con GPT-6 Sol para los niveles de pago para consumidores, así que el GPT-6 que conocen más de mil millones de personas es el mismo modelo que se invoca a través de la API, no un checkpoint aparte. Y GPT-6 es una familia, no un único modelo: GPT-6 Astra se sitúa por encima de Sol a $10.00 / $50.00 y GPT-6 Luna por debajo, a $0.10 / $0.50. Cuando una comparación nombra «GPT-6» frente a Qwen3.8 Max sin decir qué nivel, normalmente se compara con Sol por defecto, y con Astra cuando quiere presentar el caso más sólido. Nombrar el nivel es la diferencia entre una comparación justa y una retórica.
Costo, medido sobre formas en lugar de tasas
Debido a que las tarifas de entrada empatan y las de salida divergen, el ganador depende enteramente de la proporción entre tokens de entrada y tokens de salida. Calculado según las tarifas publicadas de cada proveedor, excluyendo el almacenamiento en caché:
• Análisis de video y transcripción (500K de entrada, 6K de salida): Qwen3.8 Max ≈ $1.04, GPT-6 Sol no aplicable — sin entrada de video
• Análisis de documentos (250K de entrada, 5K de salida): Qwen3.8 Max ≈ $0.53, GPT-6 Sol ≈ $0.55 antes de que se aplique su umbral de 272K, y más alto una vez que se recalcula el precio de toda la solicitud
• Generación de contenido extenso (40K de entrada, 80K de salida): Qwen3.8 Max ≈ $0.56, GPT-6 Sol ≈ $0.88
• Bucle agéntico equilibrado (60K de entrada, 20K de salida): Qwen3.8 Max ≈ $0.24, GPT-6 Sol ≈ $0.32
La forma del resultado es estable: Qwen3.8 Max es el modelo más económico para la misma combinación de tokens, ya que la tarifa de entrada empata y la de salida es menor. La contrapropuesta de GPT4 Sol no es en absoluto el precio: es el compuesto de razonamiento, la validación en la superficie del consumidor y un techo de salida que hace que la planificación presupuestaria sea sencilla.
Una salvedad operativa que vale la pena señalar porque las fichas no lo hacen. Medido en el playground de OrcaRouter durante la primera semana de octubre de 2026, la ruta de Qwen3.8 Max mostró una latencia mediana del primer token de unos 5.809 ms y aproximadamente 50 tokens de salida por segundo, con una tasa de error baja; la ruta de GPT-6 Sol en la misma ventana midió un rendimiento más rápido, pero una tasa de error considerablemente más alta. Estas son observaciones de rutas compartidas, no SLA de proveedores, y cambian de una semana a otra —lo que justifica medir tu propio tráfico en lugar de confiar en la ficha de ninguno de los dos modelos.
Ejecutando ambos bajo una sola clave
La respuesta realista para un equipo que tiene trabajo de vídeo por un lado y trabajo con gran carga de razonamiento por el otro es que ningún modelo gana de forma absoluta y ambos pertenecen al stack. Para eso sirve una pasarela. En OrcaRouter tanto qwen/qwen3.8-max como GPT-6 Sol son rutas activas en el mismo catálogo tras una única API compatible con OpenAI, al precio de lista del proveedor con un 0 % de recargo —de modo que un cambio de precio de Alibaba u OpenAI te llega el mismo día en lugar de en tu siguiente conciliación de facturas, y no hay un conjunto de credenciales ni una ruta de SDK independientes por proveedor.
Dos funciones hacen un trabajo específico aquí. La conmutación por error automática mantiene vivo un pipeline cuando la ruta de un proveedor se degrada, lo cual importa directamente dado lo diferente que se comportaron esas dos rutas en la misma ventana de medición. Y el DSL de enrutamiento permite que la solicitud decida: enviar cualquier cosa que lleve una entrada de video a Qwen3.8 Max, enviar el trabajo de razonamiento de contexto largo a GPT-6 Sol, y dejar que un predicado sobre la modalidad de entrada y el tamaño de la solicitud tome la decisión en lugar de un id de modelo codificado de forma fija que hay que cambiar a mano cuando el tráfico cambia.

La versión corta: si tus entradas incluyen video, Qwen3.8 Max es el único de los dos que puede aceptarlas, y es el modelo más barato en cualquier combinación de tokens una vez que tienes la solicitud. Si tu trabajo es razonamiento sobre texto e imágenes con necesidad de salidas largas y acotadas y un valor predeterminado de grado consumidor validado, GPT-6 Sol es la carta más fuerte en el índice compuesto y la que tiene un límite de salida documentado. Donde necesites ambos, enruta — y deja que la modalidad de la solicitud sea la clave de enrutamiento en lugar de un ciclo de lanzamiento.

Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
