Una tarjeta de título principal para un artículo que compara GPT-6 Sol con Qwen3.8-Max, que dice 'GPT-6 Sol vs Qwen3.8-Max' con el subtítulo 'La única línea en la que el modelo cerrado no puede competir', y que muestra GPT-6 Sol como entrada de texto e imagen y Qwen3.8-Max como entrada de texto, imagen y vídeo.
Guides & Insights

GPT-6 Sol vs Qwen3.8-Max: la única línea donde el modelo cerrado no puede competir

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Casi todas las comparaciones entre GPT-6 Sol y Qwen3.8-Max se decidirán por el costo, y casi todas se equivocarán con el costo en la misma dirección. Qwen3.8-Max, el buque insignia alojado del proveedor, tiene un precio de $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida desde su disponibilidad general del 3 de agosto de 2026, con la instantánea fechada Qwen3.8-Max-0902 que llegó el 2 de septiembre. GPT-6 Sol alcanzó disponibilidad general el 22 de septiembre de 2026 a $2.00 de entrada y $10.00 de salida. Idéntico precio de entrada, y una salida 40% más barata en la tarifa de Qwen3.8-Max — y, en el arnés independiente, aproximadamente cinco veces el costo de completar una tarea.

Pero hay una segunda diferencia más nítida que el argumento de costes no deja de enterrar, y es la que de verdad decide algunas cargas de trabajo. Qwen3.8-Max acepta vídeo. GPT-6 Sol no. Eso no es una línea de precio ni una línea de benchmark; es una capacidad que uno de estos modelos tiene y que el otro no puede ni aproximar, y es la única parte de esta comparación que ninguna cantidad de trabajo de eficiencia de tokens arreglará.

A six-row scoreboard card titled 'GPT-6 Sol vs Qwen3.8-Max - the scoreboard', comparing the two models on output price, Intelligence Index, cost per task, input modality, maximum output and long-context handling. The left column lists GPT-6 Sol at $10.00 output, an Index of 48, $1.06 per task, text and image input, a 128,000-token maximum output and whole-request repricing above 272K; the right column lists Qwen3.8-Max at $6.00 output, an Index of 45, $5.41 per task, text, image and video input, a 131,072-token maximum output and a flat tier above 272K. A footer reads 'Vendor list rates; Index per Artificial Analysis.'

Dos buques insignia, dos formas diferentes

Qwen3.8-Max es un modelo disperso de mezcla de expertos de 2,4 billones de parámetros, con aproximadamente 95.000 millones de parámetros activos por consulta: el segundo modelo alojado más grande en producción, solo por detrás de Kimi K3. Su ventana de contexto es de un millón de tokens, con un límite de salida de 131.072 tokens; sus modalidades de entrada son texto, imagen y vídeo, y admite esfuerzo de razonamiento en niveles bajo, medio y extraalto, junto con salidas estructuradas y llamadas a herramientas. El modelo insignia alojado no tiene pesos abiertos; el artefacto descargable de la misma generación es una publicación aparte con sus propias limitaciones.

GPT-6 Sol recibe texto e imágenes y devuelve texto. Su ventana es de 1,050,000 tokens, con un máximo de entrada de 922,000 tokens y un límite de salida de 128,000 tokens, con un precio de tarifa plana de $2.00 y $10.00, una lectura en caché de $0.20 y escrituras en caché de $2.50, y el precio de toda la solicitud se recalcula a $4.00 y $15.00 por encima de 272,000 tokens de entrada. Es cerrado, de identificador único, y OpenAI ha descrito las tarifas como permanentes en lugar de promocionales.

Las cifras de la ventana están dentro de aproximadamente un 7% entre sí, y los techos de salida se encuentran en la misma banda. La lista de modalidades es la única brecha estructural — y va en una sola dirección.

Línea por línea

• Entrada — GPT-6 Sol: 2,00 USD por millón de tokens vs. Qwen3.8-Max: 2,00 USD por millón de tokens; la cifra destacada es idéntica

• Salida — GPT-6 Sol $10.00 por millón de tokens frente a Qwen3.8-Max $6.00 por millón de tokens; la tarifa de Alibaba es 40% más baja

• Entrada en caché — GPT-6 Sol $0.20 por millón de tokens frente a Qwen3.8-Max $0.25 por millón de tokens para lecturas de caché implícitas, con una lectura de caché explícita a $0.17 y una escritura de caché explícita a $2.50

• Ventana de contexto — GPT-6 Sol 1.050.000 tokens vs Qwen3.8-Max 1.000.000 tokens

• Salida máxima — GPT-6 Sol 128.000 tokens vs Qwen3.8-Max 131.072 tokens

• Modalidades de entrada — texto e imagen de GPT-6 Sol frente a texto, imagen y video de Qwen3.8-Max

• Gestión de contexto largo — GPT-6 Sol vuelve a tarificar toda la solicitud por encima de 272.000 tokens de entrada a 2× las tarifas de entrada y de caché, y 1,5× la de salida, frente a Qwen3.8-Max, que aplica una tarifa plana en toda la ventana; este es el único punto en el que la tabla de tarifas de Qwen es estructuralmente mejor, y no solo marginalmente más barata

• Esfuerzo de razonamiento — GPT-6 Sol ninguno, bajo, medio (predeterminado), alto, xalto, máximo vs Qwen3.8-Max bajo, medio y extra alto

• Fecha de corte del conocimiento — GPT-6 Sol 20 de abril de 2026 vs Qwen3.8-Max, no publicada como una fecha única

• Instantánea fechada — GPT-6 Sol un único identificador móvil frente a Qwen3.8-Max-0902 disponible como revisión fijada del 2 de septiembre de 2026 al mismo precio

La línea de contexto largo merece más atención de la que suele recibir. El recargo de GPT-6 Sol es un escalón que se aplica a toda la solicitud, así que una ejecución de agente de 900,000 tokens se factura a $4.00 y $15.00 por cada token. Qwen3.8-Max cobra un solo tramo en toda la ventana. Para una carga de trabajo que vive por encima de 272,000 tokens, las dos tarifas dejan de ser comparables por completo: el modelo más barato según el titular es el más caro por un amplio margen, y la dirección de la diferencia depende enteramente de dónde se sitúe tu contexto.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured 23 September 2026, showing an Intelligence Index score of 45, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a cost of $5.41 per Intelligence Index task, 190 million output tokens generated during the index run, a 984,000-token context window and 39.2 output tokens per second.

La tarjeta de tarifas dice un 40% más barato. El arnés dice cinco veces la factura.

Artificial Analysis midió Qwen3.8-Max-0902 con una puntuación de 45 en el Intelligence Index, con un coste de $5.41 por tarea de índice completada, tras haber generado 190 millones de tokens de salida durante la ejecución. Su resumen describe el modelo como «notablemente lento y muy verboso». GPT-6 Sol obtuvo 48 a $1.06 por tarea con 77 millones de tokens de salida.

Lee esos tres pares en conjunto y aparece la forma del enfrentamiento. Qwen está tres puntos de índice por detrás, generó dos veces y media la cantidad de tokens y costó alrededor de cinco veces más por tarea completada — con una tarifa en la que su salida es 40% más barata. El mecanismo no es sutil. A $6.00 por millón de tokens de salida, 190 millones de tokens cuestan $1.14 por ejecución de índice solo en salida, antes de contar la entrada; a $10.00 por millón, los 77 millones de Sol cuestan $0.77. La tarifa más barata está comprando más tokens, no una factura más pequeña.

Este es el mismo patrón que aparece en todo el panorama de septiembre, y vale la pena formularlo como una regla más que como un hecho sobre estos dos modelos: en una tabla de tarifas por token, un descuento del 40 % en los tokens de salida no sirve de nada si el modelo emite dos veces y media más tokens. El costo por tarea completada es la única cifra que sobrevive.

Lo que Alibaba publicó y el problema de determinar el esfuerzo

La propia tabla de benchmarks de Alibaba es la más larga de esta comparación y la menos comparable. Las cifras reportadas por el proveedor sitúan a Qwen3.8-Max por delante en PaperBench e IFBench, pero por detrás en SWE-bench Pro y Humanity's Last Exam, con una escala de esfuerzo de razonamiento —bajo, medio, extra alto— que no tiene una correspondencia directa con la escala de seis niveles de OpenAI. Una puntuación publicada en el nivel extra alto no es el mismo producto que una puntuación publicada en el nivel medio, y ninguno de los proveedores indica cuál de ellos produjo una cifra determinada en un gráfico comparativo.

Esa es la razón honesta para no basarse en la tabla de ninguno de los dos proveedores aquí. Los números de Alibaba se ejecutan en el harness de Alibaba con el ajuste de esfuerzo de Alibaba; los de OpenAI se ejecutan en los de OpenAI. Las cifras de Artificial Analysis existen precisamente porque ambas son inutilizables como comparación directa, y son las que se usan arriba.

La reproducibilidad es una característica real, y su precio es cero

La instantánea con fecha es la línea más subestimada de esta comparación. Qwen3.8-Max-0902 es una revisión fijada del 2 de septiembre de 2026 que, según Alibaba, tiene las mismas capacidades y precios que el modelo base. Fijarla significa que el modelo detrás de tu endpoint no cambia bajo tus pies entre un martes y un jueves.

GPT-6 Sol no tiene equivalente. Es un único identificador rotativo —la misma página del modelo incluye una instantánea predeterminada y ninguna variante con fecha—, lo que significa que lo que evaluaste en septiembre no tiene garantía de ser lo que estás llamando en noviembre. Para la mayoría de los equipos, eso está bien. Para una canalización regulada que tiene que demostrar qué produjo una salida, es una diferencia real, y es una que Alibaba regala gratis mientras que OpenAI no la ofrece en absoluto.

La línea de video es la que decide

Todo lo anterior es una comparación. Esta parte no lo es. Si tu entrada incluye video —grabaciones de pantalla, metraje de inspección, capturas de clases, cualquier cosa en la que la información esté en movimiento en lugar de en un fotograma fijo—, Qwen3.8-Max lo acepta de forma nativa y GPT-6 Sol no tiene ninguna forma de acceder a él. No puedes sortear una modalidad a base de prompts. No puedes preprocesar un video convirtiéndolo en imágenes y obtener lo mismo, porque la información temporal es lo esencial, y ninguna cantidad de puntos de índice en un benchmark de texto puede sustituir a la entrada que tu tarea realmente requiere.

También vale la pena mencionar el caso inverso, porque es donde la comparación deja de ser desigual. Si tu entrada es texto e imágenes, Sol cuesta menos por tarea, está cuatro puntos por delante en la tabla neutral y cuesta menos en lecturas en caché. La capacidad de vídeo no es un desempate a tu favor; simplemente no se utiliza.

Enrutar una decisión que tiene dos respuestas separadas

Screenshot of OrcaRouter's model page for Qwen3.8 Max (0902), captured 23 September 2026, showing the model id qwen/qwen3.8-max-0902 from provider Qwen, a 1M-token context window with a 131k-token maximum output, text, image and video input with text output, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, and a p50 time to first token of 3.50 seconds.

Este es un caso en el que la arquitectura correcta es genuinamente dos modelos, no uno, y la razón es que la división se hace por modalidad de entrada y no por dificultad. Un pipeline que ingiere video y razona sobre texto necesita ambos, y la regla de enrutamiento es una propiedad de la solicitud, no una decisión de criterio.

Qwen3.8-Max está en el catálogo de OrcaRouter — la instantánea fechada qwen/qwen3.8-max-0902 es enrutable al precio de lista de Alibaba bajo el modelo de traspaso, lo que significa que un cambio de tarifa de Alibaba está activo de nuestro lado el mismo día en lugar de después de que un revendedor renegocie. GPT-6 Sol no está en nuestro catálogo a la fecha de este escrito y es accesible a través de la propia API de OpenAI. El DSL de enrutamiento es la pieza que encaja en este caso concreto: una regla que envía las solicitudes que incluyen vídeo por un lado y todo lo demás por otro es exactamente para lo que sirve, y la conmutación automática por fallo hace que la rama por modalidad no se convierta en el único punto de fallo.

Dónde gana cada uno

• Video de entrada, texto de salida — Qwen3.8-Max, y no hay competencia que describir.

• Entrada de texto e imagen, coste por tarea completada como métrica — GPT-6 Sol, por unas cinco veces en el banco de pruebas independiente.

• Trabajo de prefijo en caché — GPT-6 Sol. Su lectura en caché es ligeramente más barata y su volumen de tokens es menos de la mitad.

• Solicitudes de más de 272.000 tokens de entrada — Qwen3.8-Max. La repreciación de la solicitud completa de Sol es la mayor diferencia de coste en esta comparación, y resulta invisible en las tarifas anunciadas.

• Fijación reproducible — Qwen3.8-Max-0902, que no cuesta nada extra y es la única revisión fijada de las dos.

• Si te mostraron un gráfico con Qwen por delante en SWE-bench Pro, comprueba qué harness lo generó y con qué nivel de esfuerzo. La clasificación independiente sitúa a Qwen tres puntos por detrás en la puntuación compuesta, y las tablas de los proveedores no comparten la misma escala entre sí.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario