Tarjeta de título principal generada con el titular «GPT-6 Luna vs Qwen3.8-Max», el subtítulo «El modelo más barato de aquí no es el que ve vídeo», un pie de página que dice «Precios según OpenAI y Alibaba Cloud; cifras de índice según Artificial Analysis.», y el logotipo de OrcaRouter compuesto en la esquina inferior derecha.
Guides & Insights

GPT-6 Luna vs Qwen3.8-Max: El modelo más barato de esta comparación también es el único que ve vídeo.

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El planteamiento obvio para esta comparación es el equivocado. Qwen3.8-Max tiene un precio de lista de $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida, con lecturas de caché a $0.25. GPT-6 Luna tiene un precio de lista de $0.10 y $0.50, con lecturas de caché a un centavo. Veinte veces en entrada, doce veces en salida, cincuenta veces en entrada en caché — una brecha de precios tan amplia que la comparación parece resuelta antes de empezar.

No está resuelto, porque los dos modelos no compiten por la misma solicitud. Qwen3.8-Max acepta texto, imagen y video, y su límite de salida de 131,072 tokens está ligeramente por encima de los 128,000 de GPT-6 Luna. GPT-6 Luna solo acepta texto e imagen. El modelo de Alibaba obtiene 58 en el índice independiente Intelligence Index —el primero de su clase en la tabla agéntica— y GPT-6 Luna obtiene 37 con el máximo esfuerzo, 29 en su configuración predeterminada. Uno es un buque insignia con un linaje de pesos abiertos y una modalidad de entrada de video. El otro es una gama de volumen con una cifra de velocidad y una tarifa de caché de un centavo. La diferencia de precio no es un descuento sobre lo mismo; es una descripción de dos cosas diferentes.

Qué es cada uno de estos dos

Qwen3.8-Max es el buque insignia de Alibaba de la generación 3.8, un checkpoint de clase Max cuyo modelo subyacente —Qwen3.8-2.4T-A95B— se publicó públicamente bajo una licencia personalizada el 12 de agosto de 2026, lo que lo convierte en el primer Qwen de clase Max en tener pesos abiertos. El propio buque insignia alojado sigue clasificado como propietario por el consejo independiente. Cuenta con una ventana de contexto de 1.000.000 de tokens, un límite de salida de 131.072 tokens, entrada de texto, imagen y vídeo, y esfuerzo de razonamiento seleccionable entre bajo, medio y extraalto. Una revisión fijada Qwen3.8-Max-0902 está disponible al mismo precio, un pequeño detalle con valor operativo real.

GPT-6 Luna es el nivel de eficiencia de OpenAI del 22 de septiembre de 2026, situado por debajo de GPT-6 Sol a $2.00/$10.00 y del buque insignia GPT-6 Astra a $10.00/$50.00. Entrada de texto e imagen, salida de texto, una ventana de 1.050.000 tokens con 922.000 de entrada máxima, un límite de salida de 128.000 tokens, y esfuerzo desde none hasta low, medium, high, xhigh y max, con medium como predeterminado. Cerrado, de identificador único, disponible para cualquiera con una clave de API.

Uno acepta video y puede descargarse en su forma base. Otro acepta imágenes y es rápido. Ambos tienen un precio pensado para usarse en volumen. La superposición entre esas dos afirmaciones es menor de lo que sugiere la relación de precios.

Las tarjetas, línea por línea

Una línea por dimensión, ambos lados en cada una:

• Entrada por 1M — GPT-6 Luna $0.10 vs Qwen3.8-Max $2.00

• Salida por 1M — GPT-6 Luna $0.50 vs Qwen3.8-Max $6.00

• Entrada en caché por 1M — GPT-6 Luna $0.01 vs. Qwen3.8-Max $0.25 para lecturas de caché implícitas, con una lectura de caché explícita a $0.17 y una escritura de caché explícita a $2.50

• Cláusula de contexto largo — GPT-6 Luna duplica la entrada y la caché y eleva la salida 1,5× por encima de 272.000 tokens de entrada, aplicado a toda la solicitud, frente a Qwen3.8-Max, un nivel plano en toda la ventana, que es el único punto en el que la tarjeta de Qwen es estructuralmente mejor en lugar de marginalmente más barata

• Ventana de contexto — GPT-6 Luna 1.050.000 tokens vs Qwen3.8-Max 1.000.000 tokens

• Salida máxima — GPT-6 Luna 128.000 tokens vs Qwen3.8-Max 131.072 tokens

• Modalidades de entrada — GPT-6 Luna texto e imagen frente a Qwen3.8-Max texto, imagen y video

• Esfuerzo de razonamiento — GPT-6 Luna ninguno, bajo, medio (predeterminado), alto, xhigh, max vs. Qwen3.8-Max bajo, medio y extra-alto

• Índice de Inteligencia, independiente — GPT-6 Luna 37 con esfuerzo máximo vs Qwen3.8-Max 58

• Agentic Index, independiente — Qwen3.8-Max 58, el primero de su clase; no se ha publicado ninguna cifra comparable de GPT-6 Luna

• Puntuación de esfuerzo predeterminado — GPT-6 Luna 29 en su nivel medio predeterminado vs Qwen3.8-Max medido en su configuración máxima

• Coste por tarea de Index, de forma independiente — GPT-6 Luna aproximadamente $0.07 frente a Qwen3.8-Max $5.41

• GDPval, independiente — Qwen3.8-Max 1,739 Elo a 64 turnos por tarea, lo que equivale a aproximadamente $1.14 por tarea completada en esa evaluación; no se ha publicado ninguna ejecución comparable de GPT-6 Luna

• Tasa de alucinación en AA-Omniscience — Qwen3.8-Max 40%, una regresión respecto al 23% de la generación anterior; GPT-6 Luna 77%, por debajo del 93%

• Instantánea fechada — GPT-6 Luna un único identificador dinámico frente a Qwen3.8-Max-0902 disponible como una revisión fijada del 2 de septiembre de 2026 al mismo precio

• Pesos — GPT-6 Luna cerrado, solo API frente a Qwen3.8-Max, el checkpoint base Qwen3.8-2.4T-A95B público bajo una licencia personalizada desde el 12 de agosto de 2026, mientras que la versión insignia alojada figura como propietaria

• En OrcaRouter — GPT-6 Luna no está en nuestro catálogo frente a Qwen3.8-Max, enrutable al precio de lista de Alibaba

Generated two-column scoreboard titled 'GPT-6 Luna vs Qwen3.8-Max - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index 37 at max effort, Context 1,050,000, Input text + image, Cost per index task $0.07. Right column Qwen3.8-Max rows: Price in/out $2.00 / $6.00, Cached input $0.25, AA Index 58, Context 1,000,000, Input text + image + video, Cost per index task $5.41. Footer: 'Prices per OpenAI and Alibaba Cloud; index figures per Artificial Analysis.'

El video no es una línea de características, es una carga de trabajo diferente.

La fila de modalidad es la que decide más comparaciones reales que la fila de precio, y por lo general se lee como una casilla de verificación.

Qwen3.8-Max acepta vídeo. GPT-6 Luna no. Si tu pipeline necesita razonar sobre una grabación de pantalla, una demo de producto, la grabación de una clase, el segmento de una cámara de seguridad o un recorrido por una interfaz, la comparación termina en esa línea y la diferencia de precio de veinte veces pasa a ser irrelevante: no estás eligiendo entre una opción cara y una barata, estás eligiendo entre una opción y ninguna opción. Extraer fotogramas y pasarlos como imágenes es un apaño, no un equivalente, y cualquiera que haya construido uno conoce la diferencia tanto en coste como en calidad.

Si su canal de datos es texto e imágenes, la línea de la modalidad permanece en silencio y la línea del precio toma la palabra. Esa es la división honesta, y vale la pena ser directo sobre en qué lado de ella se encuentra usted antes de leer cualquier otra cosa en esta página.

La brecha agéntica es real y es la mitad costosa de la diferencia de precio

Qwen3.8-Max obtiene 58 en el Intelligence Index independiente. GPT-6 Luna obtiene 37 con el máximo esfuerzo y 29 con su nivel medio predeterminado. Veintiún puntos con ajustes equivalentes, veintinueve con los valores predeterminados: en un compuesto donde un solo punto queda dentro del ruido de una repetición, una diferencia de ese tamaño no es ruido.

El posicionamiento de Qwen3.8-Max se concentra en el trabajo agéntico. Obtiene 58 en el Agentic Index independiente, el primero de su clase, y 1.739 de Elo en GDPval con 64 turnos por tarea. Esa última cifra es la reveladora, porque es una medición de un modelo manteniendo una tarea cohesionada a lo largo de sesenta y cuatro decisiones secuenciales, y viene con una etiqueta de precio adjunta: aproximadamente $1,14 por tarea completada en esa evaluación. Compárese con el costo por tarea índice de GPT-6 Luna, de unos $0,07, y la afirmación honesta no es que Qwen sea caro. Es que a Qwen se le está pidiendo hacer algo mucho más difícil, y lo está haciendo.

El corolario es que el déficit de veintiún puntos de GPT-6 Luna tampoco se distribuye de manera uniforme en tu carga de trabajo. En una tarea corta, bien especificada y consumida por programas —extrae este campo, clasifica este ticket, enruta esta solicitud—, ambos modelos producirán la misma respuesta utilizable casi siempre, y la brecha del índice será invisible en tu evaluación. En una tarea que requiere sesenta y cuatro acciones secuenciales con un punto de control al final, la brecha es la diferencia entre terminar y detenerse silenciosamente a mitad de camino, y esa es la tarea para la que se creó Qwen3.8-Max y para la que no se creó GPT-6 Luna.

Un dato apunta en sentido contrario y merece que se diga en vez de quedar enterrado. La tasa de alucinación de Qwen3.8-Max en el tablero de omnisciencia es del 40 %, frente al 23 % de la generación anterior: una regresión sustancial, y del tipo que se manifiesta como respuestas incorrectas pero seguras de sí mismas en producción, y no como una línea en un benchmark. La de GPT-6 Luna es del 77 %, frente al 93 %. Ambas cifras son altas en términos absolutos, y el modelo más barato sigue siendo el peor de los dos según esta medida. Ninguna de las dos cifras es motivo para preferir un modelo; ambas son motivos para mantener a una persona o a un verificador en el circuito en todo aquello donde un hecho inventado resulte costoso.

La cláusula de contexto largo es la única línea donde Qwen gana en estructura

GPT-6 Luna incluye una cláusula que Qwen3.8-Max no: las solicitudes de más de 272,000 tokens de entrada se facturan al doble de las tarifas de entrada y caché y a 1.5× la tarifa de salida, aplicado a toda la solicitud en lugar de solo a la parte que supera el límite. Una llamada de 300,000 tokens en GPT-6 Luna se factura a $0.20 por millón de entrada por los 300,000 tokens, porque se excedió por 28,000. Divide el mismo documento en dos llamadas y el costo se reduce a la mitad sin cambiar el prompt.

Qwen3.8-Max mantiene una tarifa plana a lo largo de toda su ventana de 1.000.000 de tokens. Para solicitudes individuales realmente enormes, eso hace que la brecha de doce veces en el precio de salida parezca menor de lo que es, y puede incluso invertirla: por encima de 272.000 tokens de entrada, la tarifa efectiva de entrada de GPT-6 Luna se duplica hasta $0,20, y su tarifa de salida sube hasta $0,75, frente a los $2,00 y $6,00 planos de Qwen. La brecha se reduce de veinte veces a diez en la entrada y de doce a ocho en la salida. Sigue siendo amplia — pero las cargas de trabajo con más probabilidades de tener un contexto de trabajo de 300.000 tokens son exactamente las agénticas a las que ambos proveedores están vendiendo, y los equipos que las ejecutan son los equipos que se darán cuenta.

La otra línea estructural es la revisión fijada. Qwen3.8-Max-0902 está disponible al mismo precio que el identificador móvil, lo que significa que un equipo que necesita un comportamiento reproducible a lo largo de una actualización del modelo puede tenerlo sin pagar un sobreprecio. GPT-6 Luna no ofrece nada equivalente. Eso es una línea pequeña en una lista de precios y una línea grande en un análisis post-mortem.

Ejecutar uno de ellos, o ambos

Qwen3.8-Max está en OrcaRouter al precio de lista de Alibaba, bajo el modelo de precios de traspaso que hace que un cambio de tarifa del proveedor esté activo en nuestro lado el mismo día. Dos cosas de nuestra capa de enrutamiento se ganan su lugar para este modelo en concreto: la conmutación por error automática, porque un modelo insignia alojado con una base de pesos abiertos publicada tiene más proveedores upstream que un modelo cerrado de un único proveedor y más formas de que uno de ellos se degrade; y el manejo de revisiones fijadas, que permite que una ruta mantenga Qwen3.8-Max-0902 de forma explícita en lugar de heredar lo que sea que resuelva el identificador móvil la próxima semana.

GPT-6 Luna no está en nuestro catálogo a la fecha de redacción y se accede a él a través de la propia API de OpenAI, así que un equipo que quiera ambos usa una clave para Qwen3.8-Max junto con la que ya use para OpenAI. Este es también el emparejamiento en el que el DSL de enrutamiento vale más que una división estática, porque el límite entre los dos modelos es una comprobación de modalidad y una comprobación de longitud en lugar de una preferencia: las solicitudes que incluyen vídeo van a Qwen3.8-Max porque ningún otro puede servirlas, las solicitudes que superan los 272.000 tokens de entrada van a Qwen3.8-Max porque el acantilado del otro modelo las hace más caras allí, y todo lo demás va al modelo que cuesta una vigésima parte del precio. Eso es una regla, y pertenece a la configuración, no a una rama de la aplicación.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

¿Cuál, y cuándo?

Elige Qwen3.8-Max si cualquiera de las siguientes condiciones es cierta. Tu pipeline necesita entrada de video. Tus solicitudes superan habitualmente los 272.000 tokens de entrada, donde su nivel de tarifa plana supera el reajuste de precios de GPT-6 Luna. Tu salida supera los 128.000 tokens. Tu trabajo es ejecución agéntica de largo horizonte con un punto final verificable, donde su 58 en la clasificación agéntica y sus 1.739 de Elo en GDPval a 64 turnos por tarea son la evidencia que importa. O necesitas una revisión fijada para la reproducibilidad y estás dispuesto a pagar por ella —lo que, al mismo precio que el identificador cambiante, significa que no lo estás.

Elige GPT-6 Luna si no aplica ninguno de esos casos y tu carga de trabajo es de gran volumen, consumida por programas, de texto e imágenes, y breve. Clasificación, extracción, enrutamiento, resumen masivo, el bucle interno de un agente que necesita una respuesta rápida en lugar de una cuidadosa. A $0,10/$0,50 con una lectura en caché de un centavo y un costo por tarea completada de alrededor de una quinceava parte del de Qwen3.8-Max, la aritmética no deja lugar a dudas. Configura el parámetro de esfuerzo de forma explícita —el valor predeterminado es medium y el 37 destacado es una cifra de esfuerzo máximo— y mantén las llamadas largas del lado correcto del límite de 272.000 tokens.

El error al que invita esta comparación es leer el precio de entrada veinte veces mayor como un veredicto. Es un veredicto sobre una única forma de carga de trabajo, y no dice nada sobre las tres líneas que deciden la otra: si la solicitud incluye video, si supera los 272.000 tokens y si la respuesta tiene que sobrevivir a sesenta y cuatro pasos secuenciales.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) showing the breadcrumb Home > Models > Qwen > Qwen3.8 Max (0902), a NEW badge, the model id qwen/qwen3.8-max-0902, Vision, Tools, JSON and Reasoning chips, a Qwen attribution dated 2026-09-02, the description of a September 2, 2026 snapshot accepting text, image and video input with a 1M-token context, input pricing of $2.00 and output of $6.00 per 1M tokens, a p50 time to first token of 3.50s, a p95 of 9.38s, and traffic of 196.6M tokens over seven days.

Comparados en este artículo3

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario