
Boreal vs Qwen3.8 Max: la fila que cada proveedor espera que te saltes
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Cada lanzamiento de un modelo publica una tarjeta de cifras, y cada tarjeta tiene una fila en la que el proveedor preferiría que no te detuvieras. Para Qwen3.8 Max, lanzado el 3 de agosto de 2026, las filas halagadoras son fáciles de encontrar: ocupó el primer puesto en la tabla de clasificación de front-end de CodeArena con 1.691 puntos, alcanzó un Índice Agéntico de Artificial Analysis de 58, empatando con Claude Opus 5 en esfuerzo alto —lo más cerca que había llegado un laboratorio chino de lo más alto de esa tabla—, y consiguió una puntuación GDPval-AA de 1.739 Elo, por delante de GPT-5.6 Sol. La fila que hay debajo de ellas es más difícil de leer. En la misma batería de pruebas del evaluador, la alucinación medida subió del 23 % en la generación anterior al 40 %, y la puntuación de recuperación de contexto largo del modelo cayó dos puntos. Boreal, el modelo de vídeo publicitario de Creatify, lanzado el 15 de septiembre de 2026 a un centavo por segundo, tiene una fila del mismo tipo en su propia tarjeta, y es más concreta, porque el proveedor la publicó.
Ninguna de las dos filas descalifica. Ambas son más informativas que las puntuaciones principales, por lo que vale la pena ponerlas una al lado de la otra en lugar de comparar los banners.
En qué es Qwen3.8 Max genuinamente mejor
Las victorias son reales y no son pequeñas.
Qwen3.8 Max es un modelo de mezcla de expertos de 2,4 billones de parámetros con aproximadamente 95.000 millones de parámetros activos por token, y es el primer Qwen de clase Max que Alibaba ha dicho que se publicará como pesos abiertos —anunciado para la semana del 10 de agosto de 2026, sin licencia ni una fecha firme, un detalle que vale la pena señalar porque el anuncio no es la publicación. Tiene una ventana de contexto de 1 millón de tokens con un límite de salida de 131.072 tokens, y acepta texto, imágenes y video como entrada. Ese último punto merece énfasis en esta comparación en particular: de los cuatro modelos de texto de frontera que esta serie contrapone a Boreal, Qwen3.8 Max es uno de solo dos a los que se les puede entregar un clip de video terminado y hacerles una pregunta al respecto.
La política de precios es agresiva de un modo que redefinió el segmento. A $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida, con lecturas de caché a $0.25, es alrededor de un 20 % más barato que la generación anterior a la vez que duplica la longitud máxima de salida. En nuestro tablero, eso se sitúa en $2.00 y $6.00, un contexto de 1M tokens, un p50 de tiempo hasta el primer token de 10.00 segundos —el techo que reporta nuestra instrumentación, así que léelo como «lento» más que como preciso— y 183.0 millones de tokens de tráfico durante los últimos siete días.
Y la fila de abajo
Esta es la parte que no llegó al titular de la publicación de lanzamiento.
La evaluación independiente de Artificial Analysis registró dos regresiones entre Qwen3.7-Max y Qwen3.8 Max. Su medida de recuperación de contexto largo cayó dos puntos. Su medida de omnisciencia cayó diez, y la tasa de alucinación que mide el evaluador aumentó del 23% al 40%. Al mismo tiempo, el costo por tarea del modelo en el Intelligence Index aumentó de $0.53 a $1.14 — tomó aproximadamente 64 turnos por tarea, mientras que su predecesor tomó 14.
Si se leen en conjunto, aparece una imagen coherente. Qwen3.8 Max es un modelo que mejoró en aquellas cosas que los benchmarks con una única respuesta correcta pueden medir —código, finalización de tareas agénticas, resolución estructurada de problemas— y empeoró en lo que resulta más difícil de puntuar: saber cuándo no sabe. Que un modelo delibere más y alucine más no significa que se contradiga. Los rastros de razonamiento más largos generan más oportunidades de comprometerse con una respuesta incorrecta pero segura, y un benchmark que recompensa la finalización de tareas no penaliza eso hasta que la tarea tiene una invariante oculta que violar.
Para un comprador, la consecuencia práctica es limitada y específica. Si tu uso del modelo es la generación de código o un flujo de trabajo agéntico donde una respuesta incorrecta falla de forma evidente —una prueba falla, una compilación se rompe—, las regresiones son en gran medida invisibles y las ganancias son lo único que importa. Si tu uso es la recuperación, el resumen o cualquier cosa donde una respuesta incorrecta fluida llegue a un humano sin una verificación, el salto de 23 a 40 es el número que debería decidir tu evaluación, no la posición en CodeArena.
La peor disputa del propio Boreal, publicada por el proveedor
El contraste que hace útil esta combinación es que Creatify hizo algo que la mayoría de los proveedores no hace: puso su resultado más débil en la misma publicación que el más fuerte.
Boreal se probó a ciegas contra su propio modelo base sin modificar, con el prompt, la resolución, el número de fotogramas y la semilla fijados, en 40 casos de producción. Creatify informa de una preferencia del 81% por Boreal —25 a 6 con 9 empates, prueba de signos p<0,001— y luego desglosa ese promedio. Anuncios de productos: 83%. Escenas de creadores y UGC: 85%. Clips de una sola persona hablando: 60%.
Esa última cifra es la fila. Las cabezas parlantes están entre los formatos más comunes en la publicidad de respuesta directa, y es el formato en el que la ventaja del modelo sobre su propia base es más tenue —apenas mejor que lanzar una moneda al aire frente a un modelo que nadie iba a lanzar. El renderizado se cotiza a 1:1 con el tiempo real en la clase 720p, y la retención de detalles finos mejoró un 11,3 % con p = 0,004, así que la historia agregada es genuinamente positiva. El desglose simplemente te dice para qué mitad de la categoría se ajustó este modelo, y no es la mitad con una persona hablando a cámara.
Ten en cuenta también qué tipo de evidencia es cada una de estas filas. La regresión de Qwen3.8 Max la encontró un evaluador independiente que ejecutó su propio arnés. La fila débil de Boreal la dio a conocer el proveedor, en una prueba que el propio proveedor diseñó y ejecutó. La segunda es más fiable como declaración de un hecho y menos informativa como comparación, porque no hay ningún número independiente en ninguna parte del archivo de Boreal.

El contraste de especificaciones
• Salida — Boreal: vídeo renderizado, clase 720p, texto a vídeo e imagen a vídeo. Qwen3.8 Max: solo texto, hasta 131.072 tokens.
• Entrada — Boreal: un prompt de texto o una imagen fija. Qwen3.8 Max: texto, imágenes y vídeo.
• Precio — Boreal: $0.01 por segundo de video finalizado. Qwen3.8 Max: $2.00 por 1M de entrada / $6.00 por 1M de salida, lecturas de caché a $0.25.
• Contexto — Boreal: no publicado. Qwen3.8 Max: 1M tokens de entrada, 131K de salida.
• Latencia — Boreal: cotizada a 1:1 con tiempo real. Qwen3.8 Max: p50 de tiempo hasta el primer token de 10,00 segundos en nuestro tablero.
• Pesos — Boreal: propietario, propiedad de Creatify y servido por Creatify. Qwen3.8 Max: propietario en el lanzamiento; Alibaba ha anunciado un lanzamiento de pesos abiertos para el primer Qwen de clase Max, sin licencia ni fecha confirmadas.
• Evidencia — Boreal: prueba ciega de 40 casos realizada por el proveedor, sin evaluación independiente. Qwen3.8 Max: cobertura de benchmarks independientes que incluye dos regresiones medidas, junto con filas del proveedor de 86.1 en OSWorld-Verified y 86.6 en Terminal-Bench 2.1.
Cuánto vale una regresión para alguien que está comprando
Las regresiones en las tablas de clasificación suelen tratarse como trivialidades. Están más cerca de ser lo más relevante para la toma de decisiones que publica un benchmark, porque son las únicas filas que te dicen qué sacrificó un proveedor.
Lo útil no es leer ninguna de las dos tarjetas, sino ejecutar ambos modelos con tu propio tráfico — y el obstáculo práctico es que esto normalmente implica dos contratos, dos SDK y dos relaciones de facturación, lo que supone suficiente fricción como para que la mayoría de los equipos se salte la prueba y compre basándose en la puntuación destacada.
Esa fricción es la parte que elimina una capa de enrutamiento. Qwen3.8 Max está en nuestro catálogo junto a la generación anterior, así que compararlos en tu propio conjunto de evaluación es un cambio de una sola línea en la cadena del modelo en lugar de un ciclo de adquisición, y la misma clave alcanza el resto del catálogo cuando la comparación indica que quieres un modelo diferente para una etapa diferente del pipeline. Se sitúa en tarifa de lista del proveedor con 0% de margen, lo cual importa aquí por una razón específica: Qwen3.8 Max llegó aproximadamente un 20% más barato que la generación a la que reemplazó, y un cambio de precio por parte del proveedor de ese tipo es algo que debería reflejarse en tu factura cuando ocurre, en lugar de en la próxima renovación.
Boreal no está en nuestro catálogo. OrcaRouter no ofrece modelos de generación de vídeo, y nada de lo que aquí se dice debe interpretarse como una afirmación en sentido contrario. Lo que ofrecemos es la capa que está por encima —el copy, las variantes, la revisión de cumplimiento, el análisis de lo que funcionó—, y a dos de los modelos de esta serie, Qwen3.8 Max entre ellos, se les puede entregar el clip terminado para que lo revisen.

Cómo leer cualquiera de las dos tarjetas
Qwen3.8 Max es la opción de compra más sólida si tu trabajo es código, agentes o razonamiento estructurado, a un precio inferior al de su propio predecesor, y las dos regresiones independientes son la razón para probarlo con tu tráfico de recuperación y resumen antes de dirigir allí la producción. La cifra del 40 % de alucinaciones no es una razón para evitar el modelo; es una razón para saber cuáles de tus cargas de trabajo pueden tolerarlo.
Boreal es la única de las dos que produce el artefacto sobre el que nominalmente trata esta comparación, y es la opción creíble más barata según las tarifas publicadas para vídeo publicitario de formato corto. Su limitación es específica del formato y la declara su propio proveedor: 60 % de preferencia en clips de una sola persona hablando. Prueba ese formato antes de los anuncios de producto, porque ahí es donde el margen es más reducido.
Dos cosas harían avanzar esto. Si Alibaba publica los pesos abiertos que anunció para Qwen3.8 Max, tanto el precio como la durabilidad del modelo cambiarán, y la licencia bajo la que llegue importará más que la fecha. Y para Boreal, la primera evaluación independiente —de cualquier tipo, por parte de cualquiera— sustituiría a una prueba de proveedor de 40 casos que actualmente soporta toda la carga de evidencia de un modelo que se vende en un formato donde las marcas son inusualmente sensibles a cómo se ve su producto.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
