Reseña de Qwen3.8-Max: el buque insignia de 2.4T de Alibaba a $2/$6 — la compilación 0902 lidera Code Arena WebDev
Guides & Insights

Reseña de Qwen3.8-Max: el buque insignia de 2.4T de Alibaba a $2/$6 — la compilación 0902 lidera Code Arena WebDev

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Alibaba Qw​en presentó Qwen3.8-Max en la Conferencia Mundial de IA en Shanghái el 19 de julio de 2026, y durante dos semanas fue el modelo más comentado al que nadie podía ponerle precio. No había lista de precios, ni tabla de benchmarks, ni ficha del modelo, ni licencia, ni cifra de parámetros activos: solo un titular de 2,4 billones de parámetros y la afirmación de que el modelo estaba «solo superado por Claude Fable 5».

El 3 de agosto de 2026, eso cambió. Qwen3.8-Max está disponible de forma general: una tarifa publicada de $2 por millón de tokens de entrada y $6 por millón de salida, un endpoint compatible con OpenAI y DashScope, una tabla completa de benchmarks y pesos abiertos que llegaron el 12 de agosto. Una semana después, el 14 de agosto, se lanzó en DigitalOcean Serverless Inference como el socio de lanzamiento del "Día 0" de Alibaba —la primera gran nube occidental en ofrecerlo—. El 2 de septiembre, Alibaba publicó una actualización con nombre, Qwen3.8-Max-0902, con un post-entrenamiento adicional en Coding y Cowork, lo que, según Qwen, refuerza el rendimiento en tareas empresariales y científicas complejas. Esta reseña está escrita a partir de los hechos de la disponibilidad general, con ese lanzamiento del día cero y la versión 0902 incorporados, y responde a la pregunta que los equipos realmente se hacen ahora que el modelo se puede comprar: ¿está Qwen3.8-Max listo para manejar tráfico de producción, o sigue siendo un modelo en la lista de seguimiento?

La respuesta corta es que ha ido más lejos de lo que la mayoría esperaba — el precio, en particular, es agresivo de una manera que reajusta los precios de la frontera, y la actualización del 2 de septiembre redobla la apuesta en las dos cosas en las que el modelo ya era bueno: la codificación y el trabajo colaborativo. La evaluación independiente que se ha publicado desde entonces es realmente buena, pero conlleva una advertencia que vale la pena leer antes de enviar tráfico.

TL;DR. Qwen3.8-Max ya está disponible de forma general (GA) por $2 / $6 por cada 1M de tokens, con precio uniforme en todo el contexto de 1M de tokens y sin recargo por prompts largos: un costo inferior al de Kimi K3 ($3/$15) y Claude Opus 5 ($5/$25) en la salida, el factor determinante del costo en tareas de razonamiento. Alibaba publicó una sólida tabla de benchmarks (Terminal-Bench 2.1: 86,6; GPQA Diamond: 92,6; OSWorld-Verified: 86,1) y el salto en codificación frente a su predecesor es dramático: 73,5 en FrontierSWE frente a 40,7. Pero la tabla de calidad es de la propia Alibaba, y el primer árbitro independiente —el Índice de Inteligencia de Artificial Analysis— ya se ha pronunciado: Qwen3.8-Max obtiene 56 puntos a $1,14 por tarea, a la par de Claude Opus 4.8 (56) y un punto por detrás del líder de pesos abiertos, Kimi K3 (57), con un costo por tarea un 25% mayor. El recuento de parámetros activos ya no es un interrogante: 95B activados de un total de 2,4T, confirmado en la ficha oficial del modelo, lo que por fin permite a los externos razonar sobre la economía del servicio. Desde que se publicó esta reseña, también se ha abierto una segunda vía administrada: Qwen3.8-Max se lanzó en DigitalOcean Serverless Inference el 14 de agosto como socio Day 0 de Alibaba, con cifras de servicio publicadas por DigitalOcean —escalado de prefill hasta ~16.000 tokens/seg y ~1.937 tokens de salida/seg con 256 solicitudes concurrentes y cero errores—, que constituyen los primeros datos duros de latencia de un proveedor distinto de Alibaba. El 2 de septiembre, Alibaba actualizó su buque insignia a Qwen3.8-Max-0902, con entrenamiento posterior en Coding y Cowork; Qwen afirma que esta nueva versión es más sólida en cargas de trabajo empresariales y científicas complejas: una afirmación del proveedor que aún no cuenta con cifras independientes en el ámbito empresarial o científico. El aspecto de codificación de la versión 0902 ya tiene un resultado de arena independiente propio: Qwen3.8-Max-0902 debutó en el puesto #1 en el ranking de Code Arena: WebDev con 1.691 puntos, 22 más que la versión anterior y por delante de Claude Opus 5 y Kimi K3, según Alibaba, que cita el listado en vivo de la arena de terceros. La historia del comercio agéntico sumó un marcador esa misma semana: en CommerceAgentBench, un nuevo benchmark del equipo Accio de Alibaba construido sobre réplicas con estado de software de comercio real, Qwen3.8-Max presenta el resultado más sólido en pesos abiertos: 156 pases agregados en tres entornos, dos por delante de DeepSeek V4 Pro —una tabla creada por el proveedor, no un árbitro independiente—. Veredicto: ahora es genuinamente adquirible y lo bastante barata como para justificar una evaluación real, pero enrútala con criterio, no de forma indiscriminada.

Conclusiones clave

GA desde el 3 de agosto de 2026. La era de las campañas de vista previa y créditos ha terminado; hay una tarjeta de tarifas real y un endpoint real.

$2 / $6 por 1M de tokens, una tarifa plana única en 1M de contexto. La mayoría de los rivales aplican recargos por prompts largos. Alibaba no lo hace, algo que importa enormemente para el trabajo con documentos largos y repositorios grandes.

La tabla de benchmarks de Alibaba es sólida pero no auditada: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, PaperBench 93.0, IFBench 82.8, OSWorld-Verified 86.1, OmniDocBench 1.5 92.1.

El salto generacional en la codificación es la verdadera historia: FrontierSWE 73.5 (de 40.7) y DeepSWE 1.1 56.6 (de 21.6) — casi el doble en ambos.

La primera puntuación independiente ya está disponible: Qwen3.8-Max obtiene 56 en el AA Intelligence Index a $1.14/tarea — un salto de 10 puntos sobre Qwen3.7-Max (46), a la par con Claude Opus 4.8 (56), un punto por detrás de Kimi K3 (57). La clasificación general de LMArena todavía no tiene una puntuación pública.

• Parámetros activos confirmados en 95B — la tarjeta oficial del modelo indica 2.4T en total y 95B activados, cerrando la mayor pregunta abierta en el cálculo del coste de servicio.

• Los pesos abiertos ya están disponibles: Qwen3.8-2.4T-A95B (BF16) y Qwen3.8-2.4T-A95B-FP8 aterrizaron en Hugging Face el 12 de agosto bajo una licencia personalizada Qwen3.8-Max, no Apache 2.0. La vía local Qwen3.8-27B se lanzó el 14 de agosto bajo Apache 2.0.

Una segunda ruta gestionada se abrió el 14 de agosto. Qwen3.8-Max ya está disponible en DigitalOcean Serverless Inference como "socio de lanzamiento del día 0" de Alibaba — NVFP4 en NVIDIA HGX B300, $2/$6 con $0.20 de entrada en caché, servido con el contexto nativo de 262K del checkpoint abierto. Las cifras medidas por DigitalOcean (prefill ~16K tokens/seg, cero errores a 256 de concurrencia) son los primeros datos de rendimiento de servicio en una plataforma gestionada fuera de Alibaba.

Actualización del 2 de septiembre: Qwen3.8-Max-0902. Alibaba amplió el post-entrenamiento del modelo insignia con Coding y Cowork y lo ofrece en QwenCloud al mismo precio de $2/$6 y con contexto de 1M. Qwen afirma que el rendimiento empresarial y científico es más sólido —siguen siendo afirmaciones del proveedor—, mientras que el área de programación obtuvo el mismo día un resultado independiente en arena: la versión debutó en el puesto n.º 1 de Code Arena: WebDev con 1691 (ver el punto de Code Arena más abajo).

CommerceAgentBench: líder de peso abierto, ejecutado por el proveedor. El equipo Accio de Alibaba lanzó CommerceAgentBench esta semana — 107 tareas de largo horizonte dentro de réplicas con estado de software real de comercio y negocios, evaluadas según el estado en los entornos Accio, OpenClaw y Pi. Qwen3.8-Max lidera los modelos de peso abierto con 156 pases acumulados, dos por delante de DeepSeek V4 Pro; el modelo cerrado Claude Opus 5 lidera en general con 191, y la tabla es de Alibaba, no de un árbitro independiente.

Code Arena: WebDev #1 — el resultado de la build 0902 en la arena independiente. Qwen3.8-Max-0902 debutó en lo más alto de la tabla de clasificación de Code Arena: WebDev con 1,691 puntos, 22 más que la build anterior y por delante de Claude Opus 5 y Kimi K3; además, lidera la frontera de Pareto de costo-rendimiento de esa tabla con un precio combinado de ~$5/MToken, alrededor de una cuarta parte del precio combinado de Claude Opus 5. La cuenta oficial de QwenCloud confirmó la posición. A diferencia de CommerceAgentBench, esta tabla es de un tercero: una competición de votación humana a ciegas, no una tabla de Alibaba, aunque 'debutar en el #1' es el anuncio de Alibaba de una clasificación en un momento dado.

Nota de precisión: la tabla de benchmarks de Qwen3.8-Max presentada en esta reseña es reportada por Alibaba y no ha sido replicada de forma independiente. La puntuación del índice de inteligencia de Artificial Analysis (56 a 1,14 USD por tarea) es una medición independiente realizada por AA sobre la API oficial de Alibaba: el primer árbitro independiente del modelo. Los precios provienen de la tarjeta de tarifas de disponibilidad general (GA) de Alibaba Model Studio. Los repositorios de pesos abiertos (Qwen3.8-2.4T-A95B y Qwen3.8-2.4T-A95B-FP8), la cifra de 95B activos y el texto de la licencia son de primera parte: provienen de la propia organización de Qwen en Hugging Face, verificados el 13 de agosto de 2026. La disponibilidad en DigitalOcean, su tarjeta de tarifas, las mediciones del rendimiento de servicio y la comprobación puntual de GPQA con 88 en la versión cuantizada provienen de la documentación propia de DigitalOcean y de su tutorial comunitario, publicados junto con el anuncio del 14 de agosto; la caracterización de «socio de lanzamiento Day 0» es el lenguaje del anuncio de Alibaba. Cuando citamos cifras de competidores, estas provienen de Artificial Analysis o del proveedor citado en el propio texto. La actualización Qwen3.8-Max-0902 anunciada el 2 de septiembre se basa íntegramente en lo declarado por el proveedor: sus especificaciones, su descripción del post-entrenamiento «Coding-and-Cowork» y las supuestas mejoras empresariales y científicas provienen del anuncio de la propia Qwen y de la página del modelo en QwenCloud, y ninguna de sus cifras ha sido reproducida de forma independiente. La posición en Code Arena: WebDev que recoge la sección de benchmarks es la única excepción: esa clasificación es un arena de terceros con votación ciega, y no una tabla de Alibaba — aunque «debutar en el n.º 1 con 1.691» es el anuncio de Alibaba de una clasificación en un momento puntual, y las puntuaciones del arena siguen moviéndose a medida que se acumulan los votos. El resultado de CommerceAgentBench analizado más abajo está en la misma categoría: el benchmark fue desarrollado y publicado por Accio, el equipo de Alibaba International, por lo que sus tablas son reportadas por Alibaba: un benchmark de código abierto, pero no un árbitro independiente como sí lo es Artificial Analysis. Como regla general, las tablas de benchmarks de los proveedores suelen ser optimistas: trátelas como una hipótesis para probar con su propia carga de trabajo, no como una clasificación definitiva.

¿Qué es Qwen3.8-Max?

Qwen3.8-Max es el buque insignia de la familia Qwen de Alibaba: un modelo disperso de mezcla de expertos con 2,4 billones de parámetros en total, una ventana de contexto de 1M de tokens y entrada multimodal nativa. Acepta texto, imágenes y video, y devuelve texto. Admite modo de pensamiento, llamada de funciones, herramientas integradas y salidas estructuradas, y se sirve a través de un endpoint compatible con OpenAI /v1/chat/completions, lo que significa que la mayoría de las integraciones existentes necesitan un cambio de URL base en lugar de una reescritura. La instantánea de producción actual, lanzada el 2 de septiembre, es Qwen3.8-Max-0902, además post-entrenada en Coding y Cowork.

Los números de contexto práctico son ligeramente más específicos que el "1M" de marketing. Los metadatos de la nube de Alibaba indican una ventana de 983,616 tokens con el razonamiento habilitado, una entrada máxima de aproximadamente 991K tokens y una salida máxima de 131,072 tokens. Ese límite de salida es inusualmente generoso y es importante para tareas como la generación de código de archivos completos o la redacción de informes extensos, donde los límites menores te obligan a dividir y unir. El checkpoint abierto que DigitalOcean ahora sirve es una configuración diferente: su ficha de modelo indica 262,144 tokens de forma nativa, ampliable a aproximadamente 1,010,000, por lo que el servicio de terceros que ejecuta la base abierta normalmente se quedará en el número nativo más pequeño.

El recuento de parámetros activos ahora es público, y el nombre del repositorio lo refleja: A95B significa 95 mil millones activados. La tarjeta oficial del modelo Qwen3.8-2.4T-A95B indica «2.4T en total y 95B activados», un Mixture-of-Experts de grano fino con 512 expertos, de los cuales 10 enrutados más uno compartido están activos por token. Ese número importa más que el titular de 2.4T. Para un modelo denso, los parámetros totales te dicen aproximadamente cuánto cuesta la inferencia; para un modelo MoE, casi no te dicen nada — solo importa el recuento de activos, porque eso es lo que realmente se ejecuta por token. Un modelo de 2.4T que activa 30B se comporta de manera completamente distinta, en latencia y en economía de servidores, de uno que activa 200B. Con 95B activos, el cómputo por token se sitúa en el mismo orden que un modelo denso de alrededor de 90B — una fracción de lo que exigiría un 2.4T denso —, que es la cifra que finalmente permite responder la pregunta sobre autoalojamiento planteada más abajo.

La actualización del 2 de septiembre: Qwen3.8-Max-0902

El 2 de septiembre de 2026, Qwen lanzó su primera actualización de producción con nombre. Qwen3.8-Max-0902 mantiene la misma arquitectura sparse-MoE de 2.4T de parámetros, los mismos 95B de parámetros activos y la misma ventana de contexto de 1M de tokens, pero ha sido además posentrenado en dos capacidades — Coding y Cowork — y está disponible en la API de QwenCloud como qwen3.8-max-0902 (también listado como qwen3.8-max-2026-09-02). Es la versión recomendada actual, no una rama secundaria: el endpoint sin fecha qwen3.8-max de Alibaba ahora sirve la instantánea 0902, por lo que una llamada al nombre de modelo estándar llega a la actualización, mientras que el id con fecha está ahí para los equipos que quieran fijar la versión exacta. Desde el 3 de septiembre, la instantánea también se ha listado como su propio id de modelo enrutable en APIs gestionadas de terceros. La tarifa no ha cambiado: $2 por 1M de entrada, $6 por 1M de salida, con las mismas tarifas de caché.

Las afirmaciones sobre el rendimiento provienen de Qwen. El anuncio y la página del modelo en QwenCloud describen una capacidad de codificación que «abre nuevos caminos» en proyectos a escala de ingeniería y desarrollo autónomo de horizonte largo, una experiencia de agente colaborativo «significativamente mejorada» en la orquestación de múltiples herramientas y la entrega de tareas de extremo a extremo, y —como dice la empresa— un rendimiento más sólido en tareas empresariales complejas, investigación científica y flujos de trabajo de ciclo largo. La primera verificación independiente llegó el mismo día. Qwen3.8-Max-0902 debutó en el puesto #1 del ranking de Code Arena: WebDev —una plataforma de votación a ciegas de terceros para el desarrollo web agéntico, el proyecto antes conocido como WebDev Arena— con 1691 puntos, 22 más que la versión anterior y por delante de Claude Opus 5 y Kimi K3, según Alibaba citando el ranking en vivo —una posición que la cuenta oficial de Qwen confirmó el mismo día, señalando la API de QwenCloud—. Lo que eso demuestra y lo que no demuestra se desglosa en la sección de benchmark más abajo. Las afirmaciones restantes de esta actualización —razonamiento empresarial, trabajo científico y autonomía general de horizonte largo— siguen siendo declaraciones del proveedor, así que mantén la disciplina que se aplicó a la tabla de agosto: trátalas como una hipótesis hasta que un análisis de Artificial Analysis o una carga de trabajo real las confirme.

Lo que "Cowork" significa en la práctica es donde la actualización se vuelve interesante. El Qwen3.8-Max de la era GA ya apostaba por la autonomía de largo horizonte — la compilación de 16 días de oh-my-cli, el negocio virtual de más de 2,000 rondas — y la versión 0902 es Alibaba redoblando su apuesta en ese eje: agentes que orquestan múltiples herramientas y entregan una tarea de principio a fin, en lugar de respuestas de un solo disparo. Esa misma semana, el equipo de Accio de Alibaba publicó CommerceAgentBench, un benchmark diseñado para medir ese eje directamente: 107 tareas de largo horizonte dentro de réplicas con estado de software comercial y de negocios real, donde Qwen3.8-Max lidera el campo de pesos abiertos — detallado en la sección de benchmarks más abajo. Para los equipos que evalúan el modelo para trabajo empresarial, esa es la afirmación que deben probar primero, porque también es la más difícil de verificar a partir de una tabla de benchmarks.

Precios: lo más agresivo de este lanzamiento

Alibaba Model Studio ofrece Qwen3.8-Max a $2.00 por 1M de tokens de entrada y $6.00 por 1M de tokens de salida. La salida incluye tokens de razonamiento, lo cual importa porque las configuraciones con uso intensivo de razonamiento facturan su deliberación interna a la tarifa de salida. Economía de caché: los aciertos de entrada en caché cuestan $0.25 por 1M, la creación explícita de caché $2.50, y las lecturas explícitas de caché $0.17.

La parte estructuralmente interesante no es la cifra principal, sino el nivel plano. Alibaba cobra los mismos $2/$6 ya sea que tu prompt tenga 5.000 tokens o 900.000. La mayoría de los competidores aplican un recargo por contexto largo precisamente porque procesar un prompt de casi un millón de tokens es caro. Que Alibaba absorba ese costo es una apropiación deliberada de terreno dirigida exactamente a las cargas de trabajo donde el contexto largo es el punto: revisión de código de un repositorio completo, análisis de contratos y documentos, síntesis de investigación multidocumento.

Ejemplo resuelto. Supongamos que ejecutas un agente de análisis de repositorios: 200,000 tokens de entrada de contexto de código y 8,000 tokens de salida por llamada.

Por llamada: 0.2M × $2 = $0.40 de entrada, más 0.008M × $6 = $0.048 de salida. ≈ $0.45 por llamada.

A 1,000 llamadas/día: ≈ $448/día, o alrededor de $13,400/mes.

La misma llamada contra Claude Opus 5 a $5/$25: $1.00 + $0.20 = $1.20 — aproximadamente 2.7× más.

Con el almacenamiento en caché de prompts en un contexto de código estable, la entrada almacenada en caché a $0.25 reduce el lado de entrada de $0.40 a $0.05, llevando la llamada a ≈ $0.10 — una reducción de casi 4.5× en tráfico repetido.

Ese diferencial de caché es donde realmente está el presupuesto. Si tu agente relee un contexto casi sin cambios en cada turno — lo que describe a la mayoría de los agentes de codificación y soporte — el precio efectivo está mucho más cerca de $0.25/$6 que de $2/$6. Los equipos que omiten la configuración de la caché suelen pagar de más por 3–4× en este modelo.

Para comparar a precios de lista: Qwen3.8-Max $2/$6; su propio predecesor Qwen3.7-Max $2.50/$7.50; Kimi K3 $3/$15; GPT-5.6 Terra $2/$12; Claude Opus 5 $5/$25. En entrada, Qw​en es simplemente competitiva. En salida — el lado que domina el gasto en trabajo de razonamiento y de agentes — es el modelo de frontera más barato de esa lista.

La medición independiente de Artificial Analysis revela la otra cara de esos tokens baratos. En su índice de inteligencia, Qwen3.8-Max cuesta $1.14 por tarea — más del doble que los $0.53 de su predecesor, y un 25% más que los $0.86 de Kimi K3 aunque Kimi K3 figura a $3/$15 por token. La diferencia es de comportamiento, no un aumento de precio: el modelo promedió 64 pasos por tarea GDPval-AA frente a 14 para Qwen3.7-Max, y debido a que el banco de pruebas reenvía la conversación completa en cada paso, los tokens de entrada crecieron aproximadamente 15× y los de salida ~45%. Los tokens baratos no equivalen a agentes baratos: la verbosidad que señalaron los evaluadores de la vista previa ahora tiene un precio medido. Debido a que OrcaRouter traslada el precio de lista con un margen del 0% detrás de un endpoint compatible con OpenAI, esa pregunta de $1.14 frente a $0.86 se puede medir con prompts idénticos sin un segundo contrato.

La tabla de benchmarks, y qué mide realmente cada número.

En GA, Alibaba publicó la tabla que retuvo en la vista previa. Puntuaciones reportadas:

Terminal-Bench 2.1 — 86.6. Mide si un modelo puede operar un shell real hasta completar la tarea: ejecutar comandos, leer la salida y recuperarse de errores. Es la aproximación más cercana a si puede funcionar como un agente de codificación en lugar de un sugeridor de código.

GPQA Diamond — 92.6. Preguntas de física, química y biología a nivel de posgrado escritas para ser resistentes a la recuperación. Una puntuación alta indica razonamiento científico genuino en lugar de memorización. 92.6 se encuentra en la cima del campo actual.

PaperBench — 93.0. Reproducir resultados de artículos de investigación — leer una metodología y reimplementarla. Recompensa la comprensión sostenida de múltiples pasos.

IFBench — 82.8. Seguimiento de instrucciones bajo restricción: formato, longitud e instrucciones negativas. Notablemente, es la puntuación más baja en la propia tabla de Alibaba, lo que es consistente con la queja de la era de vista previa según la cual el modelo es exhaustivo hasta el punto de ignorar los límites de alcance.

OSWorld-Verified — 86.1. Uso de computadora: manejar una GUI de escritorio real para completar tareas. El buen desempeño aquí respalda el posicionamiento agéntico.

OmniDocBench 1.5 — 92.1.Análisis de documentos — tablas, diseño, texto y figuras combinados. Se complementa con el contexto de tarifa plana de 1M para demostrar de verdad el valor de los pipelines de documentos.

FrontierSWE — 73.5, frente a los 40.7 de su predecesor. DeepSWE 1.1 — 56.6, frente a 21.6.

Esos dos últimos merecen énfasis. Las casi duplicaciones en difíciles evaluaciones comparativas de ingeniería de software en una generación no son ganancias incrementales normales, y son consistentes con la decisión de Alibaba de comercializar este modelo para desarrolladores en lugar de usuarios de chat. Si la cifra de FrontierSWE sobrevive a la replicación independiente, Qwen3.8-Max es un modelo de programación serio y no solo uno grande.

La advertencia de la vista previa se ha reducido, pero no ha desaparecido. La tabla anterior fue elaborada por Alibaba con su propio banco de pruebas, en condiciones que nadie más puede inspeccionar. Las tablas de los proveedores se eligen, no se muestrean: los laboratorios publican los benchmarks en los que les va bien. Pero desde el 6 de agosto ya hay un auténtico árbitro independiente: Artificial Analysis ha puntuado a Qwen3.8-Max con 56 en el Intelligence Index a $1.14 por tarea, medido en la API oficial de Alibaba — un salto de 10 puntos sobre los 46 de su predecesor, a la par con Claude Opus 4.8 (56) y a un punto de Kimi K3 (57). En el leaderboard de agentes GDPval-AA de AA, el modelo alcanza 1,739 Elo, superando a Kimi K3 (1,685) y a GPT-5.6 Sol (1,730), con solo Claude Opus 5 (1,852) por delante. Las propias advertencias de AA merecen el mismo peso: una ejecución anterior obtuvo 53 antes de que se resolvieran los problemas con el endpoint, y la repetición con la API oficial dio 56; AA-Omniscience cayó 10 puntos debido a una tasa de alucinaciones que subió del 23% al 40%; y el costo por tarea es alto precisamente porque el modelo ejecuta muchos más pasos. El leaderboard general de LMArena aún no tiene puntuación pública.

El lanzamiento de DigitalOcean añadió un tercer dato, este sobre la versión cuantizada en lugar del modelo insignia. La propia comprobación interna de DigitalOcean de los pesos NVFP4 que sirve obtuvo 88 en GPQA Diamond, frente a los 92,6 publicados por Alibaba para el modelo insignia no cuantizado. La propia DigitalOcean califica la comparación como «un dato indicativo más que una comparación controlada» — las diferencias se dan en tres ejes (base de pesos abiertos en lugar del modelo insignia alojado, NVFP4 en lugar de BF16 y una pila de evaluación diferente) — pero es la primera verificación independiente de un despliegue real en servicio de estos pesos, y un recordatorio de que el checkpoint abierto no es, byte a byte, la cifra de la tabla de Alibaba.

CommerceAgentBench: el marcador de comercio agéntico

Junto con la actualización, el equipo de Accio de Alibaba International lanzó CommerceAgentBench, un benchmark diseñado para evaluar precisamente el trabajo de largo horizonte que Qwen sigue promocionando. Un agente comienza cada tarea dentro de un contenedor nuevo en una de las 14 réplicas sin conexión de software real de comercio y negocios — publicación de productos, reserva de fletes, administración de tiendas en línea, operaciones de pago, análisis de proveedores — y la evaluación se basa en el estado: una tarea solo se aprueba cuando los servicios simulados subyacentes y los archivos producidos cambian de verdad, por lo que un agente que narra un flujo de trabajo plausible sin cambiar el estado no obtiene ninguna puntuación. La suite ejecuta 107 tareas a través de interfaces de CLI, navegador, archivos/documentos y API/MCP, mediante tres entornos de prueba — Accio, OpenClaw y Pi — y el código de estos entornos (Apache 2.0) y los datos de las tareas (CC BY 4.0) están abiertos para su inspección o para volver a ejecutarse.

En las tablas publicadas, Qwen3.8-Max registra el resultado de peso abierto más fuerte: 56 de 107 tareas en el entorno de pruebas Accio, 47 en OpenClaw y 53 en Pi — 156 pases agregados, dos por delante de los 154 de DeepSeek V4 Pro. Toda la ventaja en peso abierto proviene del entorno de pruebas Accio; los dos modelos empatan en OpenClaw y Pi. El líder de peso abierto no es el líder general: el modelo cerrado Claude Opus 5 supera al resto con 191 pases agregados, 35 por delante. Y la tabla es del propio Alibaba — Accio es el equipo de Alibaba, y el propio repositorio señala las limitaciones de auditoría: el entorno de pruebas Accio es solo de referencia y no reproducible a partir de un checkout (OpenClaw es la vía reejecutable), los resultados a nivel de tarea carecen de sumas de comprobación públicas inmutables, y las filas de Qwen se basaron en un protocolo de repetición de contenido de razonamiento para mantener la comparabilidad. Trátalo como un dato declarado por el proveedor en el mismo eje agéntico que OSWorld-Verified y el enfoque GDPval-AA de AA abordan desde ángulos distintos — vale la pena probarlo contra tus propios flujos de trabajo, no una clasificación asentada.

Code Arena WebDev: el árbitro independiente de la compilación 0902

Code Arena es la pieza de evidencia independiente que le faltaba a la actualización. Es una clasificación de terceros para el desarrollo web agéntico — el proyecto antes conocido como WebDev Arena — donde los votos humanos ciegos por pares sobre qué salida de modelo preferiría enviar un usuario se convierten en una calificación de estilo Elo. En su tabla de WebDev, Qwen3.8-Max-0902 debutó en la cima con 1.691 puntos, 22 más que la versión anterior y por delante de Claude Opus 5 y Kimi K3. La posición también tiene una ventaja en eficiencia de costos: con un precio combinado de ~$5 por millón de tokens — la tarifa de lista de $2/$6 ponderada hacia la combinación con alta proporción de salida que la generación de aplicaciones web realmente produce — la versión 0902 es el modelo con mayor puntuación en la frontera de Pareto de la clasificación, con un costo de aproximadamente una cuarta parte del precio combinado de ~$20/M de Claude Opus 5 y muy por debajo de los ~$12/M de Kimi K3, razón por la cual esos dos se sitúan fuera de la frontera a pesar de ocupar los puestos #2 y #3 en puntuación. Alibaba anunció la posición el 2 de septiembre y la cuenta oficial de Qwen lo confirmó, remitiendo a los usuarios a QwenCloud; la medición no es de Alibaba: a diferencia de la tabla comparativa anterior o de la ejecución de CommerceAgentBench mencionada justo arriba, esta puntuación la produce una arena de terceros a partir de votos de preferencia humana.

Dos advertencias para mantener la honestidad. Primero, las clasificaciones de arena son un punto en el tiempo: 1,691 es donde estaba el tablero cuando Alibaba anunció el debut, y cambiará a medida que se acumulen votos, así que tómalo como una fuerte señal sobre codificación de desarrollo web, no como una corona permanente. Segundo, solo cubre ese único eje. Las afirmaciones de la actualización sobre el ámbito empresarial, científico y horizontes largos generales aún no tienen un árbitro independiente, por lo que la tabla de proveedores y el índice AA 56 en el modelo base siguen siendo los puntos de referencia para todo lo que esté fuera del trabajo frontend agéntico. Tercero, el precio de frontera es una elección de modelado, no una nueva tarifa: la cifra de ~$5/MToken combina la lista sin cambios de $2/$6 con un supuesto de uso intensivo en salida, así que trátalo como una clasificación de eficiencia de costos en los propios términos de la arena, no como un nuevo precio por parte de Alibaba.

Pesos abiertos, Qwen3.8-27B y la cuestión on-premise.

Alibaba ya ha cumplido su promesa de pesos abiertos. El 12 de agosto de 2026, Qwen publicó dos repositorios en Hugging Face — Qwen3.8-2.4T-A95B en BF16 y Qwen3.8-2.4T-A95B-FP8 — cada uno con 213 archivos de pesos. La licencia es una licencia personalizada de Qwen3.8-Max, no Apache 2.0; el campo de licencia de Hugging Face dice "other". Los términos permiten uso, modificación, distribución y fine-tuning, incluido el uso comercial, con atribución, además de dos umbrales basados en la escala: los productos con más de 100 millones de usuarios activos mensuales o 20 millones de dólares de ingresos mensuales deben mostrar el nombre del modelo de manera destacada, y los negocios de Model-as-a-Service o AI-Work-Assistant con más de 50 millones de dólares en ingresos agregados de los últimos doce meses necesitan una licencia separada de Qwen. La mayoría de los equipos están dentro de esos umbrales; si tu negocio los supera, lee el texto de la licencia antes de construir sobre ella. Los contadores de descargas corroboran lo reciente de la publicación — 978 en el repositorio BF16 y 3.851 en el repositorio FP8 al momento de escribir esto, cifras bajas para un lanzamiento de vanguardia y coherentes con un repositorio creado el 8 de agosto y abierto al público solo el 12 de agosto, no uno que llevara una semana visible. Una nota más de honestidad: el checkpoint abierto es el modelo base, solo texto con el modo de pensamiento siempre activado, mientras que la API alojada de Qwen3.8-Max añade entrada de visión, un modo opcional sin pensamiento y el contexto completo de 1M — descargar los pesos te da el modelo, no todas las funciones de la API.

El autoalojamiento del modelo insignia sigue fuera del alcance de la mayoría de los equipos, pero ahora conocemos los cálculos exactos. El conjunto completo de pesos de 2,4T de parámetros ocupa aproximadamente 4,9TB en BF16 y unos 2,4TB en FP8, porque cada experto debe residir en memoria aunque solo se activen 95B por token. Con cuantización de 4 bits, eso está en el orden de 1,2TB frente a los aproximadamente 141GB por H200, así que se necesitan ocho o más aceleradores de gama alta antes de servir un solo token. Lo que añade el recuento de parámetros activos ahora público es el lado del rendimiento: con 95B activados por token, el cómputo por token es comparable al de un modelo denso de la clase de ~90B, una fracción del costo que impondría un modelo denso de 2,4T. Así que, una vez que los pesos residen en memoria, el costo por token no es la pesadilla que sugiere la cifra total de parámetros. Esa combinación de una gran huella de memoria y un cómputo modesto por token es exactamente la razón por la que Alibaba puede poner precio a la salida en $6/1M, y orienta a los equipos de autoalojamiento hacia nodos multi-GPU que ejecutan los checkpoints FP8 en lugar de cualquier opción de una sola GPU.

La elección de servicio de DigitalOcean es un ejemplo práctico de esas matemáticas en producción. Ejecuta el modelo cuantizado NVFP4 en GPUs NVIDIA HGX B300 específicamente para que los pesos de 2,4T quepan en un solo nodo, evitando el enrutamiento de expertos entre nodos — un despliegue en vivo de la economía de 4 bits que esta sección ha estado haciendo en papel. El equilibrio es exactamente el que cuantifica la comprobación puntual de GPQA anterior: una huella más pequeña, a algún costo medible en calidad frente al buque insignia sin cuantizar.

Esto es lo que hace que Qwen3.8-27B sea el lanzamiento más trascendente para la mayoría de los lectores — y, a diferencia del modelo insignia, sus pesos llegaron según lo previsto. El 14 de agosto de 2026, Qwen publicó Qwen/Qwen3.8-27B en Hugging Face y ModelScope bajo Apache 2.0: un modelo denso de 27B, multimodal nativo, con un contexto nativo de 262K tokens ampliable a 1M y un modo configurable reasoning_effort. Daniel Han, de Unsloth, había estimado que correría en aproximadamente 17GB de VRAM — una sola tarjeta para entusiastas — y eso ahora se puede probar: el repositorio oficial incluye safetensors BF16 (alrededor de 55.6GB repartidos en 18 fragmentos), con cuantizaciones GGUF en los repositorios de la comunidad. De modo que el patrón de lanzamiento de esta generación ya está completo: los pesos del modelo insignia de 2.4T llegaron primero, el 12 de agosto, y el pequeño modelo para la ruta local aterrizó dos días después. Seguimos su lanzamiento en nuestro artículo sobre la fecha de lanzamiento de Qwen3.8-27B.

Dónde encaja Qwen3.8-Max: cuatro escenarios

1. Análisis de documentos largos y contratos. Esta es la mejor opción. La tarifa plana de 1M tokens más OmniDocBench 92.1 significa que puedes procesar un escrito de 400 páginas en una sola llamada sin recargo y sin dividir en fragmentos. Los competidores que cobran primas por contexto largo hacen que el mismo trabajo sea considerablemente más caro. En la ruta de DigitalOcean, recuerda que esa ruta ofrece la base abierta con 262K de contexto: sigue siendo un documento grande, pero no el millón completo.

2. Agentes de codificación a escala de repositorio. Terminal-Bench 86.6 y FrontierSWE 73.5 respaldan esto, y el precio de la caché abarata el trabajo iterativo sobre una base de código estable. Lo primero que hay que probar es la latencia bajo tu propia concurrencia, porque los revisores de la era de vista previa encontraron que el modelo era minucioso pero lento en ejecuciones largas de agentes, y el servicio GA es un animal distinto del servicio de vista previa. El resultado de AA en GDPval-AA — un Elo líder de 1.739 al costo de 64 pasos por tarea — es la confirmación independiente de ambas mitades de esa disyuntiva. Las mediciones de DigitalOcean del 12 de agosto — escalamiento del rendimiento agregado casi lineal hasta ~1.937 tokens de salida por segundo con 256 solicitudes concurrentes, cero errores y sin saturación encontrada — son el primer dato de plataforma gestionada sobre esa cuestión, aunque son cifras propias de DigitalOcean sobre su propio servicio, no una comparación directa contra el de Alibaba.

3. Pipelines de documento y capturas de pantalla. La entrada de video e imagen y el OSWorld-Verified 86.1 lo hacen creíble para flujos de trabajo que leen pantallas: automatización de control de calidad, triaje de soporte a partir de capturas de pantalla, tareas adyacentes a RPA. De nuevo, la entrada multimodal es una función de API alojada; la ruta de base abierta de DigitalOcean es solo texto.

4. Dónde aún no lo pondríamos. UX interactiva crítica en latencia y cualquier carga de trabajo regulada que requiera evaluación reproducible. Para la primera, quieres un rendimiento medido que controles. Para la segunda, la reproducibilidad ahora tiene una tarjeta de modelo y una licencia para citar, pero la tabla de referencia de Alibaba sigue sin replicarse — y la regresión de Omniscience de AA (tasa de alucinación de hasta el 40%) es un recordatorio de que la puntuación independiente corta en ambos sentidos.

Cómo acceder a Qwen3.8-Max

Hay varias vías prácticas. La directa, a través de Alibaba Model Studio / DashScope — o de la propia API QwenCloud de Qwen — te da la tarifa mencionada arriba y el acceso más temprano a las nuevas versiones con fecha: la compilación Qwen3.8-Max-0902 del 2 de septiembre apareció allí primero antes de extenderse a otros endpoints — a costa de incorporar un nuevo proveedor y gestionar otra clave. Qwen Chat y la aplicación Qwen son la forma más rápida de evaluar el comportamiento antes de escribir código. Descargar los pesos abiertos desde Hugging Face es una cuarta vía para los equipos que quieran ejecutar su propia infraestructura — con las salvedades de tamaño y licencia indicadas arriba. Recurrir a un router es la opción que la mayoría de los equipos de producción debería considerar, porque separa la decisión de migración de la decisión de evaluación.

Desde el 14 de agosto de 2026, existe una opción genuinamente nueva: Qwen3.8-Max ya está disponible en DigitalOcean Serverless Inference, que Alibaba anunció como su «socio de lanzamiento Day 0» — el propio planteamiento de Alibaba, aunque el listado es de DigitalOcean y se sostiene por sí solo. DigitalOcean sirve el checkpoint de pesos abiertos (id del modelo de la plataforma qwen3.8-max), cuantizado con NVFP4 en GPUs NVIDIA HGX B300 en colaboración técnica con Inferact, como una API serverless totalmente gestionada: un endpoint, precios basados en el uso, sin infraestructura que gestionar. Su tarifa coincide con la lista de Alibaba — $2.00 entrada / $6.00 salida por 1M, con entrada en caché a $0.20 — y sirve el contexto nativo de 262K de la base abierta, con el razonamiento siempre activado, en lugar del modo multimodal de ~1M de tokens del modelo insignia alojado. Ese límite de contexto importa si la carga de trabajo se inclina hacia el extremo largo: el modo completo de un millón de tokens sigue siendo exclusivo de la API de Alibaba.

Lo que la ruta de DigitalOcean añade más allá de la geografía son los primeros datos duros de serving de un proveedor distinto de Alibaba. Las propias mediciones de DigitalOcean contra su endpoint de producción, tomadas el 12 de agosto, muestran un escalado lineal del prefill de aproximadamente 16,000 tokens/sec — regla aproximada: TTFT ≈ (entrada ÷ 16,000) + 0.7s, por lo que ~1.1s con ~1,080 tokens y ~15.8s con ~254K — y un rendimiento agregado que alcanza ~1,937 tokens de salida/seg en 256 solicitudes concurrentes con cero errores y sin encontrar un punto de saturación. Esas son las cifras de DigitalOcean en su propio despliegue, no una prueba comparativa controlada, pero son los primeros datos de latencia y concurrencia de este modelo fuera de la nube de Alibaba, y abordan directamente la preocupación de "minucioso pero lento" de la era de la versión preliminar.

Qwen3.8-Max ya está disponible en OrcaRouter como qwen/qwen3.8-max, y la actualización del 2 de septiembre se puede enrutar con su propio id fechado — qwen/qwen3.8-max-0902 — ambos a la misma tarifa de lista de $2.00 / $6.00. OrcaRouter aplica un margen del 0% y traspasa el precio del proveedor directamente, así que cualquiera de las dos rutas cuesta lo mismo que ir directo. Nuestra telemetría de servicio actual muestra un p50 de tiempo hasta el primer token de 1,64 segundos en una ventana de 7 días. Esa es una medición de latencia propia, no una afirmación del proveedor, y conviene sopesarla frente a los informes de la era de vista previa de "el modelo más lento que he usado": esos provienen de un único revisor que ejecutaba procesos de agente de una hora en la infraestructura de vista previa, y deberían volver a probarse contra el servicio GA en lugar de repetirse como un hecho actual.

El valor práctico de la ruta del enrutador es que Qwen3.8-Max se encuentra detrás del mismo endpoint compatible con OpenAI que los modelos que ya ejecutas, por lo que una evaluación es un cambio de cadena de modelo. Puedes enviarle el 5% del tráfico de producción, compararlo con tu modelo actual en prompts idénticos y mantener un respaldo, que es exactamente la postura que merece un modelo con una tabla de proveedor no replicada. Esa misma postura es la manera correcta de probar el despliegue de DigitalOcean: ejecutar una porción contra él con un respaldo implementado, en lugar de apostar una ruta de producción por una pila de servicio de dos semanas.

Limitaciones y riesgos honestos

La tabla de proveedores sigue sin auditar. La puntuación independiente ya está disponible (AA Index 56), pero la tabla de referencia propia de Alibaba sigue sin replicarse, y la medición de AA señala una regresión de Omniscience con una tasa de alucinación de hasta el 40%. La puntuación independiente ayuda; no hace que la tabla de proveedores sea auditable.

La ruta de DigitalOcean es la base abierta, no el buque insignia. Sirve el checkpoint con contexto de 262K, solo texto, pensamiento siempre activo, cuantizado con NVFP4, y las comprobaciones puntuales de DigitalOcean obtienen 88 en GPQA Diamond frente al 92.6 publicado por Alibaba, una brecha que DigitalOcean califica de indicativa más que controlada. Si necesitas la API multimodal completa de un millón de tokens, esa sigue alojada en Alibaba.

Qwen3.8-27B se lanzó, pero la numeración es del proveedor. Los pesos del modelo 27B se publicaron el 14 de agosto bajo licencia Apache 2.0, cerrando la brecha on-premise — pero sus resultados de benchmark, reportados por Alibaba, no han sido reproducidos, y las cuantizaciones de la comunidad aún se estaban publicando al momento de esta actualización.

• Licencia personalizada, no Apache 2.0. La licencia de Qwen3.8-Max permite uso comercial con atribución, pero incluye dos límites de escala: visualización destacada del nombre del modelo por encima de 100M de MAU o $20M de ingresos mensuales, y una licencia separada para negocios de MaaS/AI-Work-Assistant con ingresos superiores a $50M en los últimos doce meses. Léela antes de superar los umbrales.

Verbosidad y desviación de las instrucciones.IFBench 82.8 es la cifra más baja en la propia tabla de Alibaba, y los evaluadores de la vista previa vieron repetidamente cómo el modelo excedía el alcance — añadiendo funciones no solicitadas. Las propias cifras de AA ahora lo cuantifican: 64 pasos por tarea de GDPval-AA es lo que eleva el coste a $1.14, un 25% por encima de Kimi K3. Encantador en una demo, caro cuando la salida se factura a $6/1M y desestabilizador cuando necesitas formatos exactos.

Restricciones de contenido.Al igual que otros modelos de frontera alojados en China, las respuestas sobre temas políticamente sensibles están restringidas. Relevante si tu producto atiende consultas abiertas.

Los tokens de razonamiento se facturan como salida. Con el razonamiento habilitado, los costos reales superan las estimaciones ingenuas. Mide con el razonamiento configurado de la forma en que realmente lo lanzarás.

Preguntas frecuentes

¿Está disponible Qwen3.8-Max ahora?

Sí. Alcanzó disponibilidad general el 3 de agosto de 2026, con una tarifa publicada y una API compatible con OpenAI y DashScope. La instantánea de producción actual — Qwen3.8-Max-0902, lanzada el 2 de septiembre — está activa en la API de QwenCloud y es lo que el endpoint estándar qwen3.8-max sirve ahora. Esto supone un cambio respecto a su estado de vista previa del 19 de julio, cuando el acceso se limitaba a Qwen Chat, la aplicación Qwen y la campaña de créditos de Qoder.

¿Qué es Qwen3.8-Max-0902?

Qwen3.8-Max-0902 es la actualización de producción del 2 de septiembre de 2026 de Qwen3.8-Max: el mismo buque insignia de 2,4 billones de parámetros con MoE disperso y contexto de 1 millón de tokens, con entrenamiento posterior adicional en Coding y Cowork, y disponible en la API de QwenCloud con los mismos precios de 2/6 dólares. Qwen afirma que la nueva versión es más sólida en tareas empresariales y científicas complejas —una afirmación del proveedor, aún no evaluada de forma independiente—, mientras que en el eje de codificación ya cuenta con un resultado independiente: el n.º 1 en el panel de Code Arena: WebDev con 1691 puntos y la cima de su frontera de Pareto de costo-rendimiento con un costo combinado de aproximadamente 5 dólares por millón de tokens, según el anuncio de Alibaba sobre la inclusión en la arena en vivo, confirmado por la propia cuenta de QwenCloud de Qwen.

¿Cuánto cuesta Qwen3.8-Max?

$2.00 por cada 1M de tokens de entrada y $6.00 por cada 1M de tokens de salida, fijo en todo el contexto de 1M de tokens sin recargo por mensajes largos. Los aciertos de entrada en caché cuestan $0.25 por 1M, la creación explícita de caché $2.50 y las lecturas de caché $0.17. Los tokens de razonamiento se facturan a la tarifa de salida. En el índice de inteligencia de Artificial Analysis, el costo medido del modelo es de $1.14 por tarea; consulta la sección de precios para ver por qué eso supera el cálculo de tokens. La ruta serverless de DigitalOcean indica los mismos $2/$6 con entrada en caché a $0.20.

¿Cuántos parámetros tiene Qwen3.8-Max?

2,4 billones en total, en una configuración dispersa de Mezcla de Expertos. El número de parámetros activos —la cifra que realmente determina el costo de servicio y la latencia— se confirma ahora en 95 mil millones activados, según la ficha oficial del modelo Qwen3.8-2.4T-A95B (512 expertos; 10 enrutados más uno activo compartido por token).

¿Están abiertos los pesos de Qwen3.8-Max?

Sí — desde el 12 de agosto de 2026. Qwen publicó Qwen3.8-2.4T-A95B (BF16) y Qwen3.8-2.4T-A95B-FP8 en Hugging Face, cada uno con 213 archivos de pesos. La licencia es una licencia personalizada de Qwen3.8-Max (Hugging Face la lista como "other"), no Apache 2.0: permite uso comercial con atribución y conlleva dos restricciones basadas en escala. El checkpoint abierto es solo texto con el pensamiento siempre activado; la API alojada añade visión, un modo opcional sin pensamiento y el contexto completo de 1M.

¿Ha sido Qwen3.8-Max sometido a pruebas de referencia independientes?

Sí — a partir del 6 de agosto de 2026. Artificial Analysis le puntúa 56 en su Índice de Inteligencia, a 1,14 $ por tarea, medido en la API oficial de Alibaba: un salto de 10 puntos sobre Qwen3.7-Max (46), a la altura de Claude Opus 4.8 (56) y un punto por detrás de Kimi K3 (57). La tabla comparativa anterior, sin embargo, sigue siendo la reportada por Alibaba y sin replicar, y la clasificación general de LMArena aún no tiene una puntuación pública. El panorama de la arena independiente cambió el 2 de septiembre: la actualización 0902 debutó en el #1 del tablero Code Arena: WebDev de la misma plataforma, con 1.691 puntos — un resultado de voto ciego de un tercero, no una tabla de Alibaba — y la frontera costo-rendimiento de Code Arena la sitúa como el valor con la puntuación más alta del tablero, con un costo combinado de ~5 $/MToken. La verificación puntual de DigitalOcean de su versión cuantizada (88 en GPQA Diamond) es la primera comprobación de un tercero sobre un despliegue en servicio, y es explícitamente indicativa, no controlada. Una advertencia para la columna «independiente»: CommerceAgentBench, donde Qwen3.8-Max lidera entre los modelos de pesos abiertos, no es un segundo árbitro independiente — Accio, que lo construyó y publicó, es el propio equipo de Alibaba.

¿Es Qwen3.8-Max mejor que Qwen3.7-Max?

Según las propias cifras de Alibaba, sustancialmente — FrontierSWE 73.5 frente a 40.7 y DeepSWE 1.1 56.6 frente a 21.6 son casi el doble en tareas difíciles de ingeniería de software. También es más barato que los $2.50/$7.50 de su predecesor. De forma independiente, AA sitúa el salto generacional en 10 puntos en su Índice de Inteligencia (56 frente a 46). Ambas afirmaciones del proveedor deberían verificarse aún en su carga de trabajo.

¿Puedo auto-alojar Qwen3.8-Max?

En la práctica, no. El conjunto completo de pesos de 2.4T ocupa aproximadamente 4.9TB en BF16, unos 2.4TB en FP8 y alrededor de 1.2TB en 4 bits; frente a los ~141GB por H200, eso equivale a ocho o más GPU de gama alta. Con 95B activos por token, el cómputo por token es comparativamente modesto, pero la huella de memoria es la restricción determinante. El servicio NVFP4 de DigitalOcean sobre B300s es la prueba práctica de que con 4 bits el modelo cabe en un solo nodo. El modelo Qwen3.8-27B —con ~17GB de VRAM según lo reportado— es la opción realista para entornos on-premise, y sus pesos se publicaron el 14 de agosto de 2026 bajo Apache 2.0: ahora descargables, no una mera promesa.

¿Qué es Qwen3.8-27B?

Un modelo mucho más pequeño anunciado junto al buque insignia, posicionado como la vía práctica para despliegue on-premise. Es un modelo denso de 27B, nativamente multimodal, con un contexto nativo de 262K tokens extensible a 1M, y se distribuye bajo Apache 2.0. Sus pesos estuvieron disponibles en Hugging Face y ModelScope el 14 de agosto de 2026; Daniel Han, de Unsloth, informa que se ejecuta en aproximadamente 17GB de VRAM — una única tarjeta de consumo de gama alta. Sus afirmaciones de benchmark son reportadas por Alibaba y no han sido reproducidas de forma independiente.

¿Es Qwen3.8-Max multimodal?

Sí: acepta entrada de texto, imagen y video, y devuelve texto. También admite modo de pensamiento, llamada de funciones, herramientas integradas y salidas estructuradas. El checkpoint de pesos abiertos es solo de texto; la entrada multimodal es una característica de la API alojada, que es lo que la ruta de DigitalOcean no incluye.

¿Está disponible Qwen3.8-Max en DigitalOcean?

Sí — desde el 14 de agosto de 2026. DigitalOcean Serverless Inference sirve el checkpoint de pesos abiertos (NVFP4 en NVIDIA HGX B300) a $2.00/$6.00 por 1M con $0.20 de entrada en caché, un contexto de 262K tokens, solo texto, razonamiento siempre activo. Alibaba llama a DigitalOcean su "socio de lanzamiento del Día 0"; el listado en sí es de DigitalOcean e independiente de esa expresión. Las cifras medidas por DigitalOcean: prefill de ~16K tokens/seg y ~1,937 tokens de salida/seg con 256 solicitudes concurrentes y cero errores.

¿Puedo usar Qwen3.8-Max a través de OrcaRouter?

Sí. Está disponible como qwen/qwen3.8-max, y la instantánea del 2 de septiembre con su propio id con fecha — qwen/qwen3.8-max-0902 — con el mismo precio de lista de $2.00/$6.00, con un margen del 0%. El enrutamiento cuesta lo mismo que ir directamente, a través del endpoint compatible con OpenAI que ya utilizas. Nuestra telemetría de 7 días muestra un p50 del tiempo hasta el primer token de 1.64 segundos.

¿Debería mover el tráfico de producción a eso hoy?

No en su totalidad. El precio y la primera puntuación independiente hacen que una evaluación seria sea barata y valga la pena hacerla ahora, pero con un costo por tarea un 25% superior al de Kimi K3, la medida disciplinada es dividir el tráfico contra su sistema actual con indicaciones idénticas, con un respaldo en su lugar — no una migración. La ruta de DigitalOcean añade un segundo despliegue gestionado para probar, lo que abarata aún más la evaluación.

En resumen

Qwen3.8-Max pasó dos semanas como el modelo más interesante que nadie podía comprar. En GA es una propuesta genuinamente diferente: la tarifa plana de $2/$6 por millón de tokens es un precio agresivo, las tarifas de caché abaratan el trabajo iterativo de agentes y el salto generacional en FrontierSWE y DeepSWE — si se replica — lo convierte en un modelo de código real, no en un alarde de escala. La llegada de los pesos abiertos bajo una licencia real el 12 de agosto convirtió el «open weights coming» de promesa en hecho, y la vía day-zero de DigitalOcean anunciada el 14 de agosto — con cifras de inferencia medidas y una lectura de caché de $0.20 — refuerza el argumento de «pruébalo a bajo costo» y da a los equipos un despliegue gestionado por un tercero con el que comparar la API de la propia Alibaba. La actualización Qwen3.8-Max-0902 del 2 de septiembre mantiene intacta esa tesis: los mismos $2/$6 y 1M de contexto, con más post-entrenamiento en las tareas de programación y colaboración para las que el modelo ya estaba posicionado. La actualización añadió además un marcador independiente de preferencias humanas para esa apuesta por el código: Qwen3.8-Max-0902 debutó en el #1 del ranking WebDev de Code Arena con 1.691 puntos, por delante de Claude Opus 5 y Kimi K3, y a un precio combinado de ~$5/MToken es el modelo con mayor puntuación en la frontera de Pareto costo-rendimiento de ese ranking. El resultado de CommerceAgentBench que el equipo Accio de Alibaba publicó esa misma semana — Qwen3.8-Max liderando el campo de los pesos abiertos en un benchmark construido a partir de flujos de trabajo comerciales reales — otorga a esa tesis de trabajo colaborativo un marcador concreto propio, aunque gestionado por el proveedor.

Lo que ha cambiado es que tanto el árbitro como los pesos han aterrizado —y el veredicto es en general bueno, con asteriscos de verdad—. AA asigna a Qwen3.8-Max 56 puntos en el Índice de Inteligencia: un salto generacional genuino que deja al modelo a la par de Claude Opus 4.8, aunque el mismo cuadro de resultados muestra a Kimi K3 un punto por delante, con un coste por tarea inferior en un 25 %, y advierte de una caída de 10 puntos en Omniscience conforme aumenta la tasa de alucinaciones. La cuestión de los parámetros activos está zanjada —95B activados, confirmado en la ficha del modelo— y la licencia está publicada: personalizada, no Apache 2.0. Lo que no ha cambiado: la tabla de benchmarks de la propia Alibaba sigue sin replicarse de forma independiente; el coste por tarea sigue siendo alto porque el modelo ejecuta muchísimos pasos; la base abierta servida en DigitalOcean es un modelo ligeramente distinto de lo que anuncian las cifras principales del buque insignia (contexto de 262K, NVFP4, comprobación puntual de GPQA: 88 frente a 92,6); y los resultados de benchmark del Qwen3.8-27B son declarados por el proveedor, aunque sus pesos ya se han publicado. Esa combinación no convierte a Qwen3.8-Max en una mala apuesta —a este precio es casi un experimento obligatorio—, pero sí implica que la postura correcta es evaluar sin contemplaciones, enrutar con deliberación y mantener un respaldo. Lo que ahora toca vigilar es si el número de pasos agénticos que hay detrás de ese coste de 1,14 USD por tarea es algo que tu carga de trabajo pueda absorber; si la ventaja de la build 0902 en Code Arena: WebDev se mantiene a medida que se acumulan los votos; si sus mejoras en Coding y Cowork se replican en cargas de trabajo reales; si la ventaja en la categoría de pesos abiertos de CommerceAgentBench —dos pasadas agregadas sobre el banco de pruebas de la propia Alibaba— sobrevive a una ejecución independiente; si los resultados declarados del 27B siguen en pie; y si el rendimiento medido del despliegue en DigitalOcean resiste el tráfico real —eso decidirá si «solo superado por Fable 5» era posicionamiento o profecía.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario