Una tarjeta de título generada que dice 'AREX-2 vs Qwen3.8-Max - Un sustrato y lo que corre sobre él', con dos paneles. El panel izquierdo, encabezado Qwen3.8-Max, enumera: activo desde el 3 de agosto de 2026; contexto de 1M de tokens, multimodal; $2 de entrada / $6 de salida por 1M; invocable hoy. El panel derecho, encabezado AREX-2, enumera: repositorio creado el 29 de septiembre de 2026; sin pesos, sin ficha del modelo; sin tabla de tarifas en ninguna parte; no invocable en ninguna parte. Un pie de página dice 'La primera generación de AREX fue post-entrenada sobre una base Qwen'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

AREX-2 vs Qwen 3.8: Uno es un sustrato sobre el que probablemente está construido el otro

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El enfrentamiento entre AREX-2 y Qwen3.8-Max parece una pelea directa entre los sistemas insignia de dos laboratorios chinos, y no lo es — no porque AREX-2 no esté probado, aunque de hecho no lo está, sino porque los dos se sitúan en capas diferentes de la misma pila. Qwen3.8-Max lleva activo desde el 3 de agosto de 2026, a $2 por millón de tokens de entrada y $6 por millón de salida con una ventana de contexto de 1M de tokens; sus hermanos de pesos abiertos, Qwen3.8-27B y Qwen3.8-Flash, se lanzaron el 13 y el 26 de agosto con benchmarks publicados y precios publicados. AREX-2 es un repositorio que BAAI creó en Hugging Face el 29 de septiembre de 2026 a las 17:56 UTC, que contiene un .gitattributes y nada más. Y la razón por la que los dos no son rivales está en el hecho subyacente de que ninguno de los dos proveedores anuncia a voces: todos los modelos AREX que BAAI ha lanzado hasta ahora se construyen sobre una base Qwe​n.

Eso no es una especulación sobre AREX-2. Está documentado para la generación que existe. AREX-Base es un mixture-of-experts de 122 mil millones de parámetros con 10 mil millones de parámetros activos, construido sobre Qwen3.5-122B-A10B, y AREX-Turbo es un modelo denso de 4B construido sobre Qwen3.5-4B; ambos se publicaron el 23 de julio de 2026 bajo Apache 2.0. Así que la forma honesta de esta comparación no es agente versus buque insignia. Es: ¿qué te aporta hoy el sustrato de Alibaba, qué añade encima la capa de agentes de BAAI, y cuánto de la segunda pregunta se puede responder antes de que BAAI suba un archivo?

¿Qué está en vivo del lado de Qwen y cuánto cuesta?

La generación Qwen3.8 es inusualmente fácil de analizar porque está totalmente especificada y con precios públicos, en tres niveles distintos.

• Qwen3.8-Max — lanzado el 3 de agosto de 2026. Una ventana de contexto de 1M de tokens, entrada nativa de texto, imagen y video, modo de pensamiento, llamada a funciones y salidas estructuradas, y tres formatos de conexión (compatible con OpenAI, compatible con Anthropic y DashScope nativo) en cinco regiones. $2.00 por millón de tokens de entrada y $6.00 por millón de salida, con lecturas de caché a $0.25.

• Qwen3.8-27B — lanzado el 13 de agosto de 2026. Denso, 27B parámetros, contexto de 256K (262.144 posiciones), entrada de texto, imagen y vídeo, pesos Apache 2.0. Publicado en la propia ficha de Qwe​n con 90,3 en LiveCodeBench v6, 89,2 en GPQA Diamond, 84,3 en OSWorld-Verified y 79,0 en QwenSWEBench — reportado por el proveedor, no reproducido de forma independiente. Una medición independiente lo sitúa en un Índice de Inteligencia de Artificial Analysis de 33,7 y 68,1 en el índice de codificación de AA.

• Qwen3.8-Flash — publicada el 26 de agosto de 2026. Misma ventana de 1M de tokens y la misma entrada multimodal, a $0.15 por millón de tokens de entrada y $0.47 de salida. El nivel económico de la familia, y el que hace asequible el tráfico agéntico de gran volumen.

También hay una entrada Qwen3.8 sin etiquetar: el buque insignia de 2,4 billones de parámetros cuyos pesos Alibaba ha dicho que están por llegar, y que aún no es invocable en ningún sitio. Si buscas "Qwen 3.8" y esperas un solo modelo, esa es la razón por la que la respuesta es una familia de cuatro, no uno.

A screenshot of the OrcaRouter model page for Qwen3.8-27B, showing the Featured badge, a 256K-token context window, text, image and video input with text output, badges for Vision, Tools, JSON and Reasoning, the provider line 'by Qwen - 2026-08-13', a pricing row of $0.33 input and $2.40 output per million tokens with measured latency and 120.2M tokens of traffic, and the beginning of the model description covering the 27B dense multimodal model's Apache-2.0 licence and 256K context.

Frente a todo eso, la especificación de AREX-2 ocupa una sola línea: un repositorio, una marca de tiempo y un nombre que implica una segunda generación de algo que BAAI ya construyó una vez.

El detalle que reencuadra toda la comparación

AREX no es un competidor de Qwen; es un consumidor de él. Ambos modelos AREX de primera generación reciben post-entrenamiento sobre backbones Qwen3.5 y después se envuelven en el marco que los convierte en agentes en lugar de modelos de chat: un bucle interno que busca, navega e integra evidencia en una respuesta candidata que lleva una cifra de confianza, y un bucle externo que verifica esa respuesta contra las restricciones originales y o bien la acepta, o bien la refina, o bien descarta la trayectoria y empieza de nuevo. La ingeniería interesante de AREX no es la red. Es el bucle, el mecanismo de actualización de contexto que mantiene en orden los hallazgos verificados, los candidatos abiertos y las restricciones no resueltas a lo largo de un horizonte prolongado, y la interfaz de herramientas que expone la búsqueda y la navegación al modelo como acciones de primera clase.

Por eso los números publicados por la propia familia —82.5 en BrowseComp, 85.4 en GAIA, 71.0 en xbench-2510, 89.9 en DeepSearch QA y 82.0 en WideSearch-en para el 122B Base, con 70.7 / 81.6 / 57.0 / 78.5 / 68.5 para el 4B Turbo— no son comparables con las puntuaciones de codificación y de agentes de Qwen3.8-27B, aunque ambos comparten un linaje arquitectónico. Miden cosas diferentes. QwenSWEBench pregunta si un modelo puede resolver un problema de un repositorio. BrowseComp pregunta si un agente puede encontrar un dato que es deliberadamente difícil de encontrar, a lo largo de muchas búsquedas, sin perder la pregunta. Un checkpoint Qwen3.5 en bruto obtiene malos resultados en la segunda y buenos en la primera, que es precisamente la brecha que el postentrenamiento y el harness de BAAI tienen como objetivo cerrar.

A generated pricing card headed 'The Qwen3.8 family is priced. AREX-2 is not callable.' It lists Qwen3.8-Max at $2.00 in / $6.00 out with a 1M context released 3 Aug 2026, Qwen3.8-27B at $0.33 in / $2.40 out with 256K context and open weights released 13 Aug 2026, Qwen3.8-Flash at $0.15 in / $0.47 out with a 1M context released 26 Aug 2026, Qwen3.5-122B-A10B at $0.115 in / $0.917 out as the backbone AREX-Base post-trains up to 128K, and a highlighted AREX-2 row reading 'no rate card' because there are no weights, card or licence tag. A footer reads 'Qwen3.8-27B scores 33.7 on the AA Intelligence Index; AREX-2 does not exist to score.' The OrcaRouter logo is composited in the bottom-right corner.

Lo que más plausiblemente sería una segunda generación

Si AREX-2 continúa el patrón, la lectura más probable —una inferencia, no un hecho— es un agente de investigación de segunda generación post-entrenado sobre un backbone Qwe​n más nuevo que la generación 3.5 que usan los modelos AREX actuales. Qwen3.8-27B es denso, multimodal y Apache 2.0, lo que lo convierte en un candidato natural para un agente de nivel de calidad; Qwen3.8-Flash es barato por token, lo que importa enormemente cuando tu agente hace docenas de llamadas por consulta y relee un contexto cada vez mayor en cada paso.

Nada de eso está confirmado. El nombre no aporta ningún tamaño, ninguna arquitectura base ni ninguna fecha, y un "2" en una línea de producto es una convención de nomenclatura, no una especificación. Lo que está confirmado es mucho más limitado y debería formularse así: BAAI creó el repositorio el 29 de septiembre de 2026, no puso nada en él y no ha anunciado nada. Ni pesos, ni ficha, ni número de parámetros, ni etiqueta de licencia, ni benchmarks, ni ningún proveedor que lo sirva. Si ves cifras de AREX-2 citadas en algún sitio esta semana, no son mediciones.

Lo que realmente puedes comprar esta tarde

La asimetría práctica entre estos dos no es la calidad, sino que un lado tiene una tarifa y el otro una entrada en un directorio.

Si tu trabajo es agéntico y quieres el sustrato sobre el que se construyó la familia AREX, el backbone exacto es invocable: Qwen3.5-122B-A10B está en el catálogo de OrcaRouter a $0.115 por millón de tokens de entrada y $0.917 por millón de salida hasta 128K tokens, y sube a $0.287 / $2.294 a partir de ahí, con visión, uso de herramientas y razonamiento habilitados. Ese es el modelo que AREX-Base post-entrena, disponible sin esperar nada.

Si quieres la generación actual, los dos niveles abiertos de Qwen3.8 están en el catálogo: Qwen3.8-27B a 0,33 $ por millón de tokens de entrada y 2,40 $ de salida, ejecutándose en nuestra propia infraestructura porque los pesos son abiertos y no hay ningún coste por token de un proveedor que repercutir, y Qwen3.8-Flash a 0,15 $ / 0,47 $ para el nivel de volumen. Una sola API cubre ambos, con el precio de lista del proveedor repercutido sin añadir nada por token, así que cuando Alibaba cambia un precio, la cifra de aquí cambia el mismo día.

Y cuando AREX-2 por fin se lance, la razón por la que pertenece detrás de esa misma capa es estructural, no promocional. Un bucle de agente que hace veinte llamadas por consulta multiplica por veinte la tasa de fallos de cada proveedor; una regla de enrutamiento con conmutación automática por error que decide en tiempo de ejecución es la diferencia entre que un tiempo de espera agotado sea un reintento y que sea una respuesta segura pero equivocada. Ese argumento se aplica a cualquier agente de investigación, y se aplicará a AREX-2 siempre que haya un AREX-2 que enrutar.

¿Quién debería actuar y sobre qué?

Si hoy necesitas un agente de investigación, AREX-Base es el modelo AREX que existe, se lanzó en julio bajo Apache 2.0, y sus benchmarks de agentes son del propio proveedor, pero al menos están vinculados a un modelo descargable. Si hoy necesitas razonamiento multimodal de vanguardia o tráfico agéntico de gran volumen, los niveles de Qwen3.8 están disponibles, tienen precio y están evaluados de forma independiente en parte, y nada sobre la existencia de AREX-2 cambia esa decisión.

El único escenario en el que AREX-2 importa para una decisión que vas a tomar esta semana es aquel en el que eliges un backbone para un fine-tune. Y ahí la respuesta ya se ve en el catálogo: los backbones 3.5 que usó AREX siguen siendo baratos y están disponibles, la generación 3.8 es mejor y también está disponible, y un AREX de segunda generación —cuando llegue— será evidencia sobre qué base de Qwen cree BAAI que vale la pena construir, no un reemplazo para él.

Tres cosas resolverían el resto: archivos en el árbol, una ficha con un recuento de parámetros y un campo de modelo base, y una etiqueta de licencia. La primera de ellas es la que importa, porque hasta que llegue, esta comparación es entre una familia con precio y un marcador de posición.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario