
AREX-2 vs Qwen 3.8: Uno es un sustrato sobre el que probablemente está construido el otro
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 397 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- OrcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
El enfrentamiento entre AREX-2 y Qwen3.8-Max parece una pelea directa entre los sistemas insignia de dos laboratorios chinos, y no lo es — no porque AREX-2 no esté probado, aunque de hecho no lo está, sino porque los dos se sitúan en capas diferentes de la misma pila. Qwen3.8-Max lleva activo desde el 3 de agosto de 2026, a $2 por millón de tokens de entrada y $6 por millón de salida con una ventana de contexto de 1M de tokens; sus hermanos de pesos abiertos, Qwen3.8-27B y Qwen3.8-Flash, se lanzaron el 13 y el 26 de agosto con benchmarks publicados y precios publicados. AREX-2 es un repositorio que BAAI creó en Hugging Face el 29 de septiembre de 2026 a las 17:56 UTC, que contiene un .gitattributes y nada más. Y la razón por la que los dos no son rivales está en el hecho subyacente de que ninguno de los dos proveedores anuncia a voces: todos los modelos AREX que BAAI ha lanzado hasta ahora se construyen sobre una base Qwen.
Eso no es una especulación sobre AREX-2. Está documentado para la generación que existe. AREX-Base es un mixture-of-experts de 122 mil millones de parámetros con 10 mil millones de parámetros activos, construido sobre Qwen3.5-122B-A10B, y AREX-Turbo es un modelo denso de 4B construido sobre Qwen3.5-4B; ambos se publicaron el 23 de julio de 2026 bajo Apache 2.0. Así que la forma honesta de esta comparación no es agente versus buque insignia. Es: ¿qué te aporta hoy el sustrato de Alibaba, qué añade encima la capa de agentes de BAAI, y cuánto de la segunda pregunta se puede responder antes de que BAAI suba un archivo?
¿Qué está en vivo del lado de Qwen y cuánto cuesta?
La generación Qwen3.8 es inusualmente fácil de analizar porque está totalmente especificada y con precios públicos, en tres niveles distintos.
• Qwen3.8-Max — lanzado el 3 de agosto de 2026. Una ventana de contexto de 1M de tokens, entrada nativa de texto, imagen y video, modo de pensamiento, llamada a funciones y salidas estructuradas, y tres formatos de conexión (compatible con OpenAI, compatible con Anthropic y DashScope nativo) en cinco regiones. $2.00 por millón de tokens de entrada y $6.00 por millón de salida, con lecturas de caché a $0.25.
• Qwen3.8-27B — lanzado el 13 de agosto de 2026. Denso, 27B parámetros, contexto de 256K (262.144 posiciones), entrada de texto, imagen y vídeo, pesos Apache 2.0. Publicado en la propia ficha de Qwen con 90,3 en LiveCodeBench v6, 89,2 en GPQA Diamond, 84,3 en OSWorld-Verified y 79,0 en QwenSWEBench — reportado por el proveedor, no reproducido de forma independiente. Una medición independiente lo sitúa en un Índice de Inteligencia de Artificial Analysis de 33,7 y 68,1 en el índice de codificación de AA.
• Qwen3.8-Flash — publicada el 26 de agosto de 2026. Misma ventana de 1M de tokens y la misma entrada multimodal, a $0.15 por millón de tokens de entrada y $0.47 de salida. El nivel económico de la familia, y el que hace asequible el tráfico agéntico de gran volumen.
También hay una entrada Qwen3.8 sin etiquetar: el buque insignia de 2,4 billones de parámetros cuyos pesos Alibaba ha dicho que están por llegar, y que aún no es invocable en ningún sitio. Si buscas "Qwen 3.8" y esperas un solo modelo, esa es la razón por la que la respuesta es una familia de cuatro, no uno.

Frente a todo eso, la especificación de AREX-2 ocupa una sola línea: un repositorio, una marca de tiempo y un nombre que implica una segunda generación de algo que BAAI ya construyó una vez.
El detalle que reencuadra toda la comparación
AREX no es un competidor de Qwen; es un consumidor de él. Ambos modelos AREX de primera generación reciben post-entrenamiento sobre backbones Qwen3.5 y después se envuelven en el marco que los convierte en agentes en lugar de modelos de chat: un bucle interno que busca, navega e integra evidencia en una respuesta candidata que lleva una cifra de confianza, y un bucle externo que verifica esa respuesta contra las restricciones originales y o bien la acepta, o bien la refina, o bien descarta la trayectoria y empieza de nuevo. La ingeniería interesante de AREX no es la red. Es el bucle, el mecanismo de actualización de contexto que mantiene en orden los hallazgos verificados, los candidatos abiertos y las restricciones no resueltas a lo largo de un horizonte prolongado, y la interfaz de herramientas que expone la búsqueda y la navegación al modelo como acciones de primera clase.
Por eso los números publicados por la propia familia —82.5 en BrowseComp, 85.4 en GAIA, 71.0 en xbench-2510, 89.9 en DeepSearch QA y 82.0 en WideSearch-en para el 122B Base, con 70.7 / 81.6 / 57.0 / 78.5 / 68.5 para el 4B Turbo— no son comparables con las puntuaciones de codificación y de agentes de Qwen3.8-27B, aunque ambos comparten un linaje arquitectónico. Miden cosas diferentes. QwenSWEBench pregunta si un modelo puede resolver un problema de un repositorio. BrowseComp pregunta si un agente puede encontrar un dato que es deliberadamente difícil de encontrar, a lo largo de muchas búsquedas, sin perder la pregunta. Un checkpoint Qwen3.5 en bruto obtiene malos resultados en la segunda y buenos en la primera, que es precisamente la brecha que el postentrenamiento y el harness de BAAI tienen como objetivo cerrar.

Lo que más plausiblemente sería una segunda generación
Si AREX-2 continúa el patrón, la lectura más probable —una inferencia, no un hecho— es un agente de investigación de segunda generación post-entrenado sobre un backbone Qwen más nuevo que la generación 3.5 que usan los modelos AREX actuales. Qwen3.8-27B es denso, multimodal y Apache 2.0, lo que lo convierte en un candidato natural para un agente de nivel de calidad; Qwen3.8-Flash es barato por token, lo que importa enormemente cuando tu agente hace docenas de llamadas por consulta y relee un contexto cada vez mayor en cada paso.
Nada de eso está confirmado. El nombre no aporta ningún tamaño, ninguna arquitectura base ni ninguna fecha, y un "2" en una línea de producto es una convención de nomenclatura, no una especificación. Lo que está confirmado es mucho más limitado y debería formularse así: BAAI creó el repositorio el 29 de septiembre de 2026, no puso nada en él y no ha anunciado nada. Ni pesos, ni ficha, ni número de parámetros, ni etiqueta de licencia, ni benchmarks, ni ningún proveedor que lo sirva. Si ves cifras de AREX-2 citadas en algún sitio esta semana, no son mediciones.
Lo que realmente puedes comprar esta tarde
La asimetría práctica entre estos dos no es la calidad, sino que un lado tiene una tarifa y el otro una entrada en un directorio.
Si tu trabajo es agéntico y quieres el sustrato sobre el que se construyó la familia AREX, el backbone exacto es invocable: Qwen3.5-122B-A10B está en el catálogo de OrcaRouter a $0.115 por millón de tokens de entrada y $0.917 por millón de salida hasta 128K tokens, y sube a $0.287 / $2.294 a partir de ahí, con visión, uso de herramientas y razonamiento habilitados. Ese es el modelo que AREX-Base post-entrena, disponible sin esperar nada.
Si quieres la generación actual, los dos niveles abiertos de Qwen3.8 están en el catálogo: Qwen3.8-27B a 0,33 $ por millón de tokens de entrada y 2,40 $ de salida, ejecutándose en nuestra propia infraestructura porque los pesos son abiertos y no hay ningún coste por token de un proveedor que repercutir, y Qwen3.8-Flash a 0,15 $ / 0,47 $ para el nivel de volumen. Una sola API cubre ambos, con el precio de lista del proveedor repercutido sin añadir nada por token, así que cuando Alibaba cambia un precio, la cifra de aquí cambia el mismo día.
Y cuando AREX-2 por fin se lance, la razón por la que pertenece detrás de esa misma capa es estructural, no promocional. Un bucle de agente que hace veinte llamadas por consulta multiplica por veinte la tasa de fallos de cada proveedor; una regla de enrutamiento con conmutación automática por error que decide en tiempo de ejecución es la diferencia entre que un tiempo de espera agotado sea un reintento y que sea una respuesta segura pero equivocada. Ese argumento se aplica a cualquier agente de investigación, y se aplicará a AREX-2 siempre que haya un AREX-2 que enrutar.
¿Quién debería actuar y sobre qué?
Si hoy necesitas un agente de investigación, AREX-Base es el modelo AREX que existe, se lanzó en julio bajo Apache 2.0, y sus benchmarks de agentes son del propio proveedor, pero al menos están vinculados a un modelo descargable. Si hoy necesitas razonamiento multimodal de vanguardia o tráfico agéntico de gran volumen, los niveles de Qwen3.8 están disponibles, tienen precio y están evaluados de forma independiente en parte, y nada sobre la existencia de AREX-2 cambia esa decisión.
El único escenario en el que AREX-2 importa para una decisión que vas a tomar esta semana es aquel en el que eliges un backbone para un fine-tune. Y ahí la respuesta ya se ve en el catálogo: los backbones 3.5 que usó AREX siguen siendo baratos y están disponibles, la generación 3.8 es mejor y también está disponible, y un AREX de segunda generación —cuando llegue— será evidencia sobre qué base de Qwen cree BAAI que vale la pena construir, no un reemplazo para él.
Tres cosas resolverían el resto: archivos en el árbol, una ficha con un recuento de parámetros y un campo de modelo base, y una etiqueta de licencia. La primera de ellas es la que importa, porque hasta que llegue, esta comparación es entre una familia con precio y un marcador de posición.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
