
AREX-2 vs Qwen 3.8: Um é um substrato sobre o qual o outro provavelmente é construído
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 507 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 194 tok/s
- OrcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
The matchup between AREX-2 and Qwen3.8-Max looks like a straight fight between two Chinese labs' flagship systems, and it is not one — not because AREX-2 is unproven, though it is, but because the two sit at different layers of the same stack. Qwen3.8-Max has been live since August 3, 2026, at $2 per million input tokens and $6 per million output with a 1M-token context window; its open-weight siblings, Qwen3.8-27B and Qwen3.8-Flash, shipped on August 13 and August 26 with published benchmarks and published prices. AREX-2 is a repository BAAI created on Hugging Face on September 29, 2026 at 17:56 UTC, containing a .gitattributes and nothing else. And the reason the two are not rivals is in the underlying fact that neither vendor advertises loudly: every AREX model BAAI has shipped so far is built on a Qwen backbone.
Isso não é uma especulação sobre o AREX-2. Está documentado para a geração que existe. O AREX-Base é uma mistura de especialistas de 122 bilhões de parâmetros com 10 bilhões de parâmetros ativos, construída sobre o Qwen3.5-122B-A10B, e o AREX-Turbo é um modelo denso de 4B construído sobre o Qwen3.5-4B; ambos foram lançados em 23 de julho de 2026 sob a licença Apache 2.0. Portanto, a forma honesta desta comparação não é agente versus modelo de ponta. É: o que o substrato da Alibaba lhe proporciona hoje, o que a camada de agente da BAAI acrescenta por cima, e quanto da segunda pergunta pode ser respondida antes de a BAAI fazer upload de um arquivo?
O que está ativo no lado do Qwen, e quanto custa
A geração Qwen3.8 é excepcionalmente fácil de raciocinar a respeito, porque é totalmente especificada e tem preços públicos, em três níveis distintos.
• Qwen3.8-Max — lançado em 3 de agosto de 2026. Uma janela de contexto de 1M de tokens, entrada nativa de texto, imagem e vídeo, modo de pensamento, chamada de funções e saídas estruturadas, e três formatos de protocolo (compatível com OpenAI, compatível com Anthropic e DashScope nativo) em cinco regiões. US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de saída, com leituras de cache a US$ 0,25.
• Qwen3.8-27B — released August 13, 2026. Dense, 27B parameters, 256K context (262,144 positions), text, image and video in, Apache 2.0 weights. Published on Qwen's own card at 90.3 on LiveCodeBench v6, 89.2 on GPQA Diamond, 84.3 on OSWorld-Verified and 79.0 on QwenSWEBench — vendor-reported, not independently reproduced. Independent measurement puts it at an Artificial Analysis Intelligence Index of 33.7 and 68.1 on the AA Coding index.
• Qwen3.8-Flash — lançado em 26 de agosto de 2026. Mesma janela de 1M de tokens e a mesma entrada multimodal, a US$ 0,15 por milhão de tokens de entrada e US$ 0,47 de saída. O nível barato da família, e o que torna acessível o tráfego agêntico de alto volume.
There is also an untagged Qwen3.8 entry: the 2.4-trillion-parameter flagship whose weights Alibaba has said are coming, and which is not callable anywhere yet. If you are searching for "Qwen 3.8" and expecting one model, that is why the answer is a family of four, not one.

Diante de tudo isso, a especificação do AREX-2 tem apenas uma linha: um repositório, um carimbo de data e hora, e um nome que implica uma segunda geração de algo que a BAAI já construiu uma vez.
O detalhe que reformula toda a comparação
AREX is not a competitor to Qwen; it is a consumer of it. Both first-generation AREX models are post-trained on Qwen3.5 backbones and then wrapped in the framework that makes them agents rather than chat models: an inner loop that searches, browses and integrates evidence into a candidate answer carrying a confidence figure, and an outer loop that checks that answer against the original constraints and either accepts it, refines it, or discards the trajectory and starts again. The interesting engineering in AREX is not the network. It is the loop, the context-update mechanism that keeps verified findings, open candidates and unresolved constraints straight across a long horizon, and the tool interface that exposes search and browsing to the model as first-class actions.
É por isso que os números publicados da própria família — 82,5 no BrowseComp, 85,4 no GAIA, 71,0 no xbench-2510, 89,9 no DeepSearch QA e 82,0 no WideSearch-en para o 122B Base, com 70,7 / 81,6 / 57,0 / 78,5 / 68,5 para o 4B Turbo — não são comparáveis às pontuações de codificação e agênticas do Qwen3.8-27B, mesmo que os dois compartilhem uma linhagem arquitetural. Eles medem coisas diferentes. O QwenSWEBench pergunta se um modelo consegue resolver um problema de repositório. O BrowseComp pergunta se um agente consegue encontrar um fato deliberadamente difícil de encontrar, ao longo de muitas buscas, sem perder a pergunta. Um checkpoint bruto do Qwen3.5 tem pontuação ruim no segundo e boa no primeiro, que é precisamente a lacuna que o pós-treinamento e o harness da BAAI existem para fechar.

O que uma segunda geração muito provavelmente seria
If AREX-2 continues the pattern, the most likely reading — inference, not fact — is a second-generation research agent post-trained on a newer Qwen backbone than the 3.5 generation the current AREX models use. Qwen3.8-27B is dense, multimodal and Apache 2.0, which makes it a natural candidate for a quality-tier agent; Qwen3.8-Flash is cheap per token, which matters enormously when your agent makes dozens of calls per query and re-reads a growing context on every step.
Nada disso está confirmado. O nome não indica tamanho, nem backbone, nem data, e um "2" numa linha de produtos é uma convenção de nomenclatura, não uma especificação. O que está confirmado é bem mais restrito e deve ser dito assim: a BAAI criou o repositório em 29 de setembro de 2026, não colocou nada nele e não anunciou nada. Sem pesos, sem cartão de modelo, sem contagem de parâmetros, sem etiqueta de licença, sem benchmarks, sem provedor que o sirva. Se você vir números do AREX-2 citados em qualquer lugar esta semana, eles não são medições.
O que você pode realmente comprar hoje à tarde
A assimetria prática entre estes dois não é a qualidade, é que um lado tem uma tabela de preços e o outro tem uma entrada de diretório.
Se o seu trabalho é agêntico e você quer o substrato sobre o qual a família AREX foi construída, o backbone exato pode ser chamado: Qwen3.5-122B-A10B está no catálogo da OrcaRouter a $0,115 por milhão de tokens de entrada e $0,917 por milhão de saída até 128K tokens, subindo para $0,287 / $2,294 além disso, com visão, uso de ferramentas e raciocínio habilitados. Esse é o modelo que o AREX-Base pós-treina, disponível sem esperar por nada.
Se você quer a geração atual, os dois níveis abertos do Qwen3.8 estão no catálogo: Qwen3.8-27B a $0,33 por milhão de tokens de entrada e $2,40 de saída, rodando na nossa própria infraestrutura porque os pesos são abertos e não há custo por token de fornecedor a repassar, e Qwen3.8-Flash a $0,15 / $0,47 no nível de volume. Uma única API cobre os dois, com o preço de tabela do provedor repassado sem nada acrescentado por token, então quando a Alibaba muda um preço, o número aqui muda no mesmo dia.
E quando o AREX-2 de fato for lançado, a razão pela qual ele pertence a essa mesma camada é estrutural, e não promocional. Um loop de agente que faz vinte chamadas por consulta multiplica a taxa de falha de cada provedor por vinte; uma regra de roteamento com failover automático que decide em tempo de execução é a diferença entre um timeout ser uma nova tentativa e um timeout ser uma resposta confiantemente errada. Esse argumento se aplica a qualquer agente de pesquisa, e se aplicará ao AREX-2 sempre que houver um AREX-2 para rotear.
Quem deve agir e sobre o quê?
Se você precisa de um agente de pesquisa hoje, o AREX-Base é o modelo AREX que existe, foi lançado em julho sob Apache 2.0, e seus benchmarks de agente são do próprio fornecedor, mas pelo menos estão vinculados a um modelo baixável. Se você precisa de raciocínio multimodal de ponta ou tráfego agêntico de alto volume hoje, os níveis do Qwen3.8 estão ativos, com preços e pontuação independente em parte, e nada sobre a existência do AREX-2 muda essa decisão.
The only scenario in which AREX-2 matters to a decision you are making this week is the one where you are choosing a backbone for a fine-tune. And there the answer is already visible in the catalogue: the 3.5 backbones AREX used are still cheap and available, the 3.8 generation is better and also available, and a second-generation AREX — whenever it arrives — will almost certainly be evidence about which Qwen base BAAI thinks is worth building on, not a replacement for it.
Três coisas resolveriam o resto: ficheiros na árvore, um cartão com um número de parâmetros e um campo de modelo base, e uma etiqueta de licença. A primeira delas é a que importa, porque, até que chegue, esta comparação é entre uma família com preço e um marcador de posição.
