Una title card generata che recita 'AREX-2 vs Qwen3.8-Max - Un substrato e ciò che vi gira sopra', con due pannelli. Il pannello di sinistra, intitolato Qwen3.8-Max, elenca: attivo dal 3 agosto 2026; contesto da 1M di token, multimodale; 2 $ in input / 6 $ in output per 1M; invocabile già oggi. Il pannello di destra, intitolato AREX-2, elenca: repository creato il 29 set 2026; nessun peso, nessuna model card; nessun listino prezzi da nessuna parte; non invocabile da nessuna parte. Un piè di pagina recita 'La prima generazione AREX è stata post-addestrata su un backbone Qwen.' Il logo OrcaRouter è inserito in compositing nell'angolo in basso a destra.
Guides & Insights

AREX-2 vs Qwen 3.8: uno è un substrato, l'altro è probabilmente costruito su di esso

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

The matchup between AREX-2 and Qwen3.8-Max looks like a straight fight between two Chinese labs' flagship systems, and it is not one — not because AREX-2 is unproven, though it is, but because the two sit at different layers of the same stack. Qwen3.8-Max has been live since August 3, 2026, at $2 per million input tokens and $6 per million output with a 1M-token context window; its open-weight siblings, Qwen3.8-27B and Qwen3.8-Flash, shipped on August 13 and August 26 with published benchmarks and published prices. AREX-2 is a repository BAAI created on Hugging Face on September 29, 2026 at 17:56 UTC, containing a .gitattributes and nothing else. And the reason the two are not rivals is in the underlying fact that neither vendor advertises loudly: every AREX model BAAI has shipped so far is built on a Qwe​n backbone.

Non è una speculazione su AREX-2. È documentato per la generazione esistente. AREX-Base è un mixture-of-experts da 122 miliardi di parametri con 10 miliardi di parametri attivi, basato su Qwen3.5-122B-A10B, e AREX-Turbo è un modello denso da 4B basato su Qwen3.5-4B; entrambi sono stati rilasciati il 23 luglio 2026 sotto Apache 2.0. Quindi la forma onesta di questo confronto non è agente contro flagship. È: cosa ti offre oggi il substrato Alibaba, cosa aggiunge sopra il layer agente di BAAI, e quanto della seconda domanda si può rispondere prima che BAAI carichi un file?

Cosa è attivo sul fronte Qwen e quanto costa

La generazione Qwen3.8 è insolitamente facile da analizzare perché è completamente specificata e con prezzi pubblici, su tre livelli distinti.

• Qwen3.8-Max — rilasciato il 3 agosto 2026. Una finestra di contesto da 1 milione di token, input nativo per testo, immagini e video, modalità di pensiero, chiamata di funzioni e output strutturati, e tre formati di interfaccia (compatibile con OpenAI, compatibile con Anthropic e DashScope nativo) in cinque regioni. 2,00 $ per milione di token in input e 6,00 $ per milione in output, con letture dalla cache a 0,25 $.

• Qwen3.8-27B — released August 13, 2026. Dense, 27B parameters, 256K context (262,144 positions), text, image and video in, Apache 2.0 weights. Published on Qwe​n's own card at 90.3 on LiveCodeBench v6, 89.2 on GPQA Diamond, 84.3 on OSWorld-Verified and 79.0 on QwenSWEBench — vendor-reported, not independently reproduced. Independent measurement puts it at an Artificial Analysis Intelligence Index of 33.7 and 68.1 on the AA Coding index.

• Qwen3-Flash — rilasciato il 26 agosto 2026. Stessa finestra da 1 milione di token e stesso input multimodale, a $0,15 per milione di token in input e $0,47 in output. Il livello economico della famiglia, e quello che rende sostenibile il traffico agentico ad alto volume.

There is also an untagged Qwen3.8 entry: the 2.4-trillion-parameter flagship whose weights Alibaba has said are coming, and which is not callable anywhere yet. If you are searching for "Qwe​n 3.8" and expecting one model, that is why the answer is a family of four, not one.

A screenshot of the OrcaRouter model page for Qwen3.8-27B, showing the Featured badge, a 256K-token context window, text, image and video input with text output, badges for Vision, Tools, JSON and Reasoning, the provider line 'by Qwen - 2026-08-13', a pricing row of $0.33 input and $2.40 output per million tokens with measured latency and 120.2M tokens of traffic, and the beginning of the model description covering the 27B dense multimodal model's Apache-2.0 licence and 256K context.

In confronto a tutto ciò, la specifica di AREX-2 è lunga una sola riga: un repository, un timestamp e un nome che implica una seconda generazione di qualcosa che BAAI ha già costruito una volta.

Il dettaglio che ridefinisce l'intero confronto

AREX is not a competitor to Qwe​n; it is a consumer of it. Both first-generation AREX models are post-trained on Qwen3.5 backbones and then wrapped in the framework that makes them agents rather than chat models: an inner loop that searches, browses and integrates evidence into a candidate answer carrying a confidence figure, and an outer loop that checks that answer against the original constraints and either accepts it, refines it, or discards the trajectory and starts again. The interesting engineering in AREX is not the network. It is the loop, the context-update mechanism that keeps verified findings, open candidates and unresolved constraints straight across a long horizon, and the tool interface that exposes search and browsing to the model as first-class actions.

Ecco perché i numeri pubblicati dalla stessa famiglia — 82,5 su BrowseComp, 85,4 su GAIA, 71,0 su xbench-2510, 89,9 su DeepSearch QA e 82,0 su WideSearch-en per il 122B Base, con 70,7 / 81,6 / 57,0 / 78,5 / 68,5 per il 4B Turbo — non sono confrontabili con i punteggi di coding e agentici di Qwen3.8-27B, anche se i due condividono una discendenza architetturale. Misurano cose diverse. QwenSWEBench chiede se un modello è in grado di risolvere un problema di un repository. BrowseComp chiede se un agente può trovare un fatto deliberatamente difficile da trovare, attraverso molte ricerche, senza perdere la domanda. Un checkpoint Qwen3.5 grezzo ottiene brutti punteggi sul secondo e buoni sul primo, che è precisamente il divario che il post-training e l'harness di BAAI esistono per colmare.

A generated pricing card headed 'The Qwen3.8 family is priced. AREX-2 is not callable.' It lists Qwen3.8-Max at $2.00 in / $6.00 out with a 1M context released 3 Aug 2026, Qwen3.8-27B at $0.33 in / $2.40 out with 256K context and open weights released 13 Aug 2026, Qwen3.8-Flash at $0.15 in / $0.47 out with a 1M context released 26 Aug 2026, Qwen3.5-122B-A10B at $0.115 in / $0.917 out as the backbone AREX-Base post-trains up to 128K, and a highlighted AREX-2 row reading 'no rate card' because there are no weights, card or licence tag. A footer reads 'Qwen3.8-27B scores 33.7 on the AA Intelligence Index; AREX-2 does not exist to score.' The OrcaRouter logo is composited in the bottom-right corner.

Cosa sarebbe più plausibilmente una seconda generazione

If AREX-2 continues the pattern, the most likely reading — inference, not fact — is a second-generation research agent post-trained on a newer Qwe​n backbone than the 3.5 generation the current AREX models use. Qwen3.8-27B is dense, multimodal and Apache 2.0, which makes it a natural candidate for a quality-tier agent; Qwen3.8-Flash is cheap per token, which matters enormously when your agent makes dozens of calls per query and re-reads a growing context on every step.

Niente di tutto ciò è confermato. Il nome non indica dimensioni, né backbone, né data, e un "2" in una linea di prodotto è una convenzione di denominazione, non una specifica. Ciò che è confermato è molto più ristretto e va detto così: BAAI ha creato il repository il 29 settembre 2026, non ha inserito nulla e non ha annunciato nulla. Nessun peso, nessuna model card, nessun numero di parametri, nessun tag di licenza, nessun benchmark, nessun provider che lo eroghi. Se questa settimana vedi citati numeri di AREX-2 da qualche parte, non sono misurazioni.

Cosa puoi davvero comprare questo pomeriggio

L'asimmetria pratica tra questi due non è la qualità, è che una parte ha un listino prezzi e l'altra una voce in un elenco.

Se il tuo lavoro è agentico e vuoi il substrato su cui è stata costruita la famiglia AREX, il backbone esatto è disponibile tramite chiamata: Qwen3.5-122B-A10B è nel catalogo di OrcaRouter a $0,115 per milione di token di input e $0,917 per milione di token di output fino a 128K token, salendo a $0,287 / $2,294 oltre quella soglia, con funzionalità di visione, uso degli strumenti e ragionamento abilitate. È il modello su cui AREX-Base esegue il post-training, disponibile senza dover attendere nulla.

Se vuoi la generazione attuale, entrambi i livelli aperti Qwen3.8 sono nel catalogo: Qwen3.8-27B a $0,33 per milione di token in input e $2,40 in output, in esecuzione sulla nostra infrastruttura perché i pesi sono aperti e non c'è alcun costo per token del fornitore da ribaltare, e Qwen3.8-Flash a $0,15 / $0,47 per il livello di volume. Una sola API copre entrambi, il prezzo di listino del fornitore viene ribaltato senza aggiungere nulla per token, quindi quando Alibaba modifica un prezzo, il numero qui cambia lo stesso giorno.

E quando AREX-2 verrà effettivamente rilasciato, il motivo per cui appartiene dietro quello stesso livello è strutturale piuttosto che promozionale. Un ciclo di agenti che effettua venti chiamate per query moltiplica il tasso di errore di ogni provider per venti; una regola di instradamento con failover automatico che decide a runtime è la differenza tra un timeout che diventa un nuovo tentativo e un timeout che diventa una risposta sbagliata ma data con sicurezza. Questo argomento vale per qualsiasi agente di ricerca, e varrà per AREX-2 ogni volta che ci sarà un AREX-2 da instradare.

Chi dovrebbe agire, e su cosa

Se oggi hai bisogno di un agente di ricerca, AREX-Base è il modello AREX che esiste, è stato rilasciato a luglio sotto Apache 2.0, e i suoi benchmark per agenti sono quelli del fornitore, ma almeno sono collegati a un modello scaricabile. Se oggi hai bisogno di ragionamento multimodale di frontiera o di traffico agentico ad alto volume, i tier di Qwen3.8 sono attivi, con prezzi e valutazioni indipendenti in parte, e nulla riguardo all'esistenza di AREX-2 cambia quella decisione.

The only scenario in which AREX-2 matters to a decision you are making this week is the one where you are choosing a backbone for a fine-tune. And there the answer is already visible in the catalogue: the 3.5 backbones AREX used are still cheap and available, the 3.8 generation is better and also available, and a second-generation AREX — whenever it arrives — will almost certainly be evidence about which Qwe​n base BAAI thinks is worth building on, not a replacement for it.

Tre cose chiarirebbero il resto: i file nell'albero, una scheda con un conteggio dei parametri e un campo modello di base, e un tag di licenza. La prima di queste è quella che conta, perché finché non arriva, questo confronto è tra una famiglia con un prezzo e un segnaposto.