Een gegenereerde titelkaart met de tekst 'AREX-2 vs Qwen3.8-Max - Een substraat en wat erop draait', met twee panelen. Het linkerpaneel, met als kop Qwen3.8-Max, somt op: live sinds 3 augustus 2026; context van 1M tokens, multimodaal; $2 in / $6 uit per 1M; vandaag aanroepbaar. Het rechterpaneel, met als kop AREX-2, somt op: repo aangemaakt op 29 sep 2026; geen gewichten, geen modelkaart; nergens een tariefkaart; nergens aanroepbaar. Een voettekst luidt: 'De eerste AREX-generatie werd post-getraind op een Qwen-backbone.' Het OrcaRouter-logo is gecompositeerd in de rechteronderhoek.
Guides & Insights

AREX-2 vs Qwen 3.8: De een is een substraat waarop de ander waarschijnlijk is gebouwd.

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

The matchup between AREX-2 and Qwen3.8-Max looks like a straight fight between two Chinese labs' flagship systems, and it is not one — not because AREX-2 is unproven, though it is, but because the two sit at different layers of the same stack. Qwen3.8-Max has been live since August 3, 2026, at $2 per million input tokens and $6 per million output with a 1M-token context window; its open-weight siblings, Qwen3.8-27B and Qwen3.8-Flash, shipped on August 13 and August 26 with published benchmarks and published prices. AREX-2 is a repository BAAI created on Hugging Face on September 29, 2026 at 17:56 UTC, containing a .gitattributes and nothing else. And the reason the two are not rivals is in the underlying fact that neither vendor advertises loudly: every AREX model BAAI has shipped so far is built on a Qwe​n backbone.

Dat is geen speculatie over AREX-2. Het is gedocumenteerd voor de generatie die bestaat. AREX-Base is een mixture-of-experts met 122 miljard parameters en 10 miljard actieve parameters, gebouwd op Qwen3.5-122B-A10B, en AREX-Turbo is een dense 4B gebouwd op Qwen3.5-4B; beide zijn op 23 juli 2026 uitgebracht onder Apache 2.0. De eerlijke vorm van deze vergelijking is dus niet agent tegenover vlaggenschip. Het is: wat levert het Alibaba-substraat je vandaag op, wat voegt de agentlaag van BAAI daarbovenop toe, en hoeveel van de tweede vraag kan worden beantwoord voordat BAAI een bestand uploadt?

Wat is live aan de Qwen-kant, en wat het kost

De Qwen3.8-generatie is ongewoon gemakkelijk te doorgronden, omdat deze volledig gespecificeerd en openbaar geprijsd is, in drie afzonderlijke niveaus.

• Qwen3.8-Max — vrijgegeven op 3 augustus 2026. Een contextvenster van 1M tokens, native tekst-, afbeeldings- en video-invoer, denkmodus, functieaanroepen en gestructureerde uitvoer, en drie wire-formaten (OpenAI-compatibel, Anthropic-compatibel en native DashScope) in vijf regio's. $2,00 per miljoen invoertokens en $6,00 per miljoen uitvoertokens, met cache-reads tegen $0,25.

• Qwen3.8-27B — released August 13, 2026. Dense, 27B parameters, 256K context (262,144 positions), text, image and video in, Apache 2.0 weights. Published on Qwe​n's own card at 90.3 on LiveCodeBench v6, 89.2 on GPQA Diamond, 84.3 on OSWorld-Verified and 79.0 on QwenSWEBench — vendor-reported, not independently reproduced. Independent measurement puts it at an Artificial Analysis Intelligence Index of 33.7 and 68.1 on the AA Coding index.

• Qwen3.8-Flash — uitgebracht op 26 augustus 2026. Hetzelfde 1M-tokenvenster en dezelfde multimodale invoer, tegen $0,15 per miljoen invoertokens en $0,47 voor uitvoer. De goedkope laag van de familie, en degene die hoogvolume agentisch verkeer betaalbaar maakt.

There is also an untagged Qwen3.8 entry: the 2.4-trillion-parameter flagship whose weights Alibaba has said are coming, and which is not callable anywhere yet. If you are searching for "Qwe​n 3.8" and expecting one model, that is why the answer is a family of four, not one.

A screenshot of the OrcaRouter model page for Qwen3.8-27B, showing the Featured badge, a 256K-token context window, text, image and video input with text output, badges for Vision, Tools, JSON and Reasoning, the provider line 'by Qwen - 2026-08-13', a pricing row of $0.33 input and $2.40 output per million tokens with measured latency and 120.2M tokens of traffic, and the beginning of the model description covering the 27B dense multimodal model's Apache-2.0 licence and 256K context.

Tegenover dat alles is de specificatie van AREX-2 één regel lang: een repository, een tijdstempel, en een naam die een tweede generatie suggereert van iets dat BAAI al eens heeft gebouwd.

Het detail dat de hele vergelijking in een nieuw licht plaatst

AREX is not a competitor to Qwe​n; it is a consumer of it. Both first-generation AREX models are post-trained on Qwen3.5 backbones and then wrapped in the framework that makes them agents rather than chat models: an inner loop that searches, browses and integrates evidence into a candidate answer carrying a confidence figure, and an outer loop that checks that answer against the original constraints and either accepts it, refines it, or discards the trajectory and starts again. The interesting engineering in AREX is not the network. It is the loop, the context-update mechanism that keeps verified findings, open candidates and unresolved constraints straight across a long horizon, and the tool interface that exposes search and browsing to the model as first-class actions.

Daarom zijn de door de familie zelf gepubliceerde cijfers — 82,5 op BrowseComp, 85,4 op GAIA, 71,0 op xbench-2510, 89,9 op DeepSearch QA en 82,0 op WideSearch-en voor de 122B Base, met 70,7 / 81,6 / 57,0 / 78,5 / 68,5 voor de 4B Turbo — niet vergelijkbaar met de coding- en agentic-scores van Qwen3.8-27B, ook al delen de twee een architectonische afstamming. Ze meten verschillende dingen. QwenSWEBench vraagt of een model een probleem in een repository kan oplossen. BrowseComp vraagt of een agent een feit kan vinden dat doelbewust moeilijk te vinden is, over vele zoekopdrachten heen, zonder de vraag kwijt te raken. Een ruwe Qwen3.5-checkpoint scoort slecht op de tweede en goed op de eerste, en dat is precies het gat dat de post-training en harness van BAAI moeten dichten.

A generated pricing card headed 'The Qwen3.8 family is priced. AREX-2 is not callable.' It lists Qwen3.8-Max at $2.00 in / $6.00 out with a 1M context released 3 Aug 2026, Qwen3.8-27B at $0.33 in / $2.40 out with 256K context and open weights released 13 Aug 2026, Qwen3.8-Flash at $0.15 in / $0.47 out with a 1M context released 26 Aug 2026, Qwen3.5-122B-A10B at $0.115 in / $0.917 out as the backbone AREX-Base post-trains up to 128K, and a highlighted AREX-2 row reading 'no rate card' because there are no weights, card or licence tag. A footer reads 'Qwen3.8-27B scores 33.7 on the AA Intelligence Index; AREX-2 does not exist to score.' The OrcaRouter logo is composited in the bottom-right corner.

Wat een tweede generatie het meest plausibel zou zijn

If AREX-2 continues the pattern, the most likely reading — inference, not fact — is a second-generation research agent post-trained on a newer Qwe​n backbone than the 3.5 generation the current AREX models use. Qwen3.8-27B is dense, multimodal and Apache 2.0, which makes it a natural candidate for a quality-tier agent; Qwen3.8-Flash is cheap per token, which matters enormously when your agent makes dozens of calls per query and re-reads a growing context on every step.

Niets daarvan is bevestigd. De naam bevat geen omvang, geen backbone en geen datum, en een "2" in een productlijn is een naamgevingsconventie en geen specificatie. Wat wel bevestigd is, is veel beperkter en moet ook zo worden gesteld: BAAI heeft de repository op 29 september 2026 aangemaakt, er niets in gezet en niets aangekondigd. Geen gewichten, geen modelkaart, geen parameteraantal, geen licentietag, geen benchmarks, geen provider die het serveert. Als je deze week ergens AREX-2-cijfers ziet geciteerd, dan zijn dat geen metingen.

Wat je vanmiddag daadwerkelijk kunt kopen

De praktische asymmetrie tussen deze twee is niet kwaliteit, maar dat de ene kant een tariefkaart heeft en de andere een gidsvermelding.

Als je werk agentisch is en je wilt het substraat waarop de AREX-familie is gebouwd, dan is de exacte backbone aanroepbaar: Qwen3.5-122B-A10B staat in de catalogus van OrcaRouter voor $0,115 per miljoen inputtokens en $0,917 per miljoen outputtokens tot 128K tokens, oplopend tot $0,287 / $2,294 daarboven, met vision, toolgebruik en redeneren ingeschakeld. Dat is het model dat AREX-Base post-traint, beschikbaar zonder op iets te wachten.

Als je de huidige generatie wilt, staan beide open Qwen3.8-tiers in de catalogus: Qwen3.8-27B voor $0,33 per miljoen input en $2,40 output, draaiend op onze eigen infrastructuur omdat de gewichten open zijn en er geen leverancierskosten per token zijn om door te berekenen, en Qwen3.8-Flash voor $0,15 / $0,47 voor het volumetarief. Eén API dekt beide, de lijstprijs van de provider wordt doorgegeven zonder iets per token toe te voegen, dus wanneer Alibaba een prijs wijzigt, verandert het getal hier dezelfde dag mee.

En wanneer AREX-2 daadwerkelijk wordt uitgebracht, is de reden dat het achter diezelfde laag thuishoort structureel en niet promotioneel. Een agent-loop die twintig aanroepen per query doet, vermenigvuldigt het uitvalpercentage van elke provider met twintig; een routeringsregel met automatische failover die tijdens runtime beslist is het verschil tussen een timeout die een nieuwe poging oplevert en een timeout die een zelfverzekerd maar onjuist antwoord oplevert. Dat argument geldt voor elke onderzoeksagent, en het zal gelden voor AREX-2 zodra er een AREX-2 is om te routeren.

Wie moet actie ondernemen, en waarover?

Als je vandaag een onderzoeksagent nodig hebt, is AREX-Base het AREX-model dat bestaat; het is in juli uitgebracht onder Apache 2.0, en zijn agentbenchmarks zijn die van de leverancier zelf, maar ze zijn tenminste gekoppeld aan een downloadbaar model. Als je vandaag frontier multimodale redenering of grootschalig agentisch verkeer nodig hebt, zijn de Qwen3 live, punt en onafhankelijk gescoord in, en het bestaan van AREX-2 verandert dat.

The only scenario in which AREX-2 matters to a decision you are making this week is the one where you are choosing a backbone for a fine-tune. And there the answer is already visible in the catalogue: the 3.5 backbones AREX used are still cheap and available, the 3.8 generation is better and also available, and a second-generation AREX — whenever it arrives — will almost certainly be evidence about which Qwe​n base BAAI thinks is worth building on, not a replacement for it.

Drie dingen zouden de rest oplossen: bestanden in de boomstructuur, een kaart met een parameteraantal en een veld voor het basismodel, en een licentietag. De eerste daarvan is degene die ertoe doet, want totdat die er is, gaat deze vergelijking tussen een geprijsde familie en een placeholder.