
AREX-2 vs Qwen 3.8: De een is een substraat waarop de ander waarschijnlijk is gebouwd.
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 507 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 194 tok/s
- OrcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- xAISpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
The matchup between AREX-2 and Qwen3.8-Max looks like a straight fight between two Chinese labs' flagship systems, and it is not one — not because AREX-2 is unproven, though it is, but because the two sit at different layers of the same stack. Qwen3.8-Max has been live since August 3, 2026, at $2 per million input tokens and $6 per million output with a 1M-token context window; its open-weight siblings, Qwen3.8-27B and Qwen3.8-Flash, shipped on August 13 and August 26 with published benchmarks and published prices. AREX-2 is a repository BAAI created on Hugging Face on September 29, 2026 at 17:56 UTC, containing a .gitattributes and nothing else. And the reason the two are not rivals is in the underlying fact that neither vendor advertises loudly: every AREX model BAAI has shipped so far is built on a Qwen backbone.
Dat is geen speculatie over AREX-2. Het is gedocumenteerd voor de generatie die bestaat. AREX-Base is een mixture-of-experts met 122 miljard parameters en 10 miljard actieve parameters, gebouwd op Qwen3.5-122B-A10B, en AREX-Turbo is een dense 4B gebouwd op Qwen3.5-4B; beide zijn op 23 juli 2026 uitgebracht onder Apache 2.0. De eerlijke vorm van deze vergelijking is dus niet agent tegenover vlaggenschip. Het is: wat levert het Alibaba-substraat je vandaag op, wat voegt de agentlaag van BAAI daarbovenop toe, en hoeveel van de tweede vraag kan worden beantwoord voordat BAAI een bestand uploadt?
Wat is live aan de Qwen-kant, en wat het kost
De Qwen3.8-generatie is ongewoon gemakkelijk te doorgronden, omdat deze volledig gespecificeerd en openbaar geprijsd is, in drie afzonderlijke niveaus.
• Qwen3.8-Max — vrijgegeven op 3 augustus 2026. Een contextvenster van 1M tokens, native tekst-, afbeeldings- en video-invoer, denkmodus, functieaanroepen en gestructureerde uitvoer, en drie wire-formaten (OpenAI-compatibel, Anthropic-compatibel en native DashScope) in vijf regio's. $2,00 per miljoen invoertokens en $6,00 per miljoen uitvoertokens, met cache-reads tegen $0,25.
• Qwen3.8-27B — released August 13, 2026. Dense, 27B parameters, 256K context (262,144 positions), text, image and video in, Apache 2.0 weights. Published on Qwen's own card at 90.3 on LiveCodeBench v6, 89.2 on GPQA Diamond, 84.3 on OSWorld-Verified and 79.0 on QwenSWEBench — vendor-reported, not independently reproduced. Independent measurement puts it at an Artificial Analysis Intelligence Index of 33.7 and 68.1 on the AA Coding index.
• Qwen3.8-Flash — uitgebracht op 26 augustus 2026. Hetzelfde 1M-tokenvenster en dezelfde multimodale invoer, tegen $0,15 per miljoen invoertokens en $0,47 voor uitvoer. De goedkope laag van de familie, en degene die hoogvolume agentisch verkeer betaalbaar maakt.
There is also an untagged Qwen3.8 entry: the 2.4-trillion-parameter flagship whose weights Alibaba has said are coming, and which is not callable anywhere yet. If you are searching for "Qwen 3.8" and expecting one model, that is why the answer is a family of four, not one.

Tegenover dat alles is de specificatie van AREX-2 één regel lang: een repository, een tijdstempel, en een naam die een tweede generatie suggereert van iets dat BAAI al eens heeft gebouwd.
Het detail dat de hele vergelijking in een nieuw licht plaatst
AREX is not a competitor to Qwen; it is a consumer of it. Both first-generation AREX models are post-trained on Qwen3.5 backbones and then wrapped in the framework that makes them agents rather than chat models: an inner loop that searches, browses and integrates evidence into a candidate answer carrying a confidence figure, and an outer loop that checks that answer against the original constraints and either accepts it, refines it, or discards the trajectory and starts again. The interesting engineering in AREX is not the network. It is the loop, the context-update mechanism that keeps verified findings, open candidates and unresolved constraints straight across a long horizon, and the tool interface that exposes search and browsing to the model as first-class actions.
Daarom zijn de door de familie zelf gepubliceerde cijfers — 82,5 op BrowseComp, 85,4 op GAIA, 71,0 op xbench-2510, 89,9 op DeepSearch QA en 82,0 op WideSearch-en voor de 122B Base, met 70,7 / 81,6 / 57,0 / 78,5 / 68,5 voor de 4B Turbo — niet vergelijkbaar met de coding- en agentic-scores van Qwen3.8-27B, ook al delen de twee een architectonische afstamming. Ze meten verschillende dingen. QwenSWEBench vraagt of een model een probleem in een repository kan oplossen. BrowseComp vraagt of een agent een feit kan vinden dat doelbewust moeilijk te vinden is, over vele zoekopdrachten heen, zonder de vraag kwijt te raken. Een ruwe Qwen3.5-checkpoint scoort slecht op de tweede en goed op de eerste, en dat is precies het gat dat de post-training en harness van BAAI moeten dichten.

Wat een tweede generatie het meest plausibel zou zijn
If AREX-2 continues the pattern, the most likely reading — inference, not fact — is a second-generation research agent post-trained on a newer Qwen backbone than the 3.5 generation the current AREX models use. Qwen3.8-27B is dense, multimodal and Apache 2.0, which makes it a natural candidate for a quality-tier agent; Qwen3.8-Flash is cheap per token, which matters enormously when your agent makes dozens of calls per query and re-reads a growing context on every step.
Niets daarvan is bevestigd. De naam bevat geen omvang, geen backbone en geen datum, en een "2" in een productlijn is een naamgevingsconventie en geen specificatie. Wat wel bevestigd is, is veel beperkter en moet ook zo worden gesteld: BAAI heeft de repository op 29 september 2026 aangemaakt, er niets in gezet en niets aangekondigd. Geen gewichten, geen modelkaart, geen parameteraantal, geen licentietag, geen benchmarks, geen provider die het serveert. Als je deze week ergens AREX-2-cijfers ziet geciteerd, dan zijn dat geen metingen.
Wat je vanmiddag daadwerkelijk kunt kopen
De praktische asymmetrie tussen deze twee is niet kwaliteit, maar dat de ene kant een tariefkaart heeft en de andere een gidsvermelding.
Als je werk agentisch is en je wilt het substraat waarop de AREX-familie is gebouwd, dan is de exacte backbone aanroepbaar: Qwen3.5-122B-A10B staat in de catalogus van OrcaRouter voor $0,115 per miljoen inputtokens en $0,917 per miljoen outputtokens tot 128K tokens, oplopend tot $0,287 / $2,294 daarboven, met vision, toolgebruik en redeneren ingeschakeld. Dat is het model dat AREX-Base post-traint, beschikbaar zonder op iets te wachten.
Als je de huidige generatie wilt, staan beide open Qwen3.8-tiers in de catalogus: Qwen3.8-27B voor $0,33 per miljoen input en $2,40 output, draaiend op onze eigen infrastructuur omdat de gewichten open zijn en er geen leverancierskosten per token zijn om door te berekenen, en Qwen3.8-Flash voor $0,15 / $0,47 voor het volumetarief. Eén API dekt beide, de lijstprijs van de provider wordt doorgegeven zonder iets per token toe te voegen, dus wanneer Alibaba een prijs wijzigt, verandert het getal hier dezelfde dag mee.
En wanneer AREX-2 daadwerkelijk wordt uitgebracht, is de reden dat het achter diezelfde laag thuishoort structureel en niet promotioneel. Een agent-loop die twintig aanroepen per query doet, vermenigvuldigt het uitvalpercentage van elke provider met twintig; een routeringsregel met automatische failover die tijdens runtime beslist is het verschil tussen een timeout die een nieuwe poging oplevert en een timeout die een zelfverzekerd maar onjuist antwoord oplevert. Dat argument geldt voor elke onderzoeksagent, en het zal gelden voor AREX-2 zodra er een AREX-2 is om te routeren.
Wie moet actie ondernemen, en waarover?
Als je vandaag een onderzoeksagent nodig hebt, is AREX-Base het AREX-model dat bestaat; het is in juli uitgebracht onder Apache 2.0, en zijn agentbenchmarks zijn die van de leverancier zelf, maar ze zijn tenminste gekoppeld aan een downloadbaar model. Als je vandaag frontier multimodale redenering of grootschalig agentisch verkeer nodig hebt, zijn de Qwen3 live, punt en onafhankelijk gescoord in, en het bestaan van AREX-2 verandert dat.
The only scenario in which AREX-2 matters to a decision you are making this week is the one where you are choosing a backbone for a fine-tune. And there the answer is already visible in the catalogue: the 3.5 backbones AREX used are still cheap and available, the 3.8 generation is better and also available, and a second-generation AREX — whenever it arrives — will almost certainly be evidence about which Qwen base BAAI thinks is worth building on, not a replacement for it.
Drie dingen zouden de rest oplossen: bestanden in de boomstructuur, een kaart met een parameteraantal en een veld voor het basismodel, en een licentietag. De eerste daarvan is degene die ertoe doet, want totdat die er is, gaat deze vergelijking tussen een geprijsde familie en een placeholder.
