En genererad titelbild med texten "AREX-2 vs Qwen3.8-Max – ett substrat och vad som körs på det", med två paneler. Den vänstra panelen, med rubriken Qwen3.8-Max, listar: live sedan 3 augusti 2026; kontextfönster på 1 miljon tokens, multimodalt; 2 $ in / 6 $ ut per 1 miljon; anropbart redan idag. Den högra panelen, med rubriken AREX-2, listar: repo skapat 29 sep 2026; inga vikter, inget model card; ingen prislista någonstans; inte anropbart någonstans. En sidfot lyder: "Den första AREX-generationen var eftertränad på en Qwen-ryggrad." OrcaRouter-logotypen är komponerad i nedre högra hörnet.
Guides & Insights

AREX-2 vs Qwen 3.8: Den ena är ett substrat som den andra förmodligen är byggd på

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Matchen mellan AREX-2 och Qwen3.8-Max ser ut som en direkt kamp mellan två kinesiska labbs flaggskeppssystem, och det är inte en sådan — inte för att AREX-2 är obeprövat, även om det är det, utan för att de två ligger på olika lager i samma stack. Qwen3.8-Max har varit i drift sedan 3 augusti 2026, för 2 USD per miljon indatatoken och 6 USD per miljon utdatatoken med ett kontextfönster på 1 miljon token; dess syskonmodeller med öppna vikter, Qwen3.8-27B och Qwen3.8-Flash, lanserades den 13 augusti och den 26 augusti med publicerade benchmarks och publicerade priser. AREX-2 är ett repository som BAAI skapade på Hugging Face den 29 september 2026 kl. 17:56 UTC, som innehåller en .gitattributes och inget annat. Och anledningen till att de två inte är rivaler ligger i det underliggande faktum som ingen av leverantörerna gör stor sak av: varje AREX-modell som BAAI hittills har släppt är byggd på en Qwen-backbone.

Det är inte spekulation om AREX-2. Det är dokumenterat för den generation som finns. AREX-Base är en mixture-of-experts med 122 miljarder parametrar och 10 miljarder aktiva parametrar byggd på Qwen3.5-122B-A10B, och AREX-Turbo är en dense 4B-modell byggd på Qwen3.5-4B; båda släpptes den 23 juli 2026 under Apache 2.0. Så den ärliga formen av den här jämförelsen är inte agent mot flaggskepp. Den är: vad ger Alibaba-substratet dig i dag, vad tillför BAAI:s agentlager ovanpå, och hur mycket av den andra frågan kan besvaras innan BAAI laddar upp en fil?

Vad är live på Qwen-sidan, och vad kostar det

Qwen3.8-generationen är ovanligt lätt att resonera kring eftersom den är fullt specificerad och offentligt prissatt, i tre åtskilda nivåer.

• Qwen3.8-Max — släppt 3 augusti 2026. Ett kontextfönster på 1M tokens, nativ text-, bild- och videoinmatning, tankeläge, funktionsanrop och strukturerade utdata, samt tre överföringsformat (OpenAI-kompatibelt, Anthropic-kompatibelt och nativt DashScope) i fem regioner. $2,00 per miljon indatatokens och $6,00 per miljon utdatatokens, med cacheläsningar till $0,25.

• Qwen3.8-27B — släppt 13 augusti 2026. Dense, 27B parametrar, 256K kontext (262 144 positioner), text, bild och video som indata, Apache 2.0-vikter. Publicerad på Qwens eget modellkort med 90,3 på LiveCodeBench v6, 89,2 på GPQA Diamond, 84,3 på OSWorld-Verified och 79,0 på QwenSWEBench — rapporterat av leverantören, inte oberoende reproducerat. Oberoende mätning placerar den på ett Artificial Analysis Intelligence Index på 33,7 och 68,1 på AA Coding-indexet.

• Qwen3.8-Flash — släppt den 26 augusti 2026. Samma fönster på 1 miljon token och samma multimodala indata, till 0,15 dollar per miljon indata-token och 0,47 dollar för utdata. Familjens billiga nivå, och den som gör agentisk trafik med hög volym överkomlig.

Det finns också en otaggad Qwen3.8-post: flaggskeppet med 2,4 biljoner parametrar vars vikter Alibaba har sagt är på väg, och som ännu inte går att anropa någonstans. Om du söker efter "Qwe​n 3.8" och förväntar dig en modell, är det därför svaret är en familj på fyra, inte en.

A screenshot of the OrcaRouter model page for Qwen3.8-27B, showing the Featured badge, a 256K-token context window, text, image and video input with text output, badges for Vision, Tools, JSON and Reasoning, the provider line 'by Qwen - 2026-08-13', a pricing row of $0.33 input and $2.40 output per million tokens with measured latency and 120.2M tokens of traffic, and the beginning of the model description covering the 27B dense multimodal model's Apache-2.0 licence and 256K context.

Mot allt detta är AREX-2:s specifikation bara en rad lång: ett förråd, en tidsstämpel och ett namn som antyder en andra generation av något som BAAI redan har byggt en gång.

Detaljen som omformar hela jämförelsen

AREX är inte en konkurrent till Qwen; det är en konsument av den. Båda förstagenerations-AREX-modellerna eftertränas på Qwen3.5-backbones och lindas sedan in i ramverket som gör dem till agenter snarare än chattmodeller: en inre slinga som söker, surfar och integrerar bevis i ett kandidatsvar med en konfidenssiffra, och en yttre slinga som kontrollerar svaret mot de ursprungliga begränsningarna och antingen accepterar det, förfinar det eller förkastar trajektorian och börjar om. Det intressanta ingenjörsarbetet i AREX är inte nätverket. Det är slingan, mekanismen för kontextuppdatering som håller reda på verifierade fynd, öppna kandidater och olösta begränsningar över en lång horisont, och verktygsgränssnittet som exponerar sökning och surfning för modellen som förstklassiga handlingar.

Det är därför familjens egna publicerade siffror — 82,5 på BrowseComp, 85,4 på GAIA, 71,0 på xbench-2510, 89,9 på DeepSearch QA och 82,0 på WideSearch-en för 122B Base, med 70,7 / 81,6 / 57,0 / 78,5 / 68,5 för 4B Turbo — inte är jämförbara med Qwen3.8-27B:s kodnings- och agentiska poäng, även om de två delar en arkitektonisk härstamning. De mäter olika saker. QwenSWEBench frågar om en modell kan lösa ett problem i ett kodförråd. BrowseComp frågar om en agent kan hitta ett faktum som medvetet är svårt att hitta, över många sökningar, utan att tappa frågan. En rå Qwen3.5-checkpoint får dåliga poäng på den andra och bra på den första, vilket är precis den klyfta som BAAI:s efterträning och harness finns för att överbrygga.

A generated pricing card headed 'The Qwen3.8 family is priced. AREX-2 is not callable.' It lists Qwen3.8-Max at $2.00 in / $6.00 out with a 1M context released 3 Aug 2026, Qwen3.8-27B at $0.33 in / $2.40 out with 256K context and open weights released 13 Aug 2026, Qwen3.8-Flash at $0.15 in / $0.47 out with a 1M context released 26 Aug 2026, Qwen3.5-122B-A10B at $0.115 in / $0.917 out as the backbone AREX-Base post-trains up to 128K, and a highlighted AREX-2 row reading 'no rate card' because there are no weights, card or licence tag. A footer reads 'Qwen3.8-27B scores 33.7 on the AA Intelligence Index; AREX-2 does not exist to score.' The OrcaRouter logo is composited in the bottom-right corner.

Vad en andra generation mest sannolikt skulle vara

Om AREX-2 fortsätter mönstret är den mest sannolika tolkningen — en slutledning, inte ett faktum — en forskningsagent av andra generationen som eftertränats på en nyare Qwe​n-backbone än 3.5-generationen som de nuvarande AREX-modellerna använder. Qwen3.8-27B är tät, multimodal och Apache 2.0, vilket gör den till en naturlig kandidat för en agent i kvalitetsklassen; Qwen3.8-Flash är billig per token, vilket spelar enormt stor roll när din agent gör dussintals anrop per fråga och återläser en växande kontext vid varje steg.

Inget av det är bekräftat. Namnet anger ingen storlek, ingen backbone och inget datum, och en "2" i en produktlinje är en namngivningskonvention snarare än en specifikation. Det som är bekräftat är mycket snävare och bör anges så: BAAI skapade repot den 29 september 2026, lade inte upp något i det och har inte tillkännagivit något. Inga vikter, inget modellkort, inget parameterantal, ingen licensmärkning, inga benchmarks, ingen leverantör som tillhandahåller det. Om du ser AREX-2-siffror citerade någonstans den här veckan är de inte mätvärden.

Vad du faktiskt kan köpa i eftermiddag

Den praktiska asymmetrin mellan dessa två handlar inte om kvalitet, utan om att den ena sidan har en prislista och den andra har en katalogpost.

Om ditt arbete är agentiskt och du vill ha substratet som AREX-familjen byggdes på, är den exakta ryggraden anropbar: Qwen3.5-122B-A10B finns i OrcaRouters katalog till $0.115 per miljon indatatokens och $0.917 per miljon utdatatokens upp till 128K tokens, stiger till $0.287 / $2.294 därutöver, med vision, verktygsanvändning och resonemang aktiverade. Det är modellen som AREX-Base eftertränar, tillgänglig utan att behöva vänta på något.

Om du vill ha den aktuella generationen finns båda de öppna Qwen3.8-nivåerna i katalogen: Qwen3.8-27B för $0.33 per miljon indata och $2.40 utdata, som körs på vår egen infrastruktur eftersom vikterna är öppna och det finns ingen leverantörskostnad per token att föra vidare, och Qwen3.8-Flash för $0.15 / $0.47 för volymnivån. Ett API täcker båda, leverantörens listpris förs vidare utan något tillagt per token, så när Alibaba ändrar ett pris ändras siffran här samma dag.

Och när AREX-2 väl släpps är skälet till att det hör hemma bakom samma lager strukturellt snarare än marknadsföringsmässigt. En agentloop som gör tjugo anrop per fråga multiplicerar varje leverantörs felfrekvens med tjugo; en routningsregel med automatisk failover som fattar beslut vid körning är skillnaden mellan att en timeout blir ett nytt försök och att en timeout blir ett självsäkert felaktigt svar. Det argumentet gäller alla forskningsagenter, och det kommer att gälla AREX-2 närhelst det finns en AREX-2 att routa.

Vem bör agera, och på vad

Om du behöver en forskningsagent i dag är AREX-Base den AREX-modell som finns, den släpptes i juli under Apache 2.0, och dess agentbenchmarks är leverantörens egna men åtminstone är de kopplade till en nedladdningsbar modell. Om du i dag behöver främsta multimodala resonemang eller högvolymagentisk trafik är Qwen3.8-nivåerna live, prissatta och delvis oberoende utvärderade, och inget i AREX-2:s existens ändrar det beslutet.

Det enda scenariot där AREX-2 har betydelse för ett beslut du fattar den här veckan är det där du väljer en backbone för en finjustering. Och där är svaret redan synligt i katalogen: de 3.5-backbones som AREX använde är fortfarande billiga och tillgängliga, 3.8-generationen är bättre och även tillgänglig, och en andra generationens AREX – när den än kommer – kommer nästan säkert att vara bevis för vilken Qwe​n-bas BAAI anser är värd att bygga vidare på, inte en ersättning för den.

Tre saker skulle avgöra resten: filer i trädet, ett kort med ett parameterantal och ett fält för basmodell samt en licenstagg. Den första av dessa är den som spelar roll, för tills den är på plats är den här jämförelsen mellan en prissatt familj och en platshållare.