
AREX-2 vs Qwen 3.8: Jeden jest podłożem, na którym prawdopodobnie zbudowano drugi
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 507 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 194 tok/s
- OrcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Pojedynek między AREX-2 a Qwen3.8-Max wygląda na bezpośrednie starcie między flagowymi systemami dwóch chińskich laboratoriów, ale nim nie jest — nie dlatego, że AREX-2 jest niesprawdzony, choć jest, lecz dlatego, że oba znajdują się na różnych warstwach tego samego stosu. Qwen3.8-Max działa od 3 sierpnia 2026 r., w cenie 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych, z oknem kontekstowym 1 mln tokenów; jego siostrzane modele z otwartymi wagami, Qwen3.8-27B i Qwen3.8-Flash, zostały wydane 13 i 26 sierpnia wraz z opublikowanymi benchmarkami i opublikowanymi cenami. AREX-2 to repozytorium utworzone przez BAAI na Hugging Face 29 września 2026 r. o 17:56 UTC, zawierające plik .gitattributes i nic więcej. A powód, dla którego te dwa nie są rywalami, tkwi w podstawowym fakcie, o którym żaden z dostawców głośno nie mówi: każdy model AREX, jaki BAAI dotychczas wydało, jest zbudowany na szkielecie Qwen.
To nie jest spekulacja na temat AREX-2. Jest to udokumentowane dla generacji, która istnieje. AREX-Base to 122-miliardowy model typu mixture-of-experts z 10 miliardami aktywnych parametrów, zbudowany na Qwen3.5-122B-A10B, a AREX-Turbo to gęsty model 4B zbudowany na Qwen3.5-4B; oba zostały wydane 23 lipca 2026 na licencji Apache 2.0. Uczciwy kształt tego porównania to więc nie agent kontra flagowiec. To: co daje ci dziś substrat Alibaby, co dodaje na wierzchu warstwa agentowa BAAI i na ile drugiego pytania można odpowiedzieć, zanim BAAI wgra plik?
Co jest już dostępne po stronie Qwen i ile to kosztuje
Generację Qwen3.8 wyjątkowo łatwo analizować, ponieważ jest w pełni określona i publicznie wyceniona na trzech odrębnych poziomach.
• Qwen3.8-Max — wydany 3 sierpnia 2026. Okno kontekstowe 1 mln tokenów, natywne wejście tekstowe, obrazowe i wideo, tryb myślenia, wywoływanie funkcji i ustrukturyzowane dane wyjściowe oraz trzy formaty transmisji (zgodny z OpenAI, zgodny z Anthropic i natywny DashScope) w pięciu regionach. 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych, przy odczycie z pamięci podręcznej 0,25 USD.
• Qwen3.8-27B — wydany 13 sierpnia 2026 r. Gęsty, 27 mld parametrów, kontekst 256K (262 144 pozycje), tekst, obraz i wideo na wejściu, wagi Apache 2.0. Opublikowano na własnej karcie Qwena z wynikiem 90,3 w LiveCodeBench v6, 89,2 w GPQA Diamond, 84,3 w OSWorld-Verified i 79,0 w QwenSWEBench — raportowane przez dostawcę, nieodtworzone niezależnie. Niezależny pomiar plasuje go na poziomie 33,7 w Artificial Analysis Intelligence Index i 68,1 w indeksie AA Coding.
• Qwen3.8-Flash — wydany 26 sierpnia 2026 r. To samo okno 1 mln tokenów i to samo wejście multimodalne, w cenie 0,15 USD za milion tokenów wejściowych i 0,47 USD za tokeny wyjściowe. Najtańsza warstwa w rodzinie — ta, która sprawia, że ruch agentowy o dużej skali staje się opłacalny.
Istnieje również nieoznaczony Qwen3.8 wpis: flagowy model o 2,4 biliona parametrów, którego wagi — jak zapowiedziała Alibaba — są w drodze, a którego nie można jeszcze nigdzie wywołać. Jeśli szukasz „Qwen 3.8" i oczekujesz jednego modelu, właśnie dlatego odpowiedzią jest rodzina czterech, a nie jeden.

W porównaniu z tym wszystkim specyfikacja AREX-2 ma długość jednej linii: repozytorium, znacznik czasu i nazwa, która sugeruje drugą generację czegoś, co BAAI już raz zbudowało.
Szczegół, który nadaje całemu porównaniu nowy wymiar
AREX nie jest konkurentem Qwen; jest jego konsumentem. Oba modele AREX pierwszej generacji są dotrenowywane na szkieletach Qwen3.5, a następnie opakowywane w framework, który czyni je agentami, a nie modelami czatu: wewnętrzna pętla, która wyszukuje, przegląda i integruje dowody w odpowiedź kandydacką niosącą wskaźnik pewności, oraz zewnętrzna pętla, która sprawdza tę odpowiedź względem pierwotnych ograniczeń i albo ją akceptuje, albo udoskonala, albo odrzuca trajektorię i zaczyna od nowa. Ciekawa inżynieria w AREX to nie sieć. To pętla, mechanizm aktualizacji kontekstu, który przez długi horyzont utrzymuje w ryzach zweryfikowane ustalenia, otwartych kandydatów i nierozwiązane ograniczenia, oraz interfejs narzędziowy, który udostępnia modelowi wyszukiwanie i przeglądanie jako działania pierwszej klasy.
Dlatego właśnie własne, opublikowane wyniki tej rodziny — 82,5 w BrowseComp, 85,4 w GAIA, 71,0 w xbench-2510, 89,9 w DeepSearch QA i 82,0 w WideSearch-en dla 122B Base, oraz 70,7 / 81,6 / 57,0 / 78,5 / 68,5 dla 4B Turbo — nie są porównywalne z wynikami Qwen3.8-27B w kodowaniu i zadaniach agentowych, mimo że oba modele mają wspólny rodowód architektoniczny. Mierzą różne rzeczy. QwenSWEBench pyta, czy model potrafi rozwiązać problem w repozytorium. BrowseComp pyta, czy agent potrafi znaleźć fakt, który celowo trudno znaleźć, w wielu wyszukiwaniach, nie gubiąc pytania. Surowy checkpoint Qwen3.5 wypada słabo w drugim i dobrze w pierwszym, co jest dokładnie tą luką, którą mają wypełnić dostrajanie po treningu wstępnym i harness BAAI.

Czym najprawdopodobniej byłaby druga generacja
Jeśli AREX-2 kontynuuje ten wzorzec, najbardziej prawdopodobne odczytanie — wnioskowanie, nie fakt — to agent badawczy drugiej generacji dotrenowany na nowszym backbone’ie Qwen niż generacja 3.5, której używają obecne modele AREX. Qwen3.8-27B jest gęsty, multimodalny i na licencji Apache 2.0, co czyni go naturalnym kandydatem na agenta klasy jakościowej; Qwen3.8-Flash jest tani w przeliczeniu na token, co ma ogromne znaczenie, gdy twój agent wykonuje dziesiątki wywołań na zapytanie i ponownie odczytuje rosnący kontekst na każdym kroku.
Nic z tego nie zostało potwierdzone. Nazwa nie zawiera żadnego rozmiaru, żadnego backbone'u ani żadnej daty, a „2” w linii produktów to konwencja nazewnicza, a nie specyfikacja. To, co potwierdzono, jest znacznie węższe i tak należy to ująć: BAAI utworzyło repozytorium 29 września 2026 r., nic w nim nie umieściło i nic nie ogłosiło. Żadnych wag, żadnej karty, żadnej liczby parametrów, żadnego taga licencji, żadnych benchmarków, żadnego dostawcy, który by to serwował. Jeśli w tym tygodniu zobaczysz gdziekolwiek podawane liczby dla AREX-2, to nie są to pomiary.
Co tak naprawdę możesz kupić dziś po południu
Praktyczna asymetria między tymi dwoma nie polega na jakości, lecz na tym, że jeden ma cennik, a drugi wpis w katalogu.
Jeśli Twoja praca ma charakter agentowy i chcesz mieć dostęp do fundamentu, na którym zbudowano rodzinę AREX, dokładny backbone można wywołać: Qwen3.5-122B-A10B znajduje się w katalogu OrcaRouter w cenie 0,115 USD za milion tokenów wejściowych i 0,917 USD za milion tokenów wyjściowych do 128 tys. tokenów, a powyżej tego progu stawki rosną do 0,287 USD / 2,294 USD, przy włączonej obsłudze wizji, narzędzi i rozumowania. To model, na którym AREX-Base prowadzi post-training, dostępny bez czekania na cokolwiek.
Jeśli chcesz obecną generację, oba otwarte warianty Qwen3.8 są w katalogu: Qwen3.8-27B w cenie 0,33 USD za milion tokenów wejściowych i 2,40 USD za wyjściowe, działający na naszej własnej infrastrukturze, ponieważ wagi są otwarte i nie ma kosztu za token u dostawcy, który trzeba by przenosić, a Qwen3.8-Flash w cenie 0,15 / 0,47 USD dla poziomu wolumenowego. Jedno API obsługuje oba, cena katalogowa dostawcy jest przekazywana bez dodawania niczego za token, więc gdy Alibaba zmieni cenę, liczba tutaj zmieni się tego samego dnia.
A kiedy AREX-2 faktycznie zostanie wydany, powód, dla którego powinien znajdować się za tą samą warstwą, jest strukturalny, a nie promocyjny. Pętla agenta wykonująca dwadzieścia wywołań na zapytanie mnoży współczynnik awaryjności każdego dostawcy przez dwadzieścia; reguła routingu z automatycznym przełączaniem awaryjnym, która decyduje w czasie działania to różnica między tym, czy timeout oznacza ponowienie, a tym, czy oznacza pewną siebie błędną odpowiedź. Ten argument dotyczy każdego agenta badawczego i będzie dotyczyć AREX-2, gdy tylko pojawi się AREX-2 do routowania.
Kto powinien działać i w jakiej sprawie?
Jeśli potrzebujesz dziś agenta badawczego, AREX-Base to istniejący model AREX, wydany w lipcu na licencji Apache 2.0, a jego benchmarki agentowe pochodzą od dostawcy, ale przynajmniej są powiązane z modelem do pobrania. Jeśli potrzebujesz dziś najnowocześniejszego rozumowania multimodalnego lub ruchu agentowego o dużej skali, poziomy Qwen3.8 są dostępne, wycenione i częściowo niezależnie oceniane, a istnienie AREX-2 nie zmienia tej decyzji.
Jedynym scenariuszem, w którym AREX-2 ma znaczenie dla decyzji, którą podejmujesz w tym tygodniu, jest ten, w którym wybierasz backbone do dostrojenia. A tam odpowiedź jest już widoczna w katalogu: backbony 3.5, których używał AREX, są wciąż tanie i dostępne, generacja 3.8 jest lepsza i również dostępna, a AREX drugiej generacji — kiedykolwiek się pojawi — będzie niemal na pewno dowodem na to, na której bazie Qwen BAAI uważa, że warto budować, a nie zamiennikiem dla niej.
Trzy rzeczy rozstrzygnęłyby resztę: pliki w drzewie, karta z liczbą parametrów i polem modelu bazowego oraz znacznik licencji. Najważniejsza z nich jest ta pierwsza, bo dopóki się nie pojawi, to porównanie odbywa się między wycenioną rodziną a placeholderem.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
