Wygenerowana karta tytułowa z napisem „AREX-2 vs Qwen3.8-Max – Substrat i to, co na nim działa”, z dwoma panelami. Lewy panel, zatytułowany Qwen3.8-Max, zawiera listę: dostępny od 3 sierpnia 2026; kontekst 1 mln tokenów, multimodalny; 2 USD za wejście / 6 USD za wyjście za 1 mln; można go wywołać już dziś. Prawy panel, zatytułowany AREX-2, zawiera listę: repozytorium utworzone 29 wrz 2026; brak wag, brak karty modelu; nigdzie brak cennika; nigdzie nie można go wywołać. Stopka głosi: „Pierwsza generacja AREX została poddana treningowi końcowemu na szkielecie Qwen”. Logo OrcaRouter jest wkomponowane w prawym dolnym narożniku.
Guides & Insights

AREX-2 vs Qwen 3.8: Jeden jest podłożem, na którym prawdopodobnie zbudowano drugi

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Pojedynek między AREX-2 a Qwen3.8-Max wygląda na bezpośrednie starcie między flagowymi systemami dwóch chińskich laboratoriów, ale nim nie jest — nie dlatego, że AREX-2 jest niesprawdzony, choć jest, lecz dlatego, że oba znajdują się na różnych warstwach tego samego stosu. Qwen3.8-Max działa od 3 sierpnia 2026 r., w cenie 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych, z oknem kontekstowym 1 mln tokenów; jego siostrzane modele z otwartymi wagami, Qwen3.8-27B i Qwen3.8-Flash, zostały wydane 13 i 26 sierpnia wraz z opublikowanymi benchmarkami i opublikowanymi cenami. AREX-2 to repozytorium utworzone przez BAAI na Hugging Face 29 września 2026 r. o 17:56 UTC, zawierające plik .gitattributes i nic więcej. A powód, dla którego te dwa nie są rywalami, tkwi w podstawowym fakcie, o którym żaden z dostawców głośno nie mówi: każdy model AREX, jaki BAAI dotychczas wydało, jest zbudowany na szkielecie Qwe​n.

To nie jest spekulacja na temat AREX-2. Jest to udokumentowane dla generacji, która istnieje. AREX-Base to 122-miliardowy model typu mixture-of-experts z 10 miliardami aktywnych parametrów, zbudowany na Qwen3.5-122B-A10B, a AREX-Turbo to gęsty model 4B zbudowany na Qwen3.5-4B; oba zostały wydane 23 lipca 2026 na licencji Apache 2.0. Uczciwy kształt tego porównania to więc nie agent kontra flagowiec. To: co daje ci dziś substrat Alibaby, co dodaje na wierzchu warstwa agentowa BAAI i na ile drugiego pytania można odpowiedzieć, zanim BAAI wgra plik?

Co jest już dostępne po stronie Qwen i ile to kosztuje

Generację Qwen3.8 wyjątkowo łatwo analizować, ponieważ jest w pełni określona i publicznie wyceniona na trzech odrębnych poziomach.

• Qwen3.8-Max — wydany 3 sierpnia 2026. Okno kontekstowe 1 mln tokenów, natywne wejście tekstowe, obrazowe i wideo, tryb myślenia, wywoływanie funkcji i ustrukturyzowane dane wyjściowe oraz trzy formaty transmisji (zgodny z OpenAI, zgodny z Anthropic i natywny DashScope) w pięciu regionach. 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych, przy odczycie z pamięci podręcznej 0,25 USD.

• Qwen3.8-27B — wydany 13 sierpnia 2026 r. Gęsty, 27 mld parametrów, kontekst 256K (262 144 pozycje), tekst, obraz i wideo na wejściu, wagi Apache 2.0. Opublikowano na własnej karcie Qwena z wynikiem 90,3 w LiveCodeBench v6, 89,2 w GPQA Diamond, 84,3 w OSWorld-Verified i 79,0 w QwenSWEBench — raportowane przez dostawcę, nieodtworzone niezależnie. Niezależny pomiar plasuje go na poziomie 33,7 w Artificial Analysis Intelligence Index i 68,1 w indeksie AA Coding.

• Qwen3.8-Flash — wydany 26 sierpnia 2026 r. To samo okno 1 mln tokenów i to samo wejście multimodalne, w cenie 0,15 USD za milion tokenów wejściowych i 0,47 USD za tokeny wyjściowe. Najtańsza warstwa w rodzinie — ta, która sprawia, że ruch agentowy o dużej skali staje się opłacalny.

Istnieje również nieoznaczony Qwen3.8 wpis: flagowy model o 2,4 biliona parametrów, którego wagi — jak zapowiedziała Alibaba — są w drodze, a którego nie można jeszcze nigdzie wywołać. Jeśli szukasz „Qwe​n 3.8" i oczekujesz jednego modelu, właśnie dlatego odpowiedzią jest rodzina czterech, a nie jeden.

A screenshot of the OrcaRouter model page for Qwen3.8-27B, showing the Featured badge, a 256K-token context window, text, image and video input with text output, badges for Vision, Tools, JSON and Reasoning, the provider line 'by Qwen - 2026-08-13', a pricing row of $0.33 input and $2.40 output per million tokens with measured latency and 120.2M tokens of traffic, and the beginning of the model description covering the 27B dense multimodal model's Apache-2.0 licence and 256K context.

W porównaniu z tym wszystkim specyfikacja AREX-2 ma długość jednej linii: repozytorium, znacznik czasu i nazwa, która sugeruje drugą generację czegoś, co BAAI już raz zbudowało.

Szczegół, który nadaje całemu porównaniu nowy wymiar

AREX nie jest konkurentem Qwen; jest jego konsumentem. Oba modele AREX pierwszej generacji są dotrenowywane na szkieletach Qwen3.5, a następnie opakowywane w framework, który czyni je agentami, a nie modelami czatu: wewnętrzna pętla, która wyszukuje, przegląda i integruje dowody w odpowiedź kandydacką niosącą wskaźnik pewności, oraz zewnętrzna pętla, która sprawdza tę odpowiedź względem pierwotnych ograniczeń i albo ją akceptuje, albo udoskonala, albo odrzuca trajektorię i zaczyna od nowa. Ciekawa inżynieria w AREX to nie sieć. To pętla, mechanizm aktualizacji kontekstu, który przez długi horyzont utrzymuje w ryzach zweryfikowane ustalenia, otwartych kandydatów i nierozwiązane ograniczenia, oraz interfejs narzędziowy, który udostępnia modelowi wyszukiwanie i przeglądanie jako działania pierwszej klasy.

Dlatego właśnie własne, opublikowane wyniki tej rodziny — 82,5 w BrowseComp, 85,4 w GAIA, 71,0 w xbench-2510, 89,9 w DeepSearch QA i 82,0 w WideSearch-en dla 122B Base, oraz 70,7 / 81,6 / 57,0 / 78,5 / 68,5 dla 4B Turbo — nie są porównywalne z wynikami Qwen3.8-27B w kodowaniu i zadaniach agentowych, mimo że oba modele mają wspólny rodowód architektoniczny. Mierzą różne rzeczy. QwenSWEBench pyta, czy model potrafi rozwiązać problem w repozytorium. BrowseComp pyta, czy agent potrafi znaleźć fakt, który celowo trudno znaleźć, w wielu wyszukiwaniach, nie gubiąc pytania. Surowy checkpoint Qwen3.5 wypada słabo w drugim i dobrze w pierwszym, co jest dokładnie tą luką, którą mają wypełnić dostrajanie po treningu wstępnym i harness BAAI.

A generated pricing card headed 'The Qwen3.8 family is priced. AREX-2 is not callable.' It lists Qwen3.8-Max at $2.00 in / $6.00 out with a 1M context released 3 Aug 2026, Qwen3.8-27B at $0.33 in / $2.40 out with 256K context and open weights released 13 Aug 2026, Qwen3.8-Flash at $0.15 in / $0.47 out with a 1M context released 26 Aug 2026, Qwen3.5-122B-A10B at $0.115 in / $0.917 out as the backbone AREX-Base post-trains up to 128K, and a highlighted AREX-2 row reading 'no rate card' because there are no weights, card or licence tag. A footer reads 'Qwen3.8-27B scores 33.7 on the AA Intelligence Index; AREX-2 does not exist to score.' The OrcaRouter logo is composited in the bottom-right corner.

Czym najprawdopodobniej byłaby druga generacja

Jeśli AREX-2 kontynuuje ten wzorzec, najbardziej prawdopodobne odczytanie — wnioskowanie, nie fakt — to agent badawczy drugiej generacji dotrenowany na nowszym backbone’ie Qwen niż generacja 3.5, której używają obecne modele AREX. Qwen3.8-27B jest gęsty, multimodalny i na licencji Apache 2.0, co czyni go naturalnym kandydatem na agenta klasy jakościowej; Qwen3.8-Flash jest tani w przeliczeniu na token, co ma ogromne znaczenie, gdy twój agent wykonuje dziesiątki wywołań na zapytanie i ponownie odczytuje rosnący kontekst na każdym kroku.

Nic z tego nie zostało potwierdzone. Nazwa nie zawiera żadnego rozmiaru, żadnego backbone'u ani żadnej daty, a „2” w linii produktów to konwencja nazewnicza, a nie specyfikacja. To, co potwierdzono, jest znacznie węższe i tak należy to ująć: BAAI utworzyło repozytorium 29 września 2026 r., nic w nim nie umieściło i nic nie ogłosiło. Żadnych wag, żadnej karty, żadnej liczby parametrów, żadnego taga licencji, żadnych benchmarków, żadnego dostawcy, który by to serwował. Jeśli w tym tygodniu zobaczysz gdziekolwiek podawane liczby dla AREX-2, to nie są to pomiary.

Co tak naprawdę możesz kupić dziś po południu

Praktyczna asymetria między tymi dwoma nie polega na jakości, lecz na tym, że jeden ma cennik, a drugi wpis w katalogu.

Jeśli Twoja praca ma charakter agentowy i chcesz mieć dostęp do fundamentu, na którym zbudowano rodzinę AREX, dokładny backbone można wywołać: Qwen3.5-122B-A10B znajduje się w katalogu OrcaRouter w cenie 0,115 USD za milion tokenów wejściowych i 0,917 USD za milion tokenów wyjściowych do 128 tys. tokenów, a powyżej tego progu stawki rosną do 0,287 USD / 2,294 USD, przy włączonej obsłudze wizji, narzędzi i rozumowania. To model, na którym AREX-Base prowadzi post-training, dostępny bez czekania na cokolwiek.

Jeśli chcesz obecną generację, oba otwarte warianty Qwen3.8 są w katalogu: Qwen3.8-27B w cenie 0,33 USD za milion tokenów wejściowych i 2,40 USD za wyjściowe, działający na naszej własnej infrastrukturze, ponieważ wagi są otwarte i nie ma kosztu za token u dostawcy, który trzeba by przenosić, a Qwen3.8-Flash w cenie 0,15 / 0,47 USD dla poziomu wolumenowego. Jedno API obsługuje oba, cena katalogowa dostawcy jest przekazywana bez dodawania niczego za token, więc gdy Alibaba zmieni cenę, liczba tutaj zmieni się tego samego dnia.

A kiedy AREX-2 faktycznie zostanie wydany, powód, dla którego powinien znajdować się za tą samą warstwą, jest strukturalny, a nie promocyjny. Pętla agenta wykonująca dwadzieścia wywołań na zapytanie mnoży współczynnik awaryjności każdego dostawcy przez dwadzieścia; reguła routingu z automatycznym przełączaniem awaryjnym, która decyduje w czasie działania to różnica między tym, czy timeout oznacza ponowienie, a tym, czy oznacza pewną siebie błędną odpowiedź. Ten argument dotyczy każdego agenta badawczego i będzie dotyczyć AREX-2, gdy tylko pojawi się AREX-2 do routowania.

Kto powinien działać i w jakiej sprawie?

Jeśli potrzebujesz dziś agenta badawczego, AREX-Base to istniejący model AREX, wydany w lipcu na licencji Apache 2.0, a jego benchmarki agentowe pochodzą od dostawcy, ale przynajmniej są powiązane z modelem do pobrania. Jeśli potrzebujesz dziś najnowocześniejszego rozumowania multimodalnego lub ruchu agentowego o dużej skali, poziomy Qwen3.8 są dostępne, wycenione i częściowo niezależnie oceniane, a istnienie AREX-2 nie zmienia tej decyzji.

Jedynym scenariuszem, w którym AREX-2 ma znaczenie dla decyzji, którą podejmujesz w tym tygodniu, jest ten, w którym wybierasz backbone do dostrojenia. A tam odpowiedź jest już widoczna w katalogu: backbony 3.5, których używał AREX, są wciąż tanie i dostępne, generacja 3.8 jest lepsza i również dostępna, a AREX drugiej generacji — kiedykolwiek się pojawi — będzie niemal na pewno dowodem na to, na której bazie Qwe​n BAAI uważa, że warto budować, a nie zamiennikiem dla niej.

Trzy rzeczy rozstrzygnęłyby resztę: pliki w drzewie, karta z liczbą parametrów i polem modelu bazowego oraz znacznik licencji. Najważniejsza z nich jest ta pierwsza, bo dopóki się nie pojawi, to porównanie odbywa się między wycenioną rodziną a placeholderem.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie