
GPT-6 Astra vs Qwen3.8-Max: Dwa agentyczne flagowce i drobny druk każdego z nich
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Wrzesień 2026 roku przynosi dwie historie o flagowych modelach agentowych – w obu chodzi o GPT-6 Astra i Qwen3.8-Max. OpenAI wypuściło GPT-6 Astra 3 września, przedstawiając go jako najlepszy na świecie model do obsługi komputera, inżynierii oprogramowania, nauki i cyberbezpieczeństwa. Qwen3.8-Max od Alibaby, dostępny od 3 sierpnia, to flagowy model agentowy najmocniejszego chińskiego laboratorium – tego, które Artificial Analysis plasuje w czołówce swojego indeksu agentowego – oraz najpoważniejszy w otwartym ekosystemie konkurent dla czołowych laboratoriów w kwestii autonomicznej pracy. Oba modele są naprawdę mocne, ale oba sprzedawane są z chwytliwymi liczbami, które pod lupą tracą blask. Wynik OpenAI na poziomie 99.9% ARC-AGI-3 spada do 62.7%, gdy ARC Prize uruchamia własny neutralny harness; agentowa błyskotliwość Qwen3.8-Max idzie natomiast w parze z niezależnie zmierzoną regresją w zakresie halucynacji i skłonnością do spędzania 64 tur oraz ponad dolara na zadaniach, które jego poprzednik kończył w 14 turach. To porównanie dwóch modeli – i dwóch sposobów czytania benchmarku.
Te dwa nagłówki
Przekaz OpenAI dotyczący GPT-6 Astra to szerokość plus autonomia: pojedynczy model, który obsługuje przeglądarkę, pisze i poprawia kod, prowadzi analizy naukowe oraz – wyjątkowo – znajduje nowe luki w zabezpieczeniach na tyle skutecznie, że OpenAI oceniło cały model jako „krytyczny” w ramach swojego Preparedness Framework i ograniczyło najbardziej zaawansowane ustawienia do zweryfikowanych partnerów. Według materiałów premierowych model osiąga 100% na ExploitBench, 97,6% na FrontierMath Tier 4, 96,0% na GPQA Diamond oraz wynik nasycenia ARC-AGI-3. Przekaz Aliby dotyczący Qwen3.8-Max jest węższy, ale celny: agentowy koń roboczy za $2/$6, który osiąga wyniki na szczycie lub blisko szczytu niezależnych ewaluacji agentowych, a jego wagi są opublikowane (na podstawie niestandardowej licencji) zamiast zamknięte w czarnej skrzynce.
Co mówi niezależna tablica wyników
Artificial Analysis plasuje obecnie GPT-6 Astra (max) na poziomie Intelligence 61 — 8. miejsce wśród 202 śledzonych modeli — a Qwen3.8-Max na poziomie Intelligence 58, 24. miejsce. Ta trzypunktowa różnica jest mniejsza niż różnica w cenie i mniejsza niż marketing któregokolwiek z producentów; w osobnym indeksie agentowym AA Qwen3.8-Max osiąga 58, co stawia go na równi z najlepszymi zamkniętymi modelami granicznymi, podczas gdy AA nie publikuje indeksu agentowego dla GPT-6 Astra w ogóle. Uczciwa lektura: w czysto zmierzonej inteligencji oba modele to bliscy sąsiedzi, a narracja o „najbardziej inteligentnym modelu świata” w materiałach premierowych OpenAI nie znajduje potwierdzenia w niezależnej ocenie AA.
• Inteligencja — GPT-6 Astra (max): AA Intelligence 61, miejsce #8/202. Qwen3.8-Max: AA Intelligence 58, miejsce #24/202; AA Agentic 58.
• Cena katalogowa — GPT-6 Astra: $10.00 / $50.00 za 1M, $1.00 za odczyty cache, 2× wejście powyżej 272K tokenów. Qwen3.8-Max: $2.00 / $6.00 za 1M, $0.25 za odczyty cache.
• Kontekst / wyjście — GPT-6 Astra: 1,05 mln tokenów na wejściu / 128 tys. na wyjściu. Qwen3.8-Max: 1 mln tokenów na wejściu / ~128 tys. na wyjściu.
• Dowody agentowe — GPT-6 Astra: ARC-AGI-3 99,9% (platforma ewaluacyjna OpenAI) vs 62,7% (standardowa platforma ewaluacyjna ARC Prize); WANDR 0,682 @ 11,98 USD/zadanie (raport Perplexity). Qwen3.8-Max: AA GDPval 1739 Elo przy 64 krokach na zadanie (~1,14 USD/zadanie); Code Arena WebDev #1 na 1691 Elo.
• Niezależne sygnały ostrzegawcze — GPT-6 Astra: jeszcze nie w selektorze ChatGPT, API wdrażane etapowo, ustępstwo w zakresie monitorowalności. Qwen3.8-Max: wzrost halucynacji AA-Omniscience z 23% do 40% w porównaniu z poprzednią generacją.
• Wagi — GPT-6 Astra: własnościowe. Qwen3.8-Max: checkpoint klasy Max (Qwen3.8-2.4T-A95B) publiczny na podstawie niestandardowej licencji od 12 sierpnia; AA nadal klasyfikuje hostowany flagowy model jako własnościowy.

Drobny druk, z adnotacjami
Weźmy najpierw liczbę ARC-AGI-3, bo to najczystszy przykład tego, jak liczba może być zarówno prawdziwa, jak i myląca. OpenAI podaje 99,9% dla GPT-6 Astra we własnym środowisku pomiarowym z adapterem dla dostawcy — konfiguracji dopasowanej do modelu. ARC Prize, organizacja utrzymująca benchmark, uruchomiła GPT-6 Astra na swoim neutralnym względem dostawcy standardowym środowisku pomiarowym i uzyskała 62,7%. Obie wartości są na światowym poziomie; żadna nie wynosi 99,9% na środowisku, którego nie kontroluje producent modelu. Ta sama ostrożność dotyczy wyniku Perplexity w WANDR: 0,682 — najwyższego, jaki Perplexity odnotowała, ale zmierzonego przez firmę, która jednocześnie integruje GPT-6 Astra z własnymi produktami, więc wiąże się z interesem komercyjnym. Ten schemat warto nazwać po imieniu: najbardziej spektakularne liczby OpenAI pochodzą ze środowisk, które kontroluje samo OpenAI lub jego partnerzy, a jedyna w pełni niezależna liczba — Intelligence 61 od AA — jest po prostu doskonała.
Drobny druk Qwen3.8-Max działa w drugą stronę: jego mocne strony są mierzone niezależnie, a jego słabość również. Wynik GDPval wynoszący 1739 Elo jest prawdziwy — ale testy Artificial Analysis pokazują, że Qwen3.8-Max osiąga go, zużywając 64 tury i około 1,14 dolara na zadanie, wobec 14 tur i 0,53 dolara dla poprzedniej generacji. To podatek od wysiłku: model kupuje swój agentowy pułap tokenami rozumowania, co ma znaczenie dla każdego, kto płaci za token. A ewaluacja Omniscience przeprowadzona przez AA zmierzyła pogorszenie wskaźnika halucynacji z 23% do 40% względem poprzedniej generacji Qwen — to realna, niezależna czerwona flaga dla dokładnie tych autonomicznych, wieloetapowych zadań, w których pewna błędna odpowiedź jest najbardziej kosztowna. Model, który przez 64 tury sam siebie namawia do błędów, nie jest w oczywisty sposób bezpieczniejszy do uwolnienia niż model, którego producent przyznaje, że jego monitorowalność spadła.

Cena, wdrożenie i uczciwy sposób wyboru
Jeśli chodzi o cenę, nie ma żadnej konkurencji: Qwen3.8-Max za 2,00 USD / 6,00 USD za milion tokenów to jedna piąta ceny wejściowej GPT-6 Astra i jedna ósma ceny wyjściowej, a jego kontekst 1M tokenów nie wiąże się z dopłatą za długie prompty, jak w przypadku Astry. Pod względem wdrażania Qwen3.8-Max ma w tym tygodniu dodatkową przewagę — można go wywołać już dziś, a jest dostępny na OrcaRouterze po cenie z listy Alibaba, bez żadnej marży i z automatycznym przełączaniem awaryjnym. GPT-6 Astra, wciąż wchodzący na rynek i według stanu na 4 września niedostępny do wyboru w ChatGPT dla większości użytkowników, jest osiągalny przez własne API OpenAI oraz główne marketplace’y chmurowe, w miarę jak poszerza się dostęp. Praktyczny wzorzec dla zespołu budującego potoki agentowe to uruchamiać obciążenia na modelu dostępnym już dziś, a ten drugi traktować jako punkt odniesienia, który warto obserwować. Jeśli chcesz oceniać twierdzenia o „agentowości” zamiast przyjmować je na wiarę, warstwa routingu jest właściwym narzędziem: Qwen3.8-Max, Kimi K3, Grok 4.6 i ponad 200 innych modeli znajduje się za jednym kluczem w OrcaRouterze, a DSL routowania potrafi połączyć kilka z nich w jedno wywołanie — możesz więc uruchomić własny zestaw zadań wobec kandydatów i samodzielnie przeczytać wyniki, zamiast wybierać między drobnym drukiem dwóch dostawców.
Dwa pytania, które wciąż nasuwa to starcie
Dlaczego OpenAI podaje 99,9% na ARC-AGI-3, skoro ARC Prize mierzy 62,7%? Ponieważ to nie ten sam test. Harness provider-adapter OpenAI to wersja benchmarku skonfigurowana pod sposób, w jaki GPT-6 Astra jest wywoływany w produkcji; standardowy harness ARC Prize to neutralna konfiguracja zaprojektowana do uczciwego porównywania dowolnego modelu. Wynik 62,7% to ten, który przekłada się na „co się stanie, jeśli sam wywołam ten model” i nadal jest najlepszym wynikiem, jaki ARC Prize zarejestrował na tym harnessie.
Czy Qwen3.8-Max ma otwarte wagi? Częściowo, z pewnym zastrzeżeniem licencyjnym. Alibaba opublikował 12 sierpnia checkpoint klasy Max, Qwen3.8-2.4T-A95B, na podstawie niestandardowej licencji — wagi są do pobrania, ale nie jest to otwartość w stylu Apache-2.0, jak w przypadku mniejszego Qwen3.8-27B, a Artificial Analysis nadal klasyfikuje hostowany flagowy model jako zastrzeżony. Jeśli twoim wymaganiem jest „mogę uruchomić dokładnie ten model, za który płacę”, to rozróżnienie ma znaczenie; jeśli twoim wymaganiem jest „mogę przeanalizować architekturę i samodzielnie hostować zbliżony wariant”, Qwen3.8-Max się kwalifikuje, a GPT-6 Astra nie.
Przesłanie
Wybierz GPT-6 Astra, jeśli potrzebujesz konkretnych rzeczy, które obecnie potrafi tylko on — pracy z zakresu bezpieczeństwa ofensywnego, przełomowego rozumowania naukowego, najtrudniejszych zadań autonomicznej obsługi komputera — a Twoja organizacja może spełnić jego wymogi kwalifikacyjne i pozwolić sobie na jego cenę. Wybierz Qwen3.8-Max, jeśli chcesz najwyższej klasy model agentowy, który możesz faktycznie wdrożyć w tym tygodniu za $2/$6, z wagami jako wyjściem awaryjnym i regresją halucynacji, którą — jak już wiesz — należy sprawdzić. Szersza lekcja kryje się w samym drobnym druku: we wrześniu 2026 roku dwa czołowe „agentowe” flagowce są sprzedawane z liczbami z nagłówków, nad którymi żaden z producentów nie ma pełnej kontroli, a racjonalny nabywca czyta środowisko testowe, liczy tury i uruchamia własne zadania, zanim opowie się po którejś stronie.

Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
