
Qwen 4 Max vs Claude Opus 5: benchmark, który przesunął się pod oboma z nich
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen 4 Max został zaprezentowany na konferencji Yunqi w Hangzhou 22 września 2026 r. — flagowy poziom linii Qwen 4 obejmującej cztery modele, która została ogłoszona, ale nie została jeszcze wydana, bez ceny, bez okna kontekstowego i bez opublikowanego wyniku. Claude Opus 5 jest ogólnodostępny od 24 lipca 2026 r. w cenie 5,00 USD za milion tokenów wejściowych i 25,00 USD za milion tokenów wyjściowych, a od czasu wydania Qwen3.8-Max to on był celem, w który wymierzony był każdy flagowy model. Oczywisty sposób napisania tego porównania to tabela specyfikacji z jedną pustą kolumną. Użyteczny sposób polega na zauważeniu, że 19 września 2026 r., trzy dni przed ogłoszeniem, Artificial Analysis ponownie przeliczyło swój Intelligence Index i Claude Opus 5 przestał być modelem na jego szczycie. Ta pojedyncza zmiana na nowo określa, co Qwen 4 Max musi pobić.
Co się zmieniło 19 września?
Artificial Analysis opublikował 19 września 2026 r. wersję v4.3.2 indeksu. W obecnej rewizji Claude Opus 5 osiąga 51 punktów w Intelligence Index przy maksymalnym wysiłku rozumowania — 50 przy xhigh, 48 przy high, 45 przy medium i 39 przy low — i plasuje się za Claude Fable 5.1 oraz GPT-6 Astra, oba z wynikiem 53. Koszt na zadanie w tym indeksie wynosi 5,86 USD.
Jeśli brzmi to jak obniżenie, to nim nie jest. Model się nie zmienił. Zmienił się indeks. Nasze własne relacje z lipca i sierpnia wskazywały Claude Opus 5 na 61–63 i na szczycie tabeli, a te liczby były poprawne w ramach ówczesnych poprawek. Każdy, kto nadal je cytuje bez daty poprawki, cytuje wycofaną liczbę, a to zdecydowanie najczęstszy błąd w porównaniach pisanych w tym miesiącu. Praktyczna konsekwencja jest taka, że twierdzenie w rodzaju „Claude Opus 5 to najlepiej punktowany dostępny model” nie jest już prawdziwe, a zbudowane na nim porównanie się rozpada.
W przypadku Qwen konsekwencja jest jeszcze bardziej dotkliwa. Flagowy poziom ogłoszony we wrześniu 2026 r. jest wymierzony w cel, który został na nowo zdefiniowany we wrześniu 2026 r. Cokolwiek Alibaba ostatecznie opublikuje dla Qwen 4 Max, będzie odczytywane na tle rankingu, w którym to 53 jest liczbą do pobicia, a nie 63.

Porównanie, szczerze przedstawione
Jedna strona tej tabeli jest kompletna, a druga pusta, a udawanie, że jest inaczej, byłoby zasadniczym błędem tego artykułu. Oto, co faktycznie wiadomo:
• Status — Claude Opus 5 ogólnie dostępny od 24 lipca 2026, podczas gdy Qwen 4 Max ogłoszono 22 września 2026 bez daty wydania
Cena wejściowa — Claude Opus 5 5,00 USD za 1 mln tokenów, natomiast Qwen 4 Max — nieopublikowana
• Cena za tokeny wyjściowe — Claude Opus 5: 25,00 USD za 1 mln tokenów, natomiast Qwen 4 Max — nieopublikowana
• Dane wejściowe z pamięci podręcznej — Claude Opus 5: 0,50 USD za 1 mln tokenów przy odczycie z pamięci podręcznej, w porównaniu z Qwen 4 Max, dla którego cena nie została opublikowana
• Kontekst — Claude Opus 5 1 mln tokenów przy ustawieniu domyślnym i maksymalnym, w porównaniu z Qwen 4 Max — nieopublikowane
• Limit wyjściowy — Claude Opus 5: 128K tokenów synchronicznie i 300K w Batches API z nagłówkiem beta, podczas gdy dla Qwen 4 Max nie został opublikowany
• Modalność — Claude Opus 5: wejście tekstowe, obrazowe i plikowe z wyjściem tekstowym, w zestawieniu z Qwen 4 Max — nieopublikowana
• Cennik dla długiego kontekstu — Claude Opus 5 nie ma dopłaty, więc żądanie o 900 000 tokenów jest rozliczane według tej samej stawki za token co żądanie o 9 000 tokenów, w przeciwieństwie do Qwen 4 Max, dla którego cennika nie opublikowano
• Niezależny wynik — Claude Opus 5 51 w Artificial Analysis Intelligence Index v4.3.2 przy maksymalnym wysiłku, w porównaniu do Qwen 4 Max, dla którego nie istnieje niezależna ocena
• Wyniki raportowane przez dostawców — Claude Opus 5 SWE-bench Verified 96,0%, SWE-bench Pro 79,2%, OSWorld 2.0 70,6%, Terminal-Bench 2.1 w okolicach 85% w zależności od środowiska testowego, podczas gdy dla Qwen 4 Max nie zgłoszono nic
• Kontrola rozumowania — adaptacyjne myślenie Claude Opus 5 domyślnie włączone, z pięciostopniową drabiną wysiłku, kontra Qwen 4 Max niepublikowany
Dziesięć wierszy „nie opublikowano” to nie zabieg retoryczny. To stan dowodów, a uczciwym wnioskiem z niego jest to, że nikt nie może jeszcze dokonać porównania możliwości tych dwóch modeli.
Część luki, która się nie zamknie
Ceny i kontekst zostaną w końcu opublikowane. Jedna różnica przetrwa premierę i warto zdecydować o tym teraz, a nie w tygodniu, w którym Qwen 4 Max trafi do sprzedaży: te dwa modele są stworzone, by kupować je na różne sposoby.
Claude Opus 5 to pojedynczy zamknięty model w jednej cenie od jednego dostawcy, z opublikowanym zobowiązaniem do wycofania nie wcześniej niż 24 lipca 2027 r. To stabilny cel dla planowania pojemności. Qwen 4 Max to flagowy model rodziny, którą Alibaba wielokrotnie wypuszczała w znacznie szerszym zakresie cenowym — generacja Qwen 3.8 obejmuje flagowy model frontier z wejściem po 2,00 USD oraz poziom Flash znacznie poniżej — a flagowy poziom linii Qwen historycznie miał najkrótszy okres użyteczności, zanim tańszy poziom niweluje różnicę.
Inna różnica to otwarte wagi — i wskazuje ona w przeciwnym kierunku. Generacja Qwen 3.8 opublikowała wagi swojego największego modelu na autorskiej licencji Qwen, co dopiero umożliwia dostrajanie, kwantyzację i samodzielny hosting. Claude Opus 5 nie ma wydanych wag i nie będzie ich mieć. Jeśli twoje obciążenie wymaga modelu, który możesz uruchomić we własnej infrastrukturze albo modyfikować, to jest strukturalna przewaga, której żadna aktualizacja benchmarków nie może odebrać Alibabie — i to najsilniejszy powód, by interesować się tym konkretnym porównaniem, zamiast traktować je jako starcie jednego flagowca z drugim.

Jak przeprowadzić to porównanie dzisiaj
Claude Opus 5 jest już dostępny, a OrcaRouter udostępnia go pod identyfikatorem anthropic/claude-opus-5 w cenie katalogowej Anthropic z 0% narzutu — stawka dostawcy jest przekazywana bez zmian, więc podane powyżej kwoty 5,00 USD i 25,00 USD to dokładnie to, co zostanie Ci zafakturowane, a nie ich odpowiednik z narzutem. Ma to większe znaczenie niż zwykle w przypadku modelu z tego przedziału cenowego: 10-procentowa marża platformy od stawki wyjściowej 25,00 USD to 2,50 USD za milion tokenów, czyli więcej niż całkowity koszt wejściowy większości alternatyw z otwartymi wagami. Obok niego katalog oferuje blisko 200 modeli w ramach jednego punktu końcowego zgodnego z OpenAI, z automatycznym przełączaniem awaryjnym, gdy ścieżka dostawcy pogorszy się, oraz DSL routingu do jawnego wyrażania polityki, zamiast wpisywania na sztywno nazwy modelu w aplikacji.
OrcaRouter nie ma w ofercie Qwen 4 Max ani żadnego poziomu Qwen 4. Katalog nie zawiera żadnych wpisów dla tej rodziny, czego można oczekiwać po modelu zapowiedzianym, ale niewydanym. Gdy te poziomy zostaną wydane, pojawią się w tym samym miejscu, a do tego czasu model Qwen wart porównania z Claude Opus 5 to ten, który faktycznie możesz wywołać: Qwen3.8-Max, ogólnie dostępny od 3 sierpnia 2026 r. w cenie 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych, z opublikowanymi wagami i odnotowanym niezależnym wynikiem inteligencji na poziomie 56 przy 1,14 USD za zadanie — wartość zapisaną w ramach wcześniejszej wersji indeksu, więc porównuj ją z wynikiem 51 Claude Opus 5 tylko z tym zastrzeżeniem.
Co zrobić z tym, zanim powstanie karta modelu
Nie ma tu żadnego werdyktu do wydania, ponieważ jeden z tych dwóch modeli nie istnieje jako produkt. Można natomiast powiedzieć, że porównanie zmieniło kształt 19 września 2026 r. bez żadnych działań ze strony któregokolwiek z dostawców: Claude Opus 5 nie jest już modelem z najwyższym wynikiem w niezależnym indeksie, na którym opiera się większość porównań, i plasuje się teraz dwa punkty za dwoma innymi modelami. Premiera Qwen 4 Max trafi do tej tabeli, a nie do tej z lipca.
Zatem decyzja na najbliższe kilka miesięcy nie brzmi: Qwen 4 Max kontra Claude Opus 5. Brzmi: Claude Opus 5 kontra model Qwen, który już został wydany — flagowiec za jedną piątą ceny tokenów wejściowych, z opublikowanymi wagami — a to porównanie jest dostępne teraz, z rzeczywistymi liczbami po obu stronach. Wróć do niego, gdy Alibaba opublikuje kartę modelu, a każdą tabelę wyników Qwen 4 Max, którą zobaczysz wcześniej, traktuj jako niezweryfikowaną.

Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
