Karta tytułowa hero dla „Qwen 4 Max vs Claude Opus 5” z podtytułem „Benchmark, który przesunął się pod oboma z nich”, trzema plakietkami typu pill z napisami „Rewizja indeksu v4.3.2”, „51 vs 53” i „$5.00 i $25.00” oraz logo OrcaRouter w prawym dolnym rogu.
Engineering & Research

Qwen 4 Max vs Claude Opus 5: benchmark, który przesunął się pod oboma z nich

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Qwen 4 Max został zaprezentowany na konferencji Yunqi w Hangzhou 22 września 2026 r. — flagowy poziom linii Qwen 4 obejmującej cztery modele, która została ogłoszona, ale nie została jeszcze wydana, bez ceny, bez okna kontekstowego i bez opublikowanego wyniku. Claude Opus 5 jest ogólnodostępny od 24 lipca 2026 r. w cenie 5,00 USD za milion tokenów wejściowych i 25,00 USD za milion tokenów wyjściowych, a od czasu wydania Qwen3.8-Max to on był celem, w który wymierzony był każdy flagowy model. Oczywisty sposób napisania tego porównania to tabela specyfikacji z jedną pustą kolumną. Użyteczny sposób polega na zauważeniu, że 19 września 2026 r., trzy dni przed ogłoszeniem, Artificial Analysis ponownie przeliczyło swój Intelligence Index i Claude Opus 5 przestał być modelem na jego szczycie. Ta pojedyncza zmiana na nowo określa, co Qwen 4 Max musi pobić.

Co się zmieniło 19 września?

Artificial Analysis opublikował 19 września 2026 r. wersję v4.3.2 indeksu. W obecnej rewizji Claude Opus 5 osiąga 51 punktów w Intelligence Index przy maksymalnym wysiłku rozumowania — 50 przy xhigh, 48 przy high, 45 przy medium i 39 przy low — i plasuje się za Claude Fable 5.1 oraz GPT-6 Astra, oba z wynikiem 53. Koszt na zadanie w tym indeksie wynosi 5,86 USD.

Jeśli brzmi to jak obniżenie, to nim nie jest. Model się nie zmienił. Zmienił się indeks. Nasze własne relacje z lipca i sierpnia wskazywały Claude Opus 5 na 61–63 i na szczycie tabeli, a te liczby były poprawne w ramach ówczesnych poprawek. Każdy, kto nadal je cytuje bez daty poprawki, cytuje wycofaną liczbę, a to zdecydowanie najczęstszy błąd w porównaniach pisanych w tym miesiącu. Praktyczna konsekwencja jest taka, że twierdzenie w rodzaju „Claude Opus 5 to najlepiej punktowany dostępny model” nie jest już prawdziwe, a zbudowane na nim porównanie się rozpada.

W przypadku Qwen konsekwencja jest jeszcze bardziej dotkliwa. Flagowy poziom ogłoszony we wrześniu 2026 r. jest wymierzony w cel, który został na nowo zdefiniowany we wrześniu 2026 r. Cokolwiek Alibaba ostatecznie opublikuje dla Qwen 4 Max, będzie odczytywane na tle rankingu, w którym to 53 jest liczbą do pobicia, a nie 63.

A two-column scoreboard titled "Qwen 4 Max vs Claude Opus 5 - the scoreboard". Left column Qwen 4 Max: Status announced, no date; Input price not published; Output price not published; Context window not published; Independent score none exists; Open weights not published. Right column Claude Opus 5: Status generally available; Input price $5.00 per 1M tokens; Output price $25.00 per 1M tokens; Context window 1M tokens; Independent score 51 on index v4.3.2; Open weights none. Footer reads "Claude Opus 5 from Anthropic published pricing and Artificial Analysis index v4.3.2, September 19 2026.", with the OrcaRouter logo bottom-right.

Porównanie, szczerze przedstawione

Jedna strona tej tabeli jest kompletna, a druga pusta, a udawanie, że jest inaczej, byłoby zasadniczym błędem tego artykułu. Oto, co faktycznie wiadomo:

• Status — Claude Opus 5 ogólnie dostępny od 24 lipca 2026, podczas gdy Qwen 4 Max ogłoszono 22 września 2026 bez daty wydania

Cena wejściowa — Claude Opus 5 5,00 USD za 1 mln tokenów, natomiast Qwen 4 Max — nieopublikowana

• Cena za tokeny wyjściowe — Claude Opus 5: 25,00 USD za 1 mln tokenów, natomiast Qwen 4 Max — nieopublikowana

• Dane wejściowe z pamięci podręcznej — Claude Opus 5: 0,50 USD za 1 mln tokenów przy odczycie z pamięci podręcznej, w porównaniu z Qwen 4 Max, dla którego cena nie została opublikowana

• Kontekst — Claude Opus 5 1 mln tokenów przy ustawieniu domyślnym i maksymalnym, w porównaniu z Qwen 4 Max — nieopublikowane

• Limit wyjściowy — Claude Opus 5: 128K tokenów synchronicznie i 300K w Batches API z nagłówkiem beta, podczas gdy dla Qwen 4 Max nie został opublikowany

• Modalność — Claude Opus 5: wejście tekstowe, obrazowe i plikowe z wyjściem tekstowym, w zestawieniu z Qwen 4 Max — nieopublikowana

• Cennik dla długiego kontekstu — Claude Opus 5 nie ma dopłaty, więc żądanie o 900 000 tokenów jest rozliczane według tej samej stawki za token co żądanie o 9 000 tokenów, w przeciwieństwie do Qwen 4 Max, dla którego cennika nie opublikowano

• Niezależny wynik — Claude Opus 5 51 w Artificial Analysis Intelligence Index v4.3.2 przy maksymalnym wysiłku, w porównaniu do Qwen 4 Max, dla którego nie istnieje niezależna ocena

• Wyniki raportowane przez dostawców — Claude Opus 5 SWE-bench Verified 96,0%, SWE-bench Pro 79,2%, OSWorld 2.0 70,6%, Terminal-Bench 2.1 w okolicach 85% w zależności od środowiska testowego, podczas gdy dla Qwen 4 Max nie zgłoszono nic

• Kontrola rozumowania — adaptacyjne myślenie Claude Opus 5 domyślnie włączone, z pięciostopniową drabiną wysiłku, kontra Qwen 4 Max niepublikowany

Dziesięć wierszy „nie opublikowano” to nie zabieg retoryczny. To stan dowodów, a uczciwym wnioskiem z niego jest to, że nikt nie może jeszcze dokonać porównania możliwości tych dwóch modeli.

Część luki, która się nie zamknie

Ceny i kontekst zostaną w końcu opublikowane. Jedna różnica przetrwa premierę i warto zdecydować o tym teraz, a nie w tygodniu, w którym Qwen 4 Max trafi do sprzedaży: te dwa modele są stworzone, by kupować je na różne sposoby.

Claude Opus 5 to pojedynczy zamknięty model w jednej cenie od jednego dostawcy, z opublikowanym zobowiązaniem do wycofania nie wcześniej niż 24 lipca 2027 r. To stabilny cel dla planowania pojemności. Qwen 4 Max to flagowy model rodziny, którą Alibaba wielokrotnie wypuszczała w znacznie szerszym zakresie cenowym — generacja Qwen 3.8 obejmuje flagowy model frontier z wejściem po 2,00 USD oraz poziom Flash znacznie poniżej — a flagowy poziom linii Qwen historycznie miał najkrótszy okres użyteczności, zanim tańszy poziom niweluje różnicę.

Inna różnica to otwarte wagi — i wskazuje ona w przeciwnym kierunku. Generacja Qwen 3.8 opublikowała wagi swojego największego modelu na autorskiej licencji Qwen, co dopiero umożliwia dostrajanie, kwantyzację i samodzielny hosting. Claude Opus 5 nie ma wydanych wag i nie będzie ich mieć. Jeśli twoje obciążenie wymaga modelu, który możesz uruchomić we własnej infrastrukturze albo modyfikować, to jest strukturalna przewaga, której żadna aktualizacja benchmarków nie może odebrać Alibabie — i to najsilniejszy powód, by interesować się tym konkretnym porównaniem, zamiast traktować je jako starcie jednego flagowca z drugim.

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, English UI), showing the 1M token context badge, the model ID anthropic/claude-opus-5, a 128K maximum output, text plus image plus file input with text output, the Vision, Tools, JSON and Reasoning tags, the listing date 2026-07-24 credited to Anthropic, a p50 time-to-first-token of 5.75s, the OpenAI-compatible code sample, the Public benchmarks block, and the opening of the model description calling Claude Opus 5 Anthropic flagship for demanding reasoning, coding and long-horizon agentic work.

Jak przeprowadzić to porównanie dzisiaj

Claude Opus 5 jest już dostępny, a OrcaRouter udostępnia go pod identyfikatorem anthropic/claude-opus-5 w cenie katalogowej Anthropic z 0% narzutu — stawka dostawcy jest przekazywana bez zmian, więc podane powyżej kwoty 5,00 USD i 25,00 USD to dokładnie to, co zostanie Ci zafakturowane, a nie ich odpowiednik z narzutem. Ma to większe znaczenie niż zwykle w przypadku modelu z tego przedziału cenowego: 10-procentowa marża platformy od stawki wyjściowej 25,00 USD to 2,50 USD za milion tokenów, czyli więcej niż całkowity koszt wejściowy większości alternatyw z otwartymi wagami. Obok niego katalog oferuje blisko 200 modeli w ramach jednego punktu końcowego zgodnego z OpenAI, z automatycznym przełączaniem awaryjnym, gdy ścieżka dostawcy pogorszy się, oraz DSL routingu do jawnego wyrażania polityki, zamiast wpisywania na sztywno nazwy modelu w aplikacji.

OrcaRouter nie ma w ofercie Qwen 4 Max ani żadnego poziomu Qwen 4. Katalog nie zawiera żadnych wpisów dla tej rodziny, czego można oczekiwać po modelu zapowiedzianym, ale niewydanym. Gdy te poziomy zostaną wydane, pojawią się w tym samym miejscu, a do tego czasu model Qwen wart porównania z Claude Opus 5 to ten, który faktycznie możesz wywołać: Qwen3.8-Max, ogólnie dostępny od 3 sierpnia 2026 r. w cenie 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych, z opublikowanymi wagami i odnotowanym niezależnym wynikiem inteligencji na poziomie 56 przy 1,14 USD za zadanie — wartość zapisaną w ramach wcześniejszej wersji indeksu, więc porównuj ją z wynikiem 51 Claude Opus 5 tylko z tym zastrzeżeniem.

Co zrobić z tym, zanim powstanie karta modelu

Nie ma tu żadnego werdyktu do wydania, ponieważ jeden z tych dwóch modeli nie istnieje jako produkt. Można natomiast powiedzieć, że porównanie zmieniło kształt 19 września 2026 r. bez żadnych działań ze strony któregokolwiek z dostawców: Claude Opus 5 nie jest już modelem z najwyższym wynikiem w niezależnym indeksie, na którym opiera się większość porównań, i plasuje się teraz dwa punkty za dwoma innymi modelami. Premiera Qwen 4 Max trafi do tej tabeli, a nie do tej z lipca.

Zatem decyzja na najbliższe kilka miesięcy nie brzmi: Qwen 4 Max kontra Claude Opus 5. Brzmi: Claude Opus 5 kontra model Qwen, który już został wydany — flagowiec za jedną piątą ceny tokenów wejściowych, z opublikowanymi wagami — a to porównanie jest dostępne teraz, z rzeczywistymi liczbami po obu stronach. Wróć do niego, gdy Alibaba opublikuje kartę modelu, a każdą tabelę wyników Qwen 4 Max, którą zobaczysz wcześniej, traktuj jako niezweryfikowaną.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the 1M token context badge, the model ID qwen/qwen3.8-max, text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, the OpenAI-compatible Python code sample, and the model description naming Qwen3.8-Max Alibaba newest flagship and highest-capability tier to date.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie