Karta tytułowa hero dla „Qwen 4 Max vs Gemini 3.1 Pro” z podtytułem „Nieogłoszony flagowiec kontra wersja zapoznawcza, która nigdy się nie skończyła”, trzy plakietki kapsułkowe z napisami „Wersja zapoznawcza od 19 lutego 2026”, „Kontekst 1 048 576 tokenów” i „26,3% skuteczności wyszukiwania przy 1M”, wiersz stopki „Alibaba ogłosiła 22 września 2026 r.; Google udostępnił wersję zapoznawczą 19 lutego 2026 r.” oraz logo OrcaRouter w prawym dolnym rogu.
Engineering & Research

Qwen 4 Max vs Gemini 3.1 Pro: niezapowiedziany flagowiec kontra wersja zapoznawcza, która nigdy się nie skończyła

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

W większości porównań stawia się naprzeciw siebie produkt już wydany i produkt już wydany. To porównanie jest nietypowe: Qwen 4 Max zaprezentowano w wersji przedpremierowej na konferencji Yunqi w Hangzhou 22 września 2026 r., bez daty wydania, ceny ani wag, a Gemini 3.1 Pro jest w wersji przedpremierowej od 19 lutego 2026 r. i nadal w niej pozostaje — siedem miesięcy później — bez ogłoszonej daty ogólnej dostępności i bez daty wyłączenia w tabeli wycofywania. Żaden z modeli w tym zestawieniu nie jest produktem o ustalonym statusie. To nie jest powód, by pomijać to porównanie. Na tym właśnie ono polega i to jedyny jego aspekt, który naprawdę jest wartościowy poznawczo.

Siedem miesięcy podglądu

Etykieta wersji zapoznawczej powinna oznaczać krótkotrwały stan. Gemini 3.1 Pro utrzymuje ją już przez trzy wydania Flash od tego samego laboratorium, w tym Gemini 3.8 Flash z 2 września 2026 r., który Google opisuje jako swój najinteligentniejszy model Flash. W niezależnych zestawieniach zbiorczych model ten uzyskuje obecnie wyniki powyżej 3.1 Pro. Linia Pro Google nie ma nowszego członka: nie istnieje Gemini 3.8 Pro, a generacja 3.5 Pro została opóźniona i według doniesień odłożona na bok. Praktyczny skutek jest taki, że model noszący nazwę Pro nie jest już najlepiej punktującym modelem od swojego własnego dostawcy.

Tekst samego Google dotyczący ograniczeń w pozycji katalogowej zaleca planowanie wycofania wersji zapoznawczej, co jest uczciwym sposobem odczytania tego statusu. Wersja zapoznawcza bez daty GA i bez daty wyłączenia to model, na którym można budować, ale nie można go wpisać w harmonogram.

Strona Qwen jest lustrzanym odbiciem z odwróconym znakiem. Qwen 4 Max nie znajduje się w długim podglądzie; jest na etapie przed podglądem, bez niczego opublikowanego. Te dwa tryby awarii są przeciwne: Gemini 3.1 Pro to rzeczywisty punkt końcowy, którego długoterminowe istnienie nie zostało określone, a Qwen 4 Max to określona pozycja na roadmapie bez punktu końcowego.

A two-column scoreboard titled "Qwen 4 Max vs Gemini 3.1 Pro - the scoreboard". Left column Qwen 4 Max: Status announced, no date; Input price not published; Output price not published; Context window not published; Long-context retrieval not published; Independent score none exists. Right column Gemini 3.1 Pro: Status preview since Feb 19 2026; Input price $2.00 per 1M tokens; Output price $12.00 per 1M tokens; Context window 1,048,576 tokens; Long-context retrieval 26.3% at 1M tokens; Independent score 30 on index v4.3.2. Footer reads "Gemini 3.1 Pro pricing and vendor-reported retrieval from Google; index v4.3.2 published September 19 2026.", with the OrcaRouter logo bottom-right.

Porównanie i wskaźnik długiego kontekstu, który je rozstrzyga

Specyfikacja Gemini 3.1 Pro jest publiczna i konkretna. Specyfikacja Qwen 4 Max jest pusta. Warto zatrzymać się przy jednym wierszu kolumny Gemini, ponieważ jest to rodzaj liczby, który bywa cytowany, a nie powinien:

• Status — Gemini 3.1 Pro w wersji zapoznawczej od 19 lutego 2026 r., w porównaniu z Qwen 4 Max ogłoszonym 22 września 2026 r. bez podanej daty

• Cena wejściowa — Gemini 3.1 Pro: 2,00 USD za 1 mln tokenów przy prompcie do 200 tys. i 4,00 USD powyżej tej wartości, a w przypadku Qwen 4 Max cena nie została opublikowana

• Cena za tokeny wyjściowe — Gemini 3.1 Pro 12,00 USD za 1 mln do 200 tys. i 18,00 USD powyżej, w przeciwieństwie do Qwen 4 Max, dla którego cena nie została opublikowana

• Dane wejściowe z pamięci podręcznej — Gemini 3.1 Pro 0,20 USD za 1 mln przy odczycie z pamięci podręcznej, w porównaniu z Qwen 4 Max: nieopublikowane

• Kontekst — Gemini 3.1 Pro 1 048 576 tokenów, kontra Qwen 4 Max — nieopublikowany

• Limit wyjściowy — Gemini 3.1 Pro 65 536 tokenów, w porównaniu z Qwen 4 Max: nie podano

• Modalność — Gemini 3.1 Pro: wejście tekstowe, obrazowe, wideo, audio i PDF z wyjściem tekstowym, w porównaniu z Qwen 4 Max, który nie został opublikowany

• Kontrola rozumowania — Gemini 3.1 Pro: niski, średni i wysoki poziom myślenia, w przeciwieństwie do Qwen 4 Max – nieopublikowane

• Wyszukiwanie w długim kontekście — Gemini 3.1 Pro: według dostawcy MRCR v2 na poziomie 84,9 procent uśrednione dla ośmiu igieł przy 128K, ale 26,3 procent w ustawieniu punktowym przy milonie tokenów, w porównaniu z Qwen 4 Max, dla którego nic nie zgłoszono

• Wyniki zgłoszone przez dostawcę — Gemini 3.1 Pro SWE-bench Verified 80,6 procent, GPQA Diamond 94,3 procent, ARC-AGI-2 77,1 procent, Humanity's Last Exam 44,4 procent bez narzędzi, w porównaniu z Qwen 4 Max – nic nie zgłoszono

• Niezależny wynik — Gemini 3.1 Pro 30 w Artificial Analysis Intelligence Index v4.3.2, w porównaniu z Qwen 4 Max, dla którego nie istnieje niezależna ocena

Ten wiersz dotyczący długiego kontekstu jest tym, który warto zapamiętać. Okno kontekstowe o rozmiarze 1 048 576 tokenów to liczba marketingowa; 26,3 procent skuteczności odzyskiwania przy ustawieniu miliona tokenów to wynik, który ten sam dostawca podaje, gdy mierzy daleki koniec tego okna. Obie liczby pochodzą od Google, co sprawia, że ta różnica jest stwierdzeniem o modelu, a nie o ewaluatorze. Jeśli Twoje obciążenie zależy od znalezienia faktu ukrytego gdzieś pod koniec promptu o rozmiarze miliona tokenów, nagłówkowa wartość kontekstu nie mówi nic użytecznego, a ten wiersz mówi niemal wszystko.

Indeks się przesunął, model nie

Gemini 3.1 Pro zadebiutował 19 lutego 2026 r. z wynikiem 57 w Artificial Analysis Intelligence Index, zajmując pierwsze miejsce w branży. Według rewizji indeksu v4.3.2, opublikowanej 19 września 2026 r., wynosi 30. Nic w modelu nie zmieniło się między tymi dwiema datami. Linijkę przebudowano, a przebudowano ją cztery dni przed ogłoszeniem Qwen 4 przez firmę Alibaba.

Ten zbieg okoliczności jest wart więcej niż same liczby. Trzy z czterech modeli w tej partii porównań — Gemini 3.1 Pro, Claude Opus 5 i flagowy Qwen 3.8 — mają niezależne wyniki, które zmieniły się w ramach tej samej rewizji, a w każdym przypadku zmiana była wystarczająco duża, aby odwrócić ranking. Każde porównanie napisane w tym miesiącu, które podaje pojedynczą wartość indeksu bez wskazania rewizji, porównuje wyniki uzyskane za pomocą różnych linijek, a błąd nie będzie widoczny dla czytelnika.

W przypadku Qwen 4 Max konsekwencją jest to, że cel stale się przesuwa. Gdy Alibaba w końcu opublikuje, wynikiem do pobicia w tym indeksie będzie to, co w danym dniu będzie wskazywać aktualna wersja, a wersja zmieniła się co najmniej raz w ciągu ostatniego tygodnia.

A screenshot of the OrcaRouter page for Gemini 3.1 Pro in its cost-estimator view (English UI), showing a monthly token volume of 10M against a sample summarisation prompt, an estimated $50.00 per month falling to $43.70 with prompt caching at list price, a cost per request of $0.006040, a note that the estimate uses base-tier rates and that actual token counts depend on the provider's tokenizer, and a PERFORMANCE panel for the last 7 days reading p50 time-to-first-token 10.00 s, output speed 632 tok/s and an error rate of 77.5%, above a 7-day latency trend chart running 09-16 to 09-22.

Co mówią liczby operacyjne, w tym ta niewygodna

Gemini 3.1 Pro można kierować przez OrcaRouter jako google/gemini-3.1-pro-preview, z odznakami Flagship i Featured, bez banera o wersji przedpremierowej, w cenie katalogowej Google wynoszącej 2,00 i 12,00 USD za milion tokenów, z 0% marży. Sam routing jest uczciwy — stawka podana na stronie to stawka publikowana przez Google. Wskaźniki operacyjne z siedmiu dni do 22 września również warto podać, a nie pomijać: p50 czasu do pierwszego tokenu wynoszący 10,00 sekundy, prędkość generowania na poziomie około 632 tokenów na sekundę oraz wskaźnik błędów wynoszący 77,5 procent w całym oknie. Ten wskaźnik błędów to nie przypis. W przypadku modelu z kategorii preview, bez daty GA, jest to pojedyncza liczba na stronie najbardziej istotna dla decyzji, a porównanie, które podaje cenę bez niej, to sprzedawanie, a nie informowanie.

Ten sam katalog zawiera blisko 200 modeli na jednym punkcie końcowym zgodnym z OpenAI, z automatycznym przełączaniem awaryjnym i DSL do routingu, co jest mechanizmem, który sprawia, że taki współczynnik błędów da się przetrwać, a nie jest fatalny: zdegradowaną ścieżkę dostawcy można przełączyć awaryjnie, zamiast ją wyłączać. Rodzina Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash i Qwen3.8-27B — znajduje się na tym samym punkcie końcowym co Gemini 3.1 Pro Preview, więc podstawienie, o którym tak naprawdę jest ten artykuł, to, którego można dokonać już dziś, jest zmianą polityki routingu, a nie projektem migracyjnym. Qwen 4 Max nie ma w katalogu i żaden poziom Qwen 4 go nie ma; kiedy jakiś zostanie udostępniony, właśnie tam się pojawi.

Decyzja, taka jaka jest

Żaden z modeli, o których tu mowa, nie jest produktem, na którym można się oprzeć, a uczciwa rada jest taka, by traktować oba odpowiednio. Gemini 3.1 Pro można dziś wywoływać za opublikowaną cenę, ma opublikowane okno kontekstowe i publiczny ślad ewaluacji, w tym słabość w odzyskiwaniu informacji na dalekim krańcu tego okna; to także wersja zapoznawcza, której dostawca każe planować wycofanie, działająca z odsetkiem błędów, który byłby nie do przyjęcia w przypadku produkcyjnej zależności. Qwen 4 Max nie ma żadnego z tych problemów, bo nie ma żadnej z tych właściwości.

Jeśli potrzebujesz modelu teraz, wybór nie jest między tymi dwoma. Jest między Gemini 3.1 Pro a dostępnym flagowym Qwen, a na podstawie dostępnych dowodów to decyzja między jakością wyszukiwania w długim kontekście a stawką 2,00 USD za wejście z opublikowanymi wagami. Jeśli możesz poczekać, obserwuj dwie rzeczy, a nie jedną: kartę modelu Qwen 4 Max i datę ogólnej dostępności Gemini 3.1 Pro. To, co pojawi się pierwsze, powie ci, który z tych dwóch planów rozwojowych Alibaba i Google faktycznie priorytetyzują.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (English UI), showing the header reading "199 models, 15 providers, one API key, one bill", the sort and filter rail with Newest selected alongside controls for input modalities and context length, the "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions with a model and messages JSON body, and the first catalogue cards including openai/gpt-5-mini with a 200 Status badge.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie