
Mercury 2.5 Preview a Gemini 3.1 Pro: Dwie wersje zapoznawcze, sześć miesięcy różnicy
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0259Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0258Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0166Inteligencja82Kod
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
Oba modele w tym starciu mają w nazwie słowo „preview” i na tym podobieństwa się kończą. Mercury 2.5 Preview i Gemini 3.1 Pro to modele rozumowania, które można dziś wywoływać przez API, ale są to wersje zapoznawcze na przeciwnych końcach swojego życia. Gemini 3.1 Pro, flagowy model rozumowania, jest w wersji zapoznawczej od 19 lutego 2026 r. — za nim sześć miesięcy niezależnych ewaluacji, miejsc w publicznych rankingach i ruchu produkcyjnego, ze wskaźnikiem Artificial Analysis Intelligence Index wynoszącym 57 na starcie, multimodalnym wejściem obejmującym tekst, obraz, audio i wideo, kontekstem 1M tokenów oraz ceną $2.00 / $12.00 za milion tokenów. Mercury 2.5 Preview, dyfuzyjny LLM firmy Inception wydany 31 sierpnia 2026 r., ma dwa dni: to model tekstowy z kontekstem 256K, deklarowaną prędkością 1107 tokenów na sekundę, ceną katalogową $0.20 / $0.75 (około $0.04 / $0.15 z rabatem do 8 września) i ani jednym niezależnym benchmarkiem. Nazywanie ich obu „preview” maskuje właściwe pytanie, czyli ile warta jest sześciomiesięczna przewaga zgromadzonych dowodów wobec fundamentalnie szybszego sposobu generowania tekstu.
Czym tak naprawdę jest każdy model
Gemini 3.1 Pro to zamknięty, multimodalny, ogólnego przeznaczenia flagowy model rozumowania. Przetwarza tekst, obrazy, dźwięk i wideo, obsługuje okno kontekstowe o długości 1 miliona tokenów z limitem 64 tys. tokenów wyjściowych i dynamicznie dostosowuje głębokość rozumowania — producent opisuje czteropoziomową intensywność rozumowania, która skaluje się wraz ze złożonością zadania. Jego wyniki premierowe — ARC-AGI-2 na poziomie 77,1%, GPQA Diamond 94,3%, SWE-bench Verified 80,6%, Terminal-Bench 2.0 68,5% — są raportowane przez producenta, ale opierają się na sześciu miesiącach niezależnej weryfikacji, w tym na ponownym pomiarze przeprowadzonym przez Artificial Analysis na bardziej rygorystycznej skali indeksu, na której model osiąga około 46,5. Ten ponowny pomiar to dokładnie to, na co zasługuje dojrzały model: był testowany na tyle intensywnie, że indeks wokół niego stał się bardziej wymagający. Mercury 2.5 Preview to model dyfuzyjny — generuje i udoskonala tokeny równolegle, a nie jeden po drugim — z regulowanym rozumowaniem, równoległymi wywołaniami narzędzi i JSON-em zgodnym ze schematem, stworzony z myślą o obciążeniach kumulujących opóźnienia, które Inception wymienia: agentach wyszukiwania, potokach głosowych, podagentach kodowania. Wszelkie deklaracje jakościowe dotyczące tego modelu, w tym ponad 10-punktowy skok względem Mercury 2, pochodzą wyłącznie od producenta i nie zostały zweryfikowane przez żadną stronę trzecią.

Kontrast specyfikacji
• Cena — Mercury 2.5 Preview: $0.20 / $0.75 za 1M wejść/wyjść, ~$0.04 / $0.15 w cenie wprowadzającej do 8 września. Gemini 3.1 Pro: $2.00 / $12.00 za 1M, wzrastając do $4.00 / $18.00 powyżej 200K wejść.
• Kontekst / wynik — Mercury 2.5 Preview: 256K kontekstu. Gemini 3.1 Pro: 1M kontekstu, 64K maksymalnego wyjścia.
• Wejścia — Mercury 2.5 Preview: tylko tekst. Gemini 3.1 Pro: tekst, obraz, audio, wideo, plik.
• Architektura — Mercury 2.5 Preview: dyfuzyjny LLM, równoległe generowanie tokenów. Gemini 3.1 Pro: autoregresyjny, dynamiczna głębia rozumowania.
• Szybkość — Mercury 2.5 Preview: deklarowane 1 107 tokenów/sek. Gemini 3.1 Pro: brak porównywalnej deklaracji.
• DowodyMercury 2.5 Preview: wyłącznie dane od producenta. Gemini 3.1 Pro: indeks AA 57 w momencie premiery (46,5 w nowszej skali) oraz długie niezależne wyniki ewaluacji.

Luka multimodalności jest decydującą różnicą.
W przypadku większości zastosowań to porównanie rozstrzyga się, zanim ceny czy benchmarki w ogóle wejdą do gry, ponieważ Mercury 2.5 Preview nie widzi. Gemini 3.1 Pro czyta zrzuty ekranu, diagramy, audio i wideo — to model, do którego kierujesz PDF, wykres, nagranie spotkania lub interfejs użytkownika, gdy chcesz uzyskać odpowiedź na temat czegoś, co nie jest jeszcze tekstem. Mercury 2.5 Preview jest z założenia modelem wyłącznie tekstowym; model językowy typu dyfuzyjnego, który generuje tekst równolegle, w ogóle nie ma ścieżki wejściowej dla obrazu ani dźwięku. W przypadku aplikacji opartej na dokumentach, agenta wizyjnego lub jakiegokolwiek produktu multimodalnego Gemini 3.1 Pro jest tu jedynym kandydatem, koniec kropka. Ograniczenie Mercury 2.5 Preview wyłącznie do tekstu nie jest drobnym druczkiem; to granica, która decyduje, do jakich zadań model w ogóle się kwalifikuje.
Sześć miesięcy testów kontra dwa dni
W świetle dowodów to nie jest rywalizacja i ważne jest, aby powiedzieć wprost, dlaczego. Gemini 3.1 Pro jest od sześciu miesięcy poddawany dogłębnej analizie przez niezależne laboratoria; jego wynik był przedstawiany, ponownie mierzony i poddawany dyskusji, co oznacza, że model jest „wiarygodny”. Mercury 2.5 Preview ma jedno źródło informacji — swojego twórcę — a to źródło twierdzi, że to skok inteligencji o ponad 10 punktów względem Mercury 2 oraz parytet z warstwą zoptymalizowaną pod kątem kosztów wśród modeli z czołówki. Oba stwierdzenia mogą być prawdziwe. Żadne z nich nie zostało potwierdzone przez nikogo spoza Inception, a model jest zbyt nowy, żeby to było cokolwiek innego niż oczekiwane. Asymetria nie polega na tym, że jeden jest lepszy; polega na tym, że jeden jest poznawalny, a drugi jeszcze nie.
Gdzie prędkość Merkurego faktycznie wygrywa
Uczciwy argument przemawiający za Mercury 2.5 Preview jest wąski, tekstowy i prawdziwy. Równoległe generowanie tokenów zmienia matematykę opóźnień w sposób, za którym nie nadąży żaden model autoregresyjny — w tym Gemini 3.1 Pro — ponieważ model autoregresyjny jest z natury szeregowy. W przypadku potoku głosowego ironia polega na tym, że wejście i wyjście są dźwiękiem, ale myślenie między nimi jest tekstem: szybka warstwa rozumowania tekstowego jest dokładnie tym, co sprawia, że agent głosowy sprawia wrażenie responsywnego. Dla agenta wyszukiwania wykonującego wielokrotne wywołania narzędzi oraz dla podagenta kodującego generującego wiele małych uzupełnień na zadanie, opóźnienie pojedynczego wywołania przekłada się na odczuwaną szybkość. W cenie wprowadzającej — 0,04 USD za wejście, 0,15 USD za wyjście — Mercury 2.5 Preview jest około 80 razy tańszy niż standardowa stawka wyjściowa Gemini 3.1 Pro, co czyni go nie tylko szybszym, ale też inną klasą kosztową dla wysokonakładowego rozumowania tekstowego. Haczyk, który musi towarzyszyć każdemu z tych zdań: szybkość jest deklarowana, parytet jakości jest deklarowany, a żaden niezależny pomiar nie istnieje.
Cennik: długokontekstowe premium Gemini kontra teaser Mercury
Karta cenowa Gemini 3.1 Pro ma szczegół, który warto poznać, zanim porównasz główne liczby: prośby przekraczające 200 tys. tokenów wejściowych przechodzą z 2,00 USD / 12,00 USD na 4,00 USD / 18,00 USD za milion. W modelu z kontekstem 1M ta dopłata za długi kontekst nie jest przypadkiem brzegowym — to cena faktycznego korzystania z okna, z którego model słynie. Mercury 2.5 Preview nie ma takiego progu, a jego kontekst 256K prawdopodobnie nie będzie często osiągał terytorium długiego kontekstu. Ale niska cena Mercury to wabik z terminem ważności 8 września, podczas gdy cena Gemini jest stabilną, opublikowaną stawką. Porównując, zestaw cenę katalogową Mercury wynoszącą 0,20 USD / 0,75 USD ze standardową warstwą Gemini, a nie z rabatem — rabat to zachęta do testowania, a nie cena, wokół której planujesz.
Decyzja routingu
Oba modele są dziś routowalne, a to zmienia sposób, w jaki należy traktować każdy z nich. Gemini 3.1 Pro jest w OrcaRouter jako google/gemini-3.1-pro-preview, po cenie listowej dostawcy przekazywanej dalej z 0% narzutem, więc standardowe i długokontekstowe warianty kosztują dokładnie tyle, ile publikuje dostawca, obok 200+ innych modeli na jednym kluczu API. Etykieta preview to dokładnie coś, co w routingu należy pomijać, a nie na to stawiać — panel wskaźnika błędów na stronie modelu jest tam nie bez powodu, a automatyczny failover oznacza, że zdegradowana odpowiedź preview jest kierowana do drugiego dostawcy bez zmiany kodu. Mercury 2.5 Preview nie jest jeszcze w OrcaRouter; Inception udostępnia go przez własne API i kilka platform zewnętrznych. Model mający dwa dni, którego nie można jeszcze objąć failoverem, jest kandydatem do testów, a nie zależnością produkcyjną. W dniu, w którym dostawca go opublikuje, obowiązuje ten sam sposób przenoszenia ceny, a rabat intro pojawi się tutaj tego samego dnia — to wtedy to zestawienie staje się regułą routingu, a nie decyzją.
Szczera ocena jest taka, że te dwie zapowiedzi odpowiadają na różne pytania. Gemini 3.1 Pro odpowiada na pytanie „na jakim modelu powinienem dziś oprzeć swój produkt” — jest multimodalny, ma długi kontekst, został niezależnie przetestowany i jest stabilny, w cenie, która to wszystko odzwierciedla. Mercury 2.5 Preview odpowiada na pytanie „jak szybkie może być fizycznie rozumowanie tekstowe” — a jego architektura szybkości jest najciekawszą rzeczą w tym modelu, czekającą na niezależne laboratorium, które potwierdzi, czy jakość, która z nią idzie, jest prawdziwa. Jeśli Twoje obciążenie jest multimodalne lub wymaga długiego kontekstu, wybór jest już dokonany. Jeśli jest wyłącznie tekstowe, wrażliwe na opóźnienia i cenę, Mercury 2.5 Preview to zakład, który warto obserwować — a 8 września to data, w której warto go sprawdzić.

