Karta hero z tytułem 'Mercury 2.5 Preview vs Gemini 3.1 Pro' i podtytułem 'Dwie wersje preview w odstępie sześciu miesięcy'. Lewy panel oznaczony 'Mercury 2.5 Preview' przedstawia błyskawicę, pigułkę '256K context', tag 'text only' oraz pigułkę '$0.04 intro'; prawy panel oznaczony 'Gemini 3.1 Pro' przedstawia zestaw glifów multimodalnych (obraz, audio, wideo), pigułkę '1M context', plakietkę 'AA Index 57 at launch' oraz pigułkę '$2.00 / $12.00'. Cienka plakietka 'vs' znajduje się między nimi. Logo OrcaRouter jest umieszczone w prawym dolnym rogu.
Guides & Insights

Mercury 2.5 Preview a Gemini 3.1 Pro: Dwie wersje zapoznawcze, sześć miesięcy różnicy

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Oba modele w tym starciu mają w nazwie słowo „preview” i na tym podobieństwa się kończą. Mercury 2.5 Preview i Gemini 3.1 Pro to modele rozumowania, które można dziś wywoływać przez API, ale są to wersje zapoznawcze na przeciwnych końcach swojego życia. Gemini 3.1 Pro, flagowy model rozumowania, jest w wersji zapoznawczej od 19 lutego 2026 r. — za nim sześć miesięcy niezależnych ewaluacji, miejsc w publicznych rankingach i ruchu produkcyjnego, ze wskaźnikiem Artificial Analysis Intelligence Index wynoszącym 57 na starcie, multimodalnym wejściem obejmującym tekst, obraz, audio i wideo, kontekstem 1M tokenów oraz ceną $2.00 / $12.00 za milion tokenów. Mercury 2.5 Preview, dyfuzyjny LLM firmy Inception wydany 31 sierpnia 2026 r., ma dwa dni: to model tekstowy z kontekstem 256K, deklarowaną prędkością 1107 tokenów na sekundę, ceną katalogową $0.20 / $0.75 (około $0.04 / $0.15 z rabatem do 8 września) i ani jednym niezależnym benchmarkiem. Nazywanie ich obu „preview” maskuje właściwe pytanie, czyli ile warta jest sześciomiesięczna przewaga zgromadzonych dowodów wobec fundamentalnie szybszego sposobu generowania tekstu.

Czym tak naprawdę jest każdy model

Gemini 3.1 Pro to zamknięty, multimodalny, ogólnego przeznaczenia flagowy model rozumowania. Przetwarza tekst, obrazy, dźwięk i wideo, obsługuje okno kontekstowe o długości 1 miliona tokenów z limitem 64 tys. tokenów wyjściowych i dynamicznie dostosowuje głębokość rozumowania — producent opisuje czteropoziomową intensywność rozumowania, która skaluje się wraz ze złożonością zadania. Jego wyniki premierowe — ARC-AGI-2 na poziomie 77,1%, GPQA Diamond 94,3%, SWE-bench Verified 80,6%, Terminal-Bench 2.0 68,5% — są raportowane przez producenta, ale opierają się na sześciu miesiącach niezależnej weryfikacji, w tym na ponownym pomiarze przeprowadzonym przez Artificial Analysis na bardziej rygorystycznej skali indeksu, na której model osiąga około 46,5. Ten ponowny pomiar to dokładnie to, na co zasługuje dojrzały model: był testowany na tyle intensywnie, że indeks wokół niego stał się bardziej wymagający. Mercury 2.5 Preview to model dyfuzyjny — generuje i udoskonala tokeny równolegle, a nie jeden po drugim — z regulowanym rozumowaniem, równoległymi wywołaniami narzędzi i JSON-em zgodnym ze schematem, stworzony z myślą o obciążeniach kumulujących opóźnienia, które Inception wymienia: agentach wyszukiwania, potokach głosowych, podagentach kodowania. Wszelkie deklaracje jakościowe dotyczące tego modelu, w tym ponad 10-punktowy skok względem Mercury 2, pochodzą wyłącznie od producenta i nie zostały zweryfikowane przez żadną stronę trzecią.

A screenshot of the Artificial Analysis model page for Inception's Mercury 2, the diffusion model Mercury 2.5 Preview builds on, showing its independently measured output speed of 684 tokens per second, its $0.25 / $0.75 per-1M pricing, its 128K context window, and its Intelligence Index score of 22.

Kontrast specyfikacji

Cena — Mercury 2.5 Preview: $0.20 / $0.75 za 1M wejść/wyjść, ~$0.04 / $0.15 w cenie wprowadzającej do 8 września. Gemini 3.1 Pro: $2.00 / $12.00 za 1M, wzrastając do $4.00 / $18.00 powyżej 200K wejść.

Kontekst / wynik — Mercury 2.5 Preview: 256K kontekstu. Gemini 3.1 Pro: 1M kontekstu, 64K maksymalnego wyjścia.

Wejścia — Mercury 2.5 Preview: tylko tekst. Gemini 3.1 Pro: tekst, obraz, audio, wideo, plik.

Architektura — Mercury 2.5 Preview: dyfuzyjny LLM, równoległe generowanie tokenów. Gemini 3.1 Pro: autoregresyjny, dynamiczna głębia rozumowania.

Szybkość — Mercury 2.5 Preview: deklarowane 1 107 tokenów/sek. Gemini 3.1 Pro: brak porównywalnej deklaracji.

DowodyMercury 2.5 Preview: wyłącznie dane od producenta. Gemini 3.1 Pro: indeks AA 57 w momencie premiery (46,5 w nowszej skali) oraz długie niezależne wyniki ewaluacji.

A two-column scoreboard titled 'Mercury 2.5 Preview vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mercury 2.5 Preview': 'Price: $0.20 / $0.75 (intro $0.04 / $0.15)', 'Inputs: text only', 'Context: 256K', 'Speed: 1,107 tok/s (claimed)', 'Independent score: none yet', 'Preview since: Aug 31, 2026'. Right column 'Gemini 3.1 Pro': 'Price: $2.00 / $12.00', 'Inputs: text, image, audio, video', 'Context: 1M', 'Speed: autoregressive', 'Independent score: AA Index 57 at launch', 'Preview since: Feb 19, 2026'. A footer reads 'Gemini index per Artificial Analysis; Mercury figures vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.

Luka multimodalności jest decydującą różnicą.

W przypadku większości zastosowań to porównanie rozstrzyga się, zanim ceny czy benchmarki w ogóle wejdą do gry, ponieważ Mercury 2.5 Preview nie widzi. Gemini 3.1 Pro czyta zrzuty ekranu, diagramy, audio i wideo — to model, do którego kierujesz PDF, wykres, nagranie spotkania lub interfejs użytkownika, gdy chcesz uzyskać odpowiedź na temat czegoś, co nie jest jeszcze tekstem. Mercury 2.5 Preview jest z założenia modelem wyłącznie tekstowym; model językowy typu dyfuzyjnego, który generuje tekst równolegle, w ogóle nie ma ścieżki wejściowej dla obrazu ani dźwięku. W przypadku aplikacji opartej na dokumentach, agenta wizyjnego lub jakiegokolwiek produktu multimodalnego Gemini 3.1 Pro jest tu jedynym kandydatem, koniec kropka. Ograniczenie Mercury 2.5 Preview wyłącznie do tekstu nie jest drobnym druczkiem; to granica, która decyduje, do jakich zadań model w ogóle się kwalifikuje.

Sześć miesięcy testów kontra dwa dni

W świetle dowodów to nie jest rywalizacja i ważne jest, aby powiedzieć wprost, dlaczego. Gemini 3.1 Pro jest od sześciu miesięcy poddawany dogłębnej analizie przez niezależne laboratoria; jego wynik był przedstawiany, ponownie mierzony i poddawany dyskusji, co oznacza, że model jest „wiarygodny”. Mercury 2.5 Preview ma jedno źródło informacji — swojego twórcę — a to źródło twierdzi, że to skok inteligencji o ponad 10 punktów względem Mercury 2 oraz parytet z warstwą zoptymalizowaną pod kątem kosztów wśród modeli z czołówki. Oba stwierdzenia mogą być prawdziwe. Żadne z nich nie zostało potwierdzone przez nikogo spoza Inception, a model jest zbyt nowy, żeby to było cokolwiek innego niż oczekiwane. Asymetria nie polega na tym, że jeden jest lepszy; polega na tym, że jeden jest poznawalny, a drugi jeszcze nie.

Gdzie prędkość Merkurego faktycznie wygrywa

Uczciwy argument przemawiający za Mercury 2.5 Preview jest wąski, tekstowy i prawdziwy. Równoległe generowanie tokenów zmienia matematykę opóźnień w sposób, za którym nie nadąży żaden model autoregresyjny — w tym Gemini 3.1 Pro — ponieważ model autoregresyjny jest z natury szeregowy. W przypadku potoku głosowego ironia polega na tym, że wejście i wyjście są dźwiękiem, ale myślenie między nimi jest tekstem: szybka warstwa rozumowania tekstowego jest dokładnie tym, co sprawia, że agent głosowy sprawia wrażenie responsywnego. Dla agenta wyszukiwania wykonującego wielokrotne wywołania narzędzi oraz dla podagenta kodującego generującego wiele małych uzupełnień na zadanie, opóźnienie pojedynczego wywołania przekłada się na odczuwaną szybkość. W cenie wprowadzającej — 0,04 USD za wejście, 0,15 USD za wyjście — Mercury 2.5 Preview jest około 80 razy tańszy niż standardowa stawka wyjściowa Gemini 3.1 Pro, co czyni go nie tylko szybszym, ale też inną klasą kosztową dla wysokonakładowego rozumowania tekstowego. Haczyk, który musi towarzyszyć każdemu z tych zdań: szybkość jest deklarowana, parytet jakości jest deklarowany, a żaden niezależny pomiar nie istnieje.

Cennik: długokontekstowe premium Gemini kontra teaser Mercury

Karta cenowa Gemini 3.1 Pro ma szczegół, który warto poznać, zanim porównasz główne liczby: prośby przekraczające 200 tys. tokenów wejściowych przechodzą z 2,00 USD / 12,00 USD na 4,00 USD / 18,00 USD za milion. W modelu z kontekstem 1M ta dopłata za długi kontekst nie jest przypadkiem brzegowym — to cena faktycznego korzystania z okna, z którego model słynie. Mercury 2.5 Preview nie ma takiego progu, a jego kontekst 256K prawdopodobnie nie będzie często osiągał terytorium długiego kontekstu. Ale niska cena Mercury to wabik z terminem ważności 8 września, podczas gdy cena Gemini jest stabilną, opublikowaną stawką. Porównując, zestaw cenę katalogową Mercury wynoszącą 0,20 USD / 0,75 USD ze standardową warstwą Gemini, a nie z rabatem — rabat to zachęta do testowania, a nie cena, wokół której planujesz.

Decyzja routingu

Oba modele są dziś routowalne, a to zmienia sposób, w jaki należy traktować każdy z nich. Gemini 3.1 Pro jest w OrcaRouter jako google/gemini-3.1-pro-preview, po cenie listowej dostawcy przekazywanej dalej z 0% narzutem, więc standardowe i długokontekstowe warianty kosztują dokładnie tyle, ile publikuje dostawca, obok 200+ innych modeli na jednym kluczu API. Etykieta preview to dokładnie coś, co w routingu należy pomijać, a nie na to stawiać — panel wskaźnika błędów na stronie modelu jest tam nie bez powodu, a automatyczny failover oznacza, że zdegradowana odpowiedź preview jest kierowana do drugiego dostawcy bez zmiany kodu. Mercury 2.5 Preview nie jest jeszcze w OrcaRouter; Inception udostępnia go przez własne API i kilka platform zewnętrznych. Model mający dwa dni, którego nie można jeszcze objąć failoverem, jest kandydatem do testów, a nie zależnością produkcyjną. W dniu, w którym dostawca go opublikuje, obowiązuje ten sam sposób przenoszenia ceny, a rabat intro pojawi się tutaj tego samego dnia — to wtedy to zestawienie staje się regułą routingu, a nie decyzją.

Szczera ocena jest taka, że te dwie zapowiedzi odpowiadają na różne pytania. Gemini 3.1 Pro odpowiada na pytanie „na jakim modelu powinienem dziś oprzeć swój produkt” — jest multimodalny, ma długi kontekst, został niezależnie przetestowany i jest stabilny, w cenie, która to wszystko odzwierciedla. Mercury 2.5 Preview odpowiada na pytanie „jak szybkie może być fizycznie rozumowanie tekstowe” — a jego architektura szybkości jest najciekawszą rzeczą w tym modelu, czekającą na niezależne laboratorium, które potwierdzi, czy jakość, która z nią idzie, jest prawdziwa. Jeśli Twoje obciążenie jest multimodalne lub wymaga długiego kontekstu, wybór jest już dokonany. Jeśli jest wyłącznie tekstowe, wrażliwe na opóźnienia i cenę, Mercury 2.5 Preview to zakład, który warto obserwować — a 8 września to data, w której warto go sprawdzić.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview) showing the model header, the Home > Models > Google breadcrumb, the February 19, 2026 preview start date, and the description of Google's frontier reasoning model.
© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube