
Mercury 2.5 kontra Mercury 2.5 Preview: Jeden model dyfuzyjny, dwie daty premiery
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Oto pojedynek, w którym obaj rywale dzielą tę samą kartę modelu. Mercury 2.5 Preview od Inception, wydany 31 sierpnia 2026 roku, oraz Mercury 2.5, wydany 8 września 2026 roku, to ten sam dyfuzyjny model językowy w odstępie ośmiu dni: kanał podglądu, który Inception otworzył dla deweloperów, oraz „gotowa dla przedsiębiorstw” wersja produkcyjna, którą uruchomił tydzień później. Inception nie ujawnił innego checkpointu, innej prędkości ani innej ceny dla Mercury 2.5 — a liczby, które rzeczywiście się zmieniły między tymi dwoma ogłoszeniami, wyglądają na porządki, a nie na nowy model. Wartość kontekstu została poprawiona z 256K na stronie podglądu na 260K przy premierze, a przyrost inteligencji względem Mercury 2 został przeformułowany z „ponad 10 punktów” (materiały podglądowe) na „40 procent” (materiały premierowe). Silnik, deklaracja 1107 tokenów na sekundę i cennik są identyczne. Więc to nie jest zwykła walka na specyfikacje, a sztuczne dopisanie jednej byłoby nieuczciwe. Porównanie, które ma znaczenie między tymi dwiema nazwami, dotyczy pakowania i czasu: co faktycznie zmieniła premiera produkcyjna, co naprawdę mówiła ci etykieta Preview i której nazwy powinny teraz używać twoje wywołania API.
Dlaczego model jest porównywany z samym sobą
Dostawcy zwykle prezentują model jako wersję zapoznawczą, a następnie po cichu włączają go do głównej nazwy; wpis zapowiedzi znika i nikt nie opisuje tego porównania. Inception natomiast przez tydzień prowadziło obie nazwy obok siebie, a tożsamość wersji zapoznawczej jest wycofywana dopiero teraz — właśnie dlatego to porównanie ma treść. Preview było szybką ścieżką, dzięki której Inception przedstawiło programistom swój zakład na dyfuzję. Pojawiło się 31 sierpnia z kartą specyfikacji, która obecnie jest specyfikacją Mercury 2.5: dyfuzyjny LLM (dLLM), który generuje i udoskonala bloki tokenów równolegle, zamiast emitować jeden token na raz; deklarowane 1107 tokenów na sekundę na standardowych GPU; deklarowany czas do pierwszego tokena poniżej 300 ms; okno kontekstu 260 tys. tokenów z wyjściem 65 536 tokenów; regulowane poziomy rozumowania; natywne korzystanie z narzędzi, równoległe wywołania narzędzi i strukturalne dane wyjściowe. Każda z tych wartości pochodzi od samego Inception i żadne niezależne laboratorium nie zmierzyło modelu, gdy Preview zostało udostępnione.
8 września Inception wypuściło Mercury 2.5 jako „kolejny poziom inteligencji dla dyfuzyjnych LLM-ów” i swój najszybszy model rozumowania w produkcji — gotowy dla przedsiębiorstw, przeznaczony dla agentów głosowych, podagentów kodowania, wyszukiwania korporacyjnego i obciążeń wsparcia. Te same specyfikacje, ta sama pozycja rynkowa, ten sam cennik. Podczas premiery zapowiedziano też dwa modele z tej samej rodziny, które pokazują, dokąd zmierza Inception: Mercury Voice, dLLM dostrojony do pierwszego tokena poniżej 170 ms dla agentów głosowych, oraz Mercury Router, który kieruje prompty do odpowiednich modeli według jakości, szybkości i kosztu. Mercury 2.5 to flagowiec rodziny stworzonej pod obciążenia wrażliwe na opóźnienia i agentowe, a nie pod klasę najwyższej jakości.
Co tak naprawdę zmieniła premiera 8 września
Porównaj te dwie nazwy wiersz po wierszu, a różnica nie leży w silniku — tkwi we wszystkim, co go otacza:
• Status — Mercury 2.5 Preview: zamknięta wersja zapoznawcza, która może „zmienić działanie lub dostępność". Mercury 2.5: model produkcyjny uruchomiony z deklaracją gotowości dla przedsiębiorstw, kanałem sprzedaży i datowaną listą produkcyjną.
• Tożsamość — Na stronie modeli Inception są teraz wymienione Mercury 2.5, Mercury Voice i Mercury Router, bez żadnego śladu Preview, a w przypisie dotyczącym wsparcia wymieniono Mercury 1, Mercury 2 i Mercury Edit 2 jako modele, które „pozostają wspierane dla obecnych klientów”. Preview nie pojawia się w żadnej z tych list. Według producenta etykieta preview została wchłonięta przez Mercury 2.5.
• Endpoint — Platforma deweloperska Inception udostępnia model jako mercury-2.5, a lista produkcyjna opublikowana 8 września obsługuje nowy ruch. W katalogu, który pod koniec sierpnia jako pierwszy zawierał wersję Preview, nazwa Preview nie rozwiązuje się teraz do żadnego aktywnego punktu końcowego, podczas gdy pozycja Mercury 2.5 dodana 8 września odpowiada. Każdy, kto kodował względem nazwy Preview, powinien przełączyć się na Mercury 2.5 i sprawdzić, za co faktycznie obciąża go dostawca — identyfikator zintegrowany w pierwszym tygodniu to ten, który jest wycofywany.
• Cena — identyczna lista i identyczny rabat. Obie oferty to 0,20 USD za milion wejść i 0,75 USD za milion wyjść, z wejściem cache po 0,02 USD, a obie zadebiutowały z rabatem około 80%: 0,04 / 0,15 USD, cache 0,004 USD. Rabat w wersji Preview był wyraźnie ograniczony czasowo do 8 września; Mercury 2.5 wystartował z tym samym 80% rabatem, a obniżona stawka to wciąż ta, którą w momencie pisania tego tekstu pokazuje produkcyjna lista. To jest pułapka, wyjaśniona poniżej.
• Onboarding — podczas premiery produkcyjnej dodano darmowy przydział tokenów dla nowych kont deweloperskich — materiały premiowe podają 100 milionów tokenów — oraz otwarto ścieżkę kontaktową dla przedsiębiorstw, której nie miała wersja zapoznawcza.
• Dowody — bez zmian. Żadna z nazw nie ma niezależnego benchmarku, a twierdzenia producenta to te same twierdzenia w nieco innym brzmieniu: skok inteligencji o „więcej niż 10 punktów” względem Mercury 2 w materiałach zapowiadających staje się wzrostem „o 40 procent” w materiałach premierowych, wraz z tym samym deklarowanym parytetem z warstwą frontier zoptymalizowaną pod kątem kosztów (GPT-5.6 Luna w trybie niskiego wysiłku, Gemini 3.5 Flash-Lite, Claude Haiku 4.5) oraz tym samym raportowanym przez producenta wynikiem 79% na GPQA Diamond i 77% na IFBench. Powtórzone twierdzenie nie jest twierdzeniem zweryfikowanym.

Pułapka cenowa u podstaw parowania
Ponieważ obie nazwy mają tę samą cenę katalogową i ten sam teaser 80%, łatwo założyć, że zawsze kosztują tyle samo. Wcale nie muszą. Rabat na Preview miał twardy termin 8 września; rabat startowy Mercury 2.5 działa według nowego zegara. Przez tydzień całkiem możliwe było płacenie 0,20 USD / 0,75 USD za połączenie do Preview, podczas gdy ten sam silnik odpowiadał po 0,04 USD / 0,15 USD pod swoją produkcyjną nazwą — albo, co bardziej prawdopodobne, korzystanie z identyfikatora preview, który po cichu przestał działać, a rachunek nadal przychodził. Rabat startowy wygasający dla danego endpointu to dokładnie ten drobny druk, który zmienia historię „ten sam model, ta sama cena" w realną różnicę w kosztach.
Trwała liczba to cena katalogowa, a trwała rada brzmi: budżetuj wokół niej: $0.20 / $0.75 za milion, wejście z pamięci podręcznej $0.02 — tanio jak na model rozumujący z kontekstem 260K, spokojnie poniżej poziomu flagowca, ale nie te $0.04 / $0.15, które obiecują banery premierowe. Traktuj obniżoną stawkę jak cenę testową z ograniczoną żywotnością, sprawdź, co Twój dostawca nalicza za dokładny identyfikator modelu w Twoim kodzie, a nie za nazwę na stronie marketingowej, a jeśli dołączyłeś do Preview, przejdź na Mercury 2.5, zanim wygaśnięcie lub wycofany endpoint zdecyduje za Ciebie.
To także klasa problemów, które ma usuwać warstwa routingu. Router modeli, który przekazuje ceny listowe dostawców z 0% narzutem, pokazuje cenę faktycznie naliczaną przez dostawcę, aktualizowaną tego samego dnia, w którym rabat promocyjny wchodzi w życie lub wygasa, a automatyczne przełączanie awaryjne utrzymuje ciągłość połączeń, gdy punkt końcowy zostanie wycofany spod Ciebie. Mercury 2.5 nie jest na OrcaRouter w chwili pisania tego tekstu — Inception udostępnia go przez własne API i kilka platform zewnętrznych — więc na razie strona modeli dostawcy jest źródłem prawdy co do stawki. Gdy dostawca go tam dopisze, te mechanizmy przekazywania są dostępne na jednym kluczu, a obniżka ceny lub wygaśnięcie rabatu pojawia się po naszej stronie tego samego dnia, w którym ogłoszono taką zmianę.
Problem dowodowy wspólny dla obu nazw.
Uczciwa ocena tego zestawienia jest krótka, ponieważ obie kolumny to ten sam model z tym samym brakiem dowodów. Ani Mercury 2.5, ani Mercury 2.5 Preview nie ma niezależnego wyniku indeksowego, powtórzonego uruchomienia ani miejsca na arenie na dzień 9 września 2026 r. Własne twierdzenia Inception — skok inteligencji względem Mercury 2, parytet z poziomem Haiku 4.5, wynik 79% GPQA Diamond, 1107 tokenów na sekundę — to słowa firmy i są identyczne dla obu nazw, ponieważ model jest identyczny.
Jedyny niezależny dowód w tej rodzinie modeli wskazuje, jak należy czytać deklarację dotyczącą szybkości. {{1}}Artificial Analysis zmierzyło Mercury 2, poprzednika, na 684 tokeny na sekundę na produkcyjnym endpoincie, przyznając mu 22 punkty w Intelligence Index — to naprawdę szybko i dowód, że podejście dyfuzyjne nie jest mirażem, ale wciąż daleko do mniej więcej 1000 tokenów na sekundę deklarowanych przez Inception dla tego modelu na sprzęcie Blackwell.{{/1}} Należy spodziewać się podobnej różnicy między wynikiem 1107 dla Mercury 2.5 a tym, co współdzielony, wielodostępny endpoint faktycznie oferuje pod rzeczywistym obciążeniem. {{2}}Ta sama ostrożność dotyczy jakości: zupełnie nowego modelu dyfuzyjnego, ocenianego wyłącznie przez jego twórcę, nie należy brać za słowo w kwestii dorównania Claude Haiku 4.5, dopóki nie przetestuje go strona trzecia.{{/2}}

Trackery, które zaczęły zajmować się tą premierą, dokładnie odzwierciedlają ten stan rzeczy. Wpis BenchLM dla Mercury 2.5, opublikowany 8 września, nie przyznaje modelowi żadnego publicznego wyniku ani publicznego miejsca w rankingu; zawiera wyniki Inception — 79% w GPQA Diamond i 77% w IFBench — wyraźnie oznaczone jako podane przez dostawcę, i odnotowuje, że niezależny pomiar szybkości działania nie został przeprowadzony. Pierwszy wpis w indeksie Artificial Analysis, obecność na LMArena czy odtworzony test GPQA zamienią Mercury 2.5 z twierdzenia w porównywalny obiekt — i będzie to dotyczyć obu nazw jednocześnie, ponieważ istnieje tylko jeden model do zmierzenia.

Jakie imię powinieneś zawołać
• Nowa integracja, bez legacy: wywołaj Mercury 2.5 i zignoruj Preview. Nazwa produkcyjna ma ten sam silnik, na razie tę samą zniżkę, warunki korporacyjne oraz gwarancję, że to jest id, które dostawca faktycznie udostępnia. Preview dodaje ryzyko niestabilności i nic więcej.
• Już zintegrowałeś Preview: sprawdź dzisiaj, co Twój dostawca serwuje pod tą nazwą i za co pobiera opłatę. Przełącz swojego klienta na identyfikator Mercury 2.5 i potwierdź stawkę. Trzymanie nazwy Preview w kodzie produkcyjnym to teraz zakład, że kanał podglądu z wyraźnie ograniczonym czasem życia przetrwa własne wycofanie.
• Ruch o krytycznym znaczeniu dla przedsiębiorstwa lub produkcji:Mercury 2.5 jest dostępny za pośrednictwem ścieżki enterprise Inception, a nie jako etykieta preview, za którą nie stoi żadne zobowiązanie. Potrzeby głosowe i routingowe wskazują odpowiednio na Mercury Voice i Mercury Router, które same wciąż są w wersjach preview.
• Każdy, kto ocenia poziom dyfuzyjny: obie nazwy odnoszą się do tego samego celu ewaluacji, więc przeprowadź swoją ewaluację raz na Mercury 2.5 i traktuj wynik jako odnoszący się do całej linii modeli. Załóż w budżecie cenę katalogową i traktuj twierdzenia dostawcy jako hipotezy, dopóki nie pojawi się niezależna ocena.
Co obejrzeć
Trzy rzeczy rozstrzygną tę parę w ciągu najbliższych kilku tygodni. Po pierwsze, pierwszy niezależny benchmark — pozycja w indeksie lub powtórzony przebieg GPQA czy AIME — który przetestuje twierdzenie o parytecie stanowiące cały komercyjny zakład. Po drugie, czy tożsamość Preview zniknie z ekosystemu modeli całkowicie, jak już sugeruje własna strona modeli Inception. Po trzecie, co stanie się z 80% rabatem premierowym, skoro minął już termin 8 września, do którego przypięto Preview: przedłużenie czyni Mercury 2.5 strukturalnie tanim, podczas gdy powrót do $0.20 / $0.75 czyni go jedynie konkurencyjnym. Do tego czasu poprawna odpowiedź na pytanie „Mercury 2.5 czy Mercury 2.5 Preview?" brzmi: to jeden model, i powinieneś wywoływać ten, który wciąż jest produktem.
