
LongCat-2.5-Preview kontra Grok 4.6: jeden ma kartę benchmarku, drugi ma następcę
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 610 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 189 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Porównywanie LongCat-2.5-Previewz Grok 4.6jest niezręczne z powodu, który nie ma nic wspólnego z jakością któregokolwiek z tych modeli: to pytanie ma termin ważności. Grok 4.6 ukazał się 12 sierpnia 2026 r., a Grok 4.7 — 21 września 2026 r., czyli sześć dni przed powstaniem tego tekstu — w tych samych stawkach 2,00 / 6,00 USD za milion tokenów i z tym samym oknem kontekstowym wynoszącym 500 000 tokenów. LongCat-2.5-Preview trafił tymczasem na LongCat API Platform firmy Meituan 25 września 2026 r., bez żadnego ogłoszonego następcy w zasięgu wzroku i bez jakiegokolwiek opublikowanego benchmarku. Prawdziwy wybór nie polega więc na tym, „który model jest lepszy”. Chodzi o to, czy chcesz możliwości zmierzonej, za którą stoi już zmierzony następca, czy niezmierzonej, która jest przynajmniej obecna.
To ujęcie jest mniej ekscytujące niż tablica wyników i znacznie bardziej przydatne.
Zacznij od tego, co Grok 4.6 faktycznie ma zapisane.
Grok 4.6 to dobrze udokumentowany model. W naszym katalogu ma okno kontekstowe o rozmiarze 500 000 tokenów, wejście tekstowe, obrazowe i plikowe oraz cennik obejmujący 2,00 USD za milion tokenów wejściowych, 6,00 USD za milion tokenów wyjściowych i 0,50 USD za milion tokenów wejściowych z pamięci podręcznej, rosnący do 4,00 i 12,00 USD powyżej 200 000 tokenów wejściowych. Jego niezależny profil od Artificial Analysis obejmuje Indeks Kodowania na poziomie 76,8 — piąty wśród modeli śledzonych przez ten indeks — Indeks Inteligencji 44,3 na osiemnastym miejscu, GPQA Diamond na poziomie 94,9%, Humanity's Last Exam na poziomie 42,9%, SciCode na poziomie 56,5%, Terminal-Bench v2.1 na poziomie 88,4 i τ²-Bench dla bankowości na poziomie 50,7. Jego Long-Context Recall wynosi 80,3.

LongCat-2.5-Preview nie ma nic z tego. Wpis w changelogu Meituan z 25 września 2026 r. to opatrzone datą zawiadomienie o dostępności, wymieniające trzy deklarowane możliwości — rozumienie obrazu, programowanie oraz zgodność z „Claude Code i innymi popularnymi środowiskami programistycznymi”, w tym Hermes, OpenClaw, OpenCode i Kilo Code — i nic, co przypominałoby wynik. Strona cennika dostawcy podaje 0,30 USD za milion niebuforowanych tokenów wejściowych, 0,006 USD za milion buforowanych tokenów wejściowych i 1,20 USD za milion tokenów wyjściowych, wyraźnie oznaczone jako ograniczona czasowo zniżka. Okno kontekstowe wynosi 1 000 000 tokenów; maksymalne wyjście to 131 072. Liczba parametrów — około 1,6 biliona łącznie / 48 miliardów aktywnych — pochodzi z metadanych witryny Meituan i chińskich publikacji branżowych, a nie z dokumentacji. Nie ma dla niego repozytorium na HuggingFace ani w organizacji Meituan na GitHubie, a metadane katalogu dostarczane przez OpenCode oznaczają otwarte wagi jako false.
Wymiar, który tablica wyników całkowicie by pominęła
Te dwa modele różnią się pod względem czegoś, czego nie mierzy żaden benchmark, a dla wielu zespołów to samo w sobie rozstrzyga tę kwestię: co dzieje się z promptami, które wysyłasz.
Sama dokumentacja OpenCode stwierdza, że LongCat 2.5 Preview Free jest obsługiwany przez dostawcę, który stosuje politykę zerowego przechowywania i nie wykorzystuje Twoich danych do trenowania; tabela prywatności Zen podaje to w liczbach — trenowanie modelu: „Nie wykorzystywane”, przechowywanie danych: „0 dni”. Ta sama tabela prywatności podaje trzydzieści dni przechowywania dla Grok 4.6 i Grok 4.7. Oba te stwierdzenia pochodzą od OpenCode, zostały opublikowane na stronach OpenCode i dotyczą konkretnie darmowej pozycji oraz pozycji w zestawieniu porównawczym. Jeśli jednak kierujesz agenta na prywatne repozytorium, to właśnie różnica między rozmową, której nie musisz odbywać z działem prawnym, a rozmową, którą musisz odbyć — i nie ma to nic wspólnego z tym, który model ma lepszy wynik w SciCode.

Co „measured" ci daje, a czego nie
Liczby modelu Grok 4.6 są lepsze niż liczby LongCat-2.5-Preview w jedynym sensie, jaki ma tu znaczenie: istnieją. To nie to samo, co powiedzenie, że Grok 4.6 jest lepszym modelem. Jego Coding Index na poziomie 76,8 jest niższy niż w generacji Grok 4.7, a model, z którym go porównywano, nie jest już czołówką własnej rodziny. Jego opublikowany następca ma Intelligence Index na poziomie 46,4 wobec 44,3 modelu Grok 4.6 oraz Long-Context Recall na poziomie 76,67 wobec 80,33 modelu Grok 4.6 — więc następca nie jest lepszy pod każdym względem, co jest dokładnie tym rodzajem szczegółu, jaki ukrywa numer generacji.
Jest też zastrzeżenie dotyczące obsługi na żywo, które warto wypowiedzieć wprost, ponieważ przemawia ono przeciwko pochlebnej interpretacji w przypadku obu modeli. W naszej własnej siedmiodniowej próbce z playgrounda Grok 4.6 nie odnotował żadnej zmierzonej przepustowości ani ruchu tokenów, co w tej kolumnie wygląda jak brak danych, a nie werdykt o wydajności. LongCat-2.5-Preview nie ma w ogóle naszej próbki obsługi, ponieważ nie kierujemy do niego ruchu. Zatem każde porównanie opóźnień między tymi dwoma jest jednostronne w sposób, który proza zwykle tuszuje: nie można przeprowadzić benchmarku modelu, do którego nie wysyła się ruchu.
Gdzie warstwa routingu faktycznie tu pomaga
Trzy z powyższych faktów są typu, dla którego router został zbudowany, a nie tylko z którym jest kompatybilny. Stawka w cenniku Grok 4.6 wzrasta powyżej 200 000 tokenów wejściowych, więc to samo logiczne zadanie może być rozliczone według dwóch różnych stawek w zależności od liczby, którą Twoja aplikacja zna już przed wysłaniem czegokolwiek. Grok 4.6 ma opublikowanego następcę o identycznych stawkach, co oznacza, że przejście z jednego na drugi powinno być zmianą jednej linii, a nigdy ponowną integracją. A najatrakcyjniejsza właściwość LongCat-2.5-Preview — jego cena — jest wyraźnie oznaczona przez dostawcę jako tymczasowa.
W OrcaRouter udostępniamy Grok 4.6 w cenie katalogowej xAI z zerową marżą, więc zmiana stawek dostawcy trafia na Twój rachunek tego samego dnia, a nie dopiero przy kolejnym odnowieniu, a automatyczne przełączanie awaryjne przenosi pogorszone żądanie do zdrowego dostawcy, a Twój kod nie musi wiedzieć, który z nich odpowiedział. DSL routingu obsługuje bezpośrednio przypadek cen warstwowych, a fuzja modeli obejmuje przypadek, w którym model, którego chcesz do długiej lektury, to nie ten sam model, którego chcesz do finalnej syntezy. LongCat-2.5-Preview nie jest jedną z naszych tras — nie udostępniamy go i nic tutaj nie twierdzi inaczej. Nie chodzi o to, by przez samo jego wymienienie kierować Cię gdzie indziej; chodzi o to, że model, który oceniasz, a nie uruchamiasz, powinien znajdować się za tym samym kluczem co modele, które uruchamiasz, tak aby jego ocena kosztowała wpis w konfiguracji, a nie cały projekt.

Jak podjąć decyzję
• Wybierz Grok 4.6, jeśli potrzebujesz odpowiedzi, której możesz bronić. Ma niezależną kartę, udokumentowany profil danych wejściowych i cenę, która nie wygasa. Jego głównym ryzykiem nie jest jakość, lecz aktualność: Grok 4.7 istnieje w tych samych stawkach, a koszt pozostania przy 4.6 z bezwładności to różnica między Intelligence Index wynoszącym 44,3 i 46,4, której nie musiałeś opłacać.
• Wybierz LongCat-2.5-Preview, jeśli decydującym czynnikiem jest retencja lub zasięg. Dostęp bez retencji przez OpenCode, okno kontekstowe o pojemności miliona tokenów, limit wyjściowy 131 072 tokenów i cennik stanowiący około jednej siódmej cennika Grok 4.6 to rzeczywiste zalety — pierwsza z nich potwierdzona polityką prywatności strony trzeciej, pozostałe zaś deklarowane wyłącznie przez dostawcę.
• Nie wybieraj między nimi na podstawie tabeli wyników, ponieważ istnieje tylko jedna. Wynik Grok 4.6 w kodowaniu — 76,8 — i 80,3 w przywoływaniu długiego kontekstu dotyczą Grok 4.6. Nic nie opisuje jeszcze LongCat-2.5-Preview. Każdy, kto w tym tygodniu podaje wynik LongCat-2.5-Preview obok wyniku Grok 4.6, albo cytuje inny model LongCat, albo wymyśla tę liczbę.
• Zweryfikuj stronę wejściową, zanim na niej zbudujesz. Changelog Meituana zaczyna się od rozumienia obrazu, ale przykładowa odpowiedź w jego własnej dokumentacji „Retrieve Model” nadal pokazuje input_modalities jako ["text"] z text->text ciągiem modalności — twierdzenie dostawcy w zestawieniu z opublikowanym kontraktem, który mówi co innego. Grok 4.6 przyjmuje tekst, obrazy i pliki bez takiej dwuznaczności. I sprawdź, czy Twoje narzędzie udostępnia przeplatane reasoning_content pole, zanim wyciągniesz jakiekolwiek wnioski o jakości rozumowania LongCat-2.5-Preview; klient, który pominie to pole, zawiedzie po cichu.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
