
LongCat-2.5-Preview vs Qwen3.8-Max: Jedna siódma ceny i ani śladu na tablicy wyników
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 610 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 189 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Meituan umieścił LongCat-2.5-Preview na swojej platformie API 25 września 2026 roku, wraz z wpisem w changelogu i cennikiem, ale bez jakichkolwiek benchmarków — a następnie wycenił go na około jedną siódmą tego, co Qwen3.8-Max pobiera za to samo wywołanie. To nie jest mała różnica i nie jest to bezpieczna różnica. Qwen3.8-Max, flagowy model dostawcy, jest ogólnie dostępny od 3 sierpnia 2026 roku, ma niezależny ranking Artificial Analysis, publikuje datowany snapshot, który można przypiąć po nazwie, i nalicza 6,7× więcej za dane wejściowe oraz 5× więcej za dane wyjściowe. Pytanie, na które musi odpowiedzieć to porównanie, nie brzmi, który model jest lepszy — nikt poza Meituan nie jest jeszcze w stanie na nie odpowiedzieć. Brzmi ono: co kupujesz za tę różnicę i czy ta różnica jest warta kupna.
Co każda ze stron faktycznie opublikowała
Zacznij od proweniencji, ponieważ to ona odróżnia je od siebie ostrzej niż jakikolwiek benchmark.
LongCat-2.5-Preview pojawił się wraz z datowanym wpisem we własnym changelogu Meituana — cytat dostawcy: „Wersja: 2026-09-25 — LongCat-2.5-Preview już dostępny” — stroną cennika wymieniającą go jako obecny model platformy rozliczany za użycie oraz przewodnikiem szybkiego startu obejmującym oba formaty transmisji. Własne konto Meituana na X opisuje go jako „1,6 bln parametrów. ~48 mld aktywnych. Okno kontekstu 1 mln tokenów. Natywnie multimodalny”. Poza tym nie ma nic do czytania. Żadne repozytorium w organizacji meituan-longcat na Hugging Face nie obejmuje tego modelu — najnowsze repozytorium tej organizacji to LongCat-Flash-Lite-Sparse z 31 lipca — a katalog modeli OpenCode, który go udostępnia, odnotowuje go jako model o zamkniętych wagach. Brak karty modelu, raportu technicznego, licencji, tabeli parametrów opublikowanych przez dostawcę, a także nigdzie nie ma niezależnej oceny: na dzień 27 września nie ma strony LongCat-2.5-Preview w Artificial Analysis.
Qwen3.8-Max to przypadek odwrotny pod niemal każdym względem. Stał się ogólnie dostępny 3 sierpnia 2026 r. wraz z opublikowanym cennikiem, a Alibaba wypuściła nazwaną aktualizację, Qwen3.8-Max-0902, 2 września. Artificial Analysis go mierzy: Intelligence Index 45,4, miejsce 15. na 145 modeli, oraz Coding Index 76,2, miejsce 9. na 138. Uzyskuje GPQA Diamond 92,8%, Humanity's Last Exam 43,1%, SciCode 52,1%, Long-Context Recall 80,3%, Terminal-Bench 2.1 na poziomie 88,8% oraz τ-bench banking na poziomie 47,8%. To model zmierzony, z dowodem na każdą liczbę.
Uczciwe podsumowanie kolumny dowodów jest więc przekrzywione w sposób, który nie ma nic wspólnego z możliwościami. Jeden z tych modeli można ocenić, zanim się zdecydujesz. Drugi można tylko wypróbować.
Cennik, wiersz po wierszu
Oba są modelami o milionie tokenów z tym samym limitem wyjściowym, więc karty specyfikacji zbiegają się dokładnie tam, gdzie karta specyfikacji jest najmniej przydatna:
• Wejście bez pamięci podręcznej — LongCat-2.5-Preview 0,30 USD za 1 mln vs Qwen3.8-Max 2,00 USD za 1 mln, różnica 6,7×.
• Wejście z pamięci podręcznej — 0,006 $ za 1 mln vs 0,25 $ za 1 mln, czyli różnica 41,7×.
• Wyjście — 1,20 USD za 1 mln vs 6,00 USD za 1 mln, 5-krotna różnica.
• Okno kontekstowe — 1 048 576 tokenów kontra 1 000 000 tokenów. Funkcjonalnie remis.
• Maksymalna liczba tokenów wyjściowych — 131 072 w obu przypadkach. Identyczna.
• Niezależny wynik — brak opublikowanego vs AA Intelligence 45.4 i AA Coding 76.2.
Każda wartość LongCat pochodzi z własnej strony cennika Meituan, a strona oznacza całą kolumnę jako „Cena z rabatem (oferta ograniczona czasowo)”. Wartości Qwen3.8-Max to stawka katalogowa Alibaby, odczytana z naszej własnej karty modelu, przy czym odczyt z pamięci podręcznej wynosi 0,25 USD, a zapis do pamięci podręcznej 2,50 USD za milion. Migawka Artificial Analysis jest datowana na 2 września 2026 r.
Wiersz dotyczący wejścia z pamięci podręcznej to ten, na który warto patrzeć. 42× różnica w odczytach z pamięci podręcznej to największa pojedyncza liczba w tym porównaniu i dotyczy wymiaru, na którym faktycznie opierają się obciążenia agentów. Pętla agenta, która przy każdej turze ponownie wysyła prompt systemowy o rozmiarze 100 000 tokenów oraz schemat narzędzi, płaci stawkę z pamięci podręcznej za większość swoich tokenów, a nie główną stawkę za wejście.
Wywołanie o rozmiarze 150 000 tokenów, wycenione na oba sposoby
Weźmy wiarygodne zapytanie typowe dla agenta: 150 000 tokenów wejściowych, z czego 50 000 obsługiwanych z pamięci podręcznej, oraz odpowiedź o długości 4000 tokenów. Przy zniżkowej stawce Meituan takie wywołanie kosztuje 0,0501 USD. Przy stawce cennikowej Qwen3.8-Max identyczne wywołanie kosztuje 0,3365 USD — 6,7× więcej, czyli 50 USD wobec 337 USD za tysiąc wywołań dziennie. Ustaw mieszankę tak, aby w pełni korzystała z pamięci podręcznej — co jest stanem ustalonym dla powtarzanego promptu — a stosunek rośnie do 12,3×: 0,006 USD wobec 0,074 USD na wywołanie.
Nic w tej arytmetyce nie zależy od tego, czy LongCat-2.5-Preview jest dobry. Właśnie w tym tkwi problem. Mnożnik, który ci oferują, jest prawdziwy, a słowo dołączone do niego na samej stronie dostawcy to „limited-time”, bez daty końcowej i bez podanej ceny następcy. Rabat 6.7× bez opublikowanego terminu wygaśnięcia to pozycja budżetowa, której nie można wpisać do planu; to pozycja budżetowa, którą trzeba obserwować.
Jest też asymetria w routingu, którą warto powiedzieć wprost. Qwen3.8-Max to trasa, którą obsługujemy — qwen/qwen3.8-max oraz przypięty qwen/qwen3.8-max-0902 — w cenie katalogowej Alibaby bez żadnej marży, więc zmiana ceny po stronie dostawcy trafia do nas tego samego dnia, a nie tygodnie później. LongCat-2.5-Preview nie jest jedną z naszych tras i nie zamierzamy udawać, że jest inaczej; po tańszej stronie tego porównania masz do czynienia z własnym API Meituan i dowolną platformą, przez którą do niego dotrzesz.
Jedno twierdzenie, któremu przeczy własne API Meituana
To odkrycie powinno rozstrzygnąć ten pojedynek dla każdego, którego obciążenie pracą nie jest czysto tekstowe.
Lista zmian Meituan wymienia rozumienie obrazów jako główny dodatek w generacji 2.5: „Rozumienie multimodalne: nowa funkcja rozumienia obrazów, potrafiąca analizować zawartość obrazów, obsługująca pytania i odpowiedzi międzymodalne, streszczanie treści oraz złożone rozumowanie wizualne”. We wpisie na X napisano: „natywnie multimodalny”. To twierdzenia dostawcy i same w sobie byłyby rozsądnym materiałem do uwzględnienia w decyzji.
Następnie ten sam serwis dokumentacji publikuje przykładową odpowiedź dla pobierania metadanych samego tego modelu, a zwracany model obsługuje wyłącznie tekst. W przypadku identyfikatora „LongCat-2.5-Preview” treść odpowiedzi pokazuje context_length: 1048576, input_modalities: ["text"], output_modalities: ["text"], a ciąg modalności to text->text. Brak wpisu dotyczącego obrazu. Nie w starym snapshocie — lecz w opracowanym przykładzie na stronie dokumentującej ten punkt końcowy.
![A screenshot of Meituan's LongCat API documentation for the model-retrieval endpoint, showing the worked example response for 'LongCat-2.5-Preview': context_length 1048576, input_modalities ["text"], output_modalities ["text"] and modality "text->text". The word 'text' is visible in red against the grey page.](https://cms.orcarouter.ai/api/media/file/2-1349.png)
To nie dowodzi, że model nie widzi. Dowodzi to, że dostawca nie uzgodnił swojej narracji ze schematem własnego API, i oznacza, że kupujący nie może rozliczyć obciążenia wizyjnego na podstawie tego zdania z changelogu, dopóki ktoś tego nie rozstrzygnie. Zestaw to z drugą stroną: nasz katalog wymienia Qwen3.8-Max jako przyjmujący tekst, obraz i wideo na wejściu, z wizją wśród deklarowanych możliwości, a za modelem stoi niezależna tabela benchmarków. Jeśli twoim zadaniem jest rozumienie dokumentów, triage zrzutów ekranu lub analiza klatek wideo, droga kolumna to ta ze zweryfikowaną modalnością wejściową, a tania kolumna to ta z nierozstrzygniętą. Ten pojedynczy wiersz może wymazać całe 6,7×.
Do czego nie można przypiąć Podglądu
Alibaba udostępnia datowane migawki. qwen/qwen3.8-max-0902 to nazwany, zamrożony build w tej samej cenie 2/6 USD co model bazowy, co oznacza, że reguła routingu, która go wskazuje, w przyszłym miesiącu nadal będzie zwracać te same wagi. Zmiany w zachowaniu pojawiają się jako nowy identyfikator, który możesz przyjąć według własnego harmonogramu.
LongCat-2.5-Preview nie ma takiego identyfikatora. Identyfikator modelu to identyfikator wersji zapoznawczej, nie ma sufiksu snapshot, nie ma historii wersji na platformie ani wpisu w dzienniku zmian, który powiedziałby ci, że wagi się zmieniły — jedynie to, że zniżka jest „ograniczona czasowo”. To wersja zapoznawcza w zwykłym znaczeniu: to, co kryje się pod nazwą, może się zmieniać, a dowiesz się o tym z własnych wyników, a nie z notatki o wydaniu.
Najtańszy sposób na kupienie brakujących dowodów to okno, które Meituan otworzył po drugiej stronie tego: OpenCode wymienia LongCat-2.5-Preview jako darmowy przez ograniczony okres, a dostawca stosuje politykę zerowego przechowywania i nie trenuje na twoich danych, i 26 września powiedział, że okno trwa dwa tygodnie. Darmowe wejście, darmowe wyjście, darmowe odczyty z pamięci podręcznej. To legalny sposób na zbudowanie tabeli benchmarków, której nikt nie opublikował — uruchom własny korpus ewaluacyjny przeciwko temu, a masz liczbę tam, gdzie dostawca dał ci zdanie. To jednak nie jest cena, wokół której możesz planować: dwa tygodnie się kończą, a liczba po drugiej stronie należy do Meituan.
Kto powinien wybrać, które
Sięgaj po Qwen3.8-Max, gdy obciążenie jest powodem, dla którego w ogóle kupujesz ten model. Jeśli dane wejściowe to obrazy lub wideo, jeśli odpowiedź musi być powtarzalna z buildu na build, jeśli niezależny indeks jest wymogiem zakupowym albo jeśli zadanie jest tym rodzajem kodowania agentowego, dla którego Terminal-Bench i Coding Index są tylko wskaźnikami zastępczymi, to 6.7× jest ceną możliwości sprawdzenia własnej pracy. Na jednym kluczu znajduje się on również za łańcuchem zapasowym, dzięki czemu model z wynikiem może przejąć zły dzień modelu bez wyniku, bez konieczności utrzymywania dwóch integracji.

Sięgaj po LongCat-2.5-Preview, gdy obciążenie jest wysokowolumenowe, krótkokontekstowe, czysto tekstowe i wewnętrzne — klasyfikacja, ekstrakcja, streszczanie, masowe przepisywanie — oraz gdy kosztem pomyłki jest ponowna próba, a nie klient. Przy takim profilu pozycja buforowanego wejścia nie jest rabatem, lecz całą ekonomiką zadania, a 42× to liczba warta trudu zmierzenia. Wykorzystaj darmowe okno, aby wytworzyć benchmark, który nie istnieje. Nie migruj na niego ścieżki krytycznej.
Co zmieniłoby ten werdykt, w kolejności wagi: niezależna ocena LongCat-2.5-Preview; opublikowana data zakończenia i cena, która zastąpi rabat; historia wersji z datowanymi migawkami; oraz rozstrzygnięcie, czy lista modalności obejmuje wyłącznie tekst, czy nie. Każdy z tych elementów sprawia, że tania kolumna to coś więcej niż rabat. Dopóki przynajmniej jeden z nich się nie pojawi, to porównanie nie jest starciem dwóch modeli — jest starciem między ceną, którą możesz zweryfikować, a możliwością, której nie możesz.

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
