Wygenerowana karta tytułowa hero z napisem „LongCat-2.5-Preview vs Kimi K3” i nadtytułem „Pytanie o przywoływanie w długim kontekście” oraz dwa panele: „LongCat-2.5-Preview: kontekst 1M, wynik przywoływania nieopublikowany” i „Kimi K3: AA Long-Context Recall 88,67 – najwyższy w naszej ofercie”. Logo OrcaRouter w prawym dolnym rogu.
Engineering & Research

LongCat-2.5-Preview kontra Kimi K3: Pytanie o przywoływanie z długiego kontekstu, na które nikt jeszcze nie potrafi odpowiedzieć

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Kimi K3 uzyskuje wynik 88,67 w Long-Context Recall. To najwyższa wartość spośród wszystkich modeli w naszym katalogu, jeśli chodzi o to, czy model nadal wykorzystuje informacje ukryte głęboko w długim wejściu. LongCat-2.5-Preview nie ma w ogóle wyniku w Long-Context Recall — ani od Artificial Analysis, ani od Meituan, ani od nikogo. A to właśnie LongCat-2.5-Preview reklamuje okno o długości miliona tokenów jako swoją główną cechę. Ta rozbieżność — model, którego kluczowym twierdzeniem jest długi kontekst, a dla którego nie istnieje żaden pomiar długiego kontekstu — to cała istota tego porównania. Wszystko inne jest drugorzędne.

Warto być precyzyjnym co do tego, co brakująca liczba oznacza, a czego nie oznacza, ponieważ łatwo jest przesunąć się z „niezmierzone” do „prawdopodobnie złe”, a żaden z tych kierunków nie znajduje oparcia.

Co każdy z dwóch modeli oficjalnie oświadczył

Kimi K3 od MoonshotAI został udostępniony 15 lipca 2026 r. Nasz katalog oferuje go z oknem kontekstowym wynoszącym 1 048 576 tokenów, wejściem tekstowym i obrazowym oraz cennikiem: 3,00 USD za milion tokenów wejściowych, 0,30 USD za milion buforowanych tokenów wejściowych i 15,00 USD za milion tokenów wyjściowych. Jego niezależny profil według Artificial Analysis przedstawia się następująco: Coding Index 76,2, dziewiąte miejsce; Intelligence Index 43,6, dziewiętnaste miejsce; GPQA Diamond 93,5%; Humanity's Last Exam 46,9%; SciCode 59,5%; Terminal-Bench v2.1 85,0; τ²-Bench banking 46,0. Oraz Long-Context Recall 88,67 — najlepszy wynik w naszej ofercie.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview firmy Meituan pojawił się na platformie LongCat API 25 września 2026. Jego wpis w dzienniku zmian wymienia trzy deklarowane możliwości — rozumienie obrazu, kodowanie i zgodność z „Claude Code i innymi głównymi środowiskami programistycznymi”, wymieniając Hermes, OpenClaw, OpenCode i Kilo Code. Strona z cennikiem podaje $0.30 za milion niebuforowanych tokenów wejściowych, $0.006 za milion buforowanych tokenów wejściowych i $1.20 za milion tokenów wyjściowych, oznaczonych jako ograniczona czasowo zniżka. Okno kontekstowe 1 000 000; maksymalne wyjście 131 072. Wartość ~1,6 bln łącznych / ~48 mld aktywnych parametrów pochodzi z metadanych witryny Meituan i chińskich publikacji branżowych, a nie z dokumentacji. Brak tabeli z wynikami benchmarków, brak karty modelu, brak raportu technicznego, brak repozytorium na HuggingFace ani w organizacji GitHub Meituan, a metadane katalogu zapisują otwarte wagi jako fałsz.

Dlaczego brakujący numer ma tu większe znaczenie niż w jakimkolwiek innym pojedynku

Long-Context Recall nie jest jednym z wielu wyników dla tych dwóch modeli. To ten wynik, który testuje to, co oba sprzedają. Okno o rozmiarze miliona tokenów to deklaracja dotycząca pojemności architektury; przywoływanie mierzy, czy model wciąż potrafi odnaleźć i wykorzystać fakt umieszczony przy tokenie 900 000 zamiast przy tokenie 900. Dostawcy publikują to pierwsze, bo to specyfikacja. Niezależni ewaluatorzy publikują to drugie, bo to test, a większość modeli nie wypada na nim tak dobrze, jak sugerowałby rozmiar ich okna.

Zatem uczciwe stanowisko jest węższe, niż to brzmi. Wynik 88,67 modelu Kimi K3 nie oznacza, że Kimi K3 jest lepszym modelem do długiego kontekstu niż LongCat-2.5-Preview. Oznacza, że to Kimi K3 jest tym, w przypadku którego pytanie zadano i udzielono na nie odpowiedzi. LongCat-2.5-Preview mógłby być lepszy. Mógłby być znacznie gorszy. Sedno w tym, że nikt poza Meituan obecnie tego nie wie, a okno 1M wydrukowane na stronie z cennikiem nie jest dowodem w żadną stronę.

A screenshot of OrcaRouter's own model page for MoonshotAI Kimi K3 at /models/kimi/kimi-k3, showing the kimi/kimi-k3 identifier, a 1M-token context window, text + image input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-07-15, a p50 first-token figure of 8.24 s, $3.00 and $15.00 rate tiles, and the OpenAI-compatible code samples.

Obraz kosztów, z tym samym ostrzeżeniem dotyczącym arytmetyki

Według publikowanych stawek LongCat-2.5-Preview jest 10 razy tańszy przy niebuforowanym wejściu i 12,5 razy tańszy przy wyjściu niż Kimi K3. Odczyt 500 000 tokenów, który zapisuje z powrotem 20 000 tokenów, kosztuje około 1,80 USD w Kimi K3 i około 17 centów w LongCat-2.5-Preview. Jedno i drugie to arytmetyka na cenach katalogowych, a nie pomiary, a liczba dla LongCat zawiera dodatkowe zastrzeżenie, którego nie ma liczba dla Kimi: Meituan określa własną stawkę jako ograniczoną czasowo zniżkę, więc liczba, która przetrwa promocję, jest nieznana.

Zderz to z kwestią pokrycia. Jeśli przetwarzasz dane wejściowe o rozmiarze 500 000 tokenów, a recall Twojego modelu na tej głębokości nie został zmierzony, różnica w kosztach nie jest oszczędnością — to cena nieznanego wskaźnika awaryjności. Żądanie za 17 centów, które po cichu pomija istotną sekcję, jest droższe niż żądanie za 1,80 dolara, które ją znajduje, ponieważ tak czy inaczej płacisz za ponowne uruchomienie i debugowanie. To jest konkretny kształt tego ryzyka i dlatego brakujący benchmark jest problemem kosztowym, a nie tylko marketingowym.

Co zrobić, gdy numer nie istnieje

Wygeneruj własny. To rzadki przypadek, w którym darmowe okno naprawdę dobrze pasuje do tej luki: LongCat-2.5-Preview nic nie kosztuje, gdy wywołujesz go przez OpenCode przez okres o nieokreślonej długości, z polityką zerowego przechowywania, którą dokumentuje OpenCode — trenowanie modelu „Nie używane”, przechowywanie danych „0 dni” — co oznacza, że możesz wskazać mu prywatne repozytorium bez wcześniejszej rozmowy o przetwarzaniu danych. Zbuduj test igły w stogu siana na głębokości, której faktycznie używasz, uruchom go na obu modelach, a otrzymasz liczbę, której nie opublikował żaden z dostawców. Dwie rzeczy do sprawdzenia, zanim zaufasz wynikowi: że twój harness ujawnia przeplatane reasoning_content pole zwracane przez model, oraz że wejście obrazowe w ogóle działa, ponieważ changelog Meituan to twierdzi, podczas gdy jego własny przykład „Retrieve Model” nadal pokazuje input_modalities jako ["text"] z ciągiem text->text.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Kimi K3' with the subhead 'The one model advertising a long window is the one with no recall score'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, long-context recall not published by anyone, coding index not published, no repo and catalogue open_weights false. Right column 'Kimi K3' (MoonshotAI, released 2026-07-15, independently scored): 1,048,576-token context, max output not published, text and image to text, $3.00 uncached / $0.30 cached input, $15.00 output, long-context recall 88.67 described as the highest we carry, coding index 76.2 at rank 9 and intelligence index 43.6 at rank 19 by Artificial Analysis. The footnote adds that a 500,000-token read writing 20,000 tokens back is roughly $1.80 on Kimi K3 against roughly 17 cents on LongCat-2.5-Preview at its published promotional rate. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Udział OrcaRouter w tym

Oferujemy Kimi K3 w cenie katalogowej MoonshotAI z zerową marżą. LongCat-2.5-Preview nie jest jedną z naszych tras — nie obsługujemy go i nic w tym tekście nie powinno być odczytywane jako twierdzenie, że go obsługujemy.

W tym konkretnym porównaniu użyteczna część routera to nie cena. Chodzi o to, że model, który oceniasz, i model, na którym polegasz, mogą stać za tym samym kluczem. Recall Kimi K3 wynoszący 88,67 czyni go modelem, przez który przekierowałbyś dziś przebieg długiego kontekstu; LongCat-2.5-Preview to model, który chcesz przetestować przeciwko niemu, bo jeśli jego recall się utrzyma przy jednej dwunastej ceny wyjściowej, ekonomika pracy z długimi dokumentami się zmienia. Fuzja modeli to mechanizm, który czyni to konkretnym, a nie teoretycznym: przebieg wyszukiwania długiego kontekstu i końcowy krok syntezy mogą być dwoma różnymi modelami w jednym żądaniu, więc tani, niezmierzony model i drogi, zmierzony nie muszą być wyborem albo-albo. Automatyczne przełączanie awaryjne z kolei obejmuje przypadek, w którym jeden z nich ulega degradacji, co ma większe znaczenie niż zwykle, gdy jeden z twoich dwóch kandydatów nie ma historii serwowania, którą możesz sprawdzić.

Werdykt, wypowiedziany wraz z towarzyszącą mu niepewnością

Jeśli w tym tygodniu potrzebujesz, aby praca z długim kontekstem była niezawodna, Kimi K3 jest wyborem, którego można bronić: 88,67 recall to najlepszy dostępny wynik dla dokładnie tej zdolności, o którą chodzi, a jego szerszy profil — Coding 76,2, Intelligence 43,6, GPQA Diamond 93,5% — jest solidny, a nie spektakularny; wszystko to pochodzi z niezależnych źródeł. Jeśli jesteś gotów poświęcić popołudnie na wygenerowanie własnej ewaluacji, LongCat-2.5-Preview to bardziej interesujący zakład: okno miliona tokenów, pułap wyjściowy 131 072 tokenów, dostęp z zerową retencją i cennik o rząd wielkości niższy niż w Kimi K3 — a wszystko to opiera się na twierdzeniach dostawcy, których nikt jeszcze publicznie nie przetestował.

Nie do obrony jest traktowanie ich jako równoważnych dlatego, że oba wymieniają milion tokenów. Z jednym z nich powiązana jest liczba dotycząca tego okna, a z drugim — cena. To różne rodzaje dowodów, a przepaść między nimi jest jedyną rzeczą, której to porównanie faktycznie dotyczy.