
LongCat-2.5-Preview kontra Kimi K3: Pytanie o przywoływanie z długiego kontekstu, na które nikt jeszcze nie potrafi odpowiedzieć
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 610 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 189 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Kimi K3 uzyskuje wynik 88,67 w Long-Context Recall. To najwyższa wartość spośród wszystkich modeli w naszym katalogu, jeśli chodzi o to, czy model nadal wykorzystuje informacje ukryte głęboko w długim wejściu. LongCat-2.5-Preview nie ma w ogóle wyniku w Long-Context Recall — ani od Artificial Analysis, ani od Meituan, ani od nikogo. A to właśnie LongCat-2.5-Preview reklamuje okno o długości miliona tokenów jako swoją główną cechę. Ta rozbieżność — model, którego kluczowym twierdzeniem jest długi kontekst, a dla którego nie istnieje żaden pomiar długiego kontekstu — to cała istota tego porównania. Wszystko inne jest drugorzędne.
Warto być precyzyjnym co do tego, co brakująca liczba oznacza, a czego nie oznacza, ponieważ łatwo jest przesunąć się z „niezmierzone” do „prawdopodobnie złe”, a żaden z tych kierunków nie znajduje oparcia.
Co każdy z dwóch modeli oficjalnie oświadczył
Kimi K3 od MoonshotAI został udostępniony 15 lipca 2026 r. Nasz katalog oferuje go z oknem kontekstowym wynoszącym 1 048 576 tokenów, wejściem tekstowym i obrazowym oraz cennikiem: 3,00 USD za milion tokenów wejściowych, 0,30 USD za milion buforowanych tokenów wejściowych i 15,00 USD za milion tokenów wyjściowych. Jego niezależny profil według Artificial Analysis przedstawia się następująco: Coding Index 76,2, dziewiąte miejsce; Intelligence Index 43,6, dziewiętnaste miejsce; GPQA Diamond 93,5%; Humanity's Last Exam 46,9%; SciCode 59,5%; Terminal-Bench v2.1 85,0; τ²-Bench banking 46,0. Oraz Long-Context Recall 88,67 — najlepszy wynik w naszej ofercie.

LongCat-2.5-Preview firmy Meituan pojawił się na platformie LongCat API 25 września 2026. Jego wpis w dzienniku zmian wymienia trzy deklarowane możliwości — rozumienie obrazu, kodowanie i zgodność z „Claude Code i innymi głównymi środowiskami programistycznymi”, wymieniając Hermes, OpenClaw, OpenCode i Kilo Code. Strona z cennikiem podaje $0.30 za milion niebuforowanych tokenów wejściowych, $0.006 za milion buforowanych tokenów wejściowych i $1.20 za milion tokenów wyjściowych, oznaczonych jako ograniczona czasowo zniżka. Okno kontekstowe 1 000 000; maksymalne wyjście 131 072. Wartość ~1,6 bln łącznych / ~48 mld aktywnych parametrów pochodzi z metadanych witryny Meituan i chińskich publikacji branżowych, a nie z dokumentacji. Brak tabeli z wynikami benchmarków, brak karty modelu, brak raportu technicznego, brak repozytorium na HuggingFace ani w organizacji GitHub Meituan, a metadane katalogu zapisują otwarte wagi jako fałsz.
Dlaczego brakujący numer ma tu większe znaczenie niż w jakimkolwiek innym pojedynku
Long-Context Recall nie jest jednym z wielu wyników dla tych dwóch modeli. To ten wynik, który testuje to, co oba sprzedają. Okno o rozmiarze miliona tokenów to deklaracja dotycząca pojemności architektury; przywoływanie mierzy, czy model wciąż potrafi odnaleźć i wykorzystać fakt umieszczony przy tokenie 900 000 zamiast przy tokenie 900. Dostawcy publikują to pierwsze, bo to specyfikacja. Niezależni ewaluatorzy publikują to drugie, bo to test, a większość modeli nie wypada na nim tak dobrze, jak sugerowałby rozmiar ich okna.
Zatem uczciwe stanowisko jest węższe, niż to brzmi. Wynik 88,67 modelu Kimi K3 nie oznacza, że Kimi K3 jest lepszym modelem do długiego kontekstu niż LongCat-2.5-Preview. Oznacza, że to Kimi K3 jest tym, w przypadku którego pytanie zadano i udzielono na nie odpowiedzi. LongCat-2.5-Preview mógłby być lepszy. Mógłby być znacznie gorszy. Sedno w tym, że nikt poza Meituan obecnie tego nie wie, a okno 1M wydrukowane na stronie z cennikiem nie jest dowodem w żadną stronę.

Obraz kosztów, z tym samym ostrzeżeniem dotyczącym arytmetyki
Według publikowanych stawek LongCat-2.5-Preview jest 10 razy tańszy przy niebuforowanym wejściu i 12,5 razy tańszy przy wyjściu niż Kimi K3. Odczyt 500 000 tokenów, który zapisuje z powrotem 20 000 tokenów, kosztuje około 1,80 USD w Kimi K3 i około 17 centów w LongCat-2.5-Preview. Jedno i drugie to arytmetyka na cenach katalogowych, a nie pomiary, a liczba dla LongCat zawiera dodatkowe zastrzeżenie, którego nie ma liczba dla Kimi: Meituan określa własną stawkę jako ograniczoną czasowo zniżkę, więc liczba, która przetrwa promocję, jest nieznana.
Zderz to z kwestią pokrycia. Jeśli przetwarzasz dane wejściowe o rozmiarze 500 000 tokenów, a recall Twojego modelu na tej głębokości nie został zmierzony, różnica w kosztach nie jest oszczędnością — to cena nieznanego wskaźnika awaryjności. Żądanie za 17 centów, które po cichu pomija istotną sekcję, jest droższe niż żądanie za 1,80 dolara, które ją znajduje, ponieważ tak czy inaczej płacisz za ponowne uruchomienie i debugowanie. To jest konkretny kształt tego ryzyka i dlatego brakujący benchmark jest problemem kosztowym, a nie tylko marketingowym.
Co zrobić, gdy numer nie istnieje
Wygeneruj własny. To rzadki przypadek, w którym darmowe okno naprawdę dobrze pasuje do tej luki: LongCat-2.5-Preview nic nie kosztuje, gdy wywołujesz go przez OpenCode przez okres o nieokreślonej długości, z polityką zerowego przechowywania, którą dokumentuje OpenCode — trenowanie modelu „Nie używane”, przechowywanie danych „0 dni” — co oznacza, że możesz wskazać mu prywatne repozytorium bez wcześniejszej rozmowy o przetwarzaniu danych. Zbuduj test igły w stogu siana na głębokości, której faktycznie używasz, uruchom go na obu modelach, a otrzymasz liczbę, której nie opublikował żaden z dostawców. Dwie rzeczy do sprawdzenia, zanim zaufasz wynikowi: że twój harness ujawnia przeplatane reasoning_content pole zwracane przez model, oraz że wejście obrazowe w ogóle działa, ponieważ changelog Meituan to twierdzi, podczas gdy jego własny przykład „Retrieve Model” nadal pokazuje input_modalities jako ["text"] z ciągiem text->text.

Udział OrcaRouter w tym
Oferujemy Kimi K3 w cenie katalogowej MoonshotAI z zerową marżą. LongCat-2.5-Preview nie jest jedną z naszych tras — nie obsługujemy go i nic w tym tekście nie powinno być odczytywane jako twierdzenie, że go obsługujemy.
W tym konkretnym porównaniu użyteczna część routera to nie cena. Chodzi o to, że model, który oceniasz, i model, na którym polegasz, mogą stać za tym samym kluczem. Recall Kimi K3 wynoszący 88,67 czyni go modelem, przez który przekierowałbyś dziś przebieg długiego kontekstu; LongCat-2.5-Preview to model, który chcesz przetestować przeciwko niemu, bo jeśli jego recall się utrzyma przy jednej dwunastej ceny wyjściowej, ekonomika pracy z długimi dokumentami się zmienia. Fuzja modeli to mechanizm, który czyni to konkretnym, a nie teoretycznym: przebieg wyszukiwania długiego kontekstu i końcowy krok syntezy mogą być dwoma różnymi modelami w jednym żądaniu, więc tani, niezmierzony model i drogi, zmierzony nie muszą być wyborem albo-albo. Automatyczne przełączanie awaryjne z kolei obejmuje przypadek, w którym jeden z nich ulega degradacji, co ma większe znaczenie niż zwykle, gdy jeden z twoich dwóch kandydatów nie ma historii serwowania, którą możesz sprawdzić.
Werdykt, wypowiedziany wraz z towarzyszącą mu niepewnością
Jeśli w tym tygodniu potrzebujesz, aby praca z długim kontekstem była niezawodna, Kimi K3 jest wyborem, którego można bronić: 88,67 recall to najlepszy dostępny wynik dla dokładnie tej zdolności, o którą chodzi, a jego szerszy profil — Coding 76,2, Intelligence 43,6, GPQA Diamond 93,5% — jest solidny, a nie spektakularny; wszystko to pochodzi z niezależnych źródeł. Jeśli jesteś gotów poświęcić popołudnie na wygenerowanie własnej ewaluacji, LongCat-2.5-Preview to bardziej interesujący zakład: okno miliona tokenów, pułap wyjściowy 131 072 tokenów, dostęp z zerową retencją i cennik o rząd wielkości niższy niż w Kimi K3 — a wszystko to opiera się na twierdzeniach dostawcy, których nikt jeszcze publicznie nie przetestował.
Nie do obrony jest traktowanie ich jako równoważnych dlatego, że oba wymieniają milion tokenów. Z jednym z nich powiązana jest liczba dotycząca tego okna, a z drugim — cena. To różne rodzaje dowodów, a przepaść między nimi jest jedyną rzeczą, której to porównanie faktycznie dotyczy.
