Eine generierte Hero-Titelkarte mit dem Text „LongCat-2.5-Preview vs Kimi K3“ und der Overline „Die Frage des Langkontext-Recalls“, sowie zwei Panels: „LongCat-2.5-Preview: 1M Kontext, Recall-Score nicht veröffentlicht“ und „Kimi K3: AA Long-Context Recall 88.67, der höchste, den wir führen“. OrcaRouter-Logo unten rechts.
Engineering & Research

LongCat-2.5-Preview vs. Kimi K3: Die Langkontext-Recall-Frage, die noch niemand beantworten kann

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Kimi K3 erzielt 88,67 Punkte beim Long-Context Recall. Das ist der höchste Wert aller Modelle in unserem Katalog für die spezielle Frage, ob ein Modell noch Informationen nutzt, die tief in einer langen Eingabe vergraben sind. LongCat-2.5-Preview hat überhaupt keinen Long-Context-Recall-Wert – weder von Artificial Analysis noch von Meituan noch von irgendjemandem. Und ausgerechnet LongCat-2.5-Preview wirbt mit einem Fenster von einer Million Token als Schlagzeilen-Feature. Diese Diskrepanz – ein Modell, dessen zentrale Behauptung langer Kontext ist und für das keine Langkontext-Messung existiert – ist der gesamte Kern dieses Vergleichs. Alles andere ist zweitrangig.

Es lohnt sich, präzise zu sein, wenn es darum geht, was die fehlende Zahl bedeutet und was nicht, denn es ist leicht, von „nicht gemessen“ zu „wahrscheinlich schlecht“ abzugleiten, und keine der beiden Richtungen wird gestützt.

Was die beiden Modelle jeweils zu Protokoll gaben

MoonshotAIs Kimi K3 erschien am 15. Juli 2026. Unser Katalog führt es mit einem Kontextfenster von 1.048.576 Token, Text- und Bildeingabe sowie einer Preisliste von 3,00 $ pro Million Eingabe-Token, 0,30 $ pro Million gecachter Eingabe und 15,00 $ pro Million Ausgabe. Sein unabhängiges Profil von Artificial Analysis lautet: Coding Index 76,2, Platz neun; Intelligence Index 43,6, Platz neunzehn; GPQA Diamond 93,5 %; Humanity's Last Exam 46,9 %; SciCode 59,5 %; Terminal-Bench v2.1 85,0; τ²-Bench Banking 46,0. Und Long-Context Recall 88,67, der beste, den wir führen.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

Meituans LongCat-2.5-Preview erschien am 25. September 2026 auf der LongCat API Platform. Sein Changelog-Eintrag nennt drei beanspruchte Fähigkeiten – Bildverständnis, Coding und Kompatibilität mit „Claude Code und anderen gängigen Entwicklungsumgebungen“, wobei Hermes, OpenClaw, OpenCode und Kilo Code aufgeführt werden. Die Preisseite gibt $0,30 pro Million nicht gecachter Eingabe, $0,006 pro Million gecachter Eingabe und $1,20 pro Million Ausgabe an, gekennzeichnet als zeitlich begrenzter Rabatt. Kontextfenster 1.000.000; maximale Ausgabe 131.072. Die Zahl von insgesamt ~1,6 Billionen / ~48 Milliarden aktiven Parametern stammt aus Meituans Website-Metadaten und chinesischer Fachberichterstattung, nicht aus der Dokumentation. Keine Benchmark-Tabelle, keine Modellkarte, kein technischer Bericht, kein Repository auf HuggingFace oder in Meituans GitHub-Organisation und Katalogmetadaten, die offene Gewichte als falsch verzeichnen.

Warum die fehlende Zahl hier mehr zählt als in jedem anderen Duell

Long-Context Recall ist für diese beiden Modelle nicht einer von vielen Werten. Es ist der Wert, der genau das testet, was beide verkaufen. Ein Fenster mit einer Million Token ist eine Aussage über die Kapazität der Architektur; Recall misst, ob das Modell einen Fakt, der bei Token 900.000 statt bei Token 900 platziert wurde, noch abrufen und verwenden kann. Anbieter veröffentlichen Ersteres, weil es eine Spezifikation ist. Unabhängige Evaluatoren veröffentlichen Letzteres, weil es ein Test ist, und die meisten Modelle schneiden darin nicht so gut ab, wie ihre Fenstergröße vermuten lässt.

Die ehrliche Position ist also enger, als sie klingt. Kimi K3s 88,67 bedeutet nicht, dass Kimi K3 das bessere Long-Context-Modell als LongCat-2.5-Preview ist. Es bedeutet, dass Kimi K3 das Modell ist, für das die Frage gestellt und beantwortet wurde. LongCat-2.5-Preview könnte besser sein. Es könnte erheblich schlechter sein. Der Punkt ist, dass derzeit niemand außerhalb von Meituan es weiß, und ein auf einer Preisseite angegebenes 1M-Fenster ist kein Beleg in die eine oder andere Richtung.

A screenshot of OrcaRouter's own model page for MoonshotAI Kimi K3 at /models/kimi/kimi-k3, showing the kimi/kimi-k3 identifier, a 1M-token context window, text + image input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-07-15, a p50 first-token figure of 8.24 s, $3.00 and $15.00 rate tiles, and the OpenAI-compatible code samples.

Das Kostenbild, mit derselben Rechenwarnung

Nach den veröffentlichten Preisen ist LongCat-2.5-Preview bei nicht gecachter Eingabe 10-mal günstiger und bei der Ausgabe 12,5-mal günstiger als Kimi K3. Ein Lesevorgang von 500.000 Token, der 20.000 Token zurückschreibt, kostet ungefähr 1,80 US-Dollar bei Kimi K3 und ungefähr 17 Cent bei LongCat-2.5-Preview. Beides sind Berechnungen anhand von Listenpreisen und keine Messungen, und die LongCat-Zahl enthält einen zusätzlichen Vorbehalt, den die Kimi-Zahl nicht hat: Meituan bezeichnet seinen eigenen Tarif als zeitlich begrenzten Rabatt, sodass unbekannt ist, welcher Wert die Aktion übersteht.

Stellen Sie das der Abdeckungsfrage gegenüber. Wenn Sie eine Eingabe mit 500.000 Token verarbeiten und der Recall Ihres Modells in dieser Tiefe nicht gemessen ist, ist der Kostenunterschied keine Ersparnis — er ist der Preis einer unbekannten Ausfallrate. Eine 17-Cent-Anfrage, die den relevanten Abschnitt stillschweigend verfehlt, ist teurer als eine 1,80-Dollar-Anfrage, die ihn findet, weil Sie so oder so für den erneuten Durchlauf und das Debugging bezahlen. Das ist die konkrete Gestalt des Risikos, und deshalb ist die fehlende Benchmark ein Kostenproblem und nicht nur ein Marketingproblem.

Was tun, solange die Nummer nicht existiert

Erzeugen Sie Ihre eigenen. Dies ist der seltene Fall, in dem das kostenlose Fenster tatsächlich gut zur Lücke passt: LongCat-2.5-Preview kostet nichts, um es über OpenCode für einen Zeitraum unbestimmter Länge aufzurufen, mit einer Null-Aufbewahrungsrichtlinie, die OpenCode dokumentiert — Modelltraining "Nicht verwendet", Datenaufbewahrung "0 Tage" — was bedeutet, dass Sie es auf ein privates Repository richten können, ohne zuerst ein Gespräch über Datenverarbeitung zu führen. Erstellen Sie einen Nadel-im-Heuhaufen-Test in der Tiefe, die Sie tatsächlich verwenden, führen Sie ihn auf beiden Modellen aus, und Sie erhalten die Zahl, die kein Anbieter veröffentlicht hat. Zwei Dinge sind zu prüfen, bevor Sie dem Ergebnis vertrauen: dass Ihre Testumgebung das verschachtelte reasoning_content-Feld, das das Modell zurückgibt, und dass die Bildeingabe überhaupt funktioniert, da Meituans Changelog sie behauptet, während ihr eigenes "Retrieve Model"-Beispiel immer noch zeigt input_modalities als ["text"] mit einem text->text-String.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Kimi K3' with the subhead 'The one model advertising a long window is the one with no recall score'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, long-context recall not published by anyone, coding index not published, no repo and catalogue open_weights false. Right column 'Kimi K3' (MoonshotAI, released 2026-07-15, independently scored): 1,048,576-token context, max output not published, text and image to text, $3.00 uncached / $0.30 cached input, $15.00 output, long-context recall 88.67 described as the highest we carry, coding index 76.2 at rank 9 and intelligence index 43.6 at rank 19 by Artificial Analysis. The footnote adds that a 500,000-token read writing 20,000 tokens back is roughly $1.80 on Kimi K3 against roughly 17 cents on LongCat-2.5-Preview at its published promotional rate. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

OrcaRouters Rolle in diesem hier

Wir bieten Kimi K3 zum Listenpreis von MoonshotAI mit null Aufschlag an. LongCat-2.5-Preview ist keine unserer Routen — wir bieten es nicht an, und nichts in diesem Beitrag sollte dahingehend verstanden werden, dass wir dies behaupten.

Bei diesem konkreten Vergleich ist der nützliche Teil eines Routers nicht der Preis. Sondern dass das Modell, das Sie gerade bewerten, und das Modell, auf das Sie sich verlassen, hinter demselben Schlüssel sitzen können. Der Recall von Kimi K3 mit 88,67 macht es zu dem Modell, durch das Sie heute einen Long-Context-Durchlauf routen würden; LongCat-2.5-Preview ist das Modell, gegen das Sie es testen wollen, denn wenn sein Recall bei einem Zwölftel des Ausgabepreises standhält, verändert sich die Ökonomie der Arbeit mit langen Dokumenten. Modell-Fusion ist der Mechanismus, der das konkret statt theoretisch macht: Ein Long-Context-Retrieval-Durchlauf und ein abschließender Syntheseschritt können bei einer Anfrage zwei verschiedene Modelle sein, sodass das günstige, nicht gemessene Modell und das teure, gemessene keine Entweder-oder-Entscheidung sein müssen. Automatisches Failover deckt dann den Fall ab, dass eines von beiden degradiert, was mehr als sonst zählt, wenn einer Ihrer beiden Kandidaten keine Serving-Historie hat, die Sie einsehen können.

Das Urteil, mit seiner eigenen Unsicherheit versehen

Wenn Ihre Long-Context-Arbeit diese Woche zuverlässig sein muss, ist Kimi K3 die vertretbare Wahl: 88,67 Recall ist der beste verfügbare Wert für genau die infrage stehende Fähigkeit, und sein breiteres Profil — Coding 76,2, Intelligenz 43,6, GPQA Diamond 93,5 % — ist solide statt spektakulär, alles davon aus unabhängigen Quellen. Wenn Sie bereit sind, einen Nachmittag damit zu verbringen, Ihre eigene Evaluierung zu erstellen, ist LongCat-2.5-Preview die interessantere Wette: ein Fenster von einer Million Token, eine Ausgabegrenze von 131.072 Token, Zugriff ohne Datenaufbewahrung und eine Preisliste, die um eine Größenordnung unter der von Kimi K3 liegt — all dies stützt sich auf Herstellerangaben, die noch niemand öffentlich getestet hat.

Nicht vertretbar ist es, sie als gleichwertig zu behandeln, nur weil beide eine Million Token auflisten. Bei dem einen ist mit diesem Fenster eine Zahl verknüpft, bei dem anderen ein Preis. Das sind unterschiedliche Arten von Belegen, und die Kluft zwischen ihnen ist das Einzige, worum es bei diesem Vergleich tatsächlich geht.