
LongCat-2.5-Preview vs. Kimi K3: Die Langkontext-Recall-Frage, die noch niemand beantworten kann
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 610 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 189 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Kimi K3 erzielt 88,67 Punkte beim Long-Context Recall. Das ist der höchste Wert aller Modelle in unserem Katalog für die spezielle Frage, ob ein Modell noch Informationen nutzt, die tief in einer langen Eingabe vergraben sind. LongCat-2.5-Preview hat überhaupt keinen Long-Context-Recall-Wert – weder von Artificial Analysis noch von Meituan noch von irgendjemandem. Und ausgerechnet LongCat-2.5-Preview wirbt mit einem Fenster von einer Million Token als Schlagzeilen-Feature. Diese Diskrepanz – ein Modell, dessen zentrale Behauptung langer Kontext ist und für das keine Langkontext-Messung existiert – ist der gesamte Kern dieses Vergleichs. Alles andere ist zweitrangig.
Es lohnt sich, präzise zu sein, wenn es darum geht, was die fehlende Zahl bedeutet und was nicht, denn es ist leicht, von „nicht gemessen“ zu „wahrscheinlich schlecht“ abzugleiten, und keine der beiden Richtungen wird gestützt.
Was die beiden Modelle jeweils zu Protokoll gaben
MoonshotAIs Kimi K3 erschien am 15. Juli 2026. Unser Katalog führt es mit einem Kontextfenster von 1.048.576 Token, Text- und Bildeingabe sowie einer Preisliste von 3,00 $ pro Million Eingabe-Token, 0,30 $ pro Million gecachter Eingabe und 15,00 $ pro Million Ausgabe. Sein unabhängiges Profil von Artificial Analysis lautet: Coding Index 76,2, Platz neun; Intelligence Index 43,6, Platz neunzehn; GPQA Diamond 93,5 %; Humanity's Last Exam 46,9 %; SciCode 59,5 %; Terminal-Bench v2.1 85,0; τ²-Bench Banking 46,0. Und Long-Context Recall 88,67, der beste, den wir führen.

Meituans LongCat-2.5-Preview erschien am 25. September 2026 auf der LongCat API Platform. Sein Changelog-Eintrag nennt drei beanspruchte Fähigkeiten – Bildverständnis, Coding und Kompatibilität mit „Claude Code und anderen gängigen Entwicklungsumgebungen“, wobei Hermes, OpenClaw, OpenCode und Kilo Code aufgeführt werden. Die Preisseite gibt $0,30 pro Million nicht gecachter Eingabe, $0,006 pro Million gecachter Eingabe und $1,20 pro Million Ausgabe an, gekennzeichnet als zeitlich begrenzter Rabatt. Kontextfenster 1.000.000; maximale Ausgabe 131.072. Die Zahl von insgesamt ~1,6 Billionen / ~48 Milliarden aktiven Parametern stammt aus Meituans Website-Metadaten und chinesischer Fachberichterstattung, nicht aus der Dokumentation. Keine Benchmark-Tabelle, keine Modellkarte, kein technischer Bericht, kein Repository auf HuggingFace oder in Meituans GitHub-Organisation und Katalogmetadaten, die offene Gewichte als falsch verzeichnen.
Warum die fehlende Zahl hier mehr zählt als in jedem anderen Duell
Long-Context Recall ist für diese beiden Modelle nicht einer von vielen Werten. Es ist der Wert, der genau das testet, was beide verkaufen. Ein Fenster mit einer Million Token ist eine Aussage über die Kapazität der Architektur; Recall misst, ob das Modell einen Fakt, der bei Token 900.000 statt bei Token 900 platziert wurde, noch abrufen und verwenden kann. Anbieter veröffentlichen Ersteres, weil es eine Spezifikation ist. Unabhängige Evaluatoren veröffentlichen Letzteres, weil es ein Test ist, und die meisten Modelle schneiden darin nicht so gut ab, wie ihre Fenstergröße vermuten lässt.
Die ehrliche Position ist also enger, als sie klingt. Kimi K3s 88,67 bedeutet nicht, dass Kimi K3 das bessere Long-Context-Modell als LongCat-2.5-Preview ist. Es bedeutet, dass Kimi K3 das Modell ist, für das die Frage gestellt und beantwortet wurde. LongCat-2.5-Preview könnte besser sein. Es könnte erheblich schlechter sein. Der Punkt ist, dass derzeit niemand außerhalb von Meituan es weiß, und ein auf einer Preisseite angegebenes 1M-Fenster ist kein Beleg in die eine oder andere Richtung.

Das Kostenbild, mit derselben Rechenwarnung
Nach den veröffentlichten Preisen ist LongCat-2.5-Preview bei nicht gecachter Eingabe 10-mal günstiger und bei der Ausgabe 12,5-mal günstiger als Kimi K3. Ein Lesevorgang von 500.000 Token, der 20.000 Token zurückschreibt, kostet ungefähr 1,80 US-Dollar bei Kimi K3 und ungefähr 17 Cent bei LongCat-2.5-Preview. Beides sind Berechnungen anhand von Listenpreisen und keine Messungen, und die LongCat-Zahl enthält einen zusätzlichen Vorbehalt, den die Kimi-Zahl nicht hat: Meituan bezeichnet seinen eigenen Tarif als zeitlich begrenzten Rabatt, sodass unbekannt ist, welcher Wert die Aktion übersteht.
Stellen Sie das der Abdeckungsfrage gegenüber. Wenn Sie eine Eingabe mit 500.000 Token verarbeiten und der Recall Ihres Modells in dieser Tiefe nicht gemessen ist, ist der Kostenunterschied keine Ersparnis — er ist der Preis einer unbekannten Ausfallrate. Eine 17-Cent-Anfrage, die den relevanten Abschnitt stillschweigend verfehlt, ist teurer als eine 1,80-Dollar-Anfrage, die ihn findet, weil Sie so oder so für den erneuten Durchlauf und das Debugging bezahlen. Das ist die konkrete Gestalt des Risikos, und deshalb ist die fehlende Benchmark ein Kostenproblem und nicht nur ein Marketingproblem.
Was tun, solange die Nummer nicht existiert
Erzeugen Sie Ihre eigenen. Dies ist der seltene Fall, in dem das kostenlose Fenster tatsächlich gut zur Lücke passt: LongCat-2.5-Preview kostet nichts, um es über OpenCode für einen Zeitraum unbestimmter Länge aufzurufen, mit einer Null-Aufbewahrungsrichtlinie, die OpenCode dokumentiert — Modelltraining "Nicht verwendet", Datenaufbewahrung "0 Tage" — was bedeutet, dass Sie es auf ein privates Repository richten können, ohne zuerst ein Gespräch über Datenverarbeitung zu führen. Erstellen Sie einen Nadel-im-Heuhaufen-Test in der Tiefe, die Sie tatsächlich verwenden, führen Sie ihn auf beiden Modellen aus, und Sie erhalten die Zahl, die kein Anbieter veröffentlicht hat. Zwei Dinge sind zu prüfen, bevor Sie dem Ergebnis vertrauen: dass Ihre Testumgebung das verschachtelte reasoning_content-Feld, das das Modell zurückgibt, und dass die Bildeingabe überhaupt funktioniert, da Meituans Changelog sie behauptet, während ihr eigenes "Retrieve Model"-Beispiel immer noch zeigt input_modalities als ["text"] mit einem text->text-String.

OrcaRouters Rolle in diesem hier
Wir bieten Kimi K3 zum Listenpreis von MoonshotAI mit null Aufschlag an. LongCat-2.5-Preview ist keine unserer Routen — wir bieten es nicht an, und nichts in diesem Beitrag sollte dahingehend verstanden werden, dass wir dies behaupten.
Bei diesem konkreten Vergleich ist der nützliche Teil eines Routers nicht der Preis. Sondern dass das Modell, das Sie gerade bewerten, und das Modell, auf das Sie sich verlassen, hinter demselben Schlüssel sitzen können. Der Recall von Kimi K3 mit 88,67 macht es zu dem Modell, durch das Sie heute einen Long-Context-Durchlauf routen würden; LongCat-2.5-Preview ist das Modell, gegen das Sie es testen wollen, denn wenn sein Recall bei einem Zwölftel des Ausgabepreises standhält, verändert sich die Ökonomie der Arbeit mit langen Dokumenten. Modell-Fusion ist der Mechanismus, der das konkret statt theoretisch macht: Ein Long-Context-Retrieval-Durchlauf und ein abschließender Syntheseschritt können bei einer Anfrage zwei verschiedene Modelle sein, sodass das günstige, nicht gemessene Modell und das teure, gemessene keine Entweder-oder-Entscheidung sein müssen. Automatisches Failover deckt dann den Fall ab, dass eines von beiden degradiert, was mehr als sonst zählt, wenn einer Ihrer beiden Kandidaten keine Serving-Historie hat, die Sie einsehen können.
Das Urteil, mit seiner eigenen Unsicherheit versehen
Wenn Ihre Long-Context-Arbeit diese Woche zuverlässig sein muss, ist Kimi K3 die vertretbare Wahl: 88,67 Recall ist der beste verfügbare Wert für genau die infrage stehende Fähigkeit, und sein breiteres Profil — Coding 76,2, Intelligenz 43,6, GPQA Diamond 93,5 % — ist solide statt spektakulär, alles davon aus unabhängigen Quellen. Wenn Sie bereit sind, einen Nachmittag damit zu verbringen, Ihre eigene Evaluierung zu erstellen, ist LongCat-2.5-Preview die interessantere Wette: ein Fenster von einer Million Token, eine Ausgabegrenze von 131.072 Token, Zugriff ohne Datenaufbewahrung und eine Preisliste, die um eine Größenordnung unter der von Kimi K3 liegt — all dies stützt sich auf Herstellerangaben, die noch niemand öffentlich getestet hat.
Nicht vertretbar ist es, sie als gleichwertig zu behandeln, nur weil beide eine Million Token auflisten. Bei dem einen ist mit diesem Fenster eine Zahl verknüpft, bei dem anderen ein Preis. Das sind unterschiedliche Arten von Belegen, und die Kluft zwischen ihnen ist das Einzige, worum es bei diesem Vergleich tatsächlich geht.
