Eine generierte Hero-Titelkarte mit der Aufschrift „LongCat-2.5-Preview vs Grok 4.6“ und der Überzeile „Die eine hat eine Benchmark-Karte, die andere hat einen Nachfolger“, sowie zwei Panels: „LongCat-2.5-Preview: 1M Kontext, keine Speicherung über OpenCode“ und „Grok 4.6: AA Coding 76.8, Grok 4.7 bereits veröffentlicht“. OrcaRouter-Logo unten rechts.
Guides & Insights

LongCat-2.5-Preview vs. Grok 4.6: Einer hat eine Benchmark-Karte, der andere einen Nachfolger

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Der Vergleich von LongCat-2.5-Preview mit Grok 4.6 ist aus einem Grund unangenehm, der nichts mit der Qualität eines der beiden Modelle zu tun hat: Die Frage hat ein Verfallsdatum. Grok 4.6 erschien am 12. August 2026, und Grok 4.7 erschien am 21. September 2026 – sechs Tage, bevor dieser Text geschrieben wird – zu denselben Preisen von 2,00 $ / 6,00 $ pro Million und mit demselben Kontextfenster von 500.000 Token. LongCat-2.5-Preview wiederum landete am 25. September 2026 auf Meituans LongCat API Platform, ohne einen angekündigten Nachfolger in Sicht und ohne überhaupt einen veröffentlichten Benchmark. Die eigentliche Wahl ist also nicht „welches Modell besser ist“. Sondern ob Sie eine gemessene Fähigkeit wollen, hinter der bereits ein gemessener Nachfolger steht, oder eine ungemessene, die zumindest das derzeit Aktuelle ist.

Diese Rahmung ist weniger aufregend als eine Anzeigetafel und deutlich nützlicher.

Beginne mit dem, was Grok 4.6 tatsächlich gespeichert hat.

Grok 4.6 ist ein gut dokumentiertes Modell. In unserem Katalog verfügt es über ein Kontextfenster von 500.000 Token, Text-, Bild- und Dateieingabe sowie eine Preisliste von $2,00 pro Million Eingabe-Token, $6,00 pro Million Ausgabe-Token und $0,50 pro Million gecachte Eingabe-Token, die oberhalb von 200.000 Eingabe-Token auf $4,00 und $12,00 steigen. Sein unabhängiges Profil von Artificial Analysis umfasst einen Coding Index von 76,8 – fünfter unter den Modellen, die dieser Index erfasst –, einen Intelligence Index von 44,3 auf Platz 18, GPQA Diamond bei 94,9%, Humanity's Last Exam bei 42,9%, SciCode bei 56,5%, Terminal-Bench v2.1 bei 88,4 und τ²-Bench für Banking bei 50,7. Sein Long-Context Recall liegt bei 80,3.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview hat nichts davon. Der Changelog-Eintrag von Meituan für den 25. September 2026 ist eine datierte Verfügbarkeitsmitteilung, die drei beanspruchte Fähigkeiten auflistet — Bildverständnis, Programmieren und Kompatibilität mit „Claude Code und anderen gängigen Entwicklungsumgebungen“, darunter Hermes, OpenClaw, OpenCode und Kilo Code — und nichts, was einem Ergebnis ähnelt. Die Preisseite des Anbieters nennt 0,30 $ pro Million nicht zwischengespeicherter Eingabe, 0,006 $ pro Million zwischengespeicherter Eingabe und 1,20 $ pro Million Ausgabe, ausdrücklich als zeitlich begrenzter Rabatt gekennzeichnet. Das Kontextfenster beträgt 1.000.000 Token; die maximale Ausgabe 131.072. Die Angabe von insgesamt rund 1,6 Billionen / 48 Milliarden aktiven Parametern stammt aus den Metadaten der Meituan-Website und der chinesischen Fachpresse, nicht aus der Dokumentation. Es gibt kein Repository dafür auf HuggingFace oder in der GitHub-Organisation von Meituan, und die von OpenCode mitgelieferten Katalogmetadaten verzeichnen offene Gewichte als falsch.

Die Dimension, die eine Anzeigetafel völlig übersehen würde

Diese beiden Modelle unterscheiden sich in einem Punkt, den kein Benchmark misst, und für viele Teams entscheidet genau er die Frage für sich allein: was mit den Prompts geschieht, die Sie senden.

OpenCodes eigene Dokumentation gibt an, dass LongCat 2.5 Preview Free von einem Anbieter bereitgestellt wird, der eine Null-Aufbewahrungsrichtlinie befolgt und Ihre Daten nicht für das Training verwendet; die Zen-Datenschutztabelle beziffert es – Modelltraining „Nicht verwendet“, Datenaufbewahrung „0 Tage“. Dieselbe Datenschutztabelle listet dreißig Tage Aufbewahrung für Grok 4.6 und Grok 4.7 auf. Beide Aussagen stammen von OpenCode, wurden auf OpenCodes Seiten veröffentlicht und beschreiben speziell das kostenlose Listing und das Vergleichslisting. Aber wenn Sie einen Agenten auf ein privates Repository richten, ist das der Unterschied zwischen einem Gespräch, das Sie nicht mit der Rechtsabteilung führen müssen, und einem, das Sie führen müssen – und es hat nichts damit zu tun, welches Modell bei SciCode besser abschneidet.

A screenshot of OrcaRouter's own model page for xAI Grok 4.6 at /models/grok/grok-4.6, showing the grok/grok-4.6 identifier, a 500K-token context window, text + image + file input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-08-12, $2.00 and $6.00 rate tiles, and a performance strip whose first-token and token-traffic tiles both read 'Collecting' rather than a figure. The page copy describes Grok 4.6 as the current flagship of the Grok line and cites a headline GPQA Diamond score of 94.9.

Was „gemessen" Ihnen bringt und was nicht

Die Zahlen von Grok 4.6 sind besser als die von LongCat-2.5-Preview in dem einzigen Sinne, der hier zählt: Sie existieren. Das ist nicht dasselbe wie die Aussage, dass Grok 4.6 das bessere Modell ist. Sein Coding Index von 76,8 liegt unter dem der Generation von Grok 4.7, und das Modell, gegen das es gemessen wurde, ist nicht mehr die Speerspitze seiner eigenen Familie. Sein veröffentlichter Nachfolger hat einen Intelligence Index von 46,4 gegenüber den 44,3 von Grok 4.6 und einen Long-Context Recall von 76,67 gegenüber den 80,33 von Grok 4.6 — der Nachfolger ist also nicht auf jeder Achse besser, und genau das ist die Art von Detail, die eine Generationsnummer verbirgt.

Es gibt außerdem einen Caveat beim Live-Serving, den man klar benennen sollte, denn er spricht gegen die schmeichelhafte Lesart für beide Modelle. In unserer eigenen siebentägigen Playground-Stichprobe verzeichnete Grok 4.6 keinen gemessenen Durchsatz und keinen Token-Traffic, was in dieser Spalte wie fehlende Daten aussieht und nicht wie ein Leistungsurteil. LongCat-2.5-Preview hat überhaupt keine Serving-Stichprobe von uns, weil wir es nicht routen. Jeder Latenzvergleich zwischen diesen beiden ist also in einer Weise einseitig, die Prosa gewöhnlich kaschiert: Man kann kein Modell benchmarken, an das man keinen Traffic sendet.

Wo die Routing-Schicht hier tatsächlich hilft

Drei der oben genannten Fakten sind genau die Art, für die ein Router gebaut ist, und nicht bloß eine, mit der er kompatibel ist. Die Preisliste von Grok 4.6 erhöht sich oberhalb von 200.000 Eingabe-Tokens, sodass dieselbe logische Aufgabe zu zwei unterschiedlichen Tarifen abgerechnet werden kann – je nach einer Zahl, die Ihre Anwendung bereits kennt, bevor sie irgendetwas sendet. Grok 4.6 hat einen veröffentlichten Nachfolger zu identischen Tarifen, was bedeutet, dass der Wechsel von einem zum anderen eine einzeilige Änderung sein sollte und niemals eine Neuintegration. Und die attraktivste Eigenschaft von LongCat-2.5-Preview — sein Preis — wird vom Anbieter ausdrücklich als vorübergehend gekennzeichnet.

Auf OrcaRouter bieten wir Grok 4.6 zum Listenpreis von xAI ohne Aufschlag an, sodass eine Preisänderung eines Anbieters noch am selben Tag auf Ihrer Rechnung ankommt und nicht erst zur nächsten Verlängerung, und automatisches Failover verlagert eine beeinträchtigte Anfrage zu einem gesunden Anbieter, ohne dass Ihr Code weiß, welcher geantwortet hat. Eine Routing-DSL deckt den Fall der gestaffelten Preisgestaltung direkt ab, und Modellfusion deckt den Fall ab, in dem das Modell, das Sie für das lange Lesen wollen, nicht das Modell ist, das Sie für die abschließende Synthese wollen. LongCat-2.5-Preview ist keine unserer Routen — wir bieten es nicht an, und nichts hier behauptet etwas anderes. Der Punkt, das zu erwähnen, ist nicht, Sie woandershin zu leiten; er ist, dass ein Modell, das Sie evaluieren statt ausführen, hinter demselben Schlüssel wie die Modelle, die Sie ausführen, gehören sollte, damit seine Evaluierung einen Konfigurationseintrag statt eines Projekts kostet.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Grok 4.6' with the subhead 'One model has a measured card and a measured successor; the other has a rate card'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, data retention 0 days on the free listing per OpenCode. Right column 'Grok 4.6' (xAI, released 2026-08-12, successor shipped 2026-09-21): 500,000-token context, max output not published, text, image and file to text, $2.00 input up to 200K then $4.00, $6.00 output up to 200K then $12.00, coding index 76.8 at rank 5 by Artificial Analysis, long-context recall 80.33, data retention 30 days on the comparison listing per OpenCode. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Wie man entscheidet

• Wählen Sie Grok 4.6, wenn Sie eine Antwort benötigen, die Sie verteidigen können. Es hat eine unabhängige Karte, ein dokumentiertes Eingabeprofil und einen Preis, der nicht abläuft. Das Hauptrisiko von Grok 4.6 ist nicht die Qualität, sondern die Relevanz: Grok 4.7 ist zu denselben Preisen verfügbar, und die Kosten, aus Trägheit bei 4.6 zu bleiben, sind die Differenz zwischen einem Intelligence Index von 44,3 und 46,4, die Sie nicht bezahlen mussten.

• Wählen Sie LongCat-2.5-Preview, wenn Datenaufbewahrung oder Reichweite den Ausschlag geben. Zugang ohne Datenaufbewahrung über OpenCode, ein Fenster von einer Million Token, eine Ausgabeobergrenze von 131.072 Token und eine Preisliste, die bei rund einem Siebtel der von Grok 4.6 liegt, sind echte Vorteile – wobei der erste durch die Datenschutzrichtlinie eines Dritten belegt ist und der Rest allein vom Anbieter behauptet wird.

• Wählen Sie nicht zwischen ihnen aufgrund einer Benchmark-Tabelle, denn es existiert nur eine. Grok 4.6s 76,8 Coding-Score und 80,3 Long-Context-Recall beschreiben Grok 4.6. Bisher beschreibt nichts LongCat-2.5-Preview. Wer diese Woche einen LongCat-2.5-Preview-Score neben einem Grok 4.6-Score veröffentlicht, zitiert entweder ein anderes LongCat-Modell oder erfindet die Zahl.

• Überprüfe die Eingabeseite, bevor du darauf aufbaust. Meituans Changelog beginnt mit Bildverständnis, doch die Beispielantwort in der eigenen „Retrieve Model“-Dokumentation zeigt weiterhin input_modalities als ["text"] mit einem text->text Modalitätsstring — vom Anbieter behauptet, entgegen einem veröffentlichten Vertrag, der etwas anderes sagt. Grok 4.6 akzeptiert Text, Bilder und Dateien ohne solche Mehrdeutigkeit. Und prüfe, dass dein Test-Harness ein verschachteltes reasoning_content Feld ausgibt, bevor du irgendetwas über die Reasoning-Qualität von LongCat-2.5-Preview schlussfolgerst; ein Client, der dieses Feld verwirft, wird still fehlschlagen.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert