Een gegenereerde hero-titelkaart met de tekst 'LongCat-2.5-Preview vs Grok 4.6', met daarboven de overline 'De een heeft een benchmarkkaart, de ander heeft een opvolger', en twee panelen: 'LongCat-2.5-Preview: 1M context, geen retentie via OpenCode' en 'Grok 4.6: AA Coding 76.8, Grok 4.7 al uitgebracht'. OrcaRouter-logo rechtsonder.
Guides & Insights

LongCat-2.5-Preview vs Grok 4.6: de een heeft een benchmarkkaart, de ander een opvolger

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het vergelijken van LongCat-2.5-Preview met Grok 4.6 is ongemakkelijk om een reden die niets te maken heeft met de kwaliteit van een van beide modellen: de vraag heeft een houdbaarheidsdatum. Grok 4.6 verscheen op 12 augustus 2026 en Grok 4.7 verscheen op 21 september 2026 — zes dagen voordat dit wordt geschreven — tegen dezelfde tarieven van $2,00 / $6,00 per miljoen en hetzelfde contextvenster van 500.000 tokens. LongCat-2.5-Preview verscheen ondertussen op 25 september 2026 op het LongCat API Platform van Meituan, zonder aangekondigde opvolger in zicht en zonder enige gepubliceerde benchmark. De echte keuze is dus niet "welk model is beter". Het is of je een gemeten capaciteit wilt met een gemeten opvolger die er al achter staat, of iets ongemeten dat in ieder geval het actuele is.

Die framing is minder spannend dan een scorebord en aanzienlijk nuttiger.

Begin met wat Grok 4.6 daadwerkelijk in het dossier heeft.

Grok 4.6 is een goed gedocumenteerd model. In onze catalogus heeft het een contextvenster van 500.000 tokens, tekst-, afbeeldings- en bestandsinvoer, en een tariefkaart van $2,00 per miljoen invoertokens, $6,00 per miljoen uitvoertokens en $0,50 per miljoen gecachte invoertokens, oplopend naar $4,00 en $12,00 boven 200.000 invoertokens. Het onafhankelijke profiel van Artificial Analysis bevat een Coding Index van 76,8 — vijfde onder de modellen die die index bijhoudt — een Intelligence Index van 44,3 op de achttiende plaats, GPQA Diamond op 94,9 %, Humanity's Last Exam op 42,9 %, SciCode op 56,5 %, Terminal-Bench v2.1 op 88,4 en τ²-Bench voor bankieren op 50,7. De Long-Context Recall ervan is 80,3.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview heeft niets van dat alles. De changelog-vermelding van Meituan voor 25 september 2026 is een gedateerde beschikbaarheidsmelding die drie beweerde capaciteiten opsomt — beeldbegrip, coderen en compatibiliteit met "Claude Code en andere gangbare ontwikkelomgevingen", waaronder Hermes, OpenClaw, OpenCode en Kilo Code — en niets dat op een resultaat lijkt. De prijzenpagina van de leverancier vermeldt $0,30 per miljoen niet-gecachte input, $0,006 per miljoen gecachte input en $1,20 per miljoen output, expliciet gemarkeerd als een tijdelijke korting. Het contextvenster is 1.000.000 tokens; de maximale output is 131.072. Het aantal van ongeveer 1,6 biljoen totale / 48 miljard actieve parameters is afkomstig uit de sitemetadata van Meituan en Chinese vakpers, niet uit documentatie. Er is geen repository voor op HuggingFace of in de GitHub-organisatie van Meituan, en de catalogusmetadata die OpenCode meelevert, registreert open weights als false.

De dimensie die een scorebord volledig zou missen

Deze twee modellen verschillen op een punt dat geen enkele benchmark meet, en voor veel teams beslist dat punt de vraag op zichzelf: wat er gebeurt met de prompts die je verstuurt.

De eigen documentatie van OpenCode stelt dat LongCat 2.5 Preview Free wordt geleverd door een provider die een zero-retentionbeleid volgt en je data niet voor training gebruikt; de Zen-privacytabel maakt het concreet met cijfers — modeltraining "Niet gebruikt", dataretentie "0 dagen". Dezelfde privacytabel vermeldt een bewaartermijn van dertig dagen voor Grok 4.6 en Grok 4.7. Beide uitspraken zijn van OpenCode, gepubliceerd op de pagina's van OpenCode, en ze beschrijven specifiek de gratis vermelding en de vergelijkingsvermelding. Maar als je een agent op een privérepository richt, is dat het verschil tussen een gesprek dat je niet met de juridische afdeling hoeft te voeren en een gesprek dat je wel moet voeren — en het heeft niets te maken met welk model beter scoort op SciCode.

A screenshot of OrcaRouter's own model page for xAI Grok 4.6 at /models/grok/grok-4.6, showing the grok/grok-4.6 identifier, a 500K-token context window, text + image + file input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-08-12, $2.00 and $6.00 rate tiles, and a performance strip whose first-token and token-traffic tiles both read 'Collecting' rather than a figure. The page copy describes Grok 4.6 as the current flagship of the Grok line and cites a headline GPQA Diamond score of 94.9.

Wat "measured" je wel en niet oplevert

De cijfers van Grok 4.6 zijn beter dan die van LongCat-2.5-Preview in de enige zin die hier telt: ze bestaan. Dat is niet hetzelfde als zeggen dat Grok 4.6 het betere model is. De Coding Index van 76,8 ligt onder die van de generatie van Grok 4.7, en het model waartegen het werd gemeten is niet langer de top van zijn eigen familie. De gepubliceerde opvolger ervan heeft een Intelligence Index van 46,4 tegenover de 44,3 van Grok 4.6, en een Long-Context Recall van 76,67 tegenover de 80,33 van Grok 4.6 — dus de opvolger is niet op alle assen beter, en dat is precies het soort detail dat een generatienummer verbergt.

Er is ook een live-serving-voorbehoud dat het waard is om ronduit te stellen, omdat het indruist tegen de flatterende lezing voor beide modellen. In onze eigen zevendaagse playground-steekproef registreerde Grok 4.6 geen gemeten doorvoer en geen tokenverkeer, wat in die kolom uitziet als ontbrekende data in plaats van een prestatieoordeel. LongCat-2.5-Preview heeft helemaal geen serving-steekproef van ons, omdat we het niet routeren. Elke latentievergelijking tussen deze twee is dus eenzijdig op een manier die proza doorgaans verdoezelt: je kunt geen model benchmarken waar je geen verkeer naartoe stuurt.

Waar de routeringslaag hier daadwerkelijk helpt

Drie van de bovenstaande feiten zijn van het soort waarvoor een router is gebouwd, en niet slechts van het soort waarmee hij compatibel is. De tariefkaart van Grok 4.6 gaat omhoog boven 200.000 invoertokens, dus dezelfde logische taak kan tegen twee verschillende tarieven worden gefactureerd, afhankelijk van een getal dat je applicatie al kent voordat er iets wordt verzonden. Grok 4.6 heeft een gepubliceerde opvolger tegen identieke tarieven, wat betekent dat de overstap van de een naar de ander een wijziging van één regel zou moeten zijn en nooit een herintegratie. En de meest aantrekkelijke eigenschap van LongCat-2.5-Preview — de prijs — wordt door de leverancier expliciet als tijdelijk bestempeld.

Op OrcaRouter bieden we Grok 4.6 aan tegen xAI's lijstprijs met nul opslag, zodat een tariefwijziging van een leverancier je factuur dezelfde dag bereikt in plaats van bij de volgende verlenging, en automatische failover verplaatst een gedegradeerd verzoek naar een gezonde provider zonder dat je code weet welke heeft geantwoord. Een routerings-DSL dekt het geval van getrapte prijsstelling direct, en modelfusie dekt het geval waarin het model dat je wilt voor het lange leeswerk niet het model is dat je wilt voor de uiteindelijke synthese. LongCat-2.5-Preview is geen van onze routes — we serveren het niet, en niets hier beweert het tegendeel. Het doel van het noemen daarvan is niet om je ergens anders naartoe te routeren; het is dat een model dat je aan het evalueren bent in plaats van het te draaien achter dezelfde sleutel hoort als de modellen die je draait, zodat het evalueren ervan een configuratie-item kost in plaats van een project.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Grok 4.6' with the subhead 'One model has a measured card and a measured successor; the other has a rate card'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, data retention 0 days on the free listing per OpenCode. Right column 'Grok 4.6' (xAI, released 2026-08-12, successor shipped 2026-09-21): 500,000-token context, max output not published, text, image and file to text, $2.00 input up to 200K then $4.00, $6.00 output up to 200K then $12.00, coding index 76.8 at rank 5 by Artificial Analysis, long-context recall 80.33, data retention 30 days on the comparison listing per OpenCode. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Hoe te beslissen

• Kies Grok 4.6 als je een antwoord nodig hebt dat je kunt verdedigen. Het heeft een onafhankelijke kaart, een gedocumenteerd invoerprofiel en een prijs die niet vervalt. Het grootste risico is niet de kwaliteit, maar de relevantie: Grok 4.7 bestaat tegen dezelfde tarieven, en de kosten van uit inertie op 4.6 blijven zijn het verschil tussen een Intelligence Index van 44,3 en 46,4 dat je niet had hoeven betalen.

• Kies LongCat-2.5-Preview als de beslissende factor retentie of bereik is. Zero-retentietoegang via OpenCode, een venster van een miljoen tokens, een uitvoerplafond van 131.072 tokens en een tariefkaart die ongeveer een zevende bedraagt van die van Grok 4.6 zijn echte voordelen — het eerste daarvan geverifieerd door het privacybeleid van een derde partij, de rest alleen beweerd door de leverancier.

• Kies niet tussen hen op basis van een benchmarktabel, want er bestaat er maar één. De codeerscore van 76,8 en de langecontext-recall van 80,3 van Grok 4.6 beschrijven Grok 4.6. Niets beschrijft LongCat-2.5-Preview nog. Iedereen die deze week een LongCat-2.5-Preview-score naast een Grok 4.6-score afdrukt, citeert ofwel een ander LongCat-model of verzint het getal.

• Verifieer de inputkant voordat je erop voortbouwt. De changelog van Meituan begint met beeldbegrip, maar het voorbeeldantwoord in hun eigen "Retrieve Model"-documentatie toont nog steeds input_modalities als ["text"] met een text->text-modaliteitsstring — een bewering van de leverancier tegenover een gepubliceerd contract dat iets anders zegt. Grok 4.6 accepteert tekst, afbeeldingen en bestanden zonder die dubbelzinnigheid. En controleer of je harness een tussengevoegd reasoning_content-veld toont voordat je iets concludeert over de redeneerkwaliteit van LongCat-2.5-Preview; een client die dat veld laat vallen, faalt stilletjes.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt