Een gegenereerde hero-titelkaart met de tekst 'LongCat-2.5-Preview vs Kimi K3', met daarboven de regel 'De kwestie van long-context recall', en twee panelen: 'LongCat-2.5-Preview: 1M context, recall-score niet gepubliceerd' en 'Kimi K3: AA Long-Context Recall 88.67, de hoogste die wij aanbieden'. OrcaRouter-logo rechtsonder.
Engineering & Research

LongCat-2.5-Preview vs Kimi K3: De long-context-recallvraag die nog niemand kan beantwoorden

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Kimi K3 scoort 88,67 op Long-Context Recall. Dat is het hoogste cijfer van alle modellen in onze catalogus voor de specifieke vraag of een model nog steeds gebruikmaakt van informatie die diep in een lange invoer begraven zit. LongCat-2.5-Preview heeft helemaal geen Long-Context Recall-score — niet van Artificial Analysis, niet van Meituan, niet van wie dan ook. En LongCat-2.5-Preview is juist degene die een contextvenster van één miljoen tokens als belangrijkste kenmerk adverteert. Die discrepantie, een model waarvan de centrale claim lange context is en waarvoor geen enkele meting van lange context bestaat, vormt de hele kern van deze vergelijking. Al het andere is bijzaak.

Het is de moeite waard om precies te zijn over wat het ontbrekende getal wel en niet betekent, want het is gemakkelijk om van 'niet gemeten' naar 'waarschijnlijk slecht' af te glijden, en geen van beide richtingen wordt ondersteund.

Wat de twee modellen ieder publiekelijk hebben verklaard

Kimi K3 van MoonshotAI werd op 15 juli 2026 uitgebracht. Onze catalogus bevat het met een contextvenster van 1.048.576 tokens, tekst- en beeldinvoer, en een tariefkaart van $3,00 per miljoen invoertokens, $0,30 per miljoen gecachte invoer en $15,00 per miljoen uitvoer. Het onafhankelijke profiel van Artificial Analysis luidt: Coding Index 76,2, negende; Intelligence Index 43,6, negentiende; GPQA Diamond 93,5%; Humanity's Last Exam 46,9%; SciCode 59,5%; Terminal-Bench v2.1 85,0; τ²-Bench banking 46,0. En Long-Context Recall 88,67, de beste die we voeren.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

De LongCat-2.5-Preview van Meituan verscheen op 25 september 2026 op het LongCat API Platform. De changelog-vermelding noemt drie beweerde capaciteiten — beeldbegrip, coderen en compatibiliteit met "Claude Code en andere gangbare dev-omgevingen", met vermelding van Hermes, OpenClaw, OpenCode en Kilo Code. De prijzenpagina vermeldt $0,30 per miljoen niet-gecachte input, $0,006 per miljoen gecachte input en $1,20 per miljoen output, gemarkeerd als een tijdelijke korting. Contextvenster 1.000.000; maximale output 131.072. Het cijfer van ~1,6 biljoen totaal / ~48 miljard actieve parameters komt uit de sitemetadata van Meituan en Chinese vakmedia, niet uit documentatie. Geen benchmarktabel, geen modelkaart, geen technisch rapport, geen repository op HuggingFace of in de GitHub-organisatie van Meituan, en catalogusmetadata die open weights als onwaar registreert.

Waarom het ontbrekende nummer hier meer uitmaakt dan in welke andere confrontatie dan ook

Long-Context Recall is voor deze twee modellen niet slechts één score onder vele. Het is de score die test wat ze allebei verkopen. Een contextvenster van één miljoen tokens is een uitspraak over architectuurcapaciteit; recall meet of het model een feit dat op token 900.000 staat in plaats van op token 900 nog kan ophalen en gebruiken. Leveranciers publiceren het eerste omdat het een specificatie is. Onafhankelijke beoordelaars publiceren het tweede omdat het een test is, en de meeste modellen presteren er niet zo goed op als hun venstergrootte suggereert.

Dus de eerlijke positie is nauwer dan het klinkt. Kimi K3's 88,67 betekent niet dat Kimi K3 het betere long-contextmodel is dan LongCat-2.5-Preview. Het betekent dat Kimi K3 degene is waarvoor de vraag is gesteld en beantwoord. LongCat-2.5-Preview zou beter kunnen zijn. Het zou aanzienlijk slechter kunnen zijn. Het punt is dat niemand buiten Meituan het momenteel weet, en een 1M-venster dat op een prijspagina staat, is in geen van beide richtingen bewijs.

A screenshot of OrcaRouter's own model page for MoonshotAI Kimi K3 at /models/kimi/kimi-k3, showing the kimi/kimi-k3 identifier, a 1M-token context window, text + image input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-07-15, a p50 first-token figure of 8.24 s, $3.00 and $15.00 rate tiles, and the OpenAI-compatible code samples.

Het kostenplaatje, met dezelfde rekenkundige waarschuwing

Volgens de gepubliceerde tarieven is LongCat-2.5-Preview 10 keer goedkoper voor niet-gecachte input en 12,5 keer goedkoper voor output dan Kimi K3. Een leesbewerking van 500.000 tokens die 20.000 tokens terugschrijft, komt uit op ongeveer $1,80 bij Kimi K3 en ongeveer 17 cent bij LongCat-2.5-Preview. Beide zijn rekenwerk op basis van tariefkaartprijzen in plaats van metingen, en het LongCat-getal kent een extra voorbehoud dat het Kimi-getal niet kent: Meituan bestempelt zijn eigen tarief als een tijdelijke korting, dus welk getal de promotie overleeft, is onbekend.

Zet dat tegenover de dekkingskwestie. Als je een input van 500.000 tokens verwerkt en de recall van je model op die diepte is niet gemeten, dan is het kostenverschil geen besparing — het is de prijs van een onbekend faalpercentage. Een verzoek van 17 cent dat stilzwijgend de relevante sectie mist, is duurder dan een verzoek van $1,80 dat deze vindt, omdat je hoe dan ook betaalt voor de herhaling en het debuggen. Dit is de specifieke vorm van het risico, en daarom is de ontbrekende benchmark een kostenprobleem en niet alleen een marketingprobleem.

Wat te doen terwijl het nummer niet bestaat

Genereer je eigen. Dit is het zeldzame geval waarin het gratis venster echt goed past bij de leemte: LongCat-2.5-Preview kost niets om aan te roepen via OpenCode gedurende een periode van onbepaalde duur, met een zero-retentiebeleid dat OpenCode documenteert — modeltraining "Niet gebruikt", gegevensretentie "0 dagen" — wat betekent dat je het op een privé-repository kunt richten zonder eerst een gesprek over gegevensverwerking te voeren. Bouw een naald-in-een-hooiberg-test op de diepte die je daadwerkelijk gebruikt, voer die uit op beide modellen, en je hebt het cijfer dat geen van beide leveranciers heeft gepubliceerd. Twee dingen om te controleren voordat je het resultaat vertrouwt: dat je harnas het tussengevoegde reasoning_content veld dat het model retourneert, blootlegt, en dat beeldinvoer überhaupt werkt, aangezien Meituans changelog het beweert terwijl het eigen "Retrieve Model"-voorbeeld nog steeds toont: input_modalities als ["text"] met een text->text string.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Kimi K3' with the subhead 'The one model advertising a long window is the one with no recall score'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, long-context recall not published by anyone, coding index not published, no repo and catalogue open_weights false. Right column 'Kimi K3' (MoonshotAI, released 2026-07-15, independently scored): 1,048,576-token context, max output not published, text and image to text, $3.00 uncached / $0.30 cached input, $15.00 output, long-context recall 88.67 described as the highest we carry, coding index 76.2 at rank 9 and intelligence index 43.6 at rank 19 by Artificial Analysis. The footnote adds that a 500,000-token read writing 20,000 tokens back is roughly $1.80 on Kimi K3 against roughly 17 cents on LongCat-2.5-Preview at its published promotional rate. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

OrcaRouters rol in deze

Wij leveren Kimi K3 tegen de lijstprijs van MoonshotAI, met nul opslag. LongCat-2.5-Preview is geen van onze routes — wij leveren het niet, en niets in dit stuk mag worden opgevat als de bewering dat we dat wel doen.

Voor deze specifieke vergelijking is het nuttige deel van een router niet de prijs. Het is dat het model dat je evalueert en het model waarop je vertrouwt achter dezelfde sleutel kunnen zitten. De 88,67 recall van Kimi K3 maakt het tot het model waar je vandaag een long-contextpass door zou routeren; LongCat-2.5-Preview is het model waartegen je het wilt testen, want als de recall standhoudt bij een twaalfde van de outputprijs, verandert de economie van werk met lange documenten. Modelfusie is het mechanisme dat dat concreet maakt in plaats van theoretisch: een long-context retrieval-pass en een laatste synthesestap kunnen twee verschillende modellen in één verzoek zijn, dus het goedkope ongemeten model en het dure gemeten model hoeven geen of-of-keuze te zijn. Dan is er automatische failover die het geval dekt waarin een van beide degradeert, wat meer dan gewoonlijk van belang is wanneer een van je twee kandidaten geen serveergeschiedenis heeft die je kunt inspecteren.

Het oordeel, uitgesproken met zijn eigen onzekerheid eraan verbonden.

Als je wilt dat werk met lange context deze week betrouwbaar is, is Kimi K3 de verdedigbare keuze: 88,67 recall is het beste beschikbare cijfer voor precies de capaciteit in kwestie, en het bredere profiel — Coding 76,2, Intelligence 43,6, GPQA Diamond 93,5% — is degelijk eerder dan spectaculair, en allemaal onafhankelijk onderbouwd. Als je bereid bent een middag te besteden aan het genereren van je eigen evaluatie, is LongCat-2.5-Preview de interessantere gok: een contextvenster van een miljoen tokens, een uitvoerplafond van 131.072 tokens, toegang zonder retentie en een tariefkaart die een orde van grootte onder die van Kimi K3 ligt, allemaal gebaseerd op claims van de leverancier die nog niemand publiekelijk heeft getest.

Wat niet te verdedigen is, is ze als gelijkwaardig behandelen omdat beide een miljoen tokens vermelden. Bij een van beide hangt een getal aan dat venster, en bij de andere hangt een prijs. Dat zijn verschillende soorten bewijs, en het gat daartussen is het enige waar deze vergelijking werkelijk over gaat.