
LongCat-2.5-Preview vs Kimi K3: De long-context-recallvraag die nog niemand kan beantwoorden
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 610 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 189 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Kimi K3 scoort 88,67 op Long-Context Recall. Dat is het hoogste cijfer van alle modellen in onze catalogus voor de specifieke vraag of een model nog steeds gebruikmaakt van informatie die diep in een lange invoer begraven zit. LongCat-2.5-Preview heeft helemaal geen Long-Context Recall-score — niet van Artificial Analysis, niet van Meituan, niet van wie dan ook. En LongCat-2.5-Preview is juist degene die een contextvenster van één miljoen tokens als belangrijkste kenmerk adverteert. Die discrepantie, een model waarvan de centrale claim lange context is en waarvoor geen enkele meting van lange context bestaat, vormt de hele kern van deze vergelijking. Al het andere is bijzaak.
Het is de moeite waard om precies te zijn over wat het ontbrekende getal wel en niet betekent, want het is gemakkelijk om van 'niet gemeten' naar 'waarschijnlijk slecht' af te glijden, en geen van beide richtingen wordt ondersteund.
Wat de twee modellen ieder publiekelijk hebben verklaard
Kimi K3 van MoonshotAI werd op 15 juli 2026 uitgebracht. Onze catalogus bevat het met een contextvenster van 1.048.576 tokens, tekst- en beeldinvoer, en een tariefkaart van $3,00 per miljoen invoertokens, $0,30 per miljoen gecachte invoer en $15,00 per miljoen uitvoer. Het onafhankelijke profiel van Artificial Analysis luidt: Coding Index 76,2, negende; Intelligence Index 43,6, negentiende; GPQA Diamond 93,5%; Humanity's Last Exam 46,9%; SciCode 59,5%; Terminal-Bench v2.1 85,0; τ²-Bench banking 46,0. En Long-Context Recall 88,67, de beste die we voeren.

De LongCat-2.5-Preview van Meituan verscheen op 25 september 2026 op het LongCat API Platform. De changelog-vermelding noemt drie beweerde capaciteiten — beeldbegrip, coderen en compatibiliteit met "Claude Code en andere gangbare dev-omgevingen", met vermelding van Hermes, OpenClaw, OpenCode en Kilo Code. De prijzenpagina vermeldt $0,30 per miljoen niet-gecachte input, $0,006 per miljoen gecachte input en $1,20 per miljoen output, gemarkeerd als een tijdelijke korting. Contextvenster 1.000.000; maximale output 131.072. Het cijfer van ~1,6 biljoen totaal / ~48 miljard actieve parameters komt uit de sitemetadata van Meituan en Chinese vakmedia, niet uit documentatie. Geen benchmarktabel, geen modelkaart, geen technisch rapport, geen repository op HuggingFace of in de GitHub-organisatie van Meituan, en catalogusmetadata die open weights als onwaar registreert.
Waarom het ontbrekende nummer hier meer uitmaakt dan in welke andere confrontatie dan ook
Long-Context Recall is voor deze twee modellen niet slechts één score onder vele. Het is de score die test wat ze allebei verkopen. Een contextvenster van één miljoen tokens is een uitspraak over architectuurcapaciteit; recall meet of het model een feit dat op token 900.000 staat in plaats van op token 900 nog kan ophalen en gebruiken. Leveranciers publiceren het eerste omdat het een specificatie is. Onafhankelijke beoordelaars publiceren het tweede omdat het een test is, en de meeste modellen presteren er niet zo goed op als hun venstergrootte suggereert.
Dus de eerlijke positie is nauwer dan het klinkt. Kimi K3's 88,67 betekent niet dat Kimi K3 het betere long-contextmodel is dan LongCat-2.5-Preview. Het betekent dat Kimi K3 degene is waarvoor de vraag is gesteld en beantwoord. LongCat-2.5-Preview zou beter kunnen zijn. Het zou aanzienlijk slechter kunnen zijn. Het punt is dat niemand buiten Meituan het momenteel weet, en een 1M-venster dat op een prijspagina staat, is in geen van beide richtingen bewijs.

Het kostenplaatje, met dezelfde rekenkundige waarschuwing
Volgens de gepubliceerde tarieven is LongCat-2.5-Preview 10 keer goedkoper voor niet-gecachte input en 12,5 keer goedkoper voor output dan Kimi K3. Een leesbewerking van 500.000 tokens die 20.000 tokens terugschrijft, komt uit op ongeveer $1,80 bij Kimi K3 en ongeveer 17 cent bij LongCat-2.5-Preview. Beide zijn rekenwerk op basis van tariefkaartprijzen in plaats van metingen, en het LongCat-getal kent een extra voorbehoud dat het Kimi-getal niet kent: Meituan bestempelt zijn eigen tarief als een tijdelijke korting, dus welk getal de promotie overleeft, is onbekend.
Zet dat tegenover de dekkingskwestie. Als je een input van 500.000 tokens verwerkt en de recall van je model op die diepte is niet gemeten, dan is het kostenverschil geen besparing — het is de prijs van een onbekend faalpercentage. Een verzoek van 17 cent dat stilzwijgend de relevante sectie mist, is duurder dan een verzoek van $1,80 dat deze vindt, omdat je hoe dan ook betaalt voor de herhaling en het debuggen. Dit is de specifieke vorm van het risico, en daarom is de ontbrekende benchmark een kostenprobleem en niet alleen een marketingprobleem.
Wat te doen terwijl het nummer niet bestaat
Genereer je eigen. Dit is het zeldzame geval waarin het gratis venster echt goed past bij de leemte: LongCat-2.5-Preview kost niets om aan te roepen via OpenCode gedurende een periode van onbepaalde duur, met een zero-retentiebeleid dat OpenCode documenteert — modeltraining "Niet gebruikt", gegevensretentie "0 dagen" — wat betekent dat je het op een privé-repository kunt richten zonder eerst een gesprek over gegevensverwerking te voeren. Bouw een naald-in-een-hooiberg-test op de diepte die je daadwerkelijk gebruikt, voer die uit op beide modellen, en je hebt het cijfer dat geen van beide leveranciers heeft gepubliceerd. Twee dingen om te controleren voordat je het resultaat vertrouwt: dat je harnas het tussengevoegde reasoning_content veld dat het model retourneert, blootlegt, en dat beeldinvoer überhaupt werkt, aangezien Meituans changelog het beweert terwijl het eigen "Retrieve Model"-voorbeeld nog steeds toont: input_modalities als ["text"] met een text->text string.

OrcaRouters rol in deze
Wij leveren Kimi K3 tegen de lijstprijs van MoonshotAI, met nul opslag. LongCat-2.5-Preview is geen van onze routes — wij leveren het niet, en niets in dit stuk mag worden opgevat als de bewering dat we dat wel doen.
Voor deze specifieke vergelijking is het nuttige deel van een router niet de prijs. Het is dat het model dat je evalueert en het model waarop je vertrouwt achter dezelfde sleutel kunnen zitten. De 88,67 recall van Kimi K3 maakt het tot het model waar je vandaag een long-contextpass door zou routeren; LongCat-2.5-Preview is het model waartegen je het wilt testen, want als de recall standhoudt bij een twaalfde van de outputprijs, verandert de economie van werk met lange documenten. Modelfusie is het mechanisme dat dat concreet maakt in plaats van theoretisch: een long-context retrieval-pass en een laatste synthesestap kunnen twee verschillende modellen in één verzoek zijn, dus het goedkope ongemeten model en het dure gemeten model hoeven geen of-of-keuze te zijn. Dan is er automatische failover die het geval dekt waarin een van beide degradeert, wat meer dan gewoonlijk van belang is wanneer een van je twee kandidaten geen serveergeschiedenis heeft die je kunt inspecteren.
Het oordeel, uitgesproken met zijn eigen onzekerheid eraan verbonden.
Als je wilt dat werk met lange context deze week betrouwbaar is, is Kimi K3 de verdedigbare keuze: 88,67 recall is het beste beschikbare cijfer voor precies de capaciteit in kwestie, en het bredere profiel — Coding 76,2, Intelligence 43,6, GPQA Diamond 93,5% — is degelijk eerder dan spectaculair, en allemaal onafhankelijk onderbouwd. Als je bereid bent een middag te besteden aan het genereren van je eigen evaluatie, is LongCat-2.5-Preview de interessantere gok: een contextvenster van een miljoen tokens, een uitvoerplafond van 131.072 tokens, toegang zonder retentie en een tariefkaart die een orde van grootte onder die van Kimi K3 ligt, allemaal gebaseerd op claims van de leverancier die nog niemand publiekelijk heeft getest.
Wat niet te verdedigen is, is ze als gelijkwaardig behandelen omdat beide een miljoen tokens vermelden. Bij een van beide hangt een getal aan dat venster, en bij de andere hangt een prijs. Dat zijn verschillende soorten bewijs, en het gat daartussen is het enige waar deze vergelijking werkelijk over gaat.
