
LongCat-2.5-Preview vs Kimi K3: Frågan om återkallning i långa kontexter som ingen ännu kan svara på
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 610 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 189 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Kimi K3 får 88,67 på Long-Context Recall. Det är den högsta siffran bland alla modeller i vår katalog för den specifika frågan huruvida en modell fortfarande använder information som ligger djupt begravd i en lång inmatning. LongCat-2.5-Preview har ingen Long-Context Recall-poäng alls – från Artificial Analysis, från Meituan, från vem som helst. Och LongCat-2.5-Preview är den som marknadsför ett fönster på en miljon tokens som sin främsta funktion. Den diskrepansen, en modell vars centrala påstående är lång kontext och för vilken ingen långkontextmätning finns, är hela kärnan i den här jämförelsen. Allt annat är sekundärt.
Det är värt att vara noggrann med vad den saknade siffran betyder och inte betyder, eftersom det är lätt att glida från ”ouppmätt” till ”förmodligen dåligt”, och ingen av riktningarna stöds.
Vad de två modellerna var och en förde till protokollet
MoonshotAI:s Kimi K3 släpptes den 15 juli 2026. Vår katalog har den med ett kontextfönster på 1 048 576 token, text- och bildinmatning samt en prislista på 3,00 USD per miljon indata-token, 0,30 USD per miljon cachade indata och 15,00 USD per miljon utdata. Dess oberoende profil från Artificial Analysis visar: Coding Index 76,2, nionde plats; Intelligence Index 43,6, nittonde plats; GPQA Diamond 93,5 %; Humanity's Last Exam 46,9 %; SciCode 59,5 %; Terminal-Bench v2.1 85,0; τ²-Bench banking 46,0. Och Long-Context Recall 88,67, det bästa vi erbjuder.

Meituans LongCat-2.5-Preview dök upp på LongCat API Platform den 25 september 2026. Posten i ändringsloggen anger tre påstådda förmågor – bildförståelse, kodning och kompatibilitet med "Claude Code och andra vanliga utvecklingsmiljöer", och listar Hermes, OpenClaw, OpenCode och Kilo Code. Prissidan anger $0.30 per miljon ocachad indata, $0.006 per miljon cachad indata och $1.20 per miljon utdata, markerat som en tidsbegränsad rabatt. Kontextfönster 1 000 000; maximal utdata 131 072. Siffran ~1,6T totalt / ~48B aktiva parametrar kommer från Meituans webbplatsmetadata och kinesisk branschpress, inte från dokumentation. Ingen benchmarktabell, inget modellkort, ingen teknisk rapport, inget repo på HuggingFace eller i Meituans GitHub-organisation, och katalogmetadata som anger öppna vikter som falskt.
Varför det saknade numret spelar större roll här än i någon annan match
Long-Context Recall är inte en poäng bland många för dessa två modeller. Det är poängen som testar det de båda säljer. Ett fönster på en miljon token är ett påstående om arkitektonisk kapacitet; recall mäter huruvida modellen fortfarande kan hämta och använda ett faktum som placerats vid token 900 000 i stället för token 900. Leverantörer publicerar den första eftersom den är en specifikation. Oberoende utvärderare publicerar den andra eftersom den är ett test, och de flesta modeller presterar inte lika bra på det som deras fönsterstorlek antyder.
Så den ärliga hållningen är snävare än den låter. Kimi K3:s 88,67 innebär inte att Kimi K3 är den bättre långkontextmodellen jämfört med LongCat-2.5-Preview. Det betyder att Kimi K3 är den för vilken frågan har ställts och besvarats. LongCat-2.5-Preview skulle kunna vara bättre. Den skulle kunna vara betydligt sämre. Poängen är att ingen utanför Meituan för närvarande vet, och ett 1M-fönster tryckt på en prissida utgör inte bevis i någon riktning.

Kostnadsbilden, med samma aritmetiska varning
Enligt publicerade priser är LongCat-2.5-Preview 10 gånger billigare för ocachad indata och 12,5 gånger billigare för utdata än Kimi K3. En läsning på 500 000 token som skriver tillbaka 20 000 token uppgår till ungefär 1,80 dollar på Kimi K3 och ungefär 17 cent på LongCat-2.5-Preview. Båda är beräkningar utifrån prislistepriser snarare än mätningar, och LongCat-siffran har en extra varning som Kimi-siffran inte har: Meituan betecknar sin egen taxa som en tidsbegränsad rabatt, så siffran som kvarstår efter kampanjen är okänd.
Ställ det mot täckningsfrågan. Om du bearbetar en indata på 500 000 tokens och din modells recall på det djupet är omätt, är kostnadsskillnaden inte en besparing — det är priset för en okänd felfrekvens. En begäran på 17 cent som tyst missar det relevanta avsnittet är dyrare än en begäran på 1,80 dollar som hittar det, eftersom du ändå betalar för omkörningen och felsökningen. Det här är riskens specifika form, och det är därför den saknade benchmarken är ett kostnadsproblem och inte bara ett marknadsföringsproblem.
Vad ska man göra medan numret inte finns
Skapa din egen. Detta är det sällsynta fallet där det kostnadsfria fönstret verkligen är väl lämpat för gapet: LongCat-2.5-Preview kostar ingenting att anropa via OpenCode under en period av oangiven längd, med en nollretentionspolicy som OpenCode dokumenterar — modellträning "Not used", datalagring "0 days" — vilket innebär att du kan rikta den mot ett privat repo utan att först föra ett samtal om databehandling. Bygg ett nål-i-höstack-test på det djup du faktiskt använder, kör det på båda modellerna, och du kommer att ha den siffra som ingen av leverantörerna har publicerat. Två saker att kontrollera innan du litar på resultatet: att din testrigg fångar upp det interfolierade reasoning_content-fältet som modellen returnerar, och att bildinmatning fungerar överhuvudtaget, eftersom Meituans ändringslogg påstår det medan deras eget "Retrieve Model"-exempel fortfarande visar input_modalities som ["text"] med en text->text-sträng.

OrcaRouters del i den här
Vi serverar Kimi K3 till MoonshotAI:s listpris med noll påslag. LongCat-2.5-Preview är inte en av våra rutter — vi serverar den inte, och ingenting i den här texten bör läsas som att vi påstår att vi gör det.
För just den här jämförelsen är det användbara med en router inte priset. Det är att modellen du utvärderar och modellen du förlitar dig på kan ligga bakom samma nyckel. Kimi K3:s recall på 88,67 gör den till modellen du i dag skulle routa en long-context-körning genom; LongCat-2.5-Preview är modellen du vill testa mot den, för om dess recall håller vid en tolftedel av utdatapriset förändras ekonomin för arbete med långa dokument. Modellfusion är mekanismen som gör det konkret i stället för teoretiskt: en long-context-retrieval-körning och ett avslutande syntessteg kan vara två olika modeller i en och samma förfrågan, så den billiga omätta modellen och den dyra uppmätta behöver inte vara ett antingen-eller. Automatisk failover i sin tur täcker fallet där en av dem försämras, vilket spelar större roll än vanligt när en av dina två kandidater saknar serveringshistorik som du kan granska.
Domen, uttalad med sin egen osäkerhet bifogad.
Om du behöver att arbete med lång kontext ska vara tillförlitligt den här veckan är Kimi K3 det försvarbara valet: 88.67 i recall är det bästa tillgängliga värdet för den exakta förmågan i fråga, och dess bredare profil – Coding 76.2, Intelligence 43.6, GPQA Diamond 93.5 % – är solid snarare än spektakulär, och allt är oberoende källbelagt. Om du är villig att lägga en eftermiddag på att generera din egen utvärdering är LongCat-2.5-Preview det mer intressanta vadet: ett fönster på en miljon token, ett tak för utdata på 131,072 token, åtkomst utan datalagring och en prislista en storleksordning under Kimi K3:s, och allt detta vilar på leverantörens påståenden som ingen ännu har testat offentligt.
Det som inte är försvarbart är att behandla dem som likvärdiga eftersom båda listar en miljon tokens. Den ena har en siffra kopplad till det fönstret, och den andra har ett pris. Det är olika typer av bevis, och gapet mellan dem är det enda som den här jämförelsen egentligen handlar om.
