
LongCat-2.5-Preview vs Grok 4.6: Den ena har ett benchmark-kort, den andra har en efterträdare
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 610 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 189 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Att jämföra LongCat-2.5-Preview med Grok 4.6 är besvärligt av en anledning som inte har något att göra med någon av modellernas kvalitet: frågan har ett bäst-före-datum. Grok 4.6 släpptes den 12 augusti 2026 och Grok 4.7 släpptes den 21 september 2026 — sex dagar innan detta skrivs — till samma priser på 2,00 / 6,00 dollar per miljon och samma kontextfönster på 500 000 token. LongCat-2.5-Preview landade under tiden på Meituans LongCat API-plattform den 25 september 2026 utan någon annonserad efterträdare i sikte och inget publicerat benchmark alls. Så det verkliga valet är inte "vilken modell som är bättre". Det är huruvida du vill ha en uppmätt förmåga med en uppmätt efterträdare som redan står bakom den, eller en ouppmätt sådan som åtminstone är det aktuella.
Den inramningen är mindre spännande än en resultattavla och betydligt mer användbar.
Börja med vad Grok 4.6 faktiskt har i sina register
Grok 4.6 är en väl dokumenterad modell. I vår katalog har den ett kontextfönster på 500 000 token, text-, bild- och filinmatning samt en prislista på 2,00 USD per miljon indatatoken, 6,00 USD per miljon utdatatoken och 0,50 USD per miljon cachade indatatoken, med en stegring till 4,00 och 12,00 USD över 200 000 indatatoken. Dess oberoende profil från Artificial Analysis omfattar ett Coding Index på 76,8 – femte bland de modeller som indexet följer – ett Intelligence Index på 44,3 på artonde plats, GPQA Diamond på 94,9 %, Humanity's Last Exam på 42,9 %, SciCode på 56,5 %, Terminal-Bench v2.1 på 88,4 och τ²-Bench för bankverksamhet på 50,7. Dess Long-Context Recall är 80,3.

LongCat-2.5-Preview har inget av det. Meituans ändringsloggspost för 25 september 2026 är ett daterat tillgänglighetsmeddelande som listar tre påstådda förmågor – bildförståelse, kodning och kompatibilitet med "Claude Code och andra vanliga utvecklingsmiljöer", inklusive Hermes, OpenClaw, OpenCode och Kilo Code – och inget som liknar ett resultat. Leverantörens prissida anger $0,30 per miljon ocachad indata, $0,006 per miljon cachad indata och $1,20 per miljon utdata, uttryckligen markerat som en tidsbegränsad rabatt. Kontextfönstret är 1 000 000 tokens; maximal utdata är 131 072. Det ungefärliga parameterantalet på 1,6 biljoner totalt / 48 miljarder aktiva kommer från Meituans webbplatsmetadata och kinesisk branschbevakning snarare än dokumentation. Det finns inget repo för den på HuggingFace eller i Meituans GitHub-organisation, och katalogmetadata som OpenCode levererar registrerar öppna vikter som falskt.
Den dimension som en resultattavla helt och hållet skulle missa
Dessa två modeller skiljer sig åt i något som ingen benchmark mäter, och för många team avgör det frågan på egen hand: vad som händer med de prompter du skickar.
OpenCodes egen dokumentation anger att LongCat 2.5 Preview Free tillhandahålls av en leverantör som följer en nollretentionspolicy och inte använder dina data för träning; Zens integritetstabell sätter siffror på det – modellträning "Används inte", datalagring "0 dagar". Samma integritetstabell anger trettio dagars lagring för Grok 4.6 och Grok 4.7. Båda dessa påståenden är OpenCodes, publicerade på OpenCodes sidor, och de beskriver specifikt den kostnadsfria listningen och jämförelselistningen. Men om du riktar en agent mot ett privat kodarkiv är det skillnaden mellan ett samtal du inte behöver ha med juridikavdelningen och ett som du behöver ha – och det har ingenting att göra med vilken modell som får bättre resultat på SciCode.

Vad "measured" ger och inte ger dig
Grok 4.6:s siffror är bättre än LongCat-2.5-Preview:s i den enda bemärkelse som spelar roll här: de finns. Det är inte samma sak som att säga att Grok 4.6 är den bättre modellen. Dess Coding Index på 76,8 ligger under nivån för Grok 4.7-generationen, och modellen som den mättes mot är inte längre framkanten i sin egen familj. Dess publicerade efterträdare har ett Intelligence Index på 46,4 mot Grok 4.6:s 44,3, och en Long-Context Recall på 76,67 mot Grok 4.6:s 80,33 — så efterträdaren är inte bättre på alla axlar, vilket är precis den typ av detalj som ett generationsnummer döljer.
Det finns också ett live-serving-förbehåll som är värt att säga rakt ut, eftersom det talar emot den smickrande tolkningen för båda modellerna. I vårt eget sjudagarssampel för playground registrerade Grok 4.6 ingen uppmätt genomströmning och ingen token-trafik, vilket är hur en avsaknad av data ser ut i den kolumnen snarare än en prestandadom. LongCat-2.5-Preview har inte något serving-sampel från oss alls, eftersom vi inte routar den. Så varje latensjämförelse mellan dessa två är ensidig på ett sätt som prosa vanligtvis slätar över: du kan inte benchmarka en modell som du inte skickar trafik till.
Där routningslagret faktiskt hjälper här
Tre av de fakta som nämns ovan är av det slag som en router är byggd för snarare än bara kompatibel med. Grok 4.6:s prislista trappas upp över 200 000 indatatoken, så samma logiska uppgift kan faktureras till två olika taxor beroende på ett tal som din applikation redan känner till innan den skickar något. Grok 4.6 har en publicerad efterträdare med identiska taxor, vilket innebär att bytet från den ena till den andra bör vara en ändring på en rad och aldrig en återintegration. Och LongCat-2.5-Previews mest attraktiva egenskap – priset – är uttryckligen märkt som tillfällig av leverantören.
På OrcaRouter erbjuder vi Grok 4.6 till xAI:s listpris med noll påslag, så en leverantörs prisändring når din faktura samma dag i stället för vid nästa förnyelse, och automatisk failover flyttar en degraderad begäran till en frisk leverantör utan att din kod vet vilken som svarade. Ett routing-DSL täcker fallet med nivåbaserad prissättning direkt, och modellfusion täcker fallet där modellen du vill ha för den långa läsningen inte är modellen du vill ha för den slutliga syntesen. LongCat-2.5-Preview är inte en av våra rutter — vi tillhandahåller den inte, och inget här påstår något annat. Poängen med att nämna det är inte att dirigera dig någon annanstans; det är att en modell som du utvärderar i stället för att köra hör hemma bakom samma nyckel som modellerna du kör, så att utvärdera den kostar en konfigurationspost i stället för ett projekt.

Hur man bestämmer
• Välj Grok 4.6 om du behöver ett svar du kan försvara. Den har ett oberoende kort, en dokumenterad indataprofil och ett pris som inte löper ut. Dess främsta risk är inte kvaliteten utan relevansen: Grok 4.7 finns till samma priser, och kostnaden för att stanna kvar på 4.6 av tröghet är skillnaden mellan ett Intelligence Index på 44.3 och 46.4 som du inte hade behövt betala för.
• Välj LongCat-2.5-Preview om den avgörande faktorn är dataretention eller räckvidd. Åtkomst utan dataretention via OpenCode, ett fönster på en miljon tokens, ett tak för utdata på 131 072 tokens och en prislista som är ungefär en sjundedel av Grok 4.6:s är verkliga fördelar — den första av dem verifierad genom en tredje parts integritetspolicy, resten enbart påstådd av leverantören själv.
• Välj inte mellan dem utifrån en benchmarktabell, för det finns bara en. Grok 4.6:s kodningspoäng på 76.8 och långkontextsåterkallelse på 80.3 beskriver Grok 4.6. Ingenting beskriver LongCat-2.5-Preview ännu. Den som den här veckan trycker en LongCat-2.5-Preview-poäng bredvid en Grok 4.6-poäng citerar antingen en annan LongCat-modell eller hittar på siffran.
• Verifiera indatasidan innan du bygger vidare på den. Meituans ändringslogg inleds med bildförståelse, men exempelsvaret i dess egen dokumentation för "Retrieve Model" visar fortfarande input_modalities som ["text"] med en text->text modalitetssträng — ett leverantörspåstående som motsägs av ett publicerat kontrakt. Grok 4.6 tar emot text, bilder och filer utan sådan tvetydighet. Och kontrollera att din testrigg exponerar ett interfolierat reasoning_content-fält innan du drar några slutsatser om resonemangskvaliteten hos LongCat-2.5-Preview; en klient som tappar det fältet kommer att misslyckas tyst.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
