Ett genererat hero-titelkort med texten ”LongCat-2.5-Preview vs Grok 4.6” och överraden ”Den ena har ett benchmark-kort, den andra har en efterträdare”, samt två paneler: ”LongCat-2.5-Preview: 1M kontext, noll retention via OpenCode” och ”Grok 4.6: AA Coding 76.8, Grok 4.7 har redan släppts”. OrcaRouter-logotyp nere till höger.
Guides & Insights

LongCat-2.5-Preview vs Grok 4.6: Den ena har ett benchmark-kort, den andra har en efterträdare

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Att jämföra LongCat-2.5-Preview med Grok 4.6 är besvärligt av en anledning som inte har något att göra med någon av modellernas kvalitet: frågan har ett bäst-före-datum. Grok 4.6 släpptes den 12 augusti 2026 och Grok 4.7 släpptes den 21 september 2026 — sex dagar innan detta skrivs — till samma priser på 2,00 / 6,00 dollar per miljon och samma kontextfönster på 500 000 token. LongCat-2.5-Preview landade under tiden på Meituans LongCat API-plattform den 25 september 2026 utan någon annonserad efterträdare i sikte och inget publicerat benchmark alls. Så det verkliga valet är inte "vilken modell som är bättre". Det är huruvida du vill ha en uppmätt förmåga med en uppmätt efterträdare som redan står bakom den, eller en ouppmätt sådan som åtminstone är det aktuella.

Den inramningen är mindre spännande än en resultattavla och betydligt mer användbar.

Börja med vad Grok 4.6 faktiskt har i sina register

Grok 4.6 är en väl dokumenterad modell. I vår katalog har den ett kontextfönster på 500 000 token, text-, bild- och filinmatning samt en prislista på 2,00 USD per miljon indatatoken, 6,00 USD per miljon utdatatoken och 0,50 USD per miljon cachade indatatoken, med en stegring till 4,00 och 12,00 USD över 200 000 indatatoken. Dess oberoende profil från Artificial Analysis omfattar ett Coding Index på 76,8 – femte bland de modeller som indexet följer – ett Intelligence Index på 44,3 på artonde plats, GPQA Diamond på 94,9 %, Humanity's Last Exam på 42,9 %, SciCode på 56,5 %, Terminal-Bench v2.1 på 88,4 och τ²-Bench för bankverksamhet på 50,7. Dess Long-Context Recall är 80,3.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview har inget av det. Meituans ändringsloggspost för 25 september 2026 är ett daterat tillgänglighetsmeddelande som listar tre påstådda förmågor – bildförståelse, kodning och kompatibilitet med "Claude Code och andra vanliga utvecklingsmiljöer", inklusive Hermes, OpenClaw, OpenCode och Kilo Code – och inget som liknar ett resultat. Leverantörens prissida anger $0,30 per miljon ocachad indata, $0,006 per miljon cachad indata och $1,20 per miljon utdata, uttryckligen markerat som en tidsbegränsad rabatt. Kontextfönstret är 1 000 000 tokens; maximal utdata är 131 072. Det ungefärliga parameterantalet på 1,6 biljoner totalt / 48 miljarder aktiva kommer från Meituans webbplatsmetadata och kinesisk branschbevakning snarare än dokumentation. Det finns inget repo för den på HuggingFace eller i Meituans GitHub-organisation, och katalogmetadata som OpenCode levererar registrerar öppna vikter som falskt.

Den dimension som en resultattavla helt och hållet skulle missa

Dessa två modeller skiljer sig åt i något som ingen benchmark mäter, och för många team avgör det frågan på egen hand: vad som händer med de prompter du skickar.

OpenCodes egen dokumentation anger att LongCat 2.5 Preview Free tillhandahålls av en leverantör som följer en nollretentionspolicy och inte använder dina data för träning; Zens integritetstabell sätter siffror på det – modellträning "Används inte", datalagring "0 dagar". Samma integritetstabell anger trettio dagars lagring för Grok 4.6 och Grok 4.7. Båda dessa påståenden är OpenCodes, publicerade på OpenCodes sidor, och de beskriver specifikt den kostnadsfria listningen och jämförelselistningen. Men om du riktar en agent mot ett privat kodarkiv är det skillnaden mellan ett samtal du inte behöver ha med juridikavdelningen och ett som du behöver ha – och det har ingenting att göra med vilken modell som får bättre resultat på SciCode.

A screenshot of OrcaRouter's own model page for xAI Grok 4.6 at /models/grok/grok-4.6, showing the grok/grok-4.6 identifier, a 500K-token context window, text + image + file input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-08-12, $2.00 and $6.00 rate tiles, and a performance strip whose first-token and token-traffic tiles both read 'Collecting' rather than a figure. The page copy describes Grok 4.6 as the current flagship of the Grok line and cites a headline GPQA Diamond score of 94.9.

Vad "measured" ger och inte ger dig

Grok 4.6:s siffror är bättre än LongCat-2.5-Preview:s i den enda bemärkelse som spelar roll här: de finns. Det är inte samma sak som att säga att Grok 4.6 är den bättre modellen. Dess Coding Index på 76,8 ligger under nivån för Grok 4.7-generationen, och modellen som den mättes mot är inte längre framkanten i sin egen familj. Dess publicerade efterträdare har ett Intelligence Index på 46,4 mot Grok 4.6:s 44,3, och en Long-Context Recall på 76,67 mot Grok 4.6:s 80,33 — så efterträdaren är inte bättre på alla axlar, vilket är precis den typ av detalj som ett generationsnummer döljer.

Det finns också ett live-serving-förbehåll som är värt att säga rakt ut, eftersom det talar emot den smickrande tolkningen för båda modellerna. I vårt eget sjudagarssampel för playground registrerade Grok 4.6 ingen uppmätt genomströmning och ingen token-trafik, vilket är hur en avsaknad av data ser ut i den kolumnen snarare än en prestandadom. LongCat-2.5-Preview har inte något serving-sampel från oss alls, eftersom vi inte routar den. Så varje latensjämförelse mellan dessa två är ensidig på ett sätt som prosa vanligtvis slätar över: du kan inte benchmarka en modell som du inte skickar trafik till.

Där routningslagret faktiskt hjälper här

Tre av de fakta som nämns ovan är av det slag som en router är byggd för snarare än bara kompatibel med. Grok 4.6:s prislista trappas upp över 200 000 indatatoken, så samma logiska uppgift kan faktureras till två olika taxor beroende på ett tal som din applikation redan känner till innan den skickar något. Grok 4.6 har en publicerad efterträdare med identiska taxor, vilket innebär att bytet från den ena till den andra bör vara en ändring på en rad och aldrig en återintegration. Och LongCat-2.5-Previews mest attraktiva egenskap – priset – är uttryckligen märkt som tillfällig av leverantören.

På OrcaRouter erbjuder vi Grok 4.6 till xAI:s listpris med noll påslag, så en leverantörs prisändring når din faktura samma dag i stället för vid nästa förnyelse, och automatisk failover flyttar en degraderad begäran till en frisk leverantör utan att din kod vet vilken som svarade. Ett routing-DSL täcker fallet med nivåbaserad prissättning direkt, och modellfusion täcker fallet där modellen du vill ha för den långa läsningen inte är modellen du vill ha för den slutliga syntesen. LongCat-2.5-Preview är inte en av våra rutter — vi tillhandahåller den inte, och inget här påstår något annat. Poängen med att nämna det är inte att dirigera dig någon annanstans; det är att en modell som du utvärderar i stället för att köra hör hemma bakom samma nyckel som modellerna du kör, så att utvärdera den kostar en konfigurationspost i stället för ett projekt.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Grok 4.6' with the subhead 'One model has a measured card and a measured successor; the other has a rate card'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, data retention 0 days on the free listing per OpenCode. Right column 'Grok 4.6' (xAI, released 2026-08-12, successor shipped 2026-09-21): 500,000-token context, max output not published, text, image and file to text, $2.00 input up to 200K then $4.00, $6.00 output up to 200K then $12.00, coding index 76.8 at rank 5 by Artificial Analysis, long-context recall 80.33, data retention 30 days on the comparison listing per OpenCode. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Hur man bestämmer

• Välj Grok 4.6 om du behöver ett svar du kan försvara. Den har ett oberoende kort, en dokumenterad indataprofil och ett pris som inte löper ut. Dess främsta risk är inte kvaliteten utan relevansen: Grok 4.7 finns till samma priser, och kostnaden för att stanna kvar på 4.6 av tröghet är skillnaden mellan ett Intelligence Index på 44.3 och 46.4 som du inte hade behövt betala för.

• Välj LongCat-2.5-Preview om den avgörande faktorn är dataretention eller räckvidd. Åtkomst utan dataretention via OpenCode, ett fönster på en miljon tokens, ett tak för utdata på 131 072 tokens och en prislista som är ungefär en sjundedel av Grok 4.6:s är verkliga fördelar — den första av dem verifierad genom en tredje parts integritetspolicy, resten enbart påstådd av leverantören själv.

• Välj inte mellan dem utifrån en benchmarktabell, för det finns bara en. Grok 4.6:s kodningspoäng på 76.8 och långkontextsåterkallelse på 80.3 beskriver Grok 4.6. Ingenting beskriver LongCat-2.5-Preview ännu. Den som den här veckan trycker en LongCat-2.5-Preview-poäng bredvid en Grok 4.6-poäng citerar antingen en annan LongCat-modell eller hittar på siffran.

• Verifiera indatasidan innan du bygger vidare på den. Meituans ändringslogg inleds med bildförståelse, men exempelsvaret i dess egen dokumentation för "Retrieve Model" visar fortfarande input_modalities som ["text"] med en text->text modalitetssträng — ett leverantörspåstående som motsägs av ett publicerat kontrakt. Grok 4.6 tar emot text, bilder och filer utan sådan tvetydighet. Och kontrollera att din testrigg exponerar ett interfolierat reasoning_content-fält innan du drar några slutsatser om resonemangskvaliteten hos LongCat-2.5-Preview; en klient som tappar det fältet kommer att misslyckas tyst.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen