
LongCat-2.5-Preview vs Qwen3.8-Max: En sjundedel av priset och inget på resultattavlan
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 610 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 189 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Meituan lade LongCat-2.5-Preview på sin API-plattform den 25 september 2026 med en ändringsloggspost, ett prisblad och inget benchmark av något slag – och prissatte den sedan till ungefär en sjundedel av vad Qwen3.8-Max tar för samma anrop. Det är inte en liten skillnad, och det är inte en säker sådan. Qwen3.8-Max, leverantörens flaggskepp, har varit allmänt tillgängligt sedan den 3 augusti 2026, har en oberoende Artificial Analysis-rankning, publicerar en daterad ögonblicksbild som du kan låsa fast vid namn, och debiterar 6,7× så mycket för indata och 5× så mycket för utdata. Frågan som den här jämförelsen måste besvara är inte vilken modell som är bättre – ingen utanför Meituan är i en position att besvara det ännu. Det är vad du köper med skillnaden, och huruvida skillnaden är värd att köpa.
Vad vardera sidan faktiskt har publicerat
Börja med proveniensen, för det är den som skiljer dessa två åt skarpare än något benchmark skulle göra.
LongCat-2.5-Preview dök upp med en daterad post i Meituans egen ändringslogg — leverantörens ord: "Version: 2026-09-25 — LongCat-2.5-Preview nu tillgänglig" — en prissida som listar den som plattformens nuvarande modell med betalning per användning, och en snabbstartsguide som täcker båda wire-formaten. Meituans eget konto på X beskriver den som "1,6T parametrar. ~48B aktiva. Ett kontextfönster på 1M token. Nativt multimodalt." Utöver det finns inget att läsa. Inget repo i meituan-longcat Hugging Face-organisationen omfattar den här modellen — organisationens senaste repo är LongCat-Flash-Lite-Sparse, från 31 juli — och OpenCode-modellkatalogen, som tillhandahåller den, anger att den har slutna vikter. Inget modellkort, ingen teknisk rapport, ingen licens, ingen parametertabell publicerad av leverantören, och ingen oberoende utvärdering någonstans: per den 27 september finns det ingen LongCat-2.5-Preview-sida på Artificial Analysis.
Qwen3.8-Max är motsatsen i nästan varje avseende. Den blev allmänt tillgänglig den 3 augusti 2026 med en publicerad prislista, och Alibaba släppte en namngiven uppdatering, Qwen3.8-Max-0902, den 2 september. Artificial Analysis mäter den: Intelligence Index 45,4, rankad 15:e av 145 modeller, och ett Coding Index på 76,2, rankad 9:a av 138. Den redovisar GPQA Diamond 92,8 %, Humanity's Last Exam 43,1 %, SciCode 52,1 %, Long-Context Recall 80,3 %, Terminal-Bench 2.1 vid 88,8 % och τ-bench banking vid 47,8 %. Det är en uppmätt modell med kvitto på varje siffra.
Så den ärliga sammanfattningen av beviskolumnen är snedvriden på ett sätt som inte har något att göra med förmåga. En av dessa modeller kan utvärderas innan du binder dig. Den andra kan bara provas.
Prislistan, rad för rad
Båda är miljontokenmodeller med samma utdatatak, så specifikationsbladen konvergerar precis där ett specifikationsblad är minst användbart:
• Icke-cachad indata — LongCat-2.5-Preview $0,30 per 1M mot Qwen3.8-Max $2,00 per 1M, en 6,7× skillnad.
• Cachad indata — 0,006 $ per 1M mot 0,25 $ per 1M, en skillnad på 41,7×.
• Utdata — $1.20 per 1M mot $6.00 per 1M, en skillnad på 5×.
• Kontextfönster — 1,048,576 tokens mot 1,000,000 tokens. Funktionellt sett oavgjort.
• Maximal utdata — 131 072 tokens på båda. Identiska.
• Oberoende poäng — ingen publicerad mot AA Intelligence 45,4 och AA Coding 76,2.
Varje LongCat-siffra där kommer från Meituans egen prissida, och sidan betecknar hela kolumnen "Rabatterat pris (begränsad tid)". Qwen3.8-Max siffror är Alibabas listpris, avlästa från vårt eget modellkort, med en cacheläsning på $0.25 och en cacheskrivning på $2.50 per miljon. Artificial Analysis' ögonblicksbild är daterad 2 september 2026.
Raden för cachad indata är den man ska stirra på. En 42× skillnad vid cacheläsningar är det största enskilda talet i den här jämförelsen, och den landar på den dimension där agentarbetslaster faktiskt lever. En agentloop som skickar om en systemprompt och ett verktygsschema på 100 000 token vid varje tur betalar cachat pris för merparten av sina token, inte det annonserade indatapriset.
Ett anrop på 150 000 tokens, prissatt på båda sätten
Ta en rimlig agentformad begäran: 150 000 indatatoken, varav 50 000 levereras från cache, och ett svar på 4 000 token. Med Meituans rabatterade taxa kostar det anropet 0,0501 dollar. Med Qwen3.8-Max listtaxa kostar identiska anrop 0,3365 dollar – 6,7× mer, eller 50 dollar mot 337 dollar för tusen anrop om dagen. Om man gör blandningen helt cachad, vilket är det stabila tillståndet för en upprepad prompt, vidgas förhållandet till 12,3×: 0,006 dollar mot 0,074 dollar per anrop.
Ingenting i den aritmetiken hänger på att LongCat-2.5-Preview är bra. Det är precis problemet. Multiplikatorn du erbjuds är verklig, och ordet som fästs vid den på leverantörens egen sida är "limited-time", utan slutdatum och utan angivet efterträdarpris. En rabatt på 6,7× utan offentliggjort utgångsdatum är en budgetpost du inte kan lägga in i en plan; det är en budgetpost du bevakar.
Det finns också en routing-asymmetri som är värd att säga rakt ut. Qwen3.8-Max är en väg vi tillhandahåller — qwen/qwen3.8-max och den pinnade qwen/qwen3.8-max-0902 — till Alibabas listpris utan påslag, så en prisförändring från leverantören slår igenom på vår sida samma dag i stället för veckor senare. LongCat-2.5-Preview är inte en av våra vägar, och vi tänker inte låtsas något annat; på den billiga sidan av den här jämförelsen har du att göra med Meituans eget API och vilken plattform du än når det via.
Det enda påståendet som Meituans eget API motsäger
Detta är fyndet som bör avgöra duellen för alla vars arbetsbelastning inte är ren text.
Meituans ändringslogg listar bildförståelse som huvudnyheten i 2,5-generationen: "Multimodalt förstående: Ny förmåga till bildförståelse, kan tolka bildinnehåll, stöder frågor och svar över modaliteter, sammanfattning av innehåll och komplext visuellt resonemang." X-inlägget säger "inbyggt multimodalt". Det är leverantörspåståenden, och i sig skulle de vara rimliga att ta med i ett beslut.
Sedan publicerar samma dokumentationswebbplats exempelsvaret för att hämta den modellens egen metadata, och modellen som den returnerar är endast text. Mot id:t "LongCat-2.5-Preview" visar nyttolasten context_length: 1048576, input_modalities: ["text"], output_modalities: ["text"], och en modalitetssträng på text->text. Ingen bildpost. Inte i en gammal ögonblicksbild — i det genomarbetade exemplet på sidan som dokumenterar slutpunkten.
![A screenshot of Meituan's LongCat API documentation for the model-retrieval endpoint, showing the worked example response for 'LongCat-2.5-Preview': context_length 1048576, input_modalities ["text"], output_modalities ["text"] and modality "text->text". The word 'text' is visible in red against the grey page.](https://cms.orcarouter.ai/api/media/file/2-1349.png)
Det bevisar inte att modellen inte kan se. Det bevisar att leverantören inte har stämt av sin prosa med sitt eget API-schema, och det innebär att en köpare inte kan fakturera en vision-arbetsbelastning mot den där ändringsloggsmeningen förrän någon har löst det. Ställ det bredvid den andra sidan: vår katalog listar Qwen3.8-Max som accepterar text-, bild- och videoinmatning, med vision bland sina deklarerade förmågor, och det finns en oberoende benchmarktabell bakom modellen. Om din uppgift är dokumentförståelse, triage av skärmbilder eller analys av videobildrutor, är den dyra kolumnen den med en verifierad indatamodalitet och den billiga kolumnen den med en oavgjord sådan. Den enda raden kan radera hela 6,7×.
Vad en förhandsgranskning inte kan fästas vid
Alibaba levererar daterade snapshots. qwen/qwen3.8-max-0902 är en namngiven, fryst build till samma $2/$6 som basmodellen, vilket innebär att en routingregel som namnger den fortsätter att returnera samma vikter nästa månad. Beteendeändringar kommer som ett nytt id som du kan ta i bruk enligt ditt eget schema.
LongCat-2.5-Preview har ingen sådan beteckning. Modell-id:t är förhandsversions-id:t, det finns inget snapshot-suffix, ingen versionshistorik på plattformen och ingen post i ändringsloggen som skulle tala om för dig att vikterna har ändrats – bara att rabatten är "tidsbegränsad". Det är en förhandsversion i vanlig bemärkelse: det som ligger under namnet får ändras, och du skulle få reda på det genom dina utdata snarare än från en versionsanteckning.
Det billigaste sättet att köpa de saknade bevisen är det fönster som Meituan öppnade på andra sidan av detta: OpenCode listar LongCat-2.5-Preview som gratis under en begränsad period, där leverantören följer en nollretentionspolicy och inte tränar på dina data, och den uppgav den 26 september att fönstret varar i två veckor. Gratis indata, gratis utdata, gratis cacheläsningar. Det är ett legitimt sätt att bygga den benchmarktabell som ingen har publicerat – kör din egen utvärderingskorpus mot den, och du har en siffra där leverantören gav dig en mening. Vad det inte är är ett pris du kan planera efter: två veckor tar slut, och siffran på andra sidan av det är Meituans att sätta.
Vem ska välja vilken
Välj Qwen3.8-Max när arbetsbelastningen är anledningen till att du överhuvudtaget köper modellen. Om indata är bilder eller video, om svaret måste vara reproducerbart från build till build, om ett oberoende index är ett upphandlingskrav, eller om uppgiften är den typ av agentisk kodning som Terminal-Bench och Coding Index är proxysignaler för, är 6,7× priset för att kunna kontrollera ditt arbete. Under en och samma nyckel ligger den också bakom en reservkedja, så en poängsatt modell kan absorbera en dålig dag för den opoängsatta utan att du behöver köra två integrationer.

Använd LongCat-2.5-Preview när arbetsbelastningen är högvolym, kort kontext, enbart text och intern — klassificering, extrahering, sammanfattning, massomskrivning — och när kostnaden för att ha fel är ett nytt försök snarare än en kund. I den formen är raden för cachad indata inte en rabatt, den är hela ekonomin i jobbet, och 42× är ett tal som är värt ansträngningen att mäta. Använd det kostnadsfria fönstret för att ta fram det benchmark som inte finns. Migrera inte en kritisk väg till den.
Vad skulle ändra denna bedömning, i ordning efter vikt: en oberoende utvärdering av LongCat-2.5-Preview; ett publicerat slutdatum och efterträdarpris för rabatten; en versionshistorik med daterade ögonblicksbilder; och ett avgörande av huruvida modalitetslistan är enbart text eller inte. Vilken som helst av dessa gör den billiga kolumnen till mer än en rabatt. Tills åtminstone en av dem förverkligas är denna jämförelse inte en matchning mellan två modeller — det är en matchning mellan ett pris du kan verifiera och en förmåga du inte kan.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
