
LongCat-2.5-Preview vs Qwen3.8-Max: Een zevende van de prijs en niets op het scorebord
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 610 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 189 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Meituan zette LongCat-2.5-Preview op 25 september 2026 op zijn API-platform, met een changelog-item, een prijslijst en geen enkele benchmark — en prijsde het vervolgens op ongeveer een zevende van wat Qwen3.8-Max voor dezelfde aanroep rekent. Dat is geen klein verschil, en het is geen veilig verschil. Qwen3.8-Max, het vlaggenschip van de leverancier, is algemeen beschikbaar sinds 3 augustus 2026, heeft een onafhankelijke rangorde van Artificial Analysis, publiceert een gedateerde snapshot die je bij naam kunt vastpinnen, en rekent 6,7× zoveel voor input en 5× zoveel voor output. De vraag die deze vergelijking moet beantwoorden is niet welk model beter is — niemand buiten Meituan is op dit moment in staat dat te beantwoorden. Het is wat je met het verschil koopt, en of het verschil het waard is om te kopen.
Wat elke partij daadwerkelijk heeft gepubliceerd
Begin bij herkomst, want dat is wat deze twee scherper van elkaar scheidt dan welke benchmark dan ook.
LongCat-2.5-Preview arriveerde met een gedateerde vermelding in Meituan's eigen changelog — de woorden van de leverancier: "Versie: 2026-09-25 — LongCat-2.5-Preview Nu Beschikbaar" — een prijzenpagina die het vermeldt als het huidige pay-as-you-go-model van het platform, en een quick-startgids die beide wire-formats behandelt. Meituan's eigen account op X beschrijft het als "1,6T parameters. ~48B actief. Een contextvenster van 1M tokens. Native multimodaal." Verder valt er niets te lezen. Geen repository in de meituan-longcat Hugging Face-organisatie dekt dit model — de meest recente repository van de organisatie is LongCat-Flash-Lite-Sparse, van 31 juli — en de OpenCode-modelcatalogus, die het bedient, registreert het als closed-weight. Geen modelkaart, geen technisch rapport, geen licentie, geen parametertabel gepubliceerd door de leverancier, en nergens een onafhankelijke evaluatie: per 27 september is er geen LongCat-2.5-Preview-pagina op Artificial Analysis.
Qwen3.8-Max is in bijna elk opzicht het tegenovergestelde geval. Het werd algemeen beschikbaar op 3 augustus 2026 met een gepubliceerde tariefkaart, en Alibaba bracht op 2 september een genoemde refresh uit, Qwen3.8-Max-0902. Artificial Analysis meet het: Intelligence Index 45,4, gerangschikt 15e van 145 modellen, en een Coding Index van 76,2, gerangschikt 9e van 138. Het behaalt GPQA Diamond 92,8%, Humanity's Last Exam 43,1%, SciCode 52,1%, Long-Context Recall 80,3%, Terminal-Bench 2.1 met 88,8%, en τ-bench banking met 47,8%. Dat is een gemeten model met een bewijs voor elk getal.
Dus de eerlijke samenvatting van de bewijskolom is scheef op een manier die niets met capaciteit te maken heeft. Een van deze modellen kan worden geëvalueerd voordat je je vastlegt. Het andere kan alleen worden uitgeprobeerd.
De tariefkaart, regel voor regel
Beide zijn modellen met een miljoen tokens en hetzelfde uitvoerplafond, dus de specsheets convergeren precies waar een specsheet het minst nuttig is:
• Niet-gecachte invoer — LongCat-2.5-Preview $0,30 per 1M vs Qwen3.8-Max $2,00 per 1M, een verschil van 6,7×.
• Gecachte invoer — $0,006 per 1M vs $0,25 per 1M, een verschil van 41,7×.
• Uitvoer — $ 1,20 per 1 mln vs. $ 6,00 per 1 mln, een verschil van 5×.
• Contextvenster — 1.048.576 tokens vs. 1.000.000 tokens. Functioneel gezien een gelijkspel.
• Maximale output — 131.072 tokens voor beide. Identiek.
• Onafhankelijke score — geen enkele gepubliceerd vs. AA Intelligence 45,4 en AA Coding 76,2.
Elk LongCat-bedrag daar komt van de eigen prijspagina van Meituan, en de pagina geeft de hele kolom het label 'Kortingsprijs (tijdelijk)'. De cijfers van Qwen3.8-Max zijn het lijsttarief van Alibaba, afgelezen van onze eigen modelkaart, met een cache-read tegen $0,25 en een cache-write tegen $2,50 per miljoen. De snapshot van Artificial Analysis is gedateerd op 2 september 2026.
De regel voor gecachte input is degene waar je naar moet staren. Een verschil van 42× bij cache-reads is het grootste enkele getal in deze vergelijking, en het belandt op de dimensie waarop agent-workloads daadwerkelijk draaien. Een agent-loop die bij elke beurt een systeemprompt en toolschema van 100.000 tokens opnieuw verzendt, betaalt voor de meeste van zijn tokens het gecachte tarief, niet het inputtarief dat prominent wordt genoemd.
Een call van 150.000 tokens, op beide manieren geprijsd
Neem een plausibel agentachtig verzoek: 150.000 inputtokens, waarvan 50.000 uit cache worden geleverd, en een antwoord van 4.000 tokens. Tegen Meituans kortingstarief kost die aanroep $0,0501. Tegen het lijsttarief van Qwen3.8-Max kost de identieke aanroep $0,3365 — 6,7× meer, of $50 tegen $337 voor duizend aanroepen per dag. Zet de mix volledig op cache, wat de stabiele toestand is voor een herhaalde prompt, en de verhouding groeit naar 12,3×: $0,006 tegen $0,074 per aanroep.
Niets in die berekening hangt ervan af dat LongCat-2.5-Preview goed is. Dat is precies het probleem. De multiplier die je wordt aangeboden is reëel, en het woord dat er op de eigen pagina van de leverancier aan hangt, is "limited-time", zonder einddatum en zonder vermelde prijs voor een opvolger. Een korting van 6,7× zonder gepubliceerde einddatum is een budgetpost die je niet in een plan kunt opnemen; het is een budgetpost die je in de gaten houdt.
Er is ook een routeringsasymmetrie die we ronduit moeten benoemen. Qwen3.8-Max is een route die wij aanbieden — qwen/qwen3.8-max en de gepinde qwen/qwen3.8-max-0902 — tegen Alibaba's listprijs zonder opslag, dus een prijswijziging van de leverancier komt dezelfde dag nog bij ons terecht in plaats van weken later. LongCat-2.5-Preview is geen van onze routes, en we gaan niet doen alsof dat wel zo is; aan de goedkope kant van deze vergelijking heb je te maken met Meituan's eigen API en met welk platform je die ook bereikt.
De enige bewering die Meituans eigen API tegenspreekt
Dit is de bevinding die de doorslag moet geven bij de vergelijking voor iedereen wiens werklast niet puur tekst is.
De changelog van Meituan noemt beeldbegrip als de belangrijkste toevoeging aan de 2.5-generatie: "Multimodaal begrip: Nieuwe mogelijkheid voor beeldbegrip, in staat om beeldinhoud te parsen, met ondersteuning voor cross-modale Q&A, inhoudssamenvatting en complexe visuele redeneringen." De X-post zegt "native multimodaal." Dat zijn leveranciersclaims, en op zichzelf zou het redelijk zijn om ze mee te nemen in een beslissing.
Dan publiceert dezelfde documentatiesite het voorbeeldantwoord voor het ophalen van de eigen metadata van dat model, en het model dat het retourneert, is alleen tekst. Bij de id "LongCat-2.5-Preview" toont de payload context_length: 1048576, input_modalities: ["text"], output_modalities: ["text"], en een modaliteitsstring van text->text. Geen vermelding van afbeeldingen. Niet in een oude snapshot — in het uitgewerkte voorbeeld op de pagina die de endpoint documenteert.
![A screenshot of Meituan's LongCat API documentation for the model-retrieval endpoint, showing the worked example response for 'LongCat-2.5-Preview': context_length 1048576, input_modalities ["text"], output_modalities ["text"] and modality "text->text". The word 'text' is visible in red against the grey page.](https://cms.orcarouter.ai/api/media/file/2-1349.png)
Dat bewijst niet dat het model niet kan zien. Het bewijst dat de leverancier zijn proza niet heeft afgestemd op zijn eigen API-schema, en het betekent dat een koper een vision-workload niet kan doorbelasten op basis van die changelog-zin totdat iemand het uitklaart. Zet het naast de andere kant: onze catalogus vermeldt Qwen3.8-Max die tekst-, beeld- en video-invoer accepteert, met vision als een van de aangegeven capaciteiten, en er ligt een onafhankelijke benchmarktabel achter het model. Als je taak documentbegrip, screenshot-triage of video-frame-analyse is, is de dure kolom degene met een geverifieerde invoermodaliteit en de goedkope kolom degene met een onopgeloste invoermodaliteit. Die enkele rij kan de volledige 6,7× wegvagen.
Waaraan een Preview niet kan worden vastgezet
Alibaba levert gedateerde snapshots. qwen/qwen3.8-max-0902 is een benoemde, bevroren build tegen dezelfde $2/$6 als het basismodel, wat betekent dat een routeringsregel die deze naam gebruikt, volgende maand dezelfde weights blijft retourneren. Gedragswijzigingen komen binnen als een nieuwe id die je volgens je eigen planning kunt overnemen.
LongCat-2.5-Preview heeft geen dergelijke handle. Het model-id is het preview-id, er is geen snapshot-achtervoegsel, geen versiegeschiedenis op het platform, en geen changelog-vermelding die je zou vertellen dat de weights zijn gewijzigd — alleen dat de korting "limited-time" is. Het is een preview in de gewone zin: het ding onder de naam mag veranderen, en je zou het aan je output merken in plaats van aan een release note.
De goedkoopste manier om het ontbrekende bewijs te kopen, is het venster dat Meituan aan de andere kant hiervan heeft geopend: OpenCode vermeldt LongCat-2.5-Preview als gratis voor een beperkte periode, waarbij de provider een zero-retentionbeleid volgt en niet op je data traint, en op 26 september zei het dat het venster twee weken duurt. Gratis input, gratis output, gratis cache-reads. Dat is een legitieme manier om de benchmarktabel te bouwen die niemand heeft gepubliceerd — laat je eigen evaluatiecorpus ertegen lopen, en je hebt een getal waar de leverancier je een zin gaf. Wat het niet is, is een prijs waar je omheen kunt plannen: de twee weken eindigen, en het getal aan de andere kant ervan is aan Meituan om te bepalen.
Wie moet welke kiezen
Kies Qwen3.8-Max wanneer de workload de reden is waarom je het model in de eerste plaats aanschaft. Als de input afbeeldingen of video is, als het antwoord reproduceerbaar moet zijn van build tot build, als een onafhankelijke index een inkoopvereiste is, of als de taak het soort agentische coding is waarvoor Terminal-Bench en de Coding Index proxy's zijn, dan is de 6,7× de prijs voor het kunnen controleren van je werk. Bij één sleutel staat het ook achter een fallbackketen, zodat een gescoord model een slechte dag voor het niet-gescoorde kan opvangen zonder dat je twee integraties hoeft te draaien.

Grijp naar LongCat-2.5-Preview wanneer de workload een hoog volume, korte context, alleen tekst en intern is — classificatie, extractie, samenvatting, bulkherschrijving — en wanneer de kosten van een fout een retry zijn in plaats van een klant. Bij die vorm is de regel voor gecachte input geen korting, het is de hele economie van de taak, en 42× is een getal dat de moeite van het meten waard is. Gebruik het gratis venster om de benchmark te produceren die niet bestaat. Migreer er geen kritiek pad naartoe.
Wat zou dit oordeel veranderen, in volgorde van gewicht: een onafhankelijke evaluatie van LongCat-2.5-Preview; een gepubliceerde einddatum en opvolgerprijs voor de korting; een versiegeschiedenis met gedateerde snapshots; en een beslissing over de vraag of de modaliteitenlijst alleen tekst is of niet. Elk van die punten maakt de goedkope kolom meer dan een korting. Totdat ten minste één daarvan werkelijkheid wordt, is deze vergelijking geen wedstrijd tussen twee modellen — het is een wedstrijd tussen een prijs die je kunt verifiëren en een capaciteit die je niet kunt verifiëren.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
