
LongCat-2.5-Preview vs. Qwen3.8-Max: Ein Siebtel des Preises und nichts auf der Anzeigetafel
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 610 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 189 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Meituan stellte LongCat-2.5-Preview am 25. September 2026 mit einem Changelog-Eintrag, einer Preisliste und keinerlei Benchmarks auf seiner API-Plattform bereit – und bepreiste es dann mit ungefähr einem Siebtel dessen, was Qwen3.8-Max für denselben Aufruf verlangt. Das ist keine kleine Lücke, und sie ist nicht ungefährlich. Qwen3.8-Max, das Flaggschiff des Anbieters, ist seit dem 3. August 2026 allgemein verfügbar, verfügt über einen unabhängigen Artificial-Analysis-Rang, veröffentlicht einen datierten Snapshot, den man namentlich festlegen kann, und berechnet 6,7× so viel für Eingaben und 5× so viel für Ausgaben. Die Frage, die dieser Vergleich beantworten muss, ist nicht, welches Modell besser ist – niemand außerhalb von Meituan ist derzeit in der Lage, das zu beantworten. Vielmehr geht es darum, was man mit der Differenz kauft, und ob die Differenz den Kauf wert ist.
Was jede Seite tatsächlich veröffentlicht hat
Beginnen wir mit der Provenienz, denn sie ist das, was diese beiden schärfer trennt als es jeder Benchmark könnte.
LongCat-2.5-Preview erschien mit einem datierten Eintrag im eigenen Changelog von Meituan — mit den Worten des Anbieters: „Version: 2026-09-25 — LongCat-2.5-Preview jetzt verfügbar" —, einer Preisseite, auf der es als das aktuelle Pay-as-you-go-Modell der Plattform aufgeführt wird, und einem Schnellstart-Leitfaden, der beide Übertragungsformate abdeckt. Meituans eigener Account auf X beschreibt es als „1,6 Billionen Parameter. ~48 Mrd. aktiv. Ein Kontextfenster von 1 Mio. Token. Nativ multimodal." Darüber hinaus gibt es nichts zu lesen. Kein Repository in der Hugging-Face-Organisation meituan-longcat deckt dieses Modell ab — das jüngste Repository der Organisation ist LongCat-Flash-Lite-Sparse vom 31. Juli — und der OpenCode-Modellkatalog, der es bereitstellt, führt es als Modell mit geschlossenen Gewichten (closed-weight). Keine Modellkarte, kein technischer Bericht, keine Lizenz, keine vom Anbieter veröffentlichte Parametertabelle und nirgends eine unabhängige Bewertung: Stand 27. September gibt es keine LongCat-2.5-Preview-Seite bei Artificial Analysis.
Qwen3.8-Max ist in fast jeder Hinsicht der entgegengesetzte Fall. Es wurde am 3. August 2026 allgemein verfügbar gemacht, mit einer veröffentlichten Preisliste, und Alibaba brachte am 2. September eine namentlich benannte Aktualisierung heraus, Qwen3.8-Max-0902. Artificial Analysis vermisst es: Intelligence Index 45,4, auf Rang 15 von 145 Modellen, und einen Coding Index von 76,2, auf Rang 9 von 138. Es erzielt GPQA Diamond 92,8 %, Humanity's Last Exam 43,1 %, SciCode 52,1 %, Long-Context Recall 80,3 %, Terminal-Bench 2.1 mit 88,8 % und τ-bench Banking mit 47,8 %. Das ist ein durchgemessenes Modell mit einem Beleg für jede Zahl.
Die ehrliche Zusammenfassung der Evidenzspalte ist also in einer Weise einseitig, die nichts mit Leistungsfähigkeit zu tun hat. Eines dieser Modelle kann bewertet werden, bevor man sich festlegt. Das andere kann nur ausprobiert werden.
Die Preisliste, Zeile für Zeile
Beide sind Million-Token-Modelle mit derselben Obergrenze für die Ausgabe, sodass die Datenblätter genau dort übereinstimmen, wo ein Datenblatt am wenigsten nützlich ist:
• Nicht zwischengespeicherte Eingabe — LongCat-2.5-Preview 0,30 $ pro 1 Mio. vs. Qwen3.8-Max 2,00 $ pro 1 Mio., eine 6,7-fache Lücke.
• Gecachte Eingabe — 0,006 $ pro 1 Mio. vs. 0,25 $ pro 1 Mio., eine 41,7-fache Differenz.
• Ausgabe — $1.20 pro 1M vs. $6.00 pro 1M, eine 5-fache Differenz.
• Kontextfenster — 1.048.576 Tokens vs. 1.000.000 Tokens. Funktional ein Gleichstand.
• Maximale Ausgabe — 131.072 Token bei beiden. Identisch.
• Unabhängige Bewertung — keine veröffentlicht im Vergleich zu AA Intelligence 45,4 und AA Coding 76,2.
Jede LongCat-Zahl dort stammt von Meituans eigener Preisseite, und die Seite bezeichnet die gesamte Spalte als „Rabattierter Preis (zeitlich begrenzt)“. Die Werte von Qwen3.8-Max sind Alibabas Listenpreis, abgelesen von unserer eigenen Modellkarte, mit einem Cache-Lesevorgang zu 0,25 $ und einem Cache-Schreibvorgang zu 2,50 $ pro Million. Der Snapshot von Artificial Analysis ist auf den 2. September 2026 datiert.
Die Zeile für gecachte Eingaben ist die, die man sich genau ansehen sollte. Ein 42-facher Unterschied bei Cache-Lesevorgängen ist die größte einzelne Zahl in diesem Vergleich, und sie liegt auf der Dimension, auf der Agent-Workloads tatsächlich leben. Eine Agent-Schleife, die bei jedem Durchlauf einen 100.000-Token-System-Prompt und ein Tool-Schema erneut sendet, zahlt für die meisten ihrer Token den Cache-Tarif, nicht den beworbenen Eingabe-Tarif.
Ein 150.000-Token-Aufruf, in beide Richtungen bepreist
Nehmen wir eine plausible agentenförmige Anfrage: 150.000 Eingabe-Token, 50.000 davon aus dem Cache bedient, und eine Antwort mit 4.000 Token. Beim rabattierten Tarif von Meituan kostet dieser Aufruf 0,0501 $. Beim Listenpreis von Qwen3.8-Max kostet der identische Aufruf 0,3365 $ — 6,7× mehr, oder 50 $ gegenüber 337 $ für tausend Aufrufe pro Tag. Lässt man den Mix vollständig über den Cache laufen, was der stationäre Zustand für einen wiederholten Prompt ist, weitet sich das Verhältnis auf 12,3×: 0,006 $ gegenüber 0,074 $ pro Aufruf.
Nichts an dieser Rechnung hängt davon ab, dass LongCat-2.5-Preview gut ist. Genau das ist das Problem. Der Multiplikator, der Ihnen angeboten wird, ist real, und das Wort, das auf der Seite des Anbieters selbst daran hängt, ist „limited-time“, ohne Enddatum und ohne genannten Nachfolgepreis. Ein Rabatt von 6,7× ohne veröffentlichtes Ablaufdatum ist eine Budgetposition, die Sie nicht in einen Plan aufnehmen können; es ist eine Budgetposition, die Sie beobachten.
Es gibt außerdem eine Routing-Asymmetrie, die man klar benennen sollte. Qwen3.8-Max ist eine Route, die wir anbieten — qwen/qwen3.8-max und die gepinnte qwen/qwen3.8-max-0902 — zu Alibabas Listenpreis ohne Aufschlag, sodass eine Preisänderung des Anbieters noch am selben Tag bei uns ankommt statt Wochen später. LongCat-2.5-Preview ist keine unserer Routen, und wir werden nicht so tun, als wäre es anders; auf der günstigen Seite dieses Vergleichs hat man es mit Meituans eigener API zu tun und mit der Plattform, über die man sie auch immer erreicht.
Die eine Behauptung, der Meituans eigene API widerspricht
Dies ist das Ergebnis, das für alle, deren Arbeitslast nicht reiner Text ist, den Vergleich entscheiden sollte.
Meituans Changelog führt Bildverständnis als die Hauptneuheit der 2.5-Generation auf: „Multimodales Verständnis: Neue Bildverständnisfähigkeit, kann Bildinhalte analysieren, unterstützt modalübergreifende Fragen und Antworten, Inhaltszusammenfassungen und komplexes visuelles Schlussfolgern.“ Der X-Post sagt: „Nativ multimodal.“ Das sind Herstellerangaben, und für sich genommen wäre es vernünftig, sie in eine Entscheidung einzubeziehen.
Dann veröffentlicht dieselbe Dokumentationsseite die Beispielantwort zum Abrufen der Metadaten dieses Modells selbst, und das Modell, das sie zurückgibt, ist ein reines Textmodell. Für die ID "LongCat-2.5-Preview" zeigt die Nutzlast context_length: 1048576, input_modalities: ["text"], output_modalities: ["text"], und einen Modalitäts-String von text->text. Kein Bildeintrag. Nicht in einem alten Snapshot — sondern im ausgearbeiteten Beispiel auf der Seite, die den Endpunkt dokumentiert.
![A screenshot of Meituan's LongCat API documentation for the model-retrieval endpoint, showing the worked example response for 'LongCat-2.5-Preview': context_length 1048576, input_modalities ["text"], output_modalities ["text"] and modality "text->text". The word 'text' is visible in red against the grey page.](https://cms.orcarouter.ai/api/media/file/2-1349.png)
Das beweist nicht, dass das Modell nicht sehen kann. Es beweist, dass der Anbieter seine Formulierungen nicht mit seinem eigenen API-Schema in Einklang gebracht hat, und es bedeutet, dass ein Käufer eine Vision-Workload nicht gegen diesen Changelog-Satz abrechnen kann, bis jemand das klärt. Stellen Sie es der anderen Seite gegenüber: Unser Katalog führt Qwen3.8-Max als Text-, Bild- und Videoeingabe akzeptierend auf, wobei Vision zu seinen deklarierten Fähigkeiten gehört, und hinter dem Modell steht eine unabhängige Benchmark-Tabelle. Wenn Ihre Aufgabe Dokumentenverständnis, Screenshot-Triage oder Video-Frame-Analyse ist, ist die teure Spalte die mit einer verifizierten Eingabemodalität und die günstige Spalte die mit einer ungeklärten. Diese einzelne Zeile kann die gesamten 6,7× auslöschen.
Woran eine Vorschau nicht angeheftet werden kann
Alibaba liefert datierte Snapshots. qwen/qwen3.8-max-0902 ist ein benannter, eingefrorener Build zu denselben $2/$6 wie das Basismodell, was bedeutet, dass eine Routing-Regel, die ihn benennt, auch nächsten Monat dieselben Gewichte zurückliefert. Verhaltensänderungen kommen als neue ID, die du nach deinem eigenen Zeitplan übernehmen kannst.
LongCat-2.5-Preview hat keinen solchen Handle. Die Modell-ID ist die Preview-ID, es gibt kein Snapshot-Suffix, keine Versionshistorie auf der Plattform und keinen Changelog-Eintrag, der dir sagen würde, dass sich die Gewichte geändert haben – nur, dass der Rabatt „zeitlich begrenzt“ ist. Es ist eine Preview im gewöhnlichen Sinne: Das, was unter dem Namen steckt, darf sich ändern, und du würdest es an deiner Ausgabe merken, nicht an einer Release-Notiz.
Der günstigste Weg, die fehlenden Belege zu kaufen, ist das Fenster, das Meituan auf der anderen Seite davon geöffnet hat: OpenCode führt LongCat-2.5-Preview als zeitlich begrenzt kostenlos, wobei der Anbieter eine Zero-Retention-Richtlinie befolgt und nicht mit Ihren Daten trainiert, und am 26. September hieß es, das Fenster laufe zwei Wochen. Kostenlose Eingabe, kostenlose Ausgabe, kostenlose Cache-Lesevorgänge. Das ist ein legitimer Weg, die Benchmark-Tabelle zu erstellen, die niemand veröffentlicht hat — lassen Sie Ihren eigenen Evaluierungskorpus dagegen laufen, und Sie haben eine Zahl, wo der Anbieter Ihnen einen Satz geliefert hat. Was es nicht ist, ist ein Preis, mit dem Sie planen können: Zwei Wochen enden, und die Zahl auf der anderen Seite davon kann nur Meituan festlegen.
Wer sollte welche auswählen?
Greifen Sie zu Qwen3.8-Max, wenn die Arbeitslast der eigentliche Grund dafür ist, dass Sie das Modell überhaupt kaufen. Wenn es sich bei der Eingabe um Bilder oder Videos handelt, wenn die Antwort von Build zu Build reproduzierbar sein muss, wenn ein unabhängiger Index eine Beschaffungsanforderung ist oder wenn es sich bei der Aufgabe um die Art von agentischem Coding handelt, für die Terminal-Bench und der Coding Index als Stellvertreter stehen, dann ist der Faktor 6,7× der Preis dafür, dass Sie Ihre Arbeit überprüfen können. Bei einem Key steht es außerdem hinter einer Fallback-Kette, sodass ein bewertetes Modell einen schlechten Tag für das unbewertete auffangen kann, ohne dass Sie zwei Integrationen betreiben müssen.

Greifen Sie zu LongCat-2.5-Preview, wenn die Arbeitslast durch hohes Volumen, kurzen Kontext, reinen Text und internen Charakter geprägt ist – Klassifizierung, Extraktion, Zusammenfassung, Massenumschreibung – und wenn der Preis eines Fehlers ein Wiederholungsversuch statt ein Kunde ist. Bei diesem Profil ist die Position für gecachte Eingaben kein Rabatt, sondern die gesamte Wirtschaftlichkeit der Aufgabe, und 42× ist eine Zahl, die den Aufwand des Messens wert ist. Nutzen Sie das kostenlose Fenster, um den Benchmark zu erstellen, den es nicht gibt. Migrieren Sie keinen kritischen Pfad darauf.
Was dieses Urteil ändern würde, nach Gewicht geordnet: eine unabhängige Bewertung von LongCat-2.5-Preview; ein veröffentlichtes Enddatum und ein Nachfolgerpreis für den Rabatt; eine Versionshistorie mit datierten Snapshots; und eine Klärung, ob die Modalitätenliste ausschließlich Text umfasst oder nicht. Jeder einzelne dieser Punkte macht die günstige Spalte zu mehr als nur einem Rabatt. Solange nicht mindestens einer davon eintritt, ist dieser Vergleich kein Duell zwischen zwei Modellen – er ist ein Duell zwischen einem Preis, den man verifizieren kann, und einer Fähigkeit, die man nicht verifizieren kann.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
