
MiMo-V2.6-Pro vs. Qwen3.8-Max: Ein Indexpunkt, sechsmal so teuer
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-Max ist ein Modell mit 2,4 Billionen Parametern, das pro Token 95 Milliarden davon aktiviert und bei einem einzigen Anbieter läuft. Xiaomi MiMo-V2.6-Pro ist ein Modell mit 1,02 Billionen Parametern, das pro Token 42 Milliarden aktiviert, auf demselben unabhängigen Index einen Punkt mehr erzielt und pro Aufruf etwa ein Sechstel so viel kostet. Diese Fakten passen schlecht zusammen, und wie man sie auflöst, macht die gesamte Entscheidung zwischen den beiden aus. Die Kurzfassung: Auf dem Artificial Analysis Intelligence Index v4.3.2 erzielt Xiaomi MiMo-V2.6-Pro 46 Punkte und Qwen3.8-Max 45 – ein Gleichstand innerhalb des Rauschens –, während das Preisblatt 0,43 $ und 0,87 $ pro Million Token gegenüber 2,00 $ und 6,00 $ ausweist.
Was jedes Modell tatsächlich ist
Qwen3.8-Max ist Alibabas Flaggschiff, allgemein verfügbar seit dem 3. August 2026, und es war das größte Modell, das die Qwen-Reihe bis zu seinem Erscheinen herausgebracht hatte. Es ist ein Sparse-Mixture-of-Experts-Modell auf Basis der Qwen-3.5-Architektur mit insgesamt 2,4 Billionen Parametern und rund 95 Milliarden aktiven pro Token, einem Kontextfenster von 1 Mio. Token, bis zu 131.000 Token Ausgabe und multimodaler Eingabe über Text, Bild und Video. Alibaba senkte den internationalen Tarif auf 2,00 US-Dollar pro Million Eingabe-Token und 6,00 US-Dollar pro Million Ausgabe-Token, bei zwischengespeicherter Eingabe 0,25 US-Dollar, und bewarb dies als rund 40 % des Eingabepreises von Claude Opus 5. Ein Punkt-Update, Qwen3.8-Max-0902, folgte am 2. September 2026 und ist das, was Artificial Analysis derzeit mit 45 bewertet.
Xiaomi MiMo-V2.6-Pro erreichte am 22. September 2026 die allgemeine Verfügbarkeit, drei Tage bevor dieser Vergleich verfasst wurde, wobei seine Reinforcement-Learning-Checkpoint-Repositories am Tag zuvor erschienen. Es ist ein dünnbesetztes Mixture-of-Experts-Modell mit insgesamt 1,02 Billionen Parametern und 42 Milliarden aktiven pro Token, mit demselben Kontextfenster von 1 Mio. Token, nativer Multimodalität über Text, Bild, Video und Audio sowie unter der MIT-Lizenz veröffentlichten Gewichten. Xiaomi behielt die Preisgestaltung der vorherigen Generation bei, statt den neuen Checkpoint nach oben neu zu bepreisen, weshalb es mit 0,43 $ und 0,87 $ gelistet wird, mit 99 % Cache-Rabatt und einem kombinierten Preis von 0,18 $.
• Aktive Rechenleistung pro Token — Qwen3.8-Max 95B; Xiaomi MiMo-V2.6-Pro 42B, weniger als die Hälfte
• Gesamtparameter — Qwen3.8-Max 2,4T; Xiaomi MiMo-V2.6-Pro 1,02T
• Index-Score — Xiaomi MiMo-V2.6-Pro 46; Qwen3.8-Max 45, beide auf Artificial Analysis v4.3.2
• Ausgabegeschwindigkeit — Xiaomi MiMo-V2.6-Pro 134,3 Token/Sekunde; Qwen3.8-Max 39,2, gegenüber einem Stufenmedian von 72,5
• Zeit bis zum ersten Token — Xiaomi MiMo-V2.6-Pro 2,15 Sekunden; Qwen3.8-Max 2,93
• Listenpreis — Xiaomi MiMo-V2.6-Pro 0,43 $ / 0,87 $ pro 1 Mio.; Qwen3.8-Max 2,00 $ / 6,00 $
Mischpreis — Xiaomi MiMo-V2.6-Pro $0,18 pro 1 Mio. bei 7:2:1 Cache-Treffer/Input/Output; Qwen3.8-Max $1,18
• Gewichte — Xiaomi MiMo-V2.6-Pro ist MIT-lizenziert und herunterladbar; Qwen3.8-Max wurde als proprietärer Endpunkt bereitgestellt, mit einer Open-Weight-Veröffentlichung nur für Text, die den 1M-Kontext und die Vision-Eingabe streicht
• Erreichbarkeit — ein API-Anbieter wird jeweils auf Artificial Analysis gezählt
Der Spielstand ist unentschieden. Die Geschwindigkeit nicht.
Ein Punkt auf einem zusammengesetzten Wert aus zehn Bewertungen ist kein Unterschied, aufgrund dessen jemand handeln sollte, und das aussagekräftigere Signal ist das, was darunter passiert ist. Das Modell mit weniger als der Hälfte der aktiven Parameter pro Token erzielte einen geringfügig höheren Wert und generierte Ausgaben dreimal schneller – 134,3 Token pro Sekunde gegenüber 39,2, wobei der Median für vergleichbare Reasoning-Modelle bei 72,5 liegt. Qwen3.8-Max ist das langsamste der auf dieser Seite gemessenen Modelle der Frontier-Klasse, und das ist eine Design-Konsequenz der Aktivierung von 95 Milliarden Parametern pro Token und nicht etwa ein Zufall beim Serving.
Die Latenz erzählt die entgegengesetzte Geschichte zu der, die die Parameterzahlen nahelegen. Qwen3.8-Max erreicht sein erstes Token in 2,93 Sekunden gegenüber 2,15 bei Xiaomi, und der Abstand ist deutlich kleiner als der Durchsatz-Abstand – Qwen3.8-Max ist langsam, sobald es zu schreiben beginnt, nicht langsam beim Start. Bei einer Chat-Oberfläche, in der die Antwort kurz ist, macht sich dieser Unterschied kaum bemerkbar. Bei einer Agent-Schleife, die Zehntausende Ausgabe-Tokens generiert, ist der Durchsatz die gesamte reale Laufzeit, und ein 3,4-facher Abstand summiert sich mit jeder Runde des Durchlaufs.

Wo die Anbietertabellen voneinander abweichen, und warum das kein Widerspruch ist
Alibaba hat eine umfassende Tabelle für Qwen3.8-Max veröffentlicht, und sie ist wirklich stark: Terminal-Bench 2.1 bei 86,6, SWE-bench Pro bei 67,7, PaperBench bei 93,0, GPQA Diamond bei 92,6, IFBench bei 82,8, OSWorld-Verified bei 86,1 und Humanity's Last Exam bei 43,6. Das sind vom Anbieter ermittelte Zahlen auf Alibabas eigenen Test-Harnessen und einige davon auf Alibabas eigenen Benchmarks, also sind es Behauptungen statt Messungen – aber es sind Behauptungen zu weit verbreiteten Benchmarks, was sie über Labore hinweg besser vergleichbar macht als ein Ergebnis aus einer maßgeschneiderten Testumgebung.
Xiaomis Vorzeigezahl auf DeepSWE v1.1 ist 72,57, ein Anstieg gegenüber einem Ausgangswert von 58,4, gemessen mit mini-swe-agent als Durchschnitt aus drei Läufen anhand von Xiaomis eigenem Bewertungsprogramm, über einen Reinforcement-Learning-Lauf, den Xiaomi mit dreißig Schritten und etwa 750.000 Trajektorien sowie veröffentlichten Ausgaben von etwa 2,62 Millionen US-Dollar dokumentiert hat. Diese Zahl wurde nicht beim öffentlichen DeepSWE-Leaderboard eingereicht, und keine dritte Partei hat sie reproduziert. 72,57 gegen Qwens 67,7 bei SWE-bench Pro zu stellen und einen Fünf-Punkte-Sieg für Xiaomi zu konstatieren, hieße, über zwei verschiedene Benchmarks, zwei verschiedene Auswertungsrahmen und zwei verschiedene Bewertungskonventionen hinweg zu vergleichen. Es gibt genau einen Maßstab, an dem beide Modelle von jemand anderem als ihrem Hersteller gemessen wurden, und darauf steht 46 zu 45.
Zwei der folgenreicheren Zahlen von Qwen3.8-Max sind überhaupt keine Scores. Alibaba kündigte an, dass die Gewichte zusammen mit Qwen3.8-27B als Open Source veröffentlicht würden, und der Checkpoint, der schließlich erschien, ist text-only und enthält weder den vollen 1M-Token-Kontext noch die Vision-Eingabe, über die der ausgelieferte Max-Endpunkt verfügt. Somit sind „Qwen3.8-Max hat offene Gewichte“ und „Qwen3.8-Max ist ein multimodaler 1M-Kontext-Endpunkt“ beides wahre Aussagen über unterschiedliche Artefakte, und ein Bereitstellungsplan, der auf der ersten aufbaut, während er die zweite erwartet, wird den Kontakt nicht überstehen. Das Point-Release 0902 verschob das Modell derweil an die Spitze einer öffentlichen Webentwicklungs-Arena, ohne die Versionsnummer zu ändern – eine Erinnerung daran, dass das Modell, das Sie im August gebenchmarkt haben, nicht unbedingt das Modell ist, das im September Ihre Anfragen bedient.
Bedeutet „offene Gewichte“, dass man eines von beiden selbst hosten kann?
Für Xiaomi MiMo-V2.6-Pro: prinzipiell ja: MIT-Lizenz, keine kommerzielle Vereinbarung nötig. In der Praxis benötigt ein Checkpoint mit 1,02 Billionen Parametern und 42 Mrd. aktiven Parametern einen Multi-Node-Serving-Cluster, was eine andere Größenordnung an Verpflichtung ist als der Aufruf einer API. Die Veröffentlichung der Gewichte macht Selbsthosting legal, aber nicht günstig.
Für Qwen3.8-Max ist die Antwort enger, als es der Ruf vermuten lässt. Die offene Veröffentlichung ist textbasiert und ohne das vollständige Kontextfenster, sodass Selbst-Hosting ein wesentlich kleineres Modell liefert als das, auf dem die 45 gemessen wurde. Wenn Sie die gebenchmarkte Konfiguration wollen, ist der bereitgestellte Endpunkt das Produkt, und der Endpunkt ist proprietär.
Aufrufen eines der beiden, und die Arithmetik, die darüber entscheidet
Beide Modelle werden von Artificial Analysis bei einem einzigen API-Anbieter gezählt, was für zwei Flaggschiffmodelle ungewöhnlich ist und Failover zur praktischen Frage statt zu einem Nice-to-have macht. Qwen3.8-Max ist auf OrcaRouter als qwen/qwen3.8-max — ein einziger OpenAI-kompatibler Endpunkt zu Alibabas eigenem Listenpreis mit 0 % Aufschlag, sodass die oben genannten 2,00 $ und 6,00 $ unverändert durchgereicht werden und eine Preisänderung auf Alibabas Seite noch am selben Tag bei uns live ist. Unsere eigenen Messungen ergeben für den Endpunkt einen p50 von rund 3,3 Sekunden – das ist die Zahl, mit der man planen sollte, und nicht der theoretische Bestfall –, und eine Fallback-Kette bedeutet, dass eine ins Stocken geratene Anfrage auf einen anderen Upstream wiederholt wird, bevor die Antwort beginnt. Xiaomi MiMo-V2.6-Pro ist nicht auf OrcaRouter; kein Xiaomi-Modell ist das, und der Weg dorthin führt heute über Xiaomis eigene Plattform und die Drittanbieter-Kataloge, die es führen.
Die Kostenrechnung ist der Punkt, an dem dieses Duell tatsächlich entschieden wird, und es ist nicht die Rechnung, die die in den Schlagzeilen genannten Preise nahelegen. Bei einem 7:2:1-Mix aus Cache-Treffern, Input und Output liegen die Mischpreise bei 0,18 $ und 1,18 $ pro Million — eine Lücke von 6,6×, breiter als die 4,6×-Lücke beim Input und die 6,9×-Lücke beim Output, weil Xiaomis Cache-Rabatt von 99 % tiefer ist als Alibabas 88 %. Artificial Analysis verzeichnet außerdem Kosten von 0,13 $ pro Intelligence-Index-Aufgabe für Xiaomi MiMo-V2.6-Pro, identisch für jedes Modell im Feld gemessen. Lässt man dieselbe Workload durch beide laufen, ist das günstigere Modell dasjenige, das höher abgeschnitten hat, was man nicht oft schreiben kann und der Grund dafür, dass dieser Vergleich keine Formsache ist.

Wer sollte wechseln und wer nicht
Wenn Sie heute auf Qwen3.8-Max setzen und es funktioniert, gibt es keinen dringenden Grund zu wechseln. Der Index-Abstand ist ein Punkt, das Vision- und Long-Context-Verhalten ist in Ihrer Workload erwiesen, und Alibaba entwickelt die Linie weiter — das zeigt das Update 0902. Der Fall für einen Wechsel sind Durchsatz und gemischte Kosten, und er ist nur dann stark, wenn Ihr Traffic ausgabeintensiv oder langhorizontig ist: Agenten, Codegenerierung, alles, was weit mehr schreibt als liest.
Wenn man von vorn anfängt, lässt sich die Rangfolge angesichts der veröffentlichten Belege schwer bestreiten. Das Xiaomi-Modell ist schneller, in jeder Hinsicht günstiger, MIT-lizenziert und liegt bei dem einzigen unabhängig durchgeführten zusammengesetzten Benchmark, der beide abdeckt, leicht vorn. Die Gegengewichte sind real und konkret: drei Tage Produktionshistorie, eine einzige Serving-Route und kein öffentlicher Benchmark-Eintrag, den man einsehen könnte. Diese Kombination spricht dafür, es in einer Spur neben einem etablierten Modell zu evaluieren, statt eines zu ersetzen — genau dafür ist eine Routing-Konfiguration da, und deshalb ist der sinnvolle Schritt, den Kandidaten und das etablierte Modell hinter einem Schlüssel zusammenzuführen, statt anhand einer Anzeigetafel einen Sieger zu küren.

Was würde diese Antwort ändern?
Drei Punkte. Ein zweiter und dritter Anbieter für Xiaomi MiMo-V2.6-Pro würde den einzigen strukturellen Einwand dagegen beseitigen und die Preislücke in eine reale Entscheidung verwandeln statt in eine verlockende. Ein unabhängiger Durchlauf der DeepSWE-Konfiguration würde entweder die 72,57 bestätigen oder sie verwerfen, und jedes der beiden Ergebnisse ist mehr wert als die Zahl selbst. Und Aufschlüsselungen pro Evaluierung auf v4.3.2 würden zeigen, welche der zehn Evaluierungen jedes Modell gewinnt — der Composite ist ein Composite, und ein Modell, das beim agentischen Coding führt, und eines, das bei retrieval-lastiger Fragebeantwortung führt, können denselben Indexwert erzielen, während sie für die Aufgaben des jeweils anderen ungeeignet sind.
