
MiMo-V2.6-Flash vs. Qwen3.8-Max: Ein Download gegen einen Zähler, und nur einer von ihnen hat eine Punktzahl
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Eine Zahl entscheidet darüber, wie dieser Vergleich üblicherweise geschrieben wird, und sie ist kein Benchmark. Qwen3.8-Max ist ein gehostetes Modell, das Artificial Analysis kontinuierlich misst, daher trägt es einen aktuellen Intelligence Index von 45 auf der neu kalibrierten v4.3-Skala, eine Ausgabegeschwindigkeit von 39,2 Token pro Sekunde und einen Listenpreis von 2,00 $ pro Million Eingabe-Token und 6,00 $ pro Million Ausgabe. MiMo-V2.6-Flash, das Xiaomi am 21. September 2026 als herunterladbare Gewichte veröffentlicht hat, hat nichts davon: keine Preisliste des Anbieters, keine von Xiaomi angekündigte Modellkennung und überhaupt keine Artificial-Analysis-Seite. Alles, was über die Leistungsfähigkeit von MiMo-V2.6-Flash veröffentlicht wurde, stammt aus Xiaomis eigenen Bewertungstabellen in seiner Modellkarte. Keine einzige Zahl wurde von jemandem nachgerechnet, der nicht für Xiaomi arbeitet.
Diese Asymmetrie ist kein Minuspunkt für das Modell. Sie ist eine Tatsache darüber, um welche Art von Kauf es sich bei jedem einzelnen handelt, und sie verändert, was man aus einem direkten Vergleich tatsächlich schließen kann. Im Rest dieses Beitrags geht es um die drei Dinge, die man wirklich vergleichen kann – die Form der Behauptung, die Kosten eines Tokens und die Lizenz – plus eine Zahl, die real, unabhängig gemessen und zu keinem der beiden Modelle in der Schlagzeile gehört.
Zuerst: Welches Qwen 3.8 und welches MiMo?
Beide Namen in dieser Schlagzeile sind Familien, die sich als Kontrollpunkte ausgeben, und die Ersetzungen sind nicht harmlos.
• Qwen3.8-Max — Alibabas gehostetes Flaggschiff, vorgestellt am 3. August 2026. Ein Sparse-Mixture-of-Experts-Modell mit 2,4 Billionen Parametern, von denen pro Token etwa 95 Milliarden Parameter aktiv sind, 1 Mio. Token Kontext sowie Text-, Bild- und Videoeingabe. Dies ist das Modell, das der Rest dieses Artikels als Gegner behandelt.
• Qwen3.8-Max (0902) — der datierte Snapshot vom 2. September desselben Modells, als eigener Eintrag mit derselben Preisgestaltung von 2,00 $ und 6,00 $ und einer Ausgabeobergrenze von 131.072 Token bereitgestellt. Die aktuelle Seite von Artificial Analysis bezieht sich auf diesen Build, was wichtig ist, wenn Sie einen Indexwert nennen.
• Qwen3.8-2.4T-A95B — der Open-Weights-Checkpoint desselben Kerns, seit dem 12. August 2026 unter der Qwen3.8-Max-Lizenz herunterladbar. Es ist rein textbasiert, das Denken ist immer aktiviert, und sein nativer Kontext umfasst 262K statt einer Million. Es ist nicht das Modell aus der Schlagzeile.
• MiMo-V2.6-Flash — Xiaomis Sparse-Mixture-of-Experts-Checkpoint mit insgesamt 309B Parametern und 15B aktiven Parametern, ohne Zugangsbeschränkungen auf Hugging Face unter der MIT-Lizenz, nativ omnimodal, mit der Angabe eines Kontexts von 1 Mio. Token. Es ist das Effizienz-Mitglied einer Veröffentlichung mit zwei Checkpoints, deren Flaggschiff MiMo-V2.6-Pro mit insgesamt 1,02 Billionen und 42B aktiven Parametern ist.
• MiMo-V2-Flash — das Modell vom Dezember 2025. Dieselben 309B insgesamt, dieselben 15B aktiv, dasselbe gleitende 128-Token-Fenster. Anderer Trainingslauf, andere Benchmark-Tabelle und ein 256K-Kontext. Jede Seite, die „MiMo-V2-Flash“ in einem Ranking gegen ein Qwen-Modell stellt, vergleicht die falsche Generation, und das Datenblatt allein wird Ihnen das nicht verraten.
Die MiMo-Kollision ist die schärfere der beiden Fallen, denn die Zahlen, die das Modell identifizieren, sind zufällig auch die Zahlen, die zwischen den Checkpoints von 2025 und 2026 identisch sind. Die Qwen-Kollision ist milder, hat aber einen Preis: Die offenen 2,4T-Gewichte und die gehostete API sind unterschiedliche Artefakte mit unterschiedlichen Bedingungen, und ein Vergleich, der sie vertauscht, wird sowohl die Leistungsfähigkeit als auch die Lizenz falsch bewerten.
Der Index wurde neu aufgebaut, und die Zahl, die die meisten Seiten noch drucken, ist verschwunden.
Hier ist der Fehlermodus, auf den man achten muss, bevor irgendeine Punktzahl erscheint.
Artificial Analysis hat seinen Intelligence Index am 7. September 2026 auf v4.3 neu kalibriert. Werte von vor diesem Datum sind mit den Werten danach nicht vergleichbar, und die aktuelle Qwen3.8-Max-Seite trägt ein Aktualisiert-Abzeichen, das ein neu ausgewiesenes Ergebnis kennzeichnet. Die viel verbreitete Zahl 58 für Qwen3.8-Max gehört zur alten Skala. Das aktuelle Qwen3.8-Max (0902) wird mit 45ausgewiesen und belegt Platz 19 von 202 Modellen, die Artificial Analysis dieser Klasse zuordnet.
Das ist keine Haarspalterei. Eine 58 neben einer 46 liest sich als Abstand von zwölf Punkten. Dieselben zwei Modelle auf derselben aktuellen Skala liegen nur einen einzigen Punkt auseinander – und die 46 ist nicht einmal das Modell, um das es in diesem Artikel geht:
• Qwen3.8-Max (0902), unabhängig gemessen — Intelligence Index 45 auf v4.3. Ausgabegeschwindigkeit 39,2 Tokens pro Sekunde, Rang 151 von 202, was die Seite selbst als langsam vermerkt. Kosten pro Intelligence-Index-Aufgabe 5,41 $. Zur Vervollständigung des Index generierte Ausgabe-Tokens: 190 Mio.
• MiMo-V2.6-Pro, unabhängig gemessen — Intelligence Index 46, Platz eins der 114 Modelle in der Open-Weights-Klasse. Ausgabegeschwindigkeit 134,3 Token pro Sekunde. Kosten pro Intelligence-Index-Aufgabe 0,13 $. Ausgabe-Token zum Abschluss des Index: 140 Mio.
• MiMo-V2.6-Flash, das eigentliche Thema — es gibt keine Seite bei Artificial Analysis. Nichts zum Zitieren.
Liest man diese drei zusammen, ist die ehrliche Zusammenfassung für beide Anbieter unangenehm. Der Vergleichspunkt, den alle wollen – Flash gegen Qwen3.8-Max auf einer neutralen Skala –, existiert nicht und lässt sich aus den Tabellen der Anbieter auch nicht konstruieren, denn die beiden Anbieter ließen zu unterschiedlichen Zeitpunkten unterschiedliche Test-Harness auf unterschiedlichen Checkpoints laufen und verglichen sich dann mit den Modellen anderer Firmen, die sie ebenfalls laufen ließen. Was es gibt, ist eine Lücke von einem Punkt zwischen dem Flaggschiff-Qwen und Xiaomis größerem Checkpoint – bei rund einem Vierzigstel der Kosten pro Index-Aufgabe. Das ist die interessanteste echte Zahl in diesem Duell, und es geht dabei um ein Modell, das keine der beiden Seiten in der Schlagzeile nennt.

Was die Herstellertabellen Ihnen verraten werden – und was nicht.
Beide Anbieter veröffentlichen Zahlen. Sie sind nicht die gleiche Art von Zahl, und sie Spalte für Spalte nebeneinanderzustellen ergibt eher ein Diagramm als einen Befund — aber die Form der Behauptungen ist dennoch lesenswert, weil sie verrät, worauf jedes Labor optimiert hat.
• Code-Agent — Xiaomi meldet MiMo-V2.6-Flash mit 67,9 bei DeepSWE v1.1, 87,6 bei Terminal Bench 2.1, 26,0 bei ProgramBench und 61,2 beim MiMo Code Bench. Alibaba meldet Qwen3.8-Max mit 67,7 bei SWE-bench Pro und 86,6 bei Terminal-Bench 2.1. Die Terminal-Bench-Werte liegen so nah beieinander, dass wahrscheinlich das Evaluierungs-Harness und nicht das Modell die Reihenfolge bestimmt.
• Allgemeiner Agent — Xiaomi meldet für Flash AutomationBench v1.0.6 52,3, Toolathlon-Verified 73,6, OSWorld-Verified 80,8 und Agents' Last Exam 27,6. Alibaba meldet für Qwen3.8-Max OSWorld-Verified 86,1, WideSearch 81,9 und Agent's Last Exam 52,4. Bei den beiden Benchmarks, die beide Labore durchgeführt haben, liegen Qwens gemeldete Werte vorn — auf Alibabas eigenem Harness.
• Wissen und Sicherheit — Xiaomi führt CyberGym (Flash 95.1), MiMo Cyber Bench (77.2), ExploitGym (6.0), ExploitBench (25.3) und SEC Bench Pro (47.5) durch. Alibaba führt GPQA Diamond (92.6), Humanity's Last Exam (43.6) und PaperBench (93.0) durch. Kaum Überschneidungen, also fast nichts zum Vergleichen.
Das einzig wirklich Nützliche, was eine Anbietertabelle zeigen kann, ist eine interne Inkonsistenz, und Xiaomis hat eine. Sein öffentliches RL-Dashboard, das den Trainingslauf bis September streamte, veröffentlichte MiMo-V2.6-Flash bei 65,68 auf DeepSWE v1.1 unter Verwendung eines mini-swe-agent-Harness mit Durchschnitt von drei. Die fertige Modellkarte gibt 67,9 für die veröffentlichten Gewichte an. Diese beschreiben einen Trainings-Snapshot bzw. ein veröffentlichtes Artefakt, und der Unterschied von zwei Punkten ist genauso groß wie die Lücke zwischen Xiaomis beiden Checkpoints. Wenn Sie seit letzter Woche die Dashboard-Zahl zitieren, ist sie veraltet.
Die Rechnung, der Punkt, an dem die beiden Modelle nicht mehr vergleichbar sind.
Dies ist der Abschnitt, der über Deployments entscheidet, und es ist nicht knapp.
• Qwen3.8-Max wird nutzungsabhängig abgerechnet. 2,00 $ pro Million Eingabe-Tokens und 6,00 $ pro Million Ausgabe-Tokens auf Alibabas internationaler Preisliste, mit einem von Artificial Analysis gemessenen Cache-Rabatt von 88 % und Kosten von 5,41 $ pro Intelligence-Index-Aufgabe. Alibabas Dokumentation für die China-Region listet 12 CNY und 36 CNY pro Million für dasselbe Paar. Sie können es heute Nachmittag aufrufen und bekommen eine Rechnung.
• MiMo-V2.6-Flash ist ein Download. Xiaomi veröffentlicht auf seiner eigenen Website keinen Preis pro Token für die MiMo-V2.6-Generation und hat für keinen der beiden Checkpoints einen aufrufbaren Bezeichner angekündigt, es gibt also nichts abzurechnen. Was es stattdessen gibt: 172,9 GB FP8-Gewichtsdaten über 65 Shards hinweg, bevor der KV-Cache für einen 1M-Token-Kontext hinzukommt, und einen Deployment-Abschnitt, der SGLang mit Tensor-Parallelität 16 und einem Datenparallelitätsfaktor von 2 oder ein vLLM-Rezept mit Tensor-Parallelität 8 empfiehlt – ein Multi-Node-Serving-Job.
• Die Drittanbieter-Einträge sind keine Preisliste. Katalogseiten enthalten zwar Zahlen für die MiMo-V2.6-Serie, und Artificial Analysis zählt einen einzigen API-Anbieter, der MiMo-V2.6-Pro für 0,435 US-Dollar und 0,87 US-Dollar pro Million anbietet. Das ist der Eintrag eines Anbieters für den größeren Checkpoint, kein Xiaomi-Preis, und für Flash existiert er überhaupt nicht.
Die Rechnung ist also ein verbrauchsabhängiger Posten gegenüber einer Investitionsentscheidung. Bei einigen hundert Millionen Tokens pro Monat ist Qwen3.8-Max eine Rechnung, die man prognostizieren kann, und Flash ein Knoten, den man kaufen würde, um ein Modell zu betreiben, das niemand außerhalb von Xiaomi gemessen hat. Bei Milliarden von Tokens pro Monat beginnt der offene Weg bei den Kosten zu gewinnen, und dies ist der Punkt, an dem die Lizenz aufhört, eine rechtliche Fußnote zu sein, und zu einem Beschaffungsfaktor wird.
Die Lizenzen sind nicht dieselbe Berechtigung
MIT ist so ziemlich das Permissivste, was Open Weights hergeben. Die Qwen3.8-Max-Lizenz ist nicht MIT, und der Unterschied hat Biss.
MiMo-V2.6-Flash wird unter MIT veröffentlicht, ohne Umsatzschwelle, ohne Auslöser durch Nutzerzahlen, ohne separate kommerzielle Vereinbarung und ohne Forschungs-Klausel. Kommerzieller Einsatz, Modifikation, Weitergabe und weiteres Training sind alle erlaubt, und das Repository ist nicht zugangsbeschränkt.
Die Qwen3.8-Max-Lizenz gewährt Nutzung, Änderung, Verbreitung, Unterlizenzierung, Verkauf, Bereitstellung, Hosting und Fine-Tuning unter zwei Bedingungen. Ein Produkt oder eine Dienstleistung mit mehr als 100 Millionen monatlich aktiven Nutzern oder 20 Millionen US-Dollar Monatsumsatz muss den Modellnamen gut sichtbar in seiner Oberfläche anzeigen. Und ein Model-as-a-Service- oder KI-Arbeitsassistenten-Geschäft mit einem Gesamtumsatz von über 50 Millionen US-Dollar über einen beliebigen Zeitraum von zwölf aufeinanderfolgenden Monaten benötigt vor der kommerziellen Nutzung eine separate Lizenz von Alibaba. Die interne Nutzung ist ausgenommen, sofern das Modell oder seine Fähigkeiten nicht gegenüber Dritten offengelegt werden.
Für die meisten Teams ist keine der beiden Bedingungen bindend. Für ein erfolgreiches Plattformgeschäft ist eine davon bindend – und sie bindet genau in dem Moment, in dem das Modell tragend geworden ist. Beachten Sie außerdem, dass diese Bedingungen an die herunterladbaren 2,4T-Gewichte geknüpft sind, nicht an die gehostete API, für die stattdessen die Bedingungen des Anbieters gelten. Die beiden Wege bringen unterschiedliche Pflichten mit sich, was ein weiterer Grund dafür ist, den offenen Checkpoint nicht mit dem gehosteten zu vergleichen, als wären sie dasselbe Produkt.
Wo OrcaRouter passt – und wo nicht
Qwen3.8-Max ist auf OrcaRouter routbar, sowohl über den Basis-Eintrag als auch über den datierten 0902-Snapshot, und zwar mit einem API-Schlüssel zum Listenpreis des Anbieters bei durchgereichten 0 % Aufschlag. Das ist hier aus zwei Gründen besonders wichtig. Erstens ist der 0902-Build ein separater Eintrag statt eines stillen Ersatzes, sodass die Routing-DSL reproduzierbarkeitskritischen Verkehr auf den datierten Snapshot festnageln kann, während alles andere der Basisstufe folgt – keine zweite Integration, keine Codeänderung. Zweitens, weil der Listenpreis durchgereicht und nicht mit einem Aufschlag versehen wird, wird eine Änderung an Alibabas Tarifkarte noch am selben Tag auf Ihrer Seite wirksam statt erst bei der nächsten Vertragsverlängerung, was die obige Metered-versus-Node-Rechnung ehrlich hält, wenn sich die Preise bewegen. Cache-lastige Workloads behalten außerdem den Cache-Rabatt des Anbieters, statt einen Teil davon an die Marge eines Resellers zu verlieren.

MiMo-V2.6-Flash ist nirgendwo routbar, auch nicht bei uns. Wir routen kein Xiaomi-Modell, und die Verfügbarkeitszeile in Xiaomis eigener Karte verweist auf Xiaomis eigene Kanäle: die MiMo-API-Plattform, AI Studio, MiMo Code und die Desktop-App. Wenn du diesen Checkpoint willst, lädst du 172,9 GB herunter und suchst dir einen Node.

Welches, und wann
Nehmen Sie Qwen3.8-Max, wenn Sie Leistungsfähigkeit ohne Hardware wollen, wenn Ihr Volumen unsicher ist oder wenn Sie sich die Option einer unabhängigen Zahl offenhalten möchten, bevor Sie sich festlegen. Akzeptieren Sie, dass 45 im aktuellen Index eine Position in der Mitte der Frontier und nicht an der Spitze ist, dass 39,2 Tokens pro Sekunde langsam genug sind, um in einer Agent-Schleife ins Gewicht zu fallen, und dass 190 Mio. Output-Tokens, um den Intelligence Index abzuschließen, etwa das Doppelte des Medians sind — Ausführlichkeit kostet Geld auf der ausgangsbepreisten Seite des Zählers.
Wählen Sie MiMo-V2.6-Flash, wenn die Einschränkung die Lizenz, der Datenpfad oder eine langfristige Rechnung ist, die Sie amortisieren können — und wenn Sie den Knoten haben. MIT-Bedingungen ohne Umsatzhürde sind tatsächlich eine andere Berechtigung als eine Lizenz mit MAU-Schwelle und Umsatzbeteiligungs-Trigger, und für ein Unternehmen, das erwartet, groß zu werden, ist das der Grund, es zu wählen. Planen Sie Multi-Node-Serving ein, dimensionieren Sie anhand der veröffentlichten Gewichtsdaten statt anhand der Repository-Seite, und behandeln Sie jede Zahl in Xiaomis Modellkarte als Anbieterangabe, bis jemand außerhalb des Labors sie reproduziert.
Und wenn Sie sich heute statt erst im nächsten Quartal entscheiden, nutzen Sie zuerst die verbrauchsabhängige Option. Ein Monat mit Qwen3.8-Max sagt Ihnen, was Ihr Workload tatsächlich braucht. Ein Node sagt Ihnen nur, was Sie gehofft hatten, dass er braucht.
