OrcaRouter-Modellradar-Hero-Karte mit der Überschrift „MiMo-V2.6-Flash vs. MiMo-V2.6“ und dem Untertitel „Eine Serie, zwei Checkpoints und ein Name, der doppelte Aufgabe erfüllt“, mit einem linken Panel für MiMo-V2.6-Flash, das 309B gesamt / 15B aktiv, 172,9 GB FP8-Gewichte und Effizienz-Checkpoint zeigt, einem rechten Panel für MiMo-V2.6-Pro, das 1,02T gesamt / 42B aktiv, „der Name, den die Leute für das Flaggschiff schreiben“ und dieselbe MIT-Lizenz zeigt, sowie drei Badges darunter: „Veröffentlicht am 21. Sept. 2026“, „1M-Token-Kontext-Anspruch“ und „Kein Xiaomi-Endpunkt zum Aufrufen“.
Guides & Insights

MiMo-V2.6-Flash vs. MiMo-V2.6: Eine Serie, zwei Checkpoints und ein Name mit Doppelrolle

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Fragt man zwei Personen, was MiMo-V2.6 ist, erhält man zwei unterschiedliche Modelle. Xiaomis Veröffentlichung vom September 2026 ist eine Serie mit zwei veröffentlichten Checkpoints — MiMo-V2.6-Flash mit 309 Milliarden Parametern und MiMo-V2.6-Pro mit 1,02 Billionen — und der bloße Name MiMo-V2.6 wird sowohl für die Familie als auch, in den meisten Berichten, für die oberste Stufe der Generation verwendet. Eine Seite mit der Überschrift „MiMo-V2.6-Flash vs MiMo-V2.6“ stellt also in Wirklichkeit den Effizienz-Checkpoint dem Namen gegenüber, den Leute schreiben, wenn sie das Flaggschiff meinen. Beide Checkpoints erschienen am 21. September 2026 im Abstand von achtzehn Sekunden auf Hugging Face, beide tragen die MIT-Lizenz, und beide sind in erster Linie Downloads — es gibt keinen Xiaomi-Endpunkt, den man aufrufen kann. Fast nichts anderes an ihnen ist gleich.

Das ist wichtiger, als es bei einer bloßen Namensstreitigkeit üblicherweise der Fall wäre, denn die beiden sind keine Größenleiter, auf der man später nach oben steigen kann. Sie sind getrennte Trainingsläufe mit getrennten Benchmark-Tabellen, getrennten Speicherbedarfen und – wie die veröffentlichten Zahlen zeigen – ein paar Stellen, an denen das kleinere eindeutig gewinnt.

Zwei Checkpoints, eine veröffentlichte Minute

Bei den Repositories handelt es sich um XiaomiMiMo/MiMo-V2.6-Flash-RL, erstellt um 15:39:51 UTC, und XiaomiMiMo/MiMo-V2.6-Pro-RL, erstellt um 15:39:33 UTC. Keines von beiden ist zugangsbeschränkt. Beide enthalten einen technischen Bericht und eine Modellkarte, und beide werden von Xiaomi als das Ergebnis eines einzelnen gemischten Reinforcement-Learning-Durchlaufs beschrieben, der Coding-, General-Agent-, visuelle und Cybersecurity-Aufgaben in einen einzigen Trainingsdurchgang integrierte statt in getrennte domänenspezifische Durchläufe.

• Parameter — MiMo-V2.6-Flash: 309 Mrd. insgesamt, 15 Mrd. pro Token aktiviert. MiMo-V2.6-Pro: 1,02 Bio. insgesamt, 42 Mrd. aktiviert. Beide sind dünnbesetzte Mixture-of-Experts.

• Backbone — Flash besteht aus 48 Schichten, 39 Gleitfenster- und 9 vollständigen Attention-Schichten, Hidden-Size 4096, 256 gerouteten Experten mit 8 aktivierten, einem Gleitfenster von 128 Tokens und keinen geteilten Experten. Pro verwendet dieselbe hybride Attention-Idee bei deutlich größerer Breite.

• Modalität — beide sind native omnimodal und nehmen Text, Bild, Video und Audio in ein einziges Modell auf, statt in drei zusammengeschraubte Pipelines. Flash enthält einen Vision-Transformer mit 681 Mio. Parametern, einen Audio-Tokenizer mit 308 Mio. Parametern und einen Audio-Patch-Encoder mit 127 Mio. Parametern.

• Kontext — 1 Mio. Token, für beide angegeben, wobei die Konfiguration ein maximales Positions-Embedding von 1.048.576 Token unterstützt.

• Lizenz — MIT bei beiden, ohne Umsatzschwelle, ohne über das übliche Maß hinausgehende Nutzungsauflagen und ohne Forschungsklausel. Kommerzieller Einsatz, Modifikation und Weitergabe sind allesamt zulässig.

• Gewichtsdateien — Flash veröffentlicht 172,9 GB FP8-Gewichtsdaten über 65 Shards. Pro hat etwa dreimal so viele Parameter, daher landet sein Download im Bereich eines halben Terabytes, bevor Sie selbst irgendeine Quantisierung vornehmen.

• Wo sie bereitgestellt werden — Hugging Face, Xiaomis eigene API-Plattform, AI Studio, MiMo Code und die MiMo-Desktop-App. Die Karte merkt an, dass derzeit keiner der beiden Checkpoints von einem Inferenzanbieter eines Drittanbieters auf dem Hub selbst bereitgestellt wird.

Die Kollision, die Menschen Hardware kostet

Die Verwirrung bei dieser Paarung liegt nicht wirklich zwischen Flash und Pro. Sie liegt zwischen MiMo-V2.6-Flash und dem Modell, das davor kam.

MiMo-V2-Flash wurde im Dezember 2025 veröffentlicht, und Xiaomis eigener Blogbeitrag, in dem es angekündigt wird, beschreibt ein Mixture-of-Experts-Modell mit 309 Milliarden Gesamtparametern, 15 Milliarden aktiven Parametern, einem hybriden Attention-Schema, das Sliding-Window- und Full-Attention verschachtelt, und einem aggressiven 128-Token-Sliding-Window. Lies das gegen die Aufzählung des 2026-Checkpoints und des 2025-Checkpoints: Sie haben dieselbe Headline-Form, dieselbe Sliding-Window-Größe und dasselbe Aktivierungsbudget — neun Monate auseinander, aus unterschiedlichen Trainingsläufen, mit unterschiedlichen Fähigkeiten und einer anderen Benchmark-Tabelle.

Eine Suche nach „MiMo V2.6 Flash“ liefert Ihnen also munter Seiten über MiMo-V2-Flash – samt einer 256K-Kontextangabe und einem Preis von einem Zehntel Dollar pro Million Eingabe-Tokens, der zum älteren Modell gehört. Wenn Sie einen Node dimensionieren, ist das kein kosmetischer Fehler. Der ältere Checkpoint und der neue sind unterschiedliche Downloads mit unterschiedlichen Serving-Rezepten, und der neue gibt an, viermal so viel Kontext zu haben.

Es gibt eine zweite, leisere Falle in der Namensgebung. Beide Repositories enden auf -RL, was wie ein Reinforcement-Learning-Adapter klingt, der auf einem anderen Basismodell aufsetzt. Sie sind keine Adapter. Das Suffix kennzeichnet die Post-Training-Abstammung: Dies sind die vollständigen Checkpoints, die aus dem gestreamten RL-Lauf hervorgegangen sind. Der Weight-Index bestätigt es – Zehntausende Tensoren, die das gesamte Backbone, den Vision-Encoder, den Audio-Stack und den spekulativen Drafter abdecken.

Was die eigene Tabelle des Anbieters sagt

Jede Zahl in diesem Abschnitt stammt aus Xiaomis Bewertungstabellen in den beiden Model Cards. Xiaomi hat die Test-Harnesses auf seinen eigenen Checkpoints ausgeführt. Nichts davon wurde außerhalb des Labors reproduziert, nichts davon erscheint auf einem öffentlichen Leaderboard, und bei den Vergleichsspalten handelt es sich um die eigenen Durchläufe des Anbieters mit denselben Harnesses gegen die Modelle anderer Unternehmen. Betrachten Sie das Ranking als informativ und die Nachkommastellen als Dekoration.

• Code-Agent — DeepSWE v1.1: Flash 67,9, Pro 71,9. Terminal Bench 2.1: Flash 87,6, Pro 89,9. ProgramBench: Flash 26,0. MiMo Code Bench: Flash 61,2.

• Allgemeiner Agent — AutomationBench v1.0.6: Flash 52.3, Pro 53.1. Toolathlon-Verified: Flash 73.6, Pro 76.9. OSWorld-Verified: Flash 80.8, Pro 82.0. Agents' Last Exam: Flash 27.6. Terminal Bench 4.0: Flash 28.8.

• Cybersicherheit — die einzige Spalte, in der das kleinere Modell führt. CyberGym: Flash 95,1 gegenüber 94,0 von Pro. MiMo Cyber Bench: Flash 77,2. Dann bricht der Boden weg: ExploitGym 6,0, ExploitBench 25,3, SEC Bench Pro 47,5.

• Visueller Agent — MiMo VisualCoding: Flash 71.5, Pro 72.3.

Geht man diese Aufzählungspunkte durch, lautet die ehrliche Zusammenfassung, dass Pro fast überall vorne liegt – mit kleinen Vorsprüngen, die klein genug sind, um innerhalb des Rauschens einer selbst ausgeführten Testumgebung zu liegen. Bei DeepSWE liegen die beiden vier Punkte auseinander, auf einer Skala, auf der sich derselbe Checkpoint zwischen zwei von Xiaomis eigenen Bewertungen um zwei Punkte bewegte.

Dieser letzte Punkt verdient einen eigenen Absatz, denn er ist das Nützlichste in beiden Karten. Xiaomis öffentliches RL-Dashboard, das beide Trainingsläufe bis September streamte, veröffentlichte Flash bei 65.68 auf DeepSWE v1.1 unter Verwendung eines mini-swe-agent-Harness im Durchschnitt aus drei. Die fertige Karte zeigt 67.9 für die veröffentlichten Gewichte. Der Dashboard-Wert von Pro lag hingegen bei 72.57 und seine Karte zeigt 71.9 — er ist gesunken. Zwei Checkpoints aus demselben Lauf, zweimal bewertet, und die Lücke zwischen den beiden Bewertungen ist genauso groß wie die Lücke zwischen den beiden Modellen. Wenn Sie seit letzter Woche Dashboard-Zahlen zitieren, beschreiben sie Trainings-Snapshots, nicht die Artefakte, die Sie heute herunterladen würden.

Scoreboard card headed 'MiMo-V2.6-Flash vs MiMo-V2.6-Pro', with paired rows for parameters (309B total / 15B active against 1.02T total / 42B active), weights on disk (172.9 GB FP8 across 65 shards against about three times Flash), DeepSWE v1.1 (67.9 against 71.9, with the RL dashboard's earlier 65.68 and 72.57 noted), CyberGym (95.1 against 94.0), independent score (None published against an Artificial Analysis Index of 46 at 134.3 output tokens per second) and price, plus a sourcing footer stating that every benchmark is Xiaomi's own run except the Pro index score.

Keines von beiden ist auf einem Router

Hier ist der Teil, der die meisten echten Bewertungen entscheidet. Xiaomi verkauft keinen der beiden Checkpoints: Auf der eigenen Website ist kein Preis pro Token für die MiMo-V2.6-Generation veröffentlicht, und es gibt keine aufrufbare Modellkennung, die Xiaomi für einen der beiden angekündigt hat. Was stattdessen existiert, ist ein Download plus – nur für Pro – ein einziger API-Anbieter, den Artificial Analysis als einen Anbieter zählt, der es zu $0,435 pro Million Input-Tokens und $0,87 pro Million Output-Tokens anbietet. Das ist ein Eintrag eines Anbieters und keine Preisliste des Herstellers, und für Flash gibt es überhaupt nichts Vergleichbares. Zahlen, die auf Katalogseiten Dritter kursieren, sollten auf dieselbe Weise gelesen werden.

Die Wahl zwischen Flash und Pro ist also keine Wahl zwischen zwei Endpunkten mit unterschiedlichen Messwerten. Sie ist eine Wahl zwischen zwei GPU-Rechnungen, und die kleinere ist ungefähr ein Drittel der größeren. Das ist das gesamte kommerzielle Argument für Flash, und es ist stärker, als die Benchmark-Tabelle vermuten lässt, denn die beiden Modelle liegen bei den Aufgaben, für die die meisten Leute sie kaufen, nur wenige Punkte auseinander.

Was danach bleibt, ist die bekannte Dreiteilung. Die Frontier mieten, ein kleines Modell selbst betreiben oder ein großes selbst betreiben. Die Frontier-Spalte ist die, gegen die Xiaomi in seinen eigenen Tabellen benchmarkt — Claude Opus 5, GPT-5.6 Sol und Claude Fable 5 liegen im eigenen Vergleich des Anbieters auf DeepSWE alle ein paar Punkte über Pro, und alle drei sind heute ansteuerbar über einen API-Schlüssel auf OrcaRouter zum Listenpreis des Anbieters mit 0 % durchgereichtem Aufschlag. Das ist wichtig für die konkrete Entscheidung, die vor Ihnen liegt: Eine Preisänderung des Anbieters wirkt sich noch am selben Tag bei Ihnen aus statt erst bei der nächsten Vertragsverlängerung, sodass die Mieten-gegen-Besitzen-Rechnung ehrlich bleibt, während sich die Hosting-Preise bewegen. Automatisches Failover bedeutet außerdem, dass ein Modell, das Sie noch evaluieren, nie allein auf einem Produktionspfad stehen muss während Sie sich entscheiden.

Was Sie heute auf keinem Router tun können – unseren eingeschlossen –, ist, MiMo-V2.6-Flash oder MiMo-V2.6-Pro aufzurufen. Wir routen kein Xiaomi-Modell, und die Verfügbarkeitszeile in Xiaomis eigener Karte verweist auf Xiaomis eigene Kanäle: die MiMo-API-Plattform, AI Studio, MiMo Code und die Desktop-App.

Welcher Checkpoint, und wann

Nimm MiMo-V2.6-Flash, wenn du die MiMo-V2.6-Generation willst und die Hardware die bindende Einschränkung ist. Gegenüber dem Flaggschiff verzichtest du auf rund vier DeepSWE-Punkte und ein bis zwei Punkte bei den meisten Agent-Benchmarks. Du gewinnst einen Checkpoint, dessen Speicherbedarf etwa ein Drittel beträgt, der Pro bei CyberGym in Xiaomis eigener Tabelle übertrifft und der dieselbe Lizenz, dieselbe Angabe zum 1M-Token-Kontext und dieselbe Multimodalität teilt. Für ein Team, das Cybersicherheits-Evaluierungsarbeit macht, ist diese CyberGym-Spalte kein Rundungsfehler.

Nehmen Sie MiMo-V2.6-Pro, wenn die Workload aus Coding oder langhorizontiger agentischer Arbeit besteht und der Node bereits bezahlt ist. Es ist das bessere Modell in nahezu jeder Spalte, es ist das Modell, das Artificial Analysis tatsächlich gemessen hat – ein Intelligence Index von 46 auf der neu kalibrierten v4.3-Skala, das erste der 114 Modelle in seiner Open-Weights-Klasse, 134,3 Ausgabe-Tokens pro Sekunde und mit 0,435 $ pro Million Eingabe-Tokens und 0,87 $ pro Million Ausgabe-Tokens angegeben – und unabhängige Messung ist mehr wert als eine Anbietertabelle, wenn Sie die Produktion planen.

Vertraue keinem von beiden, bevor du die Konfigurationsdateien statt der Zusammenfassungen gelesen hast. Die Flash-Karte beschreibt einen spekulativen Drafter mit fünf Schichten, der sieben Tokens pro Durchlauf vorhersagt; die config.json im selben Repository setzt num_nextn_predict_layers auf 3. Die Zusammenfassung der Karte ist nicht das, was die Laufzeitumgebung liest. Und der Safetensors-Block auf der Repository-Seite gibt 159B Parameter für Flash und 524B für Pro an, wobei keines von beiden mit der Gesamtzahl oder der aktiven Anzahl in einer der beiden Modellkarten übereinstimmt. Xiaomi hat die Diskrepanz nicht erklärt. Richte dich stattdessen nach den veröffentlichten Gewichtsdaten, denn das ist die Zahl, die man im VRAM bezahlt, unabhängig davon, wie die Parameter gezählt werden.

Screenshot of the Hugging Face model page for XiaomiMiMo/MiMo-V2.6-Flash-RL, showing the MIT licence and multimodal tags, the model card heading 'Scaling Reinforcement Learning Toward Self-Improvement', a Safetensors block reporting a 159B model size, and an inference-providers panel stating that the model is not deployed by any inference provider.

Was würde es klären

Drei Dinge, grob nach Nützlichkeit geordnet. Ein Drittanbieter-Durchlauf auf denselben Harnessen – DeepSWE oder Terminal Bench, eingereicht statt selbst berichtet – würde dir zeigen, ob der Vier-Punkte-Abstand zwischen Flash und Pro eine echte Position oder eine günstige Konfiguration ist. Eine veröffentlichte Preisliste würde den ganzen Vergleich von einem Hardware-Projekt in einen Einzelposten verwandeln, den man neben die gehostete Frontier stellen kann. Und die RL-Umgebungen, die Xiaomi nach eigenen Angaben als Open Source veröffentlichen will, sind das Artefakt, das die meisten Teams tatsächlich haben wollen, denn sie sind das, was man braucht, um die Schleife auf den eigenen Traces nachzubilden.

Bis dahin ist die praktische Lesart eng. MiMo-V2.6 sind zwei Checkpoints, nicht einer, und der bloße Name meint meist den teuren. Wenn Sie heute innerhalb der Serie wählen, ist die ehrliche Standardwahl Flash, es sei denn, eine Benchmark-Spalte, die Ihnen speziell wichtig ist, sagt etwas anderes — und wenn Sie noch nicht bereit sind, einen Node zu kaufen, ist keine von beiden noch die richtige Antwort.

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro, showing an Intelligence Index of 46 on the updated scale, ranked first of 114, output speed of 134.3 tokens per second, a price of $0.435 per million input tokens and $0.87 per million output with a 99% cache discount and $0.13 cost per Intelligence Index task, a 1M-token context window, and 1.02T total with 42B active parameters under the MIT licence with weights on Hugging Face.