Eine Hero-Titelkarte mit dem Titel 'Xiaomi MiMo-V2.6-Flash ist erschienen' über dem Untertitel '309B offene Gewichte, MIT-Lizenz, 1M-Token-Kontext – veröffentlicht am 21. September 2026', mit vier Pillen-Badges: '309B gesamt / 15B aktiv', '173 GB FP8-Gewichte', '1M-Token-Kontext' und 'Technischer Bericht enthalten'.
Guides & Insights

Xiaomi MiMo-V2.6-Flash ist da: ein offenes 309B-Modell, das Sie selbst hosten

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

MiMo-V2.6-Flash war am 21. September 2026 um 15:39 UTC kein Trainingsjob mehr; Xiaomis MiMo-Team veröffentlichte den Checkpoint als XiaomiMiMo/MiMo-V2.6-Flash-RL auf Hugging Face – ohne Zugangsbeschränkung, MIT-lizenziert, technischer Bericht beigefügt, 65 Gewichts-Shards im Index. XiaomiMiMo/MiMo-V2.6-Pro-RL folgte achtzehn Sekunden später. Eine Woche zuvor waren beide Modelle zwei Karten, die auf einem öffentlichen Trainings-Dashboard als „gestoppt“ markiert waren, und die oft wiederholte Aussage über sie war, dass es keine Gewichte gab. Jetzt sind sie Dateien, die jeder herunterladen und bereitstellen kann. Das ist eine echte Veränderung dessen, was man mit dem Modell tun kann, was etwas anderes ist als eine Ankündigung über ein solches.

Beginnen wir mit dem Zeitstempel, denn die Veröffentlichung kam ohne die übliche Choreografie der Anbieter. Xiaomis eigener Blog, am 22. September überprüft, zeigt weiterhin den Start von MiMo-V2-Flash im Dezember 2025 als neuesten Beitrag. Es gibt keinen Launch-Aufsatz zu V2.6, keine veröffentlichte Preisliste für die neue Generation und keine aufrufbare Modellkennung, die Xiaomi für einen der beiden Checkpoints angekündigt hat. Was existiert, ist ein Repository, ein technischer Bericht, Deployment-Rezepte und eine Reihe von vom Anbieter erstellten Benchmark-Tabellen – plus ein feindseliges kleines Detail in der Modellkarte, das nur für Leute relevant ist, die das Ding tatsächlich laden wollen.

Die beiden Karten, die du halten kannst

Beide Checkpoints sind nativ omnimodal, mit einem angegebenen Kontext von 1 Mio. Token, und beide stehen unter der MIT-Lizenz – kommerziell nutzbar, für Fine-Tuning geeignet, weiterverbreitbar, ohne Umsatzhürde und ohne Forschungsklausel. Die Karte bezeichnet Flash als den „effizienzbalancierten Checkpoint“ der Serie und Pro als das Flaggschiff; der interessante Teil ist, wie sich die beiden unterscheiden, wenn man statt des Marketing-Satzes die Konfigurationen betrachtet.

• Parameteranzahl — MiMo-V2.6-Flash: insgesamt 309B, mit 15B pro Token aktiviert; MiMo-V2.6-Pro: insgesamt 1,02T, mit 42B aktiviert. Beide sind sparse Mixture-of-Experts.

• Backbone — Flash besteht aus 48 Schichten (39 Sliding-Window-, 9 globale Attention), Hidden-Size 4096, 256 geroutete Experten mit 8 aktivierten, einem Sliding-Window über 128 Token, keine geteilten Experten. Der erste Block ist globale Attention mit einem dichten Feed-Forward-Netzwerk; alles danach wechselt sich ab.

• Encoder — ein MiMo ViT mit 681 M Parametern (28 Schichten, 24 mit gleitendem Fenster plus 4 vollständige), ein 308M-Audio-Tokenizer und ein 127M-Audio-Patch-Encoder, sodass Text, Bild, Video und Audio alle in dasselbe Modell gelangen statt in drei zusammengeschraubte Pipelines.

• Spekulative Dekodierung – ein fünfschichtiger Drafter zur Multi-Token-Vorhersage im DFlash-Stil, der in der Karte als Vorhersage von sieben Tokens im Voraus pro Vorwärtsdurchlauf zur parallelen Verifikation beschrieben wird.

• Speicher — der veröffentlichte Index meldet 172,9 GB Gewichtsdaten über 65 Shards hinweg, in FP8 (e4m3) mit einem dynamischen Aktivierungsschema. Das entspricht grob neun Bytes pro Parameter: Xiaomi hat das große Modell ausgeliefert, nicht eine laptopgroße Quantisierung davon.

Drei Zahlen, die nicht übereinstimmen

Das sollte man klar sagen, denn alle drei wirken sich auf eine Deployment-Entscheidung aus und nicht auf ein Benchmark-Argument, und keines davon ist etwas Böses – sie wirken wie eine Dokumentationsdrift zwischen der Ausarbeitung, der Repository-Seite und den ausgelieferten Dateien.

Das erste ist der spekulative Decoder. Die Modellzusammenfassung besagt, dass der MTP-Head ein fünfschichtiger Drafter ist, der sieben Token pro Durchlauf vorhersagt. Die config.json im selben Repository setzt num_nextn_predict_layers auf 3. Beide Zahlen können nicht dasselbe Artefakt beschreiben, und die Config ist diejenige, die die Laufzeitumgebung lesen wird. Wenn Sie den Speicher für spekulatives Decoding dimensionieren, vertrauen Sie der Config und überprüfen Sie es nach dem Laden.

Das zweite ist subtiler und überhaupt kein Fehler, sondern eher eine Namenskonvention, die wie ein Fehler wirkt. Das Repository heißt MiMo-V2.6-Flash-RL, was zu der Annahme verleitet, dass es sich um einen Reinforcement-Learning-Adapter und nicht um ein Modell handelt. Es ist das Modell. Das -RL-Suffix kennzeichnet die Post-Training-Herkunft – dieser Checkpoint ist das Ergebnis des gemischten RL-Laufs, den Xiaomi gestreamt hat, kein LoRA, das auf irgendeiner anderen Basis aufsetzt. Der Gewichtsindex bestätigt es: Zehntausende Tensoren, die das gesamte Backbone, den Vision-Encoder, den Audio-Stack und den Drafter abdecken.

Die dritte ist diejenige, auf die man zuerst stößt, wenn man die Hardware anhand der Repository-Seite statt der Modellkarte dimensioniert. Der Safetensors-Block auf dieser Seite meldet 159B Parameter. Das ist keine der beiden Zahlen der Modellkarte – weder die 309B insgesamt noch die 15B aktiven – und es ist die Zahl, die ein Kapazitätsplaner am ehesten kopieren würde, weil sie direkt neben der Download-Schaltfläche steht. Xiaomi hat den Unterschied nicht erklärt, und wir können ihn von außen nicht klären; die wahrscheinlichste Lesart ist eine Zählkonvention für quantisierte Tensoren und kein anderes Modell. Der sichere Weg ist, stattdessen anhand der veröffentlichten Gewichtsdaten zu dimensionieren: 172,9 GB FP8 über 65 Shards sind eine Zahl, die unabhängig davon, wie die Parameter gezählt werden, im VRAM bezahlt werden muss.

Was die Benchmarks sagen und wer sie durchgeführt hat

Jede Zahl im Folgenden stammt aus Xiaomis eigenen Bewertungstabellen in der Modellkarte. Nichts davon wurde unabhängig reproduziert, nichts davon erscheint auf einem öffentlichen Leaderboard, und bei den Vergleichsspalten handelt es sich um die eigenen Läufe des Anbieters mit denselben Testumgebungen gegen die Modelle anderer Unternehmen. Betrachten Sie die Form der Ergebnisse als aussagekräftig und die Nachkommastellen als Zierde.

• Code-Agent — DeepSWE v1.1: Flash 67,9, Pro 71,9, im Vergleich zu Claude Opus 5 mit 74,0, GPT-5.6 Sol mit 73,0 und Claude Fable 5 mit 70,0. Auf Terminal Bench 2.1 erreicht Flash 87,6 gegenüber den 89,1 von Opus 5 — eine Lücke, die klein genug ist, dass möglicherweise das Harness und nicht das Modell darüber entscheidet.

• Allgemeiner Agent — AutomationBench v1.0.6 setzt Flash auf 52,3 und übertrifft damit in Xiaomis Durchlauf sowohl GPT-5.6 Sol (45,8) als auch Claude Opus 5 (50,3). Toolathlon-Verified: Flash 73,6, Pro 76,9, Opus 5 80,6.

• Cybersicherheit — die am stärksten unausgewogene Spalte in der Tabelle. CyberGym: Flash 95,1, über dem eigenen größeren Geschwistermodell bei 94,0, mit MiMo-V2.5-Pro bei 40,0. Dann fällt der Boden weg: ExploitGym 6,0 für Flash gegenüber 22,1 für Opus 5, ExploitBench 25,3 gegenüber 70,0, SEC Bench Pro 47,5 gegenüber 79,1 für GPT-5.6 Sol.

• Visueller Agent — MiMo VisualCoding: Flash 71.5, Pro 72.3, Opus 5 70.0.

Eine Zahl lohnt sich herauszugreifen, weil sie genau die Art von Sache ist, die ein Launch-Post normalerweise verbirgt. Xiaomis RL-Dashboard veröffentlichte Flash mit 65.68 auf DeepSWE v1.1 — und die Modellkarte gibt jetzt 67.9 für denselben Benchmark auf dem fertigen Checkpoint an. Das sind nicht dieselben Messungen. Die Dashboard-Zahl war als mini-swe-agent, avg@3, auf einem Trainings-Snapshot gekennzeichnet; die Tabelle der Karte ist die Offline-Evaluierung der veröffentlichten Gewichte durch den Anbieter. Die Zwei-Punkte-Differenz ist der Gewinn aus dem letzten Teil des Laufs plus das, was sich am Evaluierungs-Setup geändert hat, und niemand außerhalb Xiaomis kann derzeit die beiden trennen. Wenn du seit letzter Woche 65.68 zitiert hast, ist es jetzt eine veraltete Zahl für ein anderes Artefakt.

A screenshot of the XiaomiMiMo/MiMo-V2.6-Flash-RL repository page on Hugging Face, showing the MIT licence tag, the Safetensors block reporting 'Model size 159B params' and 'This model isn't deployed by any Inference Provider', and the repository file listing that includes the technical report and the weight shards.

Was es kostet, es tatsächlich zu betreiben

Offene Gewichte sind eine Lizenz, keine Rechnung, und an dieser Stelle wird die Veröffentlichung weniger feierlich. Der Deployment-Abschnitt der Model Card selbst empfiehlt SGLang (Tensor-Parallel 16, Data-Parallel 2, mit aktiviertem EAGLE-artigem mehrschichtigem spekulativem Pfad) oder ein vLLM-Rezept bei Tensor-Parallel 8 und merkt an, dass stabiles vLLM hinter der Architektur zurückbleiben kann. Das ist ein Multi-Node-Serving-Job für ein 309B-Modell, dessen Gewichte etwa 173 GB belegen, bevor man den KV-Cache für einen Kontext von 1 Mio. Token hinzufügt. Empfohlenes Sampling ist Temperatur 1,0, top_p 0,95.

Die ehrliche Einordnung von „Open Source“ ist hier also: Xiaomi hat die Lizenzbarriere entfernt und die Hardwarebarriere genau dort belassen, wo sie war. Das Fine-Tuning von Flash auf den eigenen Traces ist jetzt legal und möglich; auf irgendetwas Kleinerem als einem ernsthaften GPU-Knoten ist es das nicht. Das ist ein echtes und anderes Angebot als ein gehosteter Endpunkt, und deshalb konkurrieren die beiden Arten, diese Generation zu nutzen, nicht miteinander – sie decken unterschiedliche Budgets ab.

Wenn Sie die Fähigkeit ohne den Node wollen, sind die Modelle, gegen die Xiaomi in dieser Tabelle benchmarkt, die praktische Alternative: GPT-5.6 Sol, Claude Opus 5 und Claude Fable 5 sind alle heute aufrufbar, und sie sind ein API-Schlüssel zum Listenpreis des Anbieters, mit 0 % Aufschlag, der auf OrcaRouter durchgereicht wird, sodass die Entscheidung, die Sie tatsächlich treffen, „einen Node kaufen“ versus „die Aufrufe abzurechnen“ lautet. Wenn Sie sehen möchten, wie die aufrufbare Stufe bei denselben Coding-Aufgaben abschneidet, bevor Sie sich in die eine oder andere Richtung festlegen, ist das Coding-Board schneller zu lesen als die Anbietertabelle. Was Sie heute bei keinem Router tun können, ist, MiMo-V2.6-Flash selbst aufzurufen — wir routen kein Xiaomi-Modell, und die Verfügbarkeitszeile in Xiaomis eigener Karte verweist auf Xiaomis eigene Kanäle: die MiMo-API-Plattform, AI Studio, MiMo Code und die Desktop-App.

A single-column scoreboard headed 'MiMo-V2.6-Flash - the numbers that decide a deployment', listing 309B total and 15B activated parameters, a 1M-token context, text/image/video/audio modalities, the MIT licence with no revenue cap, 172.9 GB of FP8 weights across 65 shards, DeepSWE v1.1 at 67.9 against 74.0 for Claude Opus 5, CyberGym at 95.1, and SGLang tp16/dp2 or vLLM tp8 serving with no vendor price published.

Die Preisfrage ist noch offen.

Xiaomi hat keinen Preis pro Token für MiMo-V2.6-Flash veröffentlicht. Berichte zum Launch besagen, dass die Serie die API-Preise von MiMo-V2.5 beibehalten werde; das ist jedoch eine Pressebehauptung und keine offizielle Preisliste des Anbieters – die veröffentlichten Auslandspreise der V2.5-Generation lagen bei rund einem Zehntel Dollar pro Million Eingabe-Tokens, wobei gecachte Eingaben um eine Größenordnung günstiger waren, doch nichts auf Xiaomis Website bestätigt, dass die neuen Checkpoints diese übernehmen. Solange keine Preisliste erscheint, ist jede Zahl, die du für einen MiMo-V2.6-Endpunkt siehst, eine Vermutung von jemandem.

Zwei weitere Dinge fehlen noch, und beide stehen auf Xiaomis eigener To-do-Liste und nicht auf der von irgendjemand anderem. Luo Fulis Aussage während des RL-Livestreams war, dass die Trainingsumgebungen und der RL-Code als Open Source veröffentlicht würden, und das Markteinführungsmaterial bekräftigt diese Zusage; die Repositories enthalten derzeit Gewichte, einen technischen Bericht und Deployment-Anweisungen, nicht den Trainingsstack. Und es gibt keine unabhängige Evaluierung: keine Leaderboard-Einreichung, keine Wiederholung der DeepSWE- oder CyberGym-Spalten durch Dritte. Das ist die Lücke, die für alle am wichtigsten ist, die entscheiden, ob ein 309B-Modell mit einem aktiven Budget von 15B einen Node wert ist.

Was würde das Bild verändern?

Drei Signale sind es wert, beobachtet zu werden, grob geordnet danach, wie stark sie eine Entscheidung beeinflussen würden. Eine veröffentlichte Preisliste macht daraus statt eines Self-Hosting-Projekts einen Posten, den man mit der gehosteten Frontier vergleichen kann. Ein Drittanbieter-Lauf auf denselben Harnessen – DeepSWE oder Terminal Bench, eingereicht statt selbst berichtet – würde klären, ob die 67.9 eine echte Position oder eine vorteilhafte Konfiguration ist. Und die RL-Umgebungen wären, falls sie kommen, für die meisten Teams das interessantere Artefakt, denn sie sind das, was man bräuchte, um den Selbstverbesserungs-Loop auf den eigenen Daten nachzubilden.

Bis dahin ist die praktische Lesart dieser Veröffentlichung eng und klar. MiMo-V2.6-Flash ist ein legitimes Open-Weight-, MIT-lizenziertes, omnimodales Agentenmodell in einer Größe, die einen Cluster voraussetzt – und es ist der erste Checkpoint der MiMo-V2.6-Generation, den man in den Händen halten kann, was mehr ist, als man letzte Woche über ihn sagen konnte.

A screenshot of Xiaomi's MiMo blog, captured 22 September 2026, showing the site navigation and the December 16, 2025 post 'Introducing MiMo-V2-Flash' as the newest entry, with the line 'Today, we are releasing and open-sourcing MiMo-V2-Flash', the availability note listing Hugging Face, the API Platform and AI Studio, and a 'Benchmark Comparison' table with columns for SWE-Bench Verified, SWE-Bench Multilingual, Tau2-Bench, AIME25, GPQA-Diamond, HLE and Arena-Hard.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert