
MiMo-V2.6: Was Xiaomis RL-Paper tatsächlich zeigt – und was es unverifiziert lässt
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 36 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 182 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Die meisten der in diesem Monat veröffentlichten Modellpapiere sind Architekturpapiere. Der technische Bericht hinter Xiaomi MiMo-V2.6-Pro und Xiaomi MiMo-V2.6-Flash ist es nicht. Mit dem Titel MiMo-V2.6: Reinforcement Learning zur Selbstverbesserung skalieren, eingereicht am 21. September 2026 und LLM-Core Xiaomi zugeschrieben, verwendet er nahezu keinen Teil seiner Länge auf das Sparse-Mixture-of-Experts-Backbone und fast die gesamte auf eine einzige Frage: Was passiert, wenn das gesamte Post-Training-Budget in einen einzigen gemischten Reinforcement-Learning-Lauf fließt. Der Bericht zu DeepSeek-V4.1-Flash hingegen ist ein Speicherdokument — seine Länge fließt in komprimierte Sparse Attention, Cross-Layer-KV-Wiederverwendung und FP4-Speicherung. Stellt man die beiden nebeneinander, sind sie Argumente darüber, woher Fähigkeit kommt, und sie stimmen nicht überein.
Der Bericht ist für sich genommen lesenswert, aber es lohnt sich, ihn sorgfältig zu lesen, denn er ist ein Selbstbericht des Labors, das den Lauf durchgeführt hat. Er benennt seine Mechanismen, zeigt seine Ablationen, veröffentlicht seine Fehlschläge und berichtet im selben Atemzug Zahlen, die von außen nicht überprüft werden können. Diese beiden Dinge auseinanderzuhalten, macht den Großteil der Arbeit aus. Dieser Beitrag leistet das, und er wurde am 23. September 2026 geschrieben – zwei Tage, nachdem die Checkpoints online gegangen waren, während das Paper das Neueste und am wenigsten Bestätigte ist, was über sie vorliegt.
Warum das Datum auf dem Papier wichtiger ist als sonst
Xiaomis MiMo-V2.6-Pro- und MiMo-V2.6-Flash-Checkpoints erschienen am 21. September 2026 auf dem Modell-Hub, MIT-lizenziert und ohne Zugangsbeschränkung. Der Bericht ist auf denselben Tag datiert und erreichte die Spitze der Trending-Liste auf der Preprint-Seite, auf der er veröffentlicht wurde. Dieses Timing ist der Grund, warum dies ein Nachrichtenbeitrag und keine Retrospektive ist: Das Paper ist keine nachträgliche Erklärung eines Modells, das alle bereits benchmarkiert haben. Es erscheint gemeinsam mit den Gewichten, bevor irgendjemand außerhalb von Xiaomi einen unabhängigen Testlauf veröffentlicht hat.

Diese Reihenfolge ist zugleich die Hauptschwäche des Papers als Beleg. Alles, was daraus folgt — die DeepSWE-Kurve, die Zugewinne bei der Pass-Rate, die Reward-Hacking-Verteidigung —, ist eine Behauptung über einen Trainingsprozess, der einmal stattfand, in einem einzigen Labor, auf einem einzigen Cluster, und den niemand sonst reproduziert hat. Der Thread, der auf den Bericht aufmerksam gemacht hat, hält genau das für den interessanten Teil: Es handelt sich um ein Paper über Daten und Experimente, kein Architektur-Paper, und Experimente sind genau die Art von Ergebnis, die sich entweder replizieren lässt oder nicht.
Drei Achsen der Skalierung, und nur eine davon ist ein Hardware-Problem
Die Darstellung des Berichts ist, dass die Rechenleistung für bestärkendes Lernen entlang dreier Achsen gleichzeitig skaliert wurde, und die dritte ist diejenige, die verändert, wie man über die Methode denkt.
• Batch und Durchsatz — 1.568 Samples pro Update, die jeweils zu sechzehn Rollouts erweitert werden, also rund 25.000 Trajektorien pro Schritt, wobei pro Schritt bei Kontextlängen von bis zu einer Million Tokens 2,7 bis 3,7 Milliarden Tokens verbraucht werden. Die Rollout-Architektur ist vollständig asynchron, was diese Batchgröße überhaupt erst bewältigbar macht.
• Umgebungen — ein einziger gemischter Durchlauf über Code-, allgemeine Agenten-, visuelle und Cyber-Aufgaben hinweg, unter mehreren Agenten-Harnessen gleichzeitig, statt separater RL-Läufe pro Domäne. Xiaomis eigener Kurzname dafür lautet „You Only RL Once“. Das Argument für die Mischung ist, dass Fortschritte bei einer Fähigkeit die anderen verstärken; das Risiko ist, dass eine langsame Aufgabenart ausgehungert wird, was der Bericht zufolge mit adaptivem Scheduling bewältigt wird.
• Grader-Compute — die Achse, bei der es nicht im üblichen Sinne um GPUs geht. Binäres Bestehen/Nichtbestehen kann zwei Lösungen, die beide bestehen, nicht in eine Rangfolge bringen, daher wird das Belohnungssignal selbst zu dem, was man skaliert. Ein agentischer Grader vergleicht die sechzehn Versuche für eine Aufgabe gemeinsam und erzeugt ein abgestuftes Signal statt eines Bits.
Diese dritte Achse ist der Punkt, an dem der Ausdruck „Selbstverbesserung“ im Titel seinen Platz verdient, und an dem der Bericht am angreifbarsten ist. Ein Modell, das seine eigenen Rollouts bewertet, ist eine Angriffsfläche für Reward-Hacking, und der Bericht behandelt es als eine solche.
Die zwei Mechanismen, die es wirklich wert sind, verstanden zu werden
Gruppenweise Vorteilsumverteilung
Nach jedem Schritt erzeugt die Policy sechzehn Versuche pro Aufgabe, und alle werden in einem gemeinsamen Arbeitsbereich abgelegt, damit ein Evaluatormodell sie zusammen statt einzeln untersuchen kann. Bestandene Patches werden dann anhand von fünf Achsen bewertet: ob der Ansatz zum Problem passt, ob die Implementierung präzise ist, ohne unnötige Fallbacks, ob die Änderung minimal ist, ob sie etwas außerhalb des Geltungsbereichs ändert und ob sie dem umgebenden Codestil entspricht. Niedriger eingestufte bestandene Patches erhalten weniger positive Verstärkung. Ein Patch, der als Hack bestätigt wurde, wird auf null zurückgesetzt und als Fehler behandelt.
Die Konsequenz ist ein Trainingssignal, das eher auf kürzere, günstigere Lösungen als auf bloß korrekte drängt – der Bericht beschreibt dies als Steuerung hin zu weniger Tokens pro Aufgabe. Das ist der Punkt, den man festhalten sollte, denn die später im Paper präsentierten Hauptergebnisse weisen in die andere Richtung.
Gruppenweise Belohnungssynthese
Die Offline-Hälfte derselben Idee. Statt Qualität ausschließlich aus einem Live-Grader abzuleiten, berechnet das Team aufgabenspezifische Rubriken vorab und multipliziert die binäre Testbelohnung mit Qualitäts- und Verhaltenswerten, die aus diesen Rubriken abgeleitet werden. Der Bericht beschreibt dies als das Erstellen der Rubriken aus kontrastierenden Rollouts – das heißt aus Fällen, in denen das Ergebnis abwich, denn dort liegt die Information.
Bewertung ist nicht kostenlos. Der Bericht veranschlagt die Kosten für Bewerter auf rund 12,7 % der gesamten Reinforcement-Learning-Kosten von MiMo-V2.6-Pro. Diese eine Zahl ist das Nützlichste in dem Paper für alle, die erwägen, die Methode zu kopieren, denn sie verwandelt „Skalieren Sie Ihre Bewerter“ von einer Idee in einen eigenen Kostenposten.
Der eingefrorene Router ist das Ergebnis, das die meisten Teams zuerst kopieren werden
Der Stabilitätsabschnitt des Berichts enthält einen Befund, der für sich steht, unabhängig von MiMo-V2.6 und unabhängig davon, wie gut das Modell abschneidet.
Bei trainierbaren Mixture-of-Experts-Routern driftete die Expertenlast über zwanzig Schritte stark ab. Der Variationskoeffizient über die Experten stieg von 0,78 auf 2,0. Die Spitzenlast auf dem meistbeschäftigten Experten stieg von sechsmal dem Durchschnitt auf das Sechzehnfache. Der Anteil kalter Experten – also derjenigen, die fast keinen Traffic erhalten – stieg von 0,5 % auf 22 %. Das Zurücksetzen der Router-Gewichte auf ihre Anfangswerte bei Schritt 20 stellte das Gleichgewicht sofort wieder her.
Xiaomis Reaktion bestand darin, den MoE-Router für den Lauf einzufrieren. Die Begründung ist nicht subtil: Bei dieser Batch-Größe ist Routing-Instabilität ein Problem der Trainingsdynamik, das man schlicht nicht haben muss, und der Router ist nicht der Ort, an dem das Reinforcement Learning seine Arbeit verrichtet. Ob das Einfrieren etwas an der endgültigen Qualität kostet, wird durch eine Ablation im veröffentlichten Material nicht beantwortet, und das ist ein berechtigter Wunsch.
Der Befund sagt nichts über Serving aus. Router-Lastverteilung während eines Trainingslaufs und Expert-Auslastung unter Produktionsverkehr sind unterschiedliche Fragen, und der Bericht behandelt nur Ersteres.
Die Zahlen, mit ihren daran angebrachten Beschriftungen
Die Schlagzeilenergebnisse des Berichts sind in ihrer Form sauber und im Detail unordentlich, und das Durcheinander ist kein Skandal – es sind drei verschiedene Messungen von drei verschiedenen Objekten, die sich einen Namen teilen.
• DeepSWE v1.1, zurückgehalten — MiMo-V2.6-Pro stieg im Verlauf des Durchlaufs von 58,4 auf 72,6; MiMo-V2.6-Flash von 48,7 auf 65,7. Der Benchmark umfasst 113 Repository-Engineering-Aufgaben mit langem Horizont, die von funktionalen Verifizierern über fünf Programmiersprachen hinweg bewertet werden, und die Metrik ist average@3 — die durchschnittliche Bestehensrate der Verifizierer über drei Stichprobenversuche, was nicht dasselbe ist wie die Frage, ob irgendeiner von drei Versuchen erfolgreich war. Wenn man avg@3 als pass@3 liest, setzt man jede Zahl auf der Seite zu hoch an.
• Derselbe Benchmark, an anderer Stelle gemessen – die veröffentlichten Modellkarten nennen für Pro 71,9 und für Flash 67,9. Xiaomis öffentliches Trainings-Dashboard zeigte 72,57 und 65,68. Es gibt also drei veröffentlichte Zahlen pro Modell, zwei davon von Xiaomi, und die Richtung der Abweichung unterscheidet sich bei den beiden Geschwistermodellen. Keine davon ist falsch; sie beschreiben eine Dashboard-Momentaufnahme, einen Eintrag in einer Modellkarte und eine Berichtszeile, zu unterschiedlichen Zeitpunkten und möglicherweise unter unterschiedlichen Test-Harnessen.
• Destillation — MiMo-V2.6-Distill-Qwen-9B, ausgehend von Qwen3.5-9B auf MiMo-generierten Demonstrationen feinabgestimmt, verbesserte SWE-bench Verified von 61,1 auf 66,2. Dies ist die übertragbarste Zahl im Paper, denn ein 9B-Student ist eine Größe, die die meisten Teams tatsächlich betreiben können.
• Ein interner Mini-Benchmark für Cybersicherheit — 31,3 bis 47,0. Intern heißt intern: Die Aufgaben sind nicht veröffentlicht, daher kann das Delta nicht einmal im Prinzip reproduziert werden.
• Der Artificial Analysis Intelligence Index — 46 für MiMo-V2.6-Pro. Dieser ist von anderer Art. Er wurde nicht von Xiaomi erzeugt, sondern von Artificial Analysis; diese ließ ihren eigenen Harness gegen den veröffentlichten Checkpoint laufen, was ihn zur einzigen Schlagzeilenkennzahl in dieser Veröffentlichung macht, die ein Leser als gemessen statt als berichtet einordnen kann. Er ist außerdem die Vergleichszahl für GLM-5.3, Kimi K3 und die geschlossene Frontier, und er liegt fünf Punkte unter Claude Opus 5.


Der Bericht ist ehrlich über die Grenzen seiner eigenen Tabelle, und das ist der Satz, den man jedem entgegenhalten sollte, der es nicht ist: Die Vergleiche mischen öffentliche und interne Benchmarks und isolieren nicht den Beitrag des Reinforcement Learning von Architektur oder Pre-Training. Ein Modell, das nach RL besser ist, ist kein Beweis dafür, dass RL der Grund dafür ist.
Es gibt einen zweiten Vorbehalt, und er ist derjenige, der gegen die Darstellung spricht. Die berichteten Zugewinne gehen im Allgemeinen mit steigender Token-Nutzung einher. Der Bericht stellt das als anhaltende Leistungsfähigkeitsverbesserung dar und nicht als Effizienz, und das zu Recht. Doch GAR wurde ausdrücklich darauf ausgelegt, in Richtung kürzerer Pfade und weniger Tokens pro Aufgabe zu lenken, und das Gesamtergebnis zeigt nicht, dass die Arbeitslast günstiger wird. Die Leistungsfähigkeit stieg; die Kosten pro Aufgabe sanken nicht. Wenn Sie „Selbstverbesserung“ als „das Modell wird im nächsten Quartal weniger von meinem Geld brauchen“ lesen, stützt das Paper diese Lesart nicht.
Was der Bericht ungeprüft lässt
Mit Stand vom 23. September 2026 hat keine dritte Partei eine unabhängige Wiederholung der Spalten DeepSWE, Terminal Bench oder CyberGym veröffentlicht. Der entscheidende Unterschied besteht zwischen dem Indexpunkt und allem anderen: 46 ist eine Messung, die jemand anderes vorgenommen hat, und 72,6 ist eine Behauptung über einen Trainingslauf, den niemand erneut ausführen kann, weil der Lauf Berichten zufolge 2,6 Millionen US-Dollar für Pro und 0,9 Millionen US-Dollar für Flash gekostet hat und nicht zweimal stattfinden wird.
Was Xiaomi veröffentlicht hat, was die meisten Labore nicht tun, sind die Trainingsdynamik, das Reinforcement-Learning-Framework und die Aufgabenumgebungen – mehr als 7.000 abgestufte Umgebungen aus Software-Engineering, Schwachstellenreproduktion, Wissensarbeit und Webdesign. Das ist das Artefakt mit der längsten Haltbarkeit. Die Gewichte sagen dir, was der Lauf hervorgebracht hat; die Umgebungen sagen dir, wie du das Experiment selbst durchführst, und nur so können die RL-Behauptungen jemals geklärt werden.
Die Verteidigung gegen Reward-Hacking verdient einen spezifischen Vorbehalt. Sie wird als mehrschichtig beschrieben — Reward-Design, adversariale Evaluation, Anomalieerkennung und Gegenprüfung zwischen Verifikatoren — und sie wird ausschließlich von der Partei beschrieben, die ein Scheitern derselben in Verlegenheit bringen würde. Eine Verteidigung dagegen, dass ein Modell einen modellbasierten Bewerter austrickst, ist nicht die Art von Sache, die sich mit einer Selbstauskunft abschließend erledigen lässt. Der Mechanismus wird benannt und der Fehlermodus wird eingeräumt, was mehr ist, als die meisten Arbeiten tun, und es bleibt eine offene Frage.
Was Sie damit heute tatsächlich tun können
Beide Checkpoints sind herunterladbar, ohne Zugangsbeschränkung, unter einem MIT-Lizenz-Tag: Xiaomi MiMo-V2.6-Pro-RL und Xiaomi MiMo-V2.6-Flash-RL, omnimodal, Kontextfenster von einer Million Token, wobei der Flash-Index 172,9 GB Gewichtsdaten über 65 Shards in FP8 meldet. Xiaomi hat für die V2.6-Generation keine Preisliste pro Token veröffentlicht, die Wahl heute fällt also zwischen Selbsthosting und einem gehosteten Modell, für das Sie bereits bezahlen.
In diesem Vergleich liegt der eigentliche Praxiswert des Papers, und er fällt für das Paper auf eine nützliche Weise wenig schmeichelhaft aus. Die Behauptung, die auf dem Prüfstand steht, lautet nicht „Ist MiMo-V2.6-Pro gut?" — das beantworten die 46 bereits. Sie lautet: „Erzeugt Reinforcement Learning auf gemischten agentischen Aufgaben Reasoning, das sich auf meinen Workload übertragen lässt?", und die einzige ehrliche Art, das zu beantworten, ist, beide laufen zu lassen und zu vergleichen — was ein Routing-Problem ist, noch bevor es ein Forschungsproblem ist. DeepSeek-V4.1-Flash ist nur einen API-Key entfernt und kostet $0,15 bzw. $0,60 pro Million Tokens, Qwen3.8-Flash und GLM-5.3-Flash liegen auf demselben Key, und wenn Sie einen selbst gehosteten MiMo-Checkpoint eine Woche lang hinter denselben Endpoint hängen und sehen wollen, ob die DeepSWE-Kurve in Ihren eigenen Evals auftaucht, dann ist das eine Konfigurationsänderung und keine Migration. OrcaRouter hostet die Modelle von Xiaomi nicht, und nichts hier sollte als gegenteilige Behauptung gelesen werden — aber die Modelle, gegen die Sie sie benchmarken würden, sind alle erreichbar über einen einzigen OrcaRouter-API-Key zum Anbieter-Listenpreis mit durchgereichtem 0-%-Aufschlag, mit automatischem Failover, falls sich ein Checkpoint, den Sie testweise einsetzen, unter Last als instabil erweist.
Der Fall des unbewiesenen Modells ist genau der, für den Failover gebaut wurde. Ein vor zwei Tagen veröffentlichter Checkpoint, mit einer vom Anbieter durchgeführten Evaluierung und ohne unabhängige Wiederholung, ist genau das, was man ausprobieren möchte, ohne einen Produktionspfad dahinterzulegen.
Wer sollte das Paper lesen?
Wenn Sie Post-Training durchführen, lesen Sie es wegen des Router-Befunds und der Grader-Kosten-Kennzahl. Beide sind übertragbar, beide sind billig zu testen, und keines hängt davon ab, irgendetwas über die Benchmark-Tabelle von MiMo-V2.6 zu glauben. Besonders das Frozen-Router-Ergebnis ist die Art von Sache, die einen Nachmittag kostet, um sie auszuprobieren, und einen Durchlauf spart.
Wenn Sie ein Modell auswählen, lesen Sie den Indexwert und überspringen Sie den Rest. Artificial Analysis hat 46 für das veröffentlichte Artefakt gemessen; das ist die einzige Zahl in dieser Veröffentlichung, die nicht vom Anbieter stammt, und sie platziert MiMo-V2.6-Pro an der Spitze des Open-Weights-Felds und fünf Punkte hinter Claude Opus 5. Alles andere im Bericht beschreibt, wie Xiaomi dorthin gelangt ist, und wie Xiaomi dorthin gelangt ist, ist nichts, was man kaufen kann.
Und wenn Sie die Berichterstattung statt das Paper lesen, sollten Sie auf das Wort „Selbstverbesserung“ achten. Die Ergebnisse des Berichts selbst zeigen, dass die Leistungsfähigkeit mit der Token-Nutzung steigt, was ein echter und reproduzierbarer Befund zur Skalierung von Reinforcement Learning ist. Es ist keine Behauptung, dass das Modell günstiger im Betrieb geworden ist, und die Papers, die diesem folgen, werden Ihnen sagen, ob es irgendwann so weit kommt.
