
Xiaomi MiMo-V2.6-Pro: Ein DeepSWE-Score von 72,57, ein Lauf, der gestoppt wurde, und weiterhin kein Veröffentlichungsdatum
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro beendete seinen öffentlich gestreamten Reinforcement-Learning-Lauf am 20. September mit einem DeepSWE-v1.1-Score von 72,57, der auf Xiaomis eigenem Dashboard stand — 1,4 Punkte unter den 74 %, die GPT-6 Astra, Gemini 3.8 Flash und Claude Opus 5 an der Spitze desselben Leaderboards teilen. Xiaomi MiMo-V2.6-Flash, das kleinere Modell, das parallel trainiert wurde, endete am 19. September bei 65,68. Beide Läufe endeten bei Schritt 30, und die kombinierte Rechnung, die Xiaomi daneben veröffentlichte, belief sich auf 3.474.715 $, als wir die Seite heute Morgen erfasst haben.
Das ist die gesamte gute Nachricht, und sie ist wirklich gut. Der Rest der Geschichte ist eine Lücke zwischen einer Zahl und einem Produkt. Weder Xiaomi MiMo-V2.6-Pro noch Xiaomi MiMo-V2.6-Flash hat ein Veröffentlichungsdatum, eine Modellkarte, eine API-Kennung, einen veröffentlichten Preis oder einen Satz herunterladbarer Gewichte. Es gibt keinen Endpunkt, den man aufrufen kann. Was existiert, ist ein Trainings-Dashboard, das jeder beobachten kann, ein Benchmark-Wert, den Xiaomis eigener Harness erzeugt hat, und eine Community, die sechs Tage damit verbracht hat, eine Telemetrie-Seite zu lesen, so wie Menschen früher Teeblätter gelesen haben.
Das hier ist also ein Was-wir-bisher-wissen-Artikel, und die ehrliche Version davon trennt drei Dinge, die die Berichterstattung der letzten Woche still und leise vermischt hat: was Xiaomi offiziell verlautbart hat, was ein einzelner Beobachter darüber berichtet hat und was all das für jemanden bedeutet, der heute ein Coding-Modell auswählt.
Was Xiaomi tatsächlich online gestellt hat
Am 16. September eröffnete das MiMo-Team unter der Leitung von Luo Fuli auf Xiaomis eigener Domain eine Live-Seite, die das Post-Training zweier unveröffentlichter Modelle in Echtzeit zeigte: Schritt-Zähler, Reward-Kurven, Token-Durchsatz, Sandbox-Anzahlen, GPU-Fehlerhinweise und einen Kosten-Zähler, der beim Zusehen hochzählt. Xiaomis Darstellung zufolge, so die Berichterstattung, habe man rund sechs Monate an einer Frage gearbeitet – wie weit sich Reinforcement Learning skalieren lässt – und sich entschieden, dieses Experiment öffentlich durchzuführen, statt ein Ergebnis zu verkünden.
Das Dashboard ist ungewöhnlich offen für ein Anbieter-Artefakt. Es listet seine eigenen Fehler in einem Mitteilungsfeed auf: einen Pro-Neustart bei Schritt 17, verursacht durch einen GPU-Out-of-Memory-Fehler aufgrund eines Ungleichgewichts der Expertenlast, den das Team nach eigenen Angaben durch Anpassung seiner Trainingsparallelisierungsstrategie behoben hat; einen Netzwerkkonnektivitätsfehler zwischen dem Pro-Trainingscluster und dem Bewertungs-Deployment, der einen Neustart erzwang und die Entscheidung, den Cyber-Datensatz aus dem kommenden Pro-Lauf zu entfernen, nachdem es „schlechte Muster in den Rollout-Logs“ gab; einen Flash-Neustart ab Schritt 15, nachdem eine Klasse von Infrastrukturfehlern etwa drei Stunden lang unentdeckt blieb; und einen Pro-Neustart aufgrund eines VRAM-Fehlers auf einem einzelnen Knoten. Es merkt außerdem an, dass Aufgaben, die als „relativ einfach für das aktuelle Pro-Modell“ eingestuft wurden, herausgefiltert wurden — ein Eingeständnis, das die meisten Post-Training-Berichte unerwähnt lassen.

Die beiden Run-Karten sind der Teil, der für alle wichtig ist, die das Timing verfolgen. Beide Modelle sind als gestoppt gekennzeichnet: MiMo-V2.6-Pro nach 5 Tagen und 7 Stunden Wall-Clock, MiMo-V2.6-Flash nach 3 Tagen und 11 Stunden, jeweils bei Schritt 30, am 20. bzw. 19. September. Pro verbrauchte 75 Mrd. Tokens und 753k Samples für seine 2,62 Mio. $; Flash verbrauchte 81,4 Mrd. Tokens für 854k $. Jeder Schritt zieht eine Batch von 1.568 Prompts mit 16 Rollouts pro Prompt – 25.088 Trajektorien pro Schritt, vollständig asynchron ausgeführt.
Es lohnt sich, es klar zu sagen: Xiaomi hat nicht mitgeteilt, ob „gestoppt" bedeutet, dass der Lauf beendet, pausiert oder mit einem Checkpoint versehen wurde. Eine gestoppte Karte ist keine Abschlussmeldung, und niemand außerhalb des Teams weiß, welche der Möglichkeiten zutrifft.
Was ist bestätigt, und was nicht
Die 72.57 ist kein Gerücht. Sie steht auf Xiaomis Dashboard, in einem Diagramm mit der Beschriftung DeepSWE v1.1, mini-swe-agent, avg@3, neben der orangefarbenen Kurve des Pro-Laufs. Die 65.68 des Flash-Modells steht im selben Diagramm. Die Zahl erscheint außerdem – als 62.24 und später 65.97 – in früheren Momentaufnahmen desselben Panels, was der Kurve ihre Form verleiht: ein stetiger Anstieg über 30 Schritte hinweg statt einer einzigen glücklichen Bewertung.
Was lediglich berichtet wird, ist der Ausgangspunkt. Die Behauptung, die am 21. September auf X kursiert, von dem Konto @nrehiew_, lautet, dass das Pro-Modell bei DeepSWE „von 58,41 auf 72,57“ gegangen sei und dass die Runs abgeschlossen seien. Der Endpunkt stimmt exakt mit dem Dashboard des Anbieters überein. Die 58,41-Basis ist die Lesart dieses Kontos davon, wo die Kurve beginnt – der am weitesten links liegende Pro-Punkt des Diagramms liegt tatsächlich im hohen 50er-Bereich – und Xiaomi hat keine Zahl für Schritt 1 veröffentlicht. Die Abschlussbehauptung ist ebenfalls eine Interpretation zweier als gestoppt markierter Karten, was eine plausible Lesart und keine Aussage von Xiaomi ist. Betrachten Sie die Verbesserung um 14 Punkte als in der Tendenz solide und zahlenmäßig ungefähr.

Es gibt noch eine Unterscheidung, die die Berichterstattung ausgelassen hat, und sie ist diejenige, die entscheidet, wie viel die Zahl wert ist. Die Benchmark-Panels des Dashboards sind Xiaomis eigene Evaluierungen: Das Unternehmen hat den Harness auf seinen eigenen Checkpoints ausgeführt und die Ergebnisse veröffentlicht. Der Harness ist derselbe, den die öffentliche Rangliste verwendet – mini-swe-agent, DeepSWE v1.1 –, was die Zahl vergleichbarer macht, als es ein hauseigener Benchmark eines Anbieters wäre. Doch eine selbst durchgeführte Evaluierung ist kein Eintrag in der Rangliste, und 72.57 erscheint nicht auf Datacurves Board, weil niemand sie eingereicht hat.
Die 74-%-Obergrenze ist enger, als die Schlagzeile vermuten lässt
Was den Vergleich in den Fokus rückt. Datacurves DeepSWE v1.1-Leaderboard, zuletzt aktualisiert am 3. September 2026, listet 113 Aufgaben über 91 Repositories in fünf Sprachen, und seine drei besten Konfigurationen liegen mit 74 % Pass@1 gleichauf: GPT-6 Astra mit xhigh Reasoning-Aufwand, Gemini 3.8 Flash mit high und Claude Opus 5 mit max. Die Zahlen, die neben diesen Ergebnissen stehen, sind die interessanten.
• Konfidenz — GPT-6 Astra 74 % ±3, Gemini 3.8 Flash 74 % ±1, Claude Opus 5 74 % ±4. In derselben Rangliste liegt GPT-5.6 Sol bei 73 % ±3 und GLM-5.3 und Kimi K3 bei 69 %. Die Intervalle überschneiden sich weit über die zweite Dezimalstelle hinaus.
• Kosten pro Aufgabe – Gemini 3.8 Flash liegt durchschnittlich bei 2,36 $, GPT-6 Astra bei 6,52 $, Claude Opus 5 bei 11,84 $. Das eigene Diagramm des Leaderboards weist Gemini 3.8 Flash als die effizienteste Konfiguration auf dem Board aus, und die Spanne zwischen diesen dreien beträgt ungefähr fünf zu eins für eine Bestehensrate, die der Benchmark nicht unterscheiden kann.
• Schritte — Gemini 3.8 Flash brauchte durchschnittlich 166 Agentenschritte pro Aufgabe, Claude Opus 5 99, GPT-6 Astra 29. Die punktgleiche Bewertung verbirgt drei sehr unterschiedliche Arbeitsweisen, und das günstige Modell ist das, das am härtesten arbeitet.

Wenn also die gemeldeten 72,57 als „sich der Spitze des Boards nähernd“ beschrieben werden, ist die zutreffende Version enger gefasst und weniger dramatisch. Sie liegt innerhalb von etwa eineinhalb Punkten eines Dreiergleichstands, dessen Mitglieder sich anhand der eigenen Fehlerbalken des Benchmarks nicht voneinander trennen lassen. Das ist ein starkes Ergebnis für ein Modell, das sich noch im Post-Training befindet, vom Anbieter statt von den Betreuern des Benchmarks erzeugt wurde und auf einem Board steht, für das das Modell nicht eingereicht wurde. Das letzte Update der Bestenliste liegt vollständig vor Xiaomis Durchlauf, weshalb dort bisher nichts von MiMo auftaucht.
Warum Xiaomi öffentlich trainiert
Die Transparenz ist kein Zufall. Bei Xiaomis letzter Open-Weight-Veröffentlichung handelte es sich um Xiaomi MiMo-V2.5 und Xiaomi MiMo-V2.5-Pro Ende April, beide unter der MIT-Lizenz — kommerziell nutzbar, feinabstimmbar, weiterverteilbar. MiMo-V2.5-Pro ist ein Mixture-of-Experts-Modell mit 1,02 Billionen Parametern und 42 Mrd. aktiven Parametern, einer Hybrid-Attention-Architektur und einem Kontextfenster von 1 Mio. Token, und sein Launch-Material machte die agentischen Behauptungen explizit: ein von Grund auf in Rust geschriebener Compiler über Hunderte von Tool-Aufrufen hinweg, eine achttausend Zeilen umfassende Desktop-Anwendung, die in elf Stunden Agentenarbeit gebaut wurde.
Das Post-Training der nächsten Generation zu streamen, ist eine andere Art von Behauptung. Ein Labor, das seine Reward-Kurven, seine Sandbox-Zahlen und seine GPU-Fehler in Echtzeit veröffentlicht, will nach dem Prozess statt nach einem Launch-Deck beurteilt werden und signalisiert damit einen Zeitplan. Luo Fuli hat gesagt, dass die technischen Details der RL-Arbeit in den kommenden Wochen Stück für Stück als Open Source veröffentlicht werden. Das kommt einem Zeitplan so nah wie alles, was jemand angeboten hat: erst die Methodik, später das Modell.
Es passt auch zu einem Muster, das Xiaomi schon früher verwendet hat, bei dem ein Modell unter einem anderen Namen öffentlich auftaucht, bevor das Unternehmen es für sich beansprucht. Die Gewohnheiten des Unternehmens sind: im Stillen trainieren, offen testen und dann mit Gewichten veröffentlichen.
Was Sie heute ausführen können
Nichts in der MiMo-V2.6-Familie. Wenn Sie jetzt ein Xiaomi-MiMo-Modell möchten, ist die V2.5-Generation das, was existiert — offene Gewichte über Xiaomis eigene Kanäle und mehrere Drittanbieterplattformen, mit veröffentlichten Modellkarten und Preisangaben. Es gibt keine MiMo-V2.6-API, keine Modellkennung und keine Preisliste, und jede Seite, die eine MiMo-V2.6-Kennung oder einen Preis pro Token angibt, füllt eine Lücke, die Xiaomi leer gelassen hat. Die Zeichenfolgen `mimo-v2.6-pro` und `mimo-v2.6-flash` im Dashboard sind Namen von Trainingsjobs, keine veröffentlichten Endpunkte.
Die andere praktische Konsequenz ist, was man in der Zwischenzeit tun sollte. Wenn MiMo-V2.6-Pro für Sie deshalb interessant ist, weil es ein günstigerer Weg sein könnte, Coding-Performance auf Frontier-Niveau zu erreichen, dann sind die Konfigurationen, gegen die es gemessen wird, bereits aufrufbar, und das Leaderboard sagt, dass die günstige konkurrenzfähig ist: Gemini 3.8 Flash erreicht mit 2,36 $ pro Aufgabe dieselbe Spitzen-Pass-Rate und ist als effizienteste Konfiguration des Boards gekennzeichnet. Gemini 3.8 Flash, Claude Opus 5 und GPT-6 Astra sind alle über einen einzigen OrcaRouter-API-Schlüssel zum Listenpreis des Anbieters mit durchgereichtem Aufschlag von 0 % erreichbar — eine Preisänderung eines Anbieters ist bei uns also noch am selben Tag live und nicht erst im nächsten Abrechnungszyklus — mit Failover, das pro Modell statt pro Anbieter konfiguriert ist. Und wenn ein Labor ein Modell wie dieses tatsächlich öffnet, ist es der unverbindliche Weg, es zu evaluieren, wenn man es hinter denselben Schlüssel routet: Sie können es vor echten Traffic setzen, ohne einen Produktionspfad auf einen Checkpoint zu verwetten, den niemand charakterisiert hat.
Was würde diese Geschichte tatsächlich verändern?
Vier Signale, ungefähr in der Reihenfolge, wie viel sie klären würden:
• Gewichte auf Hugging Face unter einer angegebenen Lizenz – so erschien die V2.5-Generation, und das ist der stärkste Beleg dafür, dass der RL-Lauf ein auslieferbares Modell hervorbrachte und nicht ein Experiment, das endete.
• Eine Modellkarte mit Parameterzahlen, Kontextlänge und Architektur — keine der V2.6-Zahlen ist öffentlich, und das Dashboard zeigt sie nicht an. Die Annahme, dass V2.6-Pro die 1,02T/42B-Form von V2.5-Pro erbt, wäre eine Vermutung.
• Ein API-Bezeichner und eine Preisliste – das ist der Moment, in dem die DeepSWE-Zahl zu einer Kaufentscheidung wird statt zu einem Zuschauersport.
• Eine Einreichung für Datacurves DeepSWE-Board, die MiMo-V2.6-Pro in dieselbe Tabelle und unter dieselben Fehlerbalken bringen würde wie die Modelle, mit denen es verglichen wird. Eine vom Anbieter durchgeführte Evaluierung und eine Leaderboard-Einreichung stellen nicht dieselbe Aussage dar, und die Lücke zwischen ihnen ist genau eine Zeile dieser Tabelle.
Bis dahin lautet die ehrliche Zusammenfassung, dass Xiaomi den transparentesten Post-Training-Lauf gezeigt hat, den je ein großes Labor veröffentlicht hat – an zwei Modellen, die es nicht veröffentlicht hat, mit einer selbst gemeldeten Benchmark-Zahl, die nahe an die Spitze des Rankings heranreicht – aber nicht dazugehört. Die Methodik-Beschreibung wird in den kommenden Wochen versprochen. Ein Veröffentlichungsdatum wird überhaupt nicht versprochen.
