Hero-Titelkarte für den Artikel „Xiaomi MiMo-V2.6-Pro: 72,57 auf DeepSWE“, angeführt vom Kicker „OrcaRouter · Model Radar — unveröffentlicht“, mit dem Untertitel „Ein Lauf, der abbrach, ein Modell, das noch nicht erschienen ist — was bestätigt ist und was nicht.“ Darunter zwei Karten: links „Auf Xiaomis eigenem Dashboard“ mit dem Inhalt „DeepSWE v1.1: 72,57 — Lauf bei Schritt 30 abgebrochen, 20. Sep.“; rechts „Noch unveröffentlicht“ mit dem Inhalt „Keine Modellkarte, keine API-ID, kein Preis, keine Gewichte“. Vier Chips zeigen „Flash-Schwestermodell: 65,68“, „Gesamtausgaben: 3.474.715 $“, „An der Spitze des Rankings: 74 %“ und „Vom Anbieter durchgeführte Evaluation, nicht eingereicht“. Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Xiaomi MiMo-V2.6-Pro: Ein DeepSWE-Score von 72,57, ein Lauf, der gestoppt wurde, und weiterhin kein Veröffentlichungsdatum

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Xiaomi MiMo-V2.6-Pro beendete seinen öffentlich gestreamten Reinforcement-Learning-Lauf am 20. September mit einem DeepSWE-v1.1-Score von 72,57, der auf Xiaomis eigenem Dashboard stand — 1,4 Punkte unter den 74 %, die GPT-6 Astra, Gemini 3.8 Flash und Claude Opus 5 an der Spitze desselben Leaderboards teilen. Xiaomi MiMo-V2.6-Flash, das kleinere Modell, das parallel trainiert wurde, endete am 19. September bei 65,68. Beide Läufe endeten bei Schritt 30, und die kombinierte Rechnung, die Xiaomi daneben veröffentlichte, belief sich auf 3.474.715 $, als wir die Seite heute Morgen erfasst haben.

Das ist die gesamte gute Nachricht, und sie ist wirklich gut. Der Rest der Geschichte ist eine Lücke zwischen einer Zahl und einem Produkt. Weder Xiaomi MiMo-V2.6-Pro noch Xiaomi MiMo-V2.6-Flash hat ein Veröffentlichungsdatum, eine Modellkarte, eine API-Kennung, einen veröffentlichten Preis oder einen Satz herunterladbarer Gewichte. Es gibt keinen Endpunkt, den man aufrufen kann. Was existiert, ist ein Trainings-Dashboard, das jeder beobachten kann, ein Benchmark-Wert, den Xiaomis eigener Harness erzeugt hat, und eine Community, die sechs Tage damit verbracht hat, eine Telemetrie-Seite zu lesen, so wie Menschen früher Teeblätter gelesen haben.

Das hier ist also ein Was-wir-bisher-wissen-Artikel, und die ehrliche Version davon trennt drei Dinge, die die Berichterstattung der letzten Woche still und leise vermischt hat: was Xiaomi offiziell verlautbart hat, was ein einzelner Beobachter darüber berichtet hat und was all das für jemanden bedeutet, der heute ein Coding-Modell auswählt.

Was Xiaomi tatsächlich online gestellt hat

Am 16. September eröffnete das MiMo-Team unter der Leitung von Luo Fuli auf Xiaomis eigener Domain eine Live-Seite, die das Post-Training zweier unveröffentlichter Modelle in Echtzeit zeigte: Schritt-Zähler, Reward-Kurven, Token-Durchsatz, Sandbox-Anzahlen, GPU-Fehlerhinweise und einen Kosten-Zähler, der beim Zusehen hochzählt. Xiaomis Darstellung zufolge, so die Berichterstattung, habe man rund sechs Monate an einer Frage gearbeitet – wie weit sich Reinforcement Learning skalieren lässt – und sich entschieden, dieses Experiment öffentlich durchzuführen, statt ein Ergebnis zu verkünden.

Das Dashboard ist ungewöhnlich offen für ein Anbieter-Artefakt. Es listet seine eigenen Fehler in einem Mitteilungsfeed auf: einen Pro-Neustart bei Schritt 17, verursacht durch einen GPU-Out-of-Memory-Fehler aufgrund eines Ungleichgewichts der Expertenlast, den das Team nach eigenen Angaben durch Anpassung seiner Trainingsparallelisierungsstrategie behoben hat; einen Netzwerkkonnektivitätsfehler zwischen dem Pro-Trainingscluster und dem Bewertungs-Deployment, der einen Neustart erzwang und die Entscheidung, den Cyber-Datensatz aus dem kommenden Pro-Lauf zu entfernen, nachdem es „schlechte Muster in den Rollout-Logs“ gab; einen Flash-Neustart ab Schritt 15, nachdem eine Klasse von Infrastrukturfehlern etwa drei Stunden lang unentdeckt blieb; und einen Pro-Neustart aufgrund eines VRAM-Fehlers auf einem einzelnen Knoten. Es merkt außerdem an, dass Aufgaben, die als „relativ einfach für das aktuelle Pro-Modell“ eingestuft wurden, herausgefiltert wurden — ein Eingeständnis, das die meisten Post-Training-Berichte unerwähnt lassen.

Screenshot of Xiaomi's public MiMo-V2.6 reinforcement-learning dashboard captured September 21, 2026. A total-cost counter reads $3,474,715, and a notices feed lists a Pro restart at step 17 from a GPU out-of-memory fault caused by expert load imbalance, a network connectivity fault between the Pro training cluster and the grader deployment, a Flash restart from step 15 after an infrastructure error went undetected for about three hours, a Pro restart from a node VRAM fault, and a note that tasks relatively easy for the current Pro model were filtered out. Two run cards show mimo-v2.6-pro stopped at step 30 — started 2026-09-15 10:32 UTC, stopped 2026-09-20, $2,620,670 spent, 75B tokens, 753k samples, batch 1,568 x 16 — and mimo-v2.6-flash stopped at step 30 — started 2026-09-15 15:16 UTC, stopped 2026-09-19, $854,044 spent, 81.4B tokens. Three benchmark panels read DeepSWE v1.1 mini-swe-agent avg@3: mimo-v2.6-pro 72.57, mimo-v2.6-flash 65.68; an in-house coding bench at 65.43 and 62.87; and AutomationBench v1.0.6 at 53.10 and 52.70.

Die beiden Run-Karten sind der Teil, der für alle wichtig ist, die das Timing verfolgen. Beide Modelle sind als gestoppt gekennzeichnet: MiMo-V2.6-Pro nach 5 Tagen und 7 Stunden Wall-Clock, MiMo-V2.6-Flash nach 3 Tagen und 11 Stunden, jeweils bei Schritt 30, am 20. bzw. 19. September. Pro verbrauchte 75 Mrd. Tokens und 753k Samples für seine 2,62 Mio. $; Flash verbrauchte 81,4 Mrd. Tokens für 854k $. Jeder Schritt zieht eine Batch von 1.568 Prompts mit 16 Rollouts pro Prompt – 25.088 Trajektorien pro Schritt, vollständig asynchron ausgeführt.

Es lohnt sich, es klar zu sagen: Xiaomi hat nicht mitgeteilt, ob „gestoppt" bedeutet, dass der Lauf beendet, pausiert oder mit einem Checkpoint versehen wurde. Eine gestoppte Karte ist keine Abschlussmeldung, und niemand außerhalb des Teams weiß, welche der Möglichkeiten zutrifft.

Was ist bestätigt, und was nicht

Die 72.57 ist kein Gerücht. Sie steht auf Xiaomis Dashboard, in einem Diagramm mit der Beschriftung DeepSWE v1.1, mini-swe-agent, avg@3, neben der orangefarbenen Kurve des Pro-Laufs. Die 65.68 des Flash-Modells steht im selben Diagramm. Die Zahl erscheint außerdem – als 62.24 und später 65.97 – in früheren Momentaufnahmen desselben Panels, was der Kurve ihre Form verleiht: ein stetiger Anstieg über 30 Schritte hinweg statt einer einzigen glücklichen Bewertung.

Was lediglich berichtet wird, ist der Ausgangspunkt. Die Behauptung, die am 21. September auf X kursiert, von dem Konto @nrehiew_, lautet, dass das Pro-Modell bei DeepSWE „von 58,41 auf 72,57“ gegangen sei und dass die Runs abgeschlossen seien. Der Endpunkt stimmt exakt mit dem Dashboard des Anbieters überein. Die 58,41-Basis ist die Lesart dieses Kontos davon, wo die Kurve beginnt – der am weitesten links liegende Pro-Punkt des Diagramms liegt tatsächlich im hohen 50er-Bereich – und Xiaomi hat keine Zahl für Schritt 1 veröffentlicht. Die Abschlussbehauptung ist ebenfalls eine Interpretation zweier als gestoppt markierter Karten, was eine plausible Lesart und keine Aussage von Xiaomi ist. Betrachten Sie die Verbesserung um 14 Punkte als in der Tendenz solide und zahlenmäßig ungefähr.

A two-column scoreboard titled 'MiMo-V2.6-Pro vs the DeepSWE top tier', subtitled 'What Xiaomi published about its own checkpoint, against what the public leaderboard lists — September 21, 2026'. The left column, badged VENDOR-REPORTED and headed 'MiMo-V2.6-Pro', reads: DeepSWE v1.1 — 72.57; Basis — Xiaomi's own offline eval, mini-swe-agent avg@3; Confidence — not published; Cost per task — not published; Release — not announced; Independent runs — none. The right column, badged PUBLIC LEADERBOARD and headed 'Top tier — three-way tie', reads: DeepSWE v1.1 — 74%; Basis — submitted configs, Pass@1, GPT-6 Astra · Gemini 3.8 Flash · Claude Opus 5; Confidence — plus or minus 1 to 4 points; Cost per task — $2.36 to $11.84; Release — shipping today; Independent runs — on the public board. A footer reads 'MiMo-V2.6-Pro is Xiaomi's own offline evaluation, read from the vendor's public RL dashboard on 2026-09-21 and not submitted to the leaderboard. Top-tier figures per Datacurve's DeepSWE v1.1 leaderboard, updated 2026-09-03.' The OrcaRouter logo is composited in the bottom-right corner.

Es gibt noch eine Unterscheidung, die die Berichterstattung ausgelassen hat, und sie ist diejenige, die entscheidet, wie viel die Zahl wert ist. Die Benchmark-Panels des Dashboards sind Xiaomis eigene Evaluierungen: Das Unternehmen hat den Harness auf seinen eigenen Checkpoints ausgeführt und die Ergebnisse veröffentlicht. Der Harness ist derselbe, den die öffentliche Rangliste verwendet – mini-swe-agent, DeepSWE v1.1 –, was die Zahl vergleichbarer macht, als es ein hauseigener Benchmark eines Anbieters wäre. Doch eine selbst durchgeführte Evaluierung ist kein Eintrag in der Rangliste, und 72.57 erscheint nicht auf Datacurves Board, weil niemand sie eingereicht hat.

Die 74-%-Obergrenze ist enger, als die Schlagzeile vermuten lässt

Was den Vergleich in den Fokus rückt. Datacurves DeepSWE v1.1-Leaderboard, zuletzt aktualisiert am 3. September 2026, listet 113 Aufgaben über 91 Repositories in fünf Sprachen, und seine drei besten Konfigurationen liegen mit 74 % Pass@1 gleichauf: GPT-6 Astra mit xhigh Reasoning-Aufwand, Gemini 3.8 Flash mit high und Claude Opus 5 mit max. Die Zahlen, die neben diesen Ergebnissen stehen, sind die interessanten.

• Konfidenz — GPT-6 Astra 74 % ±3, Gemini 3.8 Flash 74 % ±1, Claude Opus 5 74 % ±4. In derselben Rangliste liegt GPT-5.6 Sol bei 73 % ±3 und GLM-5.3 und Kimi K3 bei 69 %. Die Intervalle überschneiden sich weit über die zweite Dezimalstelle hinaus.

• Kosten pro Aufgabe – Gemini 3.8 Flash liegt durchschnittlich bei 2,36 $, GPT-6 Astra bei 6,52 $, Claude Opus 5 bei 11,84 $. Das eigene Diagramm des Leaderboards weist Gemini 3.8 Flash als die effizienteste Konfiguration auf dem Board aus, und die Spanne zwischen diesen dreien beträgt ungefähr fünf zu eins für eine Bestehensrate, die der Benchmark nicht unterscheiden kann.

• Schritte — Gemini 3.8 Flash brauchte durchschnittlich 166 Agentenschritte pro Aufgabe, Claude Opus 5 99, GPT-6 Astra 29. Die punktgleiche Bewertung verbirgt drei sehr unterschiedliche Arbeitsweisen, und das günstige Modell ist das, das am härtesten arbeitet.

Screenshot of Datacurve's DeepSWE v1.1 leaderboard captured September 21, 2026, showing 113 tasks, 91 repositories, five languages and 28 models, with the v1.1 and Best tabs selected and the board marked 'updated September 3, 2026'. The Pass@1 table lists gpt-6-astra (xhigh) at 74 percent plus or minus 3 with an average cost of $6.52, 30k output tokens and 29 steps; gemini-3.8-flash (high) at 74 percent plus or minus 1 at $2.36, 143k tokens and 166 steps; claude-opus-5 (max) at 74 percent plus or minus 4 at $11.84, 118k tokens and 99 steps; gpt-5.6-sol at 73 percent; claude-fable-5 at 70 percent; glm-5.3 and kimi-k3 at 69 percent; and grok-4.6 and gpt-5.6-luna at 67 percent. The score-versus-average-cost chart above the table labels gemini-3.8-flash as the most efficient configuration. No Xiaomi MiMo model appears on the board.

Wenn also die gemeldeten 72,57 als „sich der Spitze des Boards nähernd“ beschrieben werden, ist die zutreffende Version enger gefasst und weniger dramatisch. Sie liegt innerhalb von etwa eineinhalb Punkten eines Dreiergleichstands, dessen Mitglieder sich anhand der eigenen Fehlerbalken des Benchmarks nicht voneinander trennen lassen. Das ist ein starkes Ergebnis für ein Modell, das sich noch im Post-Training befindet, vom Anbieter statt von den Betreuern des Benchmarks erzeugt wurde und auf einem Board steht, für das das Modell nicht eingereicht wurde. Das letzte Update der Bestenliste liegt vollständig vor Xiaomis Durchlauf, weshalb dort bisher nichts von MiMo auftaucht.

Warum Xiaomi öffentlich trainiert

Die Transparenz ist kein Zufall. Bei Xiaomis letzter Open-Weight-Veröffentlichung handelte es sich um Xiaomi MiMo-V2.5 und Xiaomi MiMo-V2.5-Pro Ende April, beide unter der MIT-Lizenz — kommerziell nutzbar, feinabstimmbar, weiterverteilbar. MiMo-V2.5-Pro ist ein Mixture-of-Experts-Modell mit 1,02 Billionen Parametern und 42 Mrd. aktiven Parametern, einer Hybrid-Attention-Architektur und einem Kontextfenster von 1 Mio. Token, und sein Launch-Material machte die agentischen Behauptungen explizit: ein von Grund auf in Rust geschriebener Compiler über Hunderte von Tool-Aufrufen hinweg, eine achttausend Zeilen umfassende Desktop-Anwendung, die in elf Stunden Agentenarbeit gebaut wurde.

Das Post-Training der nächsten Generation zu streamen, ist eine andere Art von Behauptung. Ein Labor, das seine Reward-Kurven, seine Sandbox-Zahlen und seine GPU-Fehler in Echtzeit veröffentlicht, will nach dem Prozess statt nach einem Launch-Deck beurteilt werden und signalisiert damit einen Zeitplan. Luo Fuli hat gesagt, dass die technischen Details der RL-Arbeit in den kommenden Wochen Stück für Stück als Open Source veröffentlicht werden. Das kommt einem Zeitplan so nah wie alles, was jemand angeboten hat: erst die Methodik, später das Modell.

Es passt auch zu einem Muster, das Xiaomi schon früher verwendet hat, bei dem ein Modell unter einem anderen Namen öffentlich auftaucht, bevor das Unternehmen es für sich beansprucht. Die Gewohnheiten des Unternehmens sind: im Stillen trainieren, offen testen und dann mit Gewichten veröffentlichen.

Was Sie heute ausführen können

Nichts in der MiMo-V2.6-Familie. Wenn Sie jetzt ein Xiaomi-MiMo-Modell möchten, ist die V2.5-Generation das, was existiert — offene Gewichte über Xiaomis eigene Kanäle und mehrere Drittanbieterplattformen, mit veröffentlichten Modellkarten und Preisangaben. Es gibt keine MiMo-V2.6-API, keine Modellkennung und keine Preisliste, und jede Seite, die eine MiMo-V2.6-Kennung oder einen Preis pro Token angibt, füllt eine Lücke, die Xiaomi leer gelassen hat. Die Zeichenfolgen `mimo-v2.6-pro` und `mimo-v2.6-flash` im Dashboard sind Namen von Trainingsjobs, keine veröffentlichten Endpunkte.

Die andere praktische Konsequenz ist, was man in der Zwischenzeit tun sollte. Wenn MiMo-V2.6-Pro für Sie deshalb interessant ist, weil es ein günstigerer Weg sein könnte, Coding-Performance auf Frontier-Niveau zu erreichen, dann sind die Konfigurationen, gegen die es gemessen wird, bereits aufrufbar, und das Leaderboard sagt, dass die günstige konkurrenzfähig ist: Gemini 3.8 Flash erreicht mit 2,36 $ pro Aufgabe dieselbe Spitzen-Pass-Rate und ist als effizienteste Konfiguration des Boards gekennzeichnet. Gemini 3.8 Flash, Claude Opus 5 und GPT-6 Astra sind alle über einen einzigen OrcaRouter-API-Schlüssel zum Listenpreis des Anbieters mit durchgereichtem Aufschlag von 0 % erreichbar — eine Preisänderung eines Anbieters ist bei uns also noch am selben Tag live und nicht erst im nächsten Abrechnungszyklus — mit Failover, das pro Modell statt pro Anbieter konfiguriert ist. Und wenn ein Labor ein Modell wie dieses tatsächlich öffnet, ist es der unverbindliche Weg, es zu evaluieren, wenn man es hinter denselben Schlüssel routet: Sie können es vor echten Traffic setzen, ohne einen Produktionspfad auf einen Checkpoint zu verwetten, den niemand charakterisiert hat.

Was würde diese Geschichte tatsächlich verändern?

Vier Signale, ungefähr in der Reihenfolge, wie viel sie klären würden:

• Gewichte auf Hugging Face unter einer angegebenen Lizenz – so erschien die V2.5-Generation, und das ist der stärkste Beleg dafür, dass der RL-Lauf ein auslieferbares Modell hervorbrachte und nicht ein Experiment, das endete.

• Eine Modellkarte mit Parameterzahlen, Kontextlänge und Architektur — keine der V2.6-Zahlen ist öffentlich, und das Dashboard zeigt sie nicht an. Die Annahme, dass V2.6-Pro die 1,02T/42B-Form von V2.5-Pro erbt, wäre eine Vermutung.

• Ein API-Bezeichner und eine Preisliste – das ist der Moment, in dem die DeepSWE-Zahl zu einer Kaufentscheidung wird statt zu einem Zuschauersport.

• Eine Einreichung für Datacurves DeepSWE-Board, die MiMo-V2.6-Pro in dieselbe Tabelle und unter dieselben Fehlerbalken bringen würde wie die Modelle, mit denen es verglichen wird. Eine vom Anbieter durchgeführte Evaluierung und eine Leaderboard-Einreichung stellen nicht dieselbe Aussage dar, und die Lücke zwischen ihnen ist genau eine Zeile dieser Tabelle.

Bis dahin lautet die ehrliche Zusammenfassung, dass Xiaomi den transparentesten Post-Training-Lauf gezeigt hat, den je ein großes Labor veröffentlicht hat – an zwei Modellen, die es nicht veröffentlicht hat, mit einer selbst gemeldeten Benchmark-Zahl, die nahe an die Spitze des Rankings heranreicht – aber nicht dazugehört. Die Methodik-Beschreibung wird in den kommenden Wochen versprochen. Ein Veröffentlichungsdatum wird überhaupt nicht versprochen.