
Xiaomi MiMo-V2.6-Pro führt den Open-Weights-Index mit 46 an — und veröffentlicht die Trainingsrechnung
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro ist jetzt das am höchsten platzierte Open-Weights-Modell im Artificial Analysis Intelligence Index, mit 46 auf v4.3.2 – einen Punkt vor GLM-5.3 und zwei Punkte vor Kimi K3 sowie zwanzig Punkte über den 26, die sein Vorgänger MiMo-V2.5-Pro auf der früheren Indexskala erreichte. Diese Zahl wurde von Artificial Analysis mit seinem eigenen Harness erzeugt, nicht von Xiaomi, und sie ist die nützlichste Einzeltatsache in dieser Veröffentlichung. Die zweitnützlichste Tatsache ist der daneben abgedruckte Preis: 0,43 US-Dollar pro Million Eingabe-Tokens, 0,87 US-Dollar pro Million Ausgabe-Tokens, gegenüber 5,00 und 25,00 US-Dollar für Claude Opus 5 – ein Modell, das fünf Indexpunkte höher liegt. Die dritte ist die, von der niemand erwartet hätte, dass Xiaomi sie herausgibt: eine öffentliche Abrechnung dessen, was der Reinforcement-Learning-Lauf, der MiMo-V2.6-Pro hervorbrachte, tatsächlich gekostet hat.
Der Score ist eine Messung, keine Behauptung.
Fast alles, was über die Markteinführung eines chinesischen Modells veröffentlicht wird, kommt als Anbieterzahl daher, und die Leserschaft hat gelernt, sie zu relativieren. Dieser Fall ist anders, und es lohnt sich, den Unterschied präzise zu benennen, weil die Berichterstattung über die Markteinführung ihn bereits verwischt hat.
Artificial Analysis hat MiMo-V2.6-Pro selbst bewertet, auf dem v4.3.2-Composite – zehn Bewertungen, die Reasoning, Wissen, Mathematik und Coding abdecken, darunter AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience und AA-LCR v1.1. Die 46 ist das Ergebnis, das diese Suite lieferte. Außerdem wurden die Betriebseigenschaften erfasst, die darüber entscheiden, ob ein Modell brauchbar statt nur gut ist: 134,3 Ausgabe-Token pro Sekunde, 2,15 Sekunden bis zum ersten Token, ein Cache-Rabatt von 99 % und gemessene Kosten von 0,13 $ pro Aufgabe des Intelligence Index.
Zwei davon verdienen besondere Betonung. Die 134,3 Tokens pro Sekunde setzen MiMo-V2.6-Pro bei der Geschwindigkeit auf Platz elf von 114 Modellen – für ein Billionen-Parameter-Mixture-of-Experts-Modell ist das ein Serving-Ergebnis, nicht nur ein Trainingsergebnis. Und die 0,13 $ pro Aufgabe sind die Zahl, die einer Budgetprüfung standhält: Sie gibt an, was der Index tatsächlich gekostet hat, um gegen dieses Modell ausgeführt zu werden, gemessen auf dieselbe Weise für jedes Modell auf dem Board, was sie auf eine Weise vergleichbar macht, wie es die plakativen Pro-Token-Preise nicht tun.

Was der Index abdeckt und was nicht
Die Open-Weights-Krone ist real, aber schmaler, als es den Anschein hat. Mit 46 führt MiMo-V2.6-Pro die Open-Weights-Kategorie an. Den Index führt es nicht an. An der Spitze von v4.3 stehen Claude Fable 5.1 bei maximalem Aufwand mit Standard-Fallback und GPT-6 Astra bei maximalem Aufwand, beide bei 53, mit Claude Opus 5 bei 51 und Claude Fable 5 bei 50. Die ehrliche Einordnung ist also eine Fünf-Punkte-Lücke zur Frontier bei einem Composite, das Breite belohnt, und eine Zwanzig-Punkte-Verbesserung gegenüber Xiaomis eigener vorheriger Generation.
• Open-Weights-Spitzenreiter — Xiaomi MiMo-V2.6-Pro 46, GLM-5.3 (max) 45, Kimi K3 (max) 44
• An der Spitze desselben Index — Claude Fable 5.1 (max, Fallback) 53, GPT-6 Astra (max) 53, Claude Opus 5 (max) 51
• Geschwindigkeit — 134,3 Ausgabe-Token pro Sekunde, Elfter von 114 gemessenen Modellen; der Median für die Größenklasse liegt bei 77,9
• Zeit bis zum ersten Token — 2,15 Sekunden, gegenüber einem Median von 2,34 Sekunden
• Kosten pro Aufgabe im Intelligence Index — 0,13 $, wobei die gesamte Evaluation 206,66 $ für den Durchlauf kostet
• Angegebener Preis — 0,43 $ pro Million Eingabe-Tokens, 0,87 $ pro Million Ausgabe-Tokens, 99 % Cache-Rabatt und ein gemischter Preis von 0,18 $ bei einem Verhältnis von 7:2:1 aus Cache-Treffern/Eingaben/Ausgaben
Eine Zahl auf der Seite von Artificial Analysis ist ein echter Vorbehalt und keine Prahlerei: Sie zählte zum Zeitpunkt des Verfassens einen einzigen API-Anbieter für MiMo-V2.6-Pro. Das ist der praktische Engpass für dieses Modell im Moment, und es ist kein Qualitätsproblem – es ist ein Verfügbarkeitsproblem. Ein Modell, das über eine einzige Route erreichbar ist, hat kein Failover. Wenn diese Route beeinträchtigt wird, wird Ihre Anwendung mit ihr beeinträchtigt, und die Failover-Geschichte ist genau das, wofür ein Router existiert. Die relevante Beobachtung für alle, die im Hinblick auf diese Veröffentlichung planen, ist, dass wir MiMo-V2.6-Pro nicht hosten, und wir werden nicht so tun, als wäre es anders; der Weg dorthin ist heute Xiaomis eigene Plattform und die Handvoll Drittanbieter-Kataloge, die es auflisten.

Die beiden Zahlen, die nicht verwechselt werden dürfen
Xiaomi hat außerdem eigene Benchmark-Zahlen veröffentlicht, und diese sind eine andere Art von Objekt als die 46. Das Dashboard des Unternehmens meldet, dass MiMo-V2.6-Pro auf DeepSWE v1.1 während seines Reinforcement-Learning-Laufs von 58.4 auf 72.57 steigt, bewertet mit mini-swe-agent im Durchschnitt aus drei. Das ist Xiaomis Harness, Xiaomis Grader, Xiaomis Offline-Lauf. Es wurde nicht beim öffentlichen DeepSWE-Leaderboard eingereicht und von niemandem reproduziert.
Liest man die beiden nebeneinander, verleitet es dazu, 72,57 als einen Wert auf Augenhöhe mit den 74 % zu behandeln, die das öffentliche DeepSWE-Board in der Spitzengruppe aufführt. Sie liegen nicht auf derselben Skala. Die Leaderboard-Zahl ist eine eingereichte Konfiguration, Pass@1, mit einem veröffentlichten Konfidenzintervall und durchschnittlichen Kosten pro Aufgabe; die Anbieterzahl ist eine interne Evaluierung, an die nichts davon geknüpft ist. Unser eigener Beitrag vom 21. September hat genau darauf hingewiesen, als die Zahlen noch Dashboard-Messwerte waren, und das gilt auch jetzt, da die Gewichte veröffentlicht sind. Ein Anbieter-Harness kann vollkommen ehrlich sein und trotzdem kein Leaderboard-Eintrag sein, denn der Leaderboard-Eintrag ist eine Behauptung über eine bestimmte Konfiguration unter bestimmten Bedingungen, die ein Dritter erneut ausführen kann.
Dieselbe Disziplin gilt für die Trainingsausgaben. Xiaomi gibt rund 3.474.715 US-Dollar für die Pro- und Flash-Läufe an – 2.620.670 US-Dollar für Pro, 854.044 US-Dollar für Flash – bei jeweils über dreißig Reinforcement-Learning-Schritten und etwa 750.000 Trajektorien pro Lauf, abgeschlossen in weniger als sechs Tagen. Das sind die unternehmenseigenen Zahlen aus der Compute-Abrechnung. Sie sind interessant, weil Labore sie fast nie veröffentlichen, und sie sind kein API-Preis, keine Kosten, die Sie zahlen werden, und keine Zahl, die ein Dritter geprüft hat.
Was Xiaomi tatsächlich ausgeliefert hat
Das Release ist ein spärliches Mixture-of-Experts-Modell mit insgesamt 1,02 Billionen Parametern, von denen 42 Milliarden pro Token aktiviert werden, einem Kontextfenster von 1 Mio. Token und nativer Multimodalität über Text, Bild, Video und Audio hinweg. Sein Geschwistermodell Xiaomi MiMo-V2.6-Flash weist dieselbe Architektur in kleinerem Maßstab auf: 309 Milliarden insgesamt und 15 Milliarden aktive. Die veröffentlichten Gewichte tragen ein MIT-Lizenz-Tag, und das Release-Bundle enthält einen technischen Bericht, Bereitstellungsanweisungen sowie – laut Xiaomi – die Umgebungen und den Code für das Reinforcement-Learning-Training, die benötigt werden, um das Post-Training zu untersuchen und zu reproduzieren.
Der letzte Punkt ist der substanzielle Unterschied zwischen diesem Launch und einer typischen API-Ankündigung, und er verdient es, getrennt vom Marketing betrachtet zu werden. Die Veröffentlichung der RL-Umgebung ist die Aussage, dass das Trainingssetup überprüfbar ist. Ob die veröffentlichten Umgebungen ausreichen, um eine 72,57 zu reproduzieren, ist eine separate Frage, die von den Leuten geklärt wird, die es versuchen – nicht durch die Release Notes. Xiaomis eigene Trainingsnotizen beschreiben einen Lauf, der Coding-, General-Agent-, Visual- und Cybersecurity-Aufgaben in einem einzigen Durchgang kombinierte, mit Bewertungssystemen, die erfolgreiche Trajektorien einordnen und Belohnung hin zu besseren Pfaden umverteilen – und sie halten auch Fehler fest: einen GPU-Out-of-Memory-Neustart, verursacht durch eine unausgewogene Lastverteilung der Experten, einen Netzwerkfehler zwischen dem Trainingscluster und dem Deployment des Bewertungssystems sowie einen Flash-Neustart nach einem Infrastrukturfehler, der rund drei Stunden lang unentdeckt blieb. Die Fehler neben den Erfolgen zu veröffentlichen, ist der Teil, der den Rest der Offenlegung glaubwürdig macht.
Was ein Anruf kostet und wo die Routing-Frage steht
Bei $0,43 und $0,87 pro Million Token ist MiMo-V2.6-Pro preislich wie ein Mittelklasse-Modell eingestuft und von den Benchmarks her wie ein Frontier-Open-Weights-Modell. Xiaomi behielt die Standardpreise der vorherigen MiMo-V2.5-Generation bei, statt den neuen Checkpoint nach oben umzupreisen, weshalb der Tarif im Verhältnis zur Parameteranzahl niedrig erscheint. Ein Cache-Rabatt von 99 % bedeutet, dass eine cache-lastige Agent-Schleife ihren Kontext praktisch kostenlos liest, und genau dort summiert sich die Rechnung eines Long-Horizon-Agenten tatsächlich.
Es gibt eine Variante dieses Geschäfts, die sich sauber routen lässt, und eine, bei der das nicht der Fall ist. Die Variante, bei der es der Fall ist: die Frontier-Modelle, mit denen Sie MiMo-V2.6-Pro vergleichen würden — Claude Opus 5 zu $5.00/$25.00, GPT-6 Astra, Gemini 3.8 Flash, GLM-5.3 — sind alle über einen einzigen OrcaRouter-Schlüssel zum Listenpreis des Anbieters mit 0 % Aufschlag erreichbar, sodass eine Preissenkung eines Anbieters bei einem beliebigen von ihnen am selben Tag auf unserer Seite live ist, und eine Routing-Regel kann eine Anfrage an ein zweites Modell weiterleiten, wenn das erste langsam oder nicht verfügbar ist. Das ist hier wichtiger als sonst, denn das Modell mit dem besten Open-Weights-Score ist auch dasjenige mit der dünnsten Route dorthin. Die beiden zu kombinieren — eine günstige Open-Weights-Spur für Massenarbeit und eine Frontier-Spur für den schwierigen Rest — ist eine Routing-Entscheidung, und es ist die Art von Entscheidung, die aufhört, eine Wette zu sein, sobald beide Spuren auf demselben Schlüssel liegen.
Noch ein Produkt, das man auseinanderhalten muss, weil es leicht mit dem Modell verwechselt wird: Xiaomi bietet außerdem MiMo-V2.6-Pro-UltraSpeed an, eine gehostete Serving-Stufe, die auf demselben Checkpoint basiert. Xiaomis eigene Unterlagen behaupten bei gleicher Qualität bis zur zwanzigfachen Ausgabegeschwindigkeit des Standard-Pro-Dienstes; Katalogeinträge Dritter nennen etwa das Zehnfache. Das sind zwei verschiedene Zahlen, die dieselbe Stufe beschreiben; niemand hat Latenzverteilungen pro Anfrage veröffentlicht, die sie miteinander in Einklang bringen, und die Stufe kostet deutlich mehr. Nichts an UltraSpeed ändert, was die Gewichte leisten können – es ändert nur, wie schnell die Server von jemand anderem sie ausführen.
Was würde dieses Bild verändern?
Drei Dinge, geordnet danach, wie sehr sie von Bedeutung wären.
Ein zweiter und dritter Serving-Pfad. Die Single-Provider-Zahl auf Artificial Analysis ist die Einschränkung für alles andere. Mehr Routen bedeuten Failover, bedeuten Preiswettbewerb auf der Serving-Ebene und bedeuten, dass das Modell in einen Produktionspfad statt in ein Experiment gestellt werden kann.
Unabhängige Reproduktion der DeepSWE-Zahlen. Die 46 ist bereits unabhängig, die 72,57 nicht. Landen externe Läufe in deren Nähe, spricht das erheblich für das Modell. Fallen sie deutlich darunter aus, bleibt die Zahl von Artificial Analysis diejenige, der man vertrauen sollte, und die Herstellerangabe reiht sich ein in die lange Liste der zum Marktstart erhobenen Behauptungen, die den Kontakt mit der Realität nicht überlebt haben.

Aufschlüsselungen je Evaluation. Der Composite-Wert ist ein zusammengesetzter Wert. Welche der zehn Evaluationen MiMo-V2.6-Pro gewinnt und welche es verliert, ist der Unterschied zwischen einem Modell, das man für agentisches Coding einsetzt, und einem Modell, das man für retrieval-lastige Fragebeantwortung einsetzt, und der Index allein verrät Ihnen das nicht. Dieses Detail ist das, worauf Sie als Nächstes achten sollten, und es ist das, was eine Routing-Konfiguration braucht, bevor es sich lohnt, sie aufzuschreiben.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
