Hero-Karte mit der Überschrift „MiMo-V2.6-Pro vs. MiMo-V2.6-Flash“ und dem Untertitel „Ein Preisunterschied um den Faktor 3 – und was ihn nicht erklärt“, und zwei Panels: ein linkes Panel mit der Überschrift „MiMo-V2.6-Pro“, das „$0.435 / $0.87 pro 1 Mio.“ und „42B aktive Parameter“ anzeigt, und ein rechtes Panel mit der Überschrift „MiMo-V2.6-Flash“, das „$0.14 / $0.28 pro 1 Mio.“ und „15B aktive Parameter“ anzeigt, über einer Fußzeile mit der Angabe „Beide unter MIT-Lizenz · beide mit 1M-Kontext · Index nur für Pro veröffentlicht“.
Guides & Insights

MiMo-V2.6-Pro vs. MiMo-V2.6-Flash: Ein Preisunterschied von Faktor 3, den zwei Benchmarks nicht erklären

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

In Xiaomis eigenen Bewertungstabellen schlägt MiMo-V2.6-Flash MiMo-V2.6-Pro. Die Zeile ist CyberGym, und der Vorsprung beträgt 95,1 zu 94,0. Es ist eine von fünfzehn Zeilen, und sie ist der Grund, den Rest dieses Vergleichs sorgfältig zu lesen, statt anzunehmen, dass das Flaggschiff immer die Antwort ist – denn MiMo-V2.6-Flash kostet ungefähr ein Drittel dessen, was MiMo-V2.6-Pro kostet, und bei den meisten Zeilen liegen die beiden nur wenige Punkte auseinander.

Beide Modelle wurden am 21. September 2026 als Hugging-Face-Repositories unter der MIT-Lizenz veröffentlicht, im Abstand von achtzehn Sekunden, als separate Trainingsläufe und nicht als Sprossen ein und derselben Leiter. Xiaomi MiMo-V2.6-Pro ist die Billionen-Parameter-Klasse. MiMo-V2.6-Flash ist die Effizienzklasse. Die Frage, die diese Seite beantwortet, ist, welches von ihnen auf Ihren Produktionspfad gehört, und die ehrliche Antwort hängt von einer Zahl ab, die in keiner der beiden Veröffentlichungen existiert.

Was jedes einzelne ist

• Parameter — Xiaomi MiMo-V2.6-Pro 1,02 Bio. insgesamt mit 42 Mrd. aktiven pro Token, gegenüber Xiaomi MiMo-V2.6-Flash mit ungefähr 309 Mrd. insgesamt und 15 Mrd. aktiven
• Architektur — beide Sparse-Mixture-of-Experts mit nativem omnimodalen Input; Flash ist mit 48 Schichten dokumentiert: 39 Sliding-Window- und 9 Full-Attention-Schichten, Hidden-Size 4096, 256 geroutete Experten mit 8 aktiven und ohne geteilte Experten, daneben ein 681-Mio.-Vision-Transformer, ein 308-Mio.-Audio-Tokenizer und ein 127-Mio.-Audio-Patch-Encoder
• Kontext — 1 Mio. Token bei beiden, mit bis zu 128.000 Ausgabe-Token bei beiden
• Lizenz — MIT bei beiden, Gewichte bei beiden ohne Zugangsbeschränkung
• Preis — 0,435 $ Eingabe und 0,87 $ Ausgabe pro Million Token für Pro, gegenüber 0,14 $ und 0,28 $ für Flash: eine 3,1-fache Lücke auf beiden Seiten der Karte
• Cache-Hit-Eingabe — 0,0036 $ pro Million bei Pro, 0,0028 $ bei Flash
• Trainingsausgaben — Xiaomi gibt ungefähr 2,62 Mio. $ für den Pro-RL-Lauf und 854.000 $ für Flash an, jeweils abgeschlossen in unter sechs Tagen über 30 Reinforcement-Learning-Schritte und etwa 750.000 Trajektorien
• Unabhängiger Indexwert — 46 für Xiaomi MiMo-V2.6-Pro im Artificial Analysis Intelligence Index v4.3.2; für MiMo-V2.6-Flash wurde keiner veröffentlicht

Die letzte Zeile ist die, an der man sich festhalten sollte. Alles darüber außer dem Pro-Wert stammt von Xiaomi.

Wo man für den dreifachen Preis fast nichts bekommt

Xiaomis Tabelle 3 stellt die beiden über die Harnesses hinweg nebeneinander, auf denen die Serie trainiert wurde, und bei langhorizontiger agentischer Arbeit sind die Abstände gering:

• DeepSWE v1.1 — Pro 71,9, Flash 67,9
• MiMo Code Bench — Pro 63,2, Flash 61,2
• AutomationBench v1.0.6 — Pro 53,1, Flash 52,3
• Toolathlon-Verified — Pro 76,9, Flash 73,6
• Terminal Bench 2.1 — Pro 89,9, Flash 87,6
• OSWorld-Verified — Pro 82,0, Flash 80,8
• JobBench — Pro 62,0, Flash 61,2
• MiMo Visual Coding — Pro 72,3, Flash 71,5
• CyberGym — Pro 94,0, Flash 95,1
• MiMo Cyber Bench — Pro 80,2, Flash 77,2

Lesen Sie diese Spalte von oben nach unten, und der Vorteil des Flaggschiffs liegt meist zwischen einem und vier Punkten, wobei eine Zeile komplett verloren geht. In einem Workflow, in dem der Unterschied zwischen 67,9 und 71,9 darüber entscheidet, ob eine Aufgabe abgeschlossen wird oder fehlschlägt, ist der dreifache Preis günstig. In einem Workflow, in dem er den Unterschied zwischen zwei akzeptablen Antworten ausmacht, ist er nicht günstig. Herstellertabellen mit solchen Dezimalstellen verleiten zu Scheingenauigkeit – niemand außerhalb von Xiaomi hat sie ausgeführt, und eine Zwei-Punkte-Differenz bei einer intern bewerteten Testumgebung liegt weit innerhalb des Bereichs, den ein anderer Bewerter oder eine andere Wiederholungsrichtlinie verschieben kann.

Two-column scoreboard headed 'MiMo-V2.6-Pro vs MiMo-V2.6-Flash — the scoreboard'. The left column, MiMo-V2.6-Pro, reads Active params 42B, Price $0.435 / $0.87, DeepSWE v1.1 71.9, CyberGym 94.0, ExploitGym 17.8, Independent index 46. The right column, MiMo-V2.6-Flash, reads Active params 15B, Price $0.14 / $0.28, DeepSWE v1.1 67.9, CyberGym 95.1, ExploitGym 6.0, Independent index none published. A footer reads 'All benchmark figures are Xiaomi's own runs; only the Pro index score is independent.'

Wo es viel kauft

Es gibt eine Gruppe von Zeilen, bei denen die Lücke aufhört, ein Rundungsargument zu sein. Jede einzelne davon ist Sicherheitsarbeit:

• ExploitGym — Pro 17.8, Flash 6.0
• ExploitBench — Pro 47.9, Flash 25.3
• SEC Bench Pro — Pro 66.3, Flash 47.5
• Agents' Last Exam — Pro 31.6, Flash 27.6
• Terminal Bench 4.0 — Pro 34.9, Flash 28.8

Auf ExploitGym ist das Flaggschiff dreimal so leistungsstark wie das günstigere Modell – derselbe Faktor wie beim Preis –, und auf SEC Bench Pro beträgt der Faktor 1,4. Dieses Muster entspricht dem, was man von einem Modell mit 42B aktiven Parametern gegenüber einem mit 15B erwarten würde: Eine Aufgabe, die eine lange Argumentationskette ohne Teilpunkte erfordert, ist genau die Art von Aufgabe, bei der sich die zusätzliche Kapazität zeigt, und dass CyberGym in die andere Richtung ausfällt, ist die Ausnahme, die beweist, dass die beiden Läufe unterschiedliche Dinge gelernt haben statt derselben Sache in unterschiedlichen Größen.

Die Aufteilung entspricht also eher einer echten Grenze der Arbeitslast als einer Marketing-Grenze. Hochvolumige Agentenarbeit mit einem nachsichtigen Erfolgskriterium – Retrieval, Klassifikation, Routineänderungen, Aufrufe, die ein Wiederholungsversuch retten kann – ist Flash-Territorium. Arbeit, bei der eine falsche Antwort teuer und eine unvollständige Antwort wertlos ist – Exploit-Entwicklung, Sicherheitsprüfung, Terminal-Sitzungen mit mehrstufigem Zustand –, ist der Bereich, in dem die Pro-Stufe den Mehrpreis rechtfertigt.

Die Zahl, die nicht existiert

MiMo-V2.6-Flash hat keine Modellseite bei Artificial Analysis. Sein Schwestermodell schon. Diese Asymmetrie ist das mit Abstand Wichtigste auf dieser Seite, denn sie bedeutet, dass die einzige unabhängig gemessene Zahl in der gesamten MiMo-V2.6-Reihe die 46 neben Xiaomi MiMo-V2.6-Pro ist. Jede Flash-Zahl oben – einschließlich der CyberGym-Zeile, die es gewinnt – stammt aus einem Xiaomi-Harness, einem Xiaomi-Bewerter und einem Xiaomi-Offline-Lauf.

Es gibt gute Gründe für die Annahme, dass dies vorübergehend ist: Das Modell ist zum Zeitpunkt des Verfassens einen Tag alt, und die Bewertung durch Dritte braucht Zeit. Es gibt auch gute Gründe für die Annahme, dass es strukturell bedingt ist, denn Flash ist die Volumenstufe, und Volumenstufen ziehen weniger Benchmarking-Aufmerksamkeit auf sich. So oder so ist die praktische Konsequenz heute, dass man Flash nicht mit derselben Zuversicht wie Pro mit irgendetwas außerhalb seiner eigenen Familie vergleichen kann. Wenn man sich aufgrund des Preis-Leistungs-Verhältnisses zwischen Flash und einem Nicht-Xiaomi-Modell entscheidet, vergleicht man eine Herstellerangabe mit dem gemessenen Wert von jemand anderem.

Beide Modellkarten tragen denselben zweiten Vorbehalt. Keines der beiden Repositories wird von einem Inference-Anbieter bereitgestellt – Hugging Face sagt das auf jeder Seite ausdrücklich, und Artificial Analysis hat für Pro einen einzigen API-Anbieter gezählt. Wir hosten keinen der beiden Checkpoints, daher ist keiner über uns routbar. Der Weg zu beiden führt über Xiaomis eigene Plattform und die Drittanbieter-Kataloge, die sie führen.

Screenshot of the Hugging Face model page for XiaomiMiMo/MiMo-V2.6-Flash-RL, showing the MIT licence tag and multimodal tags including 8-bit precision and fp8, a Safetensors panel reporting a model size of 159B parameters, an Inference Providers panel stating 'This model isn't deployed by any Inference Provider', a model tree listing one finetune and six quantizations, and a collection block headed MiMo-V2.6 holding three items.

Der Preis, den Sie in Hardware zahlen, nicht in Tokens.

Der Preis pro Token ist nur die Hälfte dessen, was dich ein Checkpoint kostet, und die beiden unterscheiden sich auf der Festplatte weit schärfer als auf der Preisliste. MiMo-V2.6-Flash veröffentlicht 172,9 GB FP8-Gewichte, verteilt auf 65 Shards. Xiaomi MiMo-V2.6-Pro trägt rund dreimal so viele Parameter, was seinen Rohdownload vor jeglicher Quantisierung in den Bereich eines halben Terabytes bringt — und sein eigenes Repository meldet eine Safetensors-Modellgröße von 524B Parametern, eine Zahl, die sich weder mit der Gesamtzahl von 1,02T noch mit der aktiven Anzahl von 42B in Einklang bringen lässt.

Diese Lücke verändert die Form der Entscheidung. Flash mit 172,9 GB ist ein Modell, das ein kleines Team auf gemieteter Kapazität selbst hosten und als Commodity behandeln kann. Pro mit rund dem Dreifachen davon ist eine Cluster-Entscheidung – die Berichterstattung rund um den Launch bezifferte die beiden Trainingsläufe auf rund 4.000 bzw. 8.000 H200-äquivalente GPUs. Wenn Ihr Grund, sich offene Gewichte anzusehen, darin liegt, dass Sie die Option haben möchten, nicht mehr pro Token zu zahlen, bieten die beiden Checkpoints diese Option mit sehr unterschiedlich großem Verpflichtungsumfang.

Zwischen ihnen wählen

Die Regel, die die oben genannten Vorbehalte übersteht, lautet: Wählen Sie nach Workload-Klasse statt nach Benchmark-Durchschnitt. Flash für alles, was Sie bedenkenlos erneut versuchen würden; Pro für alles, wo ein erneuter Versuch Sie nicht rettet. Und dann messen Sie, denn keines der beiden Modelle hat einen unabhängigen Wert auf den Benchmarks, die Ihnen tatsächlich wichtig sind.

Zwei Checkpoints nebeneinander zu messen, ist genau der Punkt, an dem ein Router etwas leistet, was ein Vertrag pro Modell nicht kann. Eine günstige Stufe auf den Großteil Ihres Traffics zu legen und nur die schwierigen Fälle auf die teure hochzustufen ist dieselbe Entscheidung wie diese Seite, nur als Konfiguration statt als Rewrite ausgedrückt — und genau dafür gibt es die Routing-Schicht. Es spielt auch für den Preis selbst eine Rolle: wir geben den Listenpreis des Anbieters mit 0 % Aufschlag weiter, wenn Xiaomi also den Satz für einen der beiden Checkpoints senkt, ändert sich die Zahl auf unserer Seite noch am selben Tag und nicht erst bei der nächsten Vertragsverlängerung. Das gilt für die Modelle, die wir führen. Beim Paar MiMo-V2.6 speziell gilt: Heute kaufen Sie noch direkt bei Xiaomi.

Was würde es klären

Zwei Dinge würden daraus statt einer Ermessensentscheidung eine reine Rechenaufgabe machen. Eine Seite von Artificial Analysis für MiMo-V2.6-Flash würde beide Checkpoints auf dieselbe Kosten-pro-Aufgabe-Achse setzen, auf der Pro derzeit mit $0.133 pro Intelligence-Index-Aufgabe liegt, und der Vergleich würde sich von selbst klären. Eine Replikation des Sicherheitsclusters durch Dritte – ExploitGym, ExploitBench, SEC Bench Pro – würde bestätigen, ob die 3-fache Lücke in diesen Zeilen eine Eigenschaft des Modells oder eine Eigenschaft des Bewerters ist.

Bis dahin ist die vertretbare Position, dass Xiaomi MiMo-V2.6-Flash für die meisten Teams in den meisten Fällen die bessere Kaufentscheidung ist und dass Xiaomi MiMo-V2.6-Pro die bessere Kaufentscheidung für die eng umrissene Klasse von Arbeit ist, bei der ein Fehlschlag die teure Folge ist. Die eine Zeile, in der Flash gewinnt, widerlegt das nicht — aber sie ist ein nützlicher Hinweis darauf, dass der Aufpreis des Flaggschiffs eine Aussage über einen Workload ist, nicht über ein Modell.

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro, showing the Xiaomi attribution and 'Released September 2026', an Intelligence card reading 46 ranked #1 of 114, a Speed card reading 125.2 output tokens per second, a Cost card reading $0.435 in and $0.87 out per million tokens with a 99% cache discount and $0.13 cost per Intelligence Index task, and a Verbosity card reading 140M output tokens, with a technical specifications panel listing 1M context window, 1.0T total parameters, 42B active, MIT licence and weights on Hugging Face.