
Xiaomi MiMo-V2.6-Pro-UltraSpeed vs. Xiaomi MiMo-V2.6: Ein Checkpoint, zehnfacher Preis
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro-UltraSpeed und Xiaomi MiMo-V2.6-Pro sind nicht zwei Modelle. Sie sind ein Modell, das auf zwei Arten verkauft wird. Beide werden von demselben MiMo-V2.6-Checkpoint mit einer Billion Parametern bedient, den Xiaomi im September 2026 veröffentlicht hat – der Pro-Stufe der Xiaomi MiMo-V2.6-Serie, deren kleineres Geschwister Xiaomi MiMo-V2.6-Flash ist. Der Unterschied zwischen den beiden Pro-Angeboten liegt vollständig darin, wie schnell die Tokens herauskommen und wie viel man dafür bezahlt. Die Standard-Stufe verlangt 0,435 $ pro Million Eingabe-Tokens und 0,87 $ pro Million Ausgabe-Tokens. Die UltraSpeed-Stufe verlangt 4,35 $ und 8,70 $. Das ist ein sauberes Zehn-zu-eins auf beiden Seiten des Meters, und es erkauft die Behauptung von ungefähr der zehnfachen Ausgabegeschwindigkeit – eine Behauptung, die Xiaomi über seinen eigenen Serving-Stack aufstellt und für die noch kein unabhängiger Benchmark eine Zahl veröffentlicht hat.
Die interessante Frage ist also nicht, welches Modell besser ist. Sie lautet, ob ein Zehnfaches der richtige Preis für die zehnfache Geschwindigkeit ist – und dafür gibt es einen Präzedenzfall, den man lesen sollte, bevor man einen Produktionspfad darauf festlegt.
Das schnelle Tier ist eine Serving-Entscheidung, keine Modell-Entscheidung
Xiaomis eigene Darstellung für die UltraSpeed-Reihe ist, dass sie in der Qualität mit dem Standardmodell übereinstimmt und sich nur im Durchsatz unterscheidet. Das ist wichtiger, als es klingt, denn es beseitigt den üblichen Grund, bei einer neuen Stufe zu zögern. Man wettet nicht auf die Persönlichkeit eines anderen Checkpoints, sein Ablehnungsverhalten oder seine Formatierungseigenheiten. Man wettet darauf, dass dieselben Gewichte, ausgeführt über eine aggressivere Serving-Konfiguration, sich bei den eigenen Prompts gleich verhalten. Wenn das zutrifft, ist der Wechsel zwischen den beiden Stufen eine Konfigurationsänderung, keine Migration.
Was in dieser Serving-Konfiguration steckt, wurde für diese Generation nicht dokumentiert. Die vorherige UltraSpeed-Stufe, die auf dem MiMo-V2.5-Pro-Checkpoint im Juni 2026 aufbaute, wurde von Xiaomi so beschrieben, dass sie FP4-Quantisierung nur auf den Expert-Layern verwendete, ein blockparalleles spekulatives Decoding-Verfahren namens DFlash sowie eine Runtime namens TileRT einsetzte und auf einem einzelnen Acht-GPU-Knoten lief. Xiaomi hat die entsprechenden Details für die V2.6-Stufe nicht veröffentlicht. Betrachten Sie den früheren Stack als Kontext dafür, wie die Geschwindigkeit erzielt wird, nicht als Beschreibung dessen, was jetzt läuft.
Das Line-up, in dem es steht, ist kurz. Neben den beiden Pro-Tiers gibt es MiMo-V2.6-Flash, den kleineren Bruder mit 309 Milliarden Gesamtparametern und 15 Milliarden aktiven Parametern. Pro ist das Flaggschiff unter den Sparse-Mixture-of-Experts-Modellen: Artificial Analysis listet es mit 1,0 Billionen Gesamtparametern und 42 Milliarden aktiven pro Token, einem Kontextfenster von 1 Million Token und einer MIT-Lizenz mit Gewichten auf Hugging Face. Das sind die Zahlen, an denen man sich festhalten sollte, denn der gesamte Vergleich beruht auf ihnen.
Was tatsächlich verifiziert ist und was nicht

Die Asymmetrie zwischen den beiden obigen Spalten ist das mit Abstand Wichtigste in diesem Artikel. Nahezu alles Messbare an dieser Paarung wurde auf der langsamen Seite
Artificial Analysis hat MiMo-V2.6-Pro benchmarkiert und veröffentlicht dafür einen Intelligence Index von 46 – die höchste Punktzahl in der 114-Modell-Klasse, in die es das Modell einordnet. Es misst 134,3 Ausgabe-Token pro Sekunde über Xiaomis API, gegenüber einem Klassenmedian von 77,9, sowie eine Zeit bis zum ersten Chunk von 2,15 Sekunden gegenüber einem Median von 2,34. Es listet die Kosten pro Intelligence-Index-Aufgabe mit 0,13 $, einen Cache-Rabatt von 99 % auf den Eingabepreis und eine Ausgabe-Ausführlichkeit von 140 Millionen Token auf. Das sind unabhängige Zahlen zu einer benannten Konfiguration, und sie sind der einzige harte Durchsatz-Anker, den dieser Vergleich hat.
Für UltraSpeed ist die verifizierte Liste viel kürzer:
• Ausgabegeschwindigkeit — etwa zehnmal so hoch wie bei der Standard-Stufe, angegeben von Xiaomi und wiederholt von den Plattformen, die sie listen. Kein Drittanbieter hat eine Tokens-pro-Sekunde-Messung für diese spezifische Stufe veröffentlicht.
• Preis — 4,35 $ pro Million Eingabe-Tokens und 8,70 $ pro Million Ausgabe-Tokens, das Zehnfache der Standard-Stufe bei beiden. Neben diesen beiden Tarifen ist keine Cache-Stufe aufgeführt.
• Qualität — „entspricht dem Original“, wieder einmal eine Herstelleraussage. Es wurde keine unabhängige Bewertung des UltraSpeed-Endpunkts veröffentlicht, daher ist die Behauptung, dass die Qualität unverändert ist, ungetestet statt widerlegt.
• Kontext und Modalität — 1.048.576 Token sowie native Text-, Bild-, Video- und Audioeingabe, geerbt vom Basis-Checkpoint.
Es gibt außerdem einen Anbieter-Benchmark, der genau deshalb erwähnenswert ist, weil er eine bemerkenswerte Reise hinter sich hat. Xiaomis öffentliches Reinforcement-Learning-Dashboard, das im September 2026 die V2.6-Post-Training-Läufe streamte, meldet DeepSWE-v1.1-Werte von 72,57 für den Pro-Lauf und 65,68 für Flash. Diese stammen aus Xiaomis eigener Offline-Evaluierung mit einem Mini-swe-agent-Harness im Durchschnitt von drei Läufen; sie wurden nie an das öffentliche Leaderboard übermittelt und sind außerhalb des Labors nicht reproduziert worden. Wenn Sie 72,57 als Leaderboard-Wert zitiert gesehen haben, dann ist das eine Anbieter-Zahl im Gewand eines Leaderboards.

Der Präzedenzfall: Letztes Mal verlangte Xiaomi das Dreifache, nicht das Zehnfache
Dies ist nicht Xiaomis erste Geschwindigkeitsstufe, und die vorherige ist der nützlichste Vergleich in der ganzen Geschichte – weil sich der Multiplikator geändert hat.
MiMo-V2.5-Pro-UltraSpeed erschien im Juni 2026, basierte auf dem V2.5-Pro-Checkpoint, und der Preis lag etwa beim Dreifachen des Ausgabetarifs des Standardmodells. Xiaomis damaliges Werbeversprechen war dasselbe wie heute: etwa die zehnfache Ausgabegeschwindigkeit. Die damalige Berichterstattung nannte einen anhaltenden Durchsatz von rund 1.000 Tokens pro Sekunde mit Spitzenwerten nahe 1.200 auf einem einzelnen Knoten mit acht GPUs, obwohl die Modellseite selbst einen breiteren Bereich von 500 bis 1.000 angab – und nichts davon wurde unabhängig verifiziert. Der Zugang war an ein Antragsformular statt an eine offene Registrierung gebunden.
Stellt man die beiden nebeneinander, ist die Verschiebung die eigentliche Geschichte. Der Geschwindigkeitsfaktor blieb bei ungefähr zehn. Der Preisfaktor verschob sich von drei auf zehn. Das ist ein ganz anderes Angebot für dieselbe Art von Upgrade, und Xiaomi hat keine Erklärung für die Änderung veröffentlicht. Es könnte tatsächlich teureres Serving widerspiegeln – einen größeren Checkpoint, eine aggressivere Decoding-Konfiguration oder eine knappere Kapazität zum Launch. Es könnte Preise im Einführungsfenster für eine Tarifstufe widerspiegeln, die erst seit einem Tag verfügbar ist. Was ihm noch fehlt, ist eine öffentliche Begründung, die man überprüfen kann.
Ein praktischer Unterschied sollte für alle erwähnt werden, die die V2.5-Stufe genutzt haben: Jene war ein zugangsbeschränkter Test. Die V2.6-Stufe wird als allgemein verfügbar über Xiaomis eigene API und mehrere Drittanbieter-Plattformen zu den veröffentlichten Preisen aufgeführt, ohne Antragsverfahren. Was auch sonst geändert wurde, die Hürde, sie auszuprobieren, ist gesunken.
Was das Zehnfache bei einem echten Workload kostet
Prozentangaben verbergen die Gestalt davon, deshalb hier die Rechnung anhand eines konkreten Agentenlaufs – eines Laufs, der über seine Lebensdauer 20 Millionen Eingabe-Tokens liest und 2 Millionen Ausgabe-Tokens ausgibt. Das ist eine schwere, aber nicht exotische agentische Arbeitslast, die Art, bei der ein Modell Tool-Aufrufe durchläuft und seinen eigenen Kontext erneut liest.
• Standard-Tarif, Eingabe — 20 Mio. Token zu 0,435 $ pro Million: 8,70 $.
• Standard-Tarif, Ausgabe — 2 Mio. Token zu 0,87 $ pro Million: 1,74 $.
• Standard-Tarif, gesamt — 10,44 $ pro Durchlauf.
• UltraSpeed-Tarif, Eingabe — 20 Mio. Token zu 4,35 $ pro Million: 87,00 $.
• UltraSpeed-Tarif, Ausgabe — 2 Mio. Tokens zu 8,70 $ pro Million: 17,40 $.
• UltraSpeed-Tarif, insgesamt — 104,40 $ pro Lauf.
Die Differenz beträgt 93,96 $, und sie ist genau das Zehnfache der Rechnung statt das Zehnfache einer einzelnen Rechnungsposition darin, weil beide Sätze gemeinsam skalieren. Nun die andere Seite der Bilanz. Bei den 134,3 Ausgabe-Tokens pro Sekunde, die Artificial Analysis für die Standardstufe misst, dauert die Erzeugung von 2 Millionen Ausgabe-Tokens etwas mehr als vier Stunden reine Generierungszeit. Bei der zehnfachen Rate dauert es etwa fünfundzwanzig Minuten. Die zusätzlichen 94 $ holen bei diesem Lauf also irgendwo im Bereich von dreieinhalb Stunden Wanduhrzeit zurück – grob 27 $ für jede eingesparte Stunde, wenn man es so ausdrücken möchte.
Ob dieser Tausch gut ist, hängt ganz davon ab, was Ihnen die Wall-Clock-Zeit wert ist, und es gibt einen Haken, der einer naiven Lesart zuwiderläuft. Der Eingabepreis des Standard-Tarifs weist auf der Seite von Artificial Analysis einen Cache-Rabatt von 99 % auf, was bedeutet, dass die Eingabehälfte der Rechnung bei Workloads, die denselben Kontext erneut lesen, auf nahezu nichts zusammenschrumpfen kann. Die Auflistung von UltraSpeed zeigt die beiden Hauptpreise und keine Cache-Stufe. Wenn Ihr Workload cache-intensiv ist, ist der effektive Faktor nicht zehn — er ist viel schlechter, weil Sie den Rabatt auf der Seite verlieren, auf der Sie fast nichts bezahlt haben. Wenn Ihr Workload ausgabelastig und cache-arm ist, liegt das Zehnfache nahe an der tatsächlichen Zahl. Messen Sie Ihren eigenen Mix, bevor Sie einer der beiden Zahlen vertrauen.
Die Open-Weights-Asymmetrie
Es gibt einen strukturellen Unterschied zwischen den beiden Stufen, der nichts mit Preis oder Geschwindigkeit zu tun hat, und er könnte wichtiger sein als beides.
MiMo-V2.6-Pro wird unter einer MIT-Lizenz ausgeliefert, die Gewichte werden auf Hugging Face veröffentlicht. Das erlaubt kommerziellen Einsatz, Modifikation und weiteres Training, und es bedeutet, dass der Preis des Standardmodells eine Untergrenze hat, die kein Anbieter aufheben kann: Wenn der Hosting-Tarif keinen Sinn mehr ergibt, kannst du den Checkpoint selbst bereitstellen. Auf deiner eigenen Hardware wirst du nicht an den Durchsatz von Xiaomi herankommen, und du wirst für die GPUs bezahlen, aber die Option existiert, und sie begrenzt, was die gehostete Stufe verlangen kann.
UltraSpeed hat keine solche Untergrenze. Es gibt keine UltraSpeed-Gewichte, denn die Stufe ist der Serving-Stack und nicht das Modell – der Checkpoint ist derselbe, der bereits öffentlich ist, und was du mietest, ist Xiaomis Fähigkeit, ihn schnell laufen zu lassen. Das ist eine legitime Sache zum Verkaufen, und es hat dieselbe Form wie jede andere Geschwindigkeitsstufe auf dem Markt. Es bedeutet allerdings, dass der zehnfache Tarif keiner wettbewerblichen Kontrolle unterliegt außer durch andere Anbieter, die dieselben offenen Gewichte betreiben, und es gibt keine Selbsthosting-Ausweichmöglichkeit, falls der Preis sich erneut bewegt.

Lies das vor dem Hintergrund der Verfügbarkeit. Der Standard-Checkpoint ist über Xiaomis eigene Kanäle und mehrere Drittanbieter-Plattformen erreichbar und außerdem als Download verfügbar. Die UltraSpeed-Stufe ist über Xiaomis eigene API und mehrere Drittanbieter-Plattformen erreichbar, und das ist der einzige Weg, sie zu bekommen. Wer eine langlebige Abhängigkeit abwägt, sollte diesen Unterschied in der Wahlfreiheit neben dem Preis pro Token in seine Kalkulation einbeziehen.
Wer sollte welches nehmen
Die Entscheidung hängt eindeutig davon ab, wie viel Ihrer Kosten auf Output-Tokens entfällt und wie viel Ihres Latenzbudgets auf die Generierung statt auf das Anstehen in der Warteschlange.
• Nutzen Sie UltraSpeed, wenn die Arbeitslast ausgabelastig, cache-arm und interaktiv ist – bei langformatiger Generierung, Agentenschleifen, in denen das Modell zwischen Tool-Aufrufen viel Reasoning schreibt, oder bei allem, wo am anderen Ende der Anfrage ein Mensch wartet.
• Nutze den Standard-Tarif, wenn die Arbeitslast cache-intensiv, batch-tolerierbar oder marginal kostensensibel ist – Massenklassifizierung, retrieval-gestütztes Antworten über einen festen Korpus, nächtliche Evaluierungsläufe, alles, wo vier Stunden Generierung in Ordnung sind, weil niemand zusieht.
• Wählen Sie den Standard-Tarif, wenn Sie die Option zum Selbst-Hosting möchten. Wenn Ihre Compliance-Vorgaben erfordern, dass Sie die Gewichte selbst halten können, steht UltraSpeed Ihnen zu keinem Preis zur Verfügung.
• Nimm keins von beiden, bevor du gemessen hast. Die Zehnfach-Behauptung ist hier die tragende Zahl, und sie ist derzeit anbieterseitig angegeben. Ein einziger Nachmittag, an dem du deine eigenen Prompts durch beide Stufen laufen lässt, sagt dir mehr als jede der veröffentlichten Zahlen, denn die einzige Durchsatz-Zahl, die unabhängig verifiziert wurde, gehört zur langsamen Seite des Vergleichs.
Zu diesem letzten Punkt: Die Mechanik beim Testen eines Serving-Tiers ist dieselbe wie beim Testen eines Modells, und genau hier verdient sich eine Routing-Schicht ihren Platz. OrcaRouter führt mehr als 200 Modelle hinter einem einzigen API-Schlüssel zum Listenpreis des Anbieters, wobei ein Aufschlag von 0 % durchgereicht wird, also eine Preisänderung eines Anbieters noch am selben Tag bei Ihnen ankommt statt erst zur nächsten Vertragsverlängerung. Automatisches Failover bedeutet, dass ein Tier, das Sie noch evaluieren, nie allein auf einem Produktionspfad liegt, und die Routing-DSL ermöglicht es Ihnen, eine Klasse von Anfragen an den schnellen Endpunkt zu senden und alles andere an den Standard-Endpunkt, ohne zwei Integrationen pflegen zu müssen. Nichts davon erfordert speziell Xiaomis Modelle — der Punkt ist, dass Entscheidungen auf Tier-Ebene wie diese leicht rückgängig zu machen sind, wenn die Tiers hinter einem Schlüssel liegen.
Was würde das klären
Der ehrliche Stand der Frage MiMo-V2.6-Pro-UltraSpeed versus MiMo-V2.6-Pro ist, dass die Hälfte davon gemessen und die Hälfte behauptet ist. Die Standardstufe hat einen unabhängigen Intelligence Index, einen unabhängigen Durchsatzwert und veröffentlichte offene Gewichte. Die schnelle Stufe hat einen Preis, ein Kontextfenster und ein Versprechen des Anbieters, dass es dasselbe Modell sei, nur schneller.
Drei Dinge würden die Lücke schließen. Eine unabhängige Durchsatzmessung am UltraSpeed-Endpunkt – Artificial Analysis hat den Standard-Tarif über Xiaomis API gemessen, also ist dieselbe Behandlung möglich und ist einfach noch nicht erfolgt. Eine Cache-Richtlinie für den schnellen Tarif, da das Fehlen einer solchen das ist, was eine zehnfach höhere Rechnung bei cache-intensiven Workloads zu etwas Schlimmerem macht. Und jedes veröffentlichte Detail zum Serving-Stack von V2.6, so wie Xiaomi FP4-Experten, DFlash und TileRT für die V2.5-Generation dokumentiert hat.
Bis dahin ist der zehnfache Preis real, und die zehnfache Geschwindigkeit ist eine Behauptung. Wenn Ihre Workload stark ausgabelastig ist und jemand wartet, lohnt es sich, diese Behauptung mit Ihren eigenen Prompts zu testen – und sie hinter einer Ebene zu testen, die es Ihnen ermöglicht, noch am selben Nachmittag zurückzuwechseln, falls sie sich nicht bewahrheitet.
