
MiMo-V2.6-Pro vs. DeepSeek V4 Pro: Zwei offene Flaggschiffe, zehn Indexpunkte auseinander
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro und DeepSeek V4 Pro sind von derselben Art – chinesische Mixture-of-Experts-Flaggschiffe mit Billionen Parametern, MIT-lizenziert, 1M-Token-Kontext, offene Gewichte, die man heute herunterladen kann – und sie liegen zehn Punkte auseinander im Artificial Analysis Intelligence Index v4.3.2, 46 gegen 36. Sie sind sich außerdem uneinig darüber, wofür ein Flaggschiff da ist. DeepSeek V4 Pro, veröffentlicht am 13. August 2026, ist ein reines Text-Reasoning-Modell: 1,6 Billionen Parameter, davon 49 Milliarden aktive, und keine Bild-, Audio- oder Videoeingabe an irgendeiner Stelle seiner veröffentlichten Oberfläche. Xiaomi MiMo-V2.6-Pro, veröffentlicht am 21. September 2026, hat 1,02 Billionen Parameter, davon 42 Milliarden aktive, und akzeptiert Text, Bild, Video und Audio. Dieser Unterschied entscheidet über mehr Deployments als die zehn Punkte, und er ist das Erste, was geklärt werden muss, bevor man irgendetwas anderes vergleicht.
Gleiche Lizenz, andere Maschinen
Beginne mit dem, was tatsächlich identisch ist, denn es ist mehr, als man bei zwei konkurrierenden Laboren erwarten würde. Beide werden auf öffentlichen Repositories unter einer MIT-Lizenz-Kennzeichnung ausgeliefert, was kommerziellen Einsatz, Modifikation und weiteres Training ohne Umsatzhürde oder Nutzungsbereichsklausel bedeutet. Beide beanspruchen ein Kontextfenster von 1M Token. Beide sind sparse Mixture-of-Experts-Designs – die Architektur ist in dieser Größenordnung zum Standard geworden, kein Differenzierungsmerkmal. Und beide wurden von Laboren trainiert, die weniger über ihre Methoden veröffentlichen als westliche Frontier-Labore.
• Parameter — MiMo-V2.6-Pro 1,02T gesamt / 42B aktiv; DeepSeek V4 Pro 1,6T gesamt / 49B aktiv
• Eingabemodalität — MiMo-V2.6-Pro: Text, Bild, Video, Audio; DeepSeek V4 Pro: nur Text
• Kontext — 1 Mio. Tokens bei beiden; DeepSeek V4 Pro begrenzt die Ausgabe auf 384K Tokens
• Indexwert — MiMo-V2.6-Pro 46 im Intelligence Index v4.3.2; DeepSeek V4 Pro 36 in derselben Version
• Kosten pro Index-Aufgabe — MiMo-V2.6-Pro 0,13 $; DeepSeek V4 Pro 0,67 $
• Listenpreis — MiMo-V2.6-Pro 0,43 $ / 0,87 $ pro 1 Mio. Tokens; DeepSeek V4 Pro 1,32 $ / 3,96 $, wie Artificial Analysis es aufführt, bevor DeepSeeks eigener Peak-/Off-Peak-Zeitplan greift
• Geschwindigkeit — MiMo-V2.6-Pro 134,3 Ausgabe-Tokens/Sekunde; DeepSeek V4 Pro 97,4
• Zeit bis zum ersten Token — MiMo-V2.6-Pro 2,15 s; DeepSeek V4 Pro 1,62 s
Lesen Sie diese Liste zweimal, denn zwei Zeilen sind kontraintuitiv. Das kleinere Modell erzielt zehn Punkte mehr — 42 Milliarden aktive Parameter, die 49 Milliarden schlagen, sind keine Rundungsdifferenz, sondern ein Ergebnis des Post-Trainings, und es ist das eindeutigste Signal in diesem Vergleich, dass die Qualität des Reinforcement-Learnings die rohe Skalierung als Hebel überholt hat. Und das günstigere Modell ist auch das schnellere, sowohl beim Durchsatz als auch bei den Kosten pro Aufgabe, was das Gegenteil des üblichen Trade-offs ist. Xiaomi verkauft Ihnen keinen Rabatt im Tausch gegen Geduld. DeepSeeks Vorteil ist die Zeit bis zum ersten Token, 1,62 Sekunden gegenüber 2,15 — real, aber die einzige Kategorie, in der V4 Pro führt.

Warum dieselbe Indexversion hier wichtig ist
Der Vergleich von Open-Weights-Modellen über Index-Revisionen hinweg ist der Grund, warum die meisten veröffentlichten Vergleiche schiefgehen – die Versionsnummer ist also keine Fußnote. Artificial Analysis hat den Intelligence Index im September 2026 als v4.3 neu aufgebaut, und die Bewertungen haben sich über diese Grenze hinweg deutlich verändert – Claude Opus 5 verlor zwischen v4.2 und v4.3 drei Punkte, und das Feld der Open-Weights-Modelle wurde neu sortiert. Beide oben genannten Werte sind v4.3.2, was bedeutet, dass die 46 und die 36 direkt miteinander vergleichbar sind. Sie sind nicht mit den älteren Zahlen vergleichbar, die Sie anderswo für eines der beiden Modelle zitiert finden.
Das ist keine hypothetische Annahme. DeepSeek V4 Pro wurde im August 2026 weithin mit 53 auf einer früheren Indexskala gemeldet, und unsere eigene Berichterstattung aus dieser Zeit enthielt das. Auf v4.3.2 steht dasselbe Modell bei 36. Am Modell hat sich nichts geändert; der Maßstab hat sich geändert. Wenn Sie eine Tabelle haben, in der 53 neben einer 46 für MiMo-V2.6-Pro steht, haben Sie einen Vergleich, der Sie auf das falsche Modell verweisen wird. Die richtige Paarung ist 46 gegen 36, und die richtige Schlussfolgerung ist, dass das Modell, das fünf Wochen später mit zwei Dritteln der Parameterzahl veröffentlicht wurde, deutlich vorne liegt.
Die Berichtslücke zwischen den beiden Labors
Es gibt einen zweiten, subtileren Unterschied, und er betrifft die Frage, was jedes Labor bereit ist, überprüfen zu lassen.
Die 46 von MiMo-V2.6-Pro ist eine Messung von Artificial Analysis. Das Evaluierungsinstitut führte seine eigene Suite durch – zehn Evaluierungen in den Bereichen Reasoning, Wissen, Mathematik und Programmierung – an dem veröffentlichten Modell und veröffentlichte das Ergebnis zusammen mit den Betriebszahlen: 134,3 Token/Sekunde, 2,15 Sekunden bis zum ersten Token, ein Cache-Rabatt von 99 %, 0,13 US-Dollar pro Index-Aufgabe und Gesamtkosten der Evaluierung von 206,66 US-Dollar. Das ist die Zahl eines Dritten über das Modell von Xiaomi.
Die herausragenden agentischen Zahlen von DeepSeek V4 Pro stammen von DeepSeek selbst, und die Diskrepanz zwischen ihnen und den unabhängigen wurde dokumentiert. Das Startmaterial des Unternehmens meldet Terminal-Bench 2.1 mit 87,9, DeepSWE mit 62,7, CyberGym mit 83,3 und SWE-bench Verified mit 80,6. Unabhängige Durchläufe setzen Terminal-Bench 2.1 auf 78,7 — etwa neun Punkte unter der Herstellerangabe — und den Artificial Analysis Coding Index auf 68,8. Keine dieser Herstellerzahlen wurde reproduziert, und die Größe der Terminal-Bench-Lücke ist der Grund, den Rest des Sets als Behauptungen statt als Messungen zu behandeln.
Xiaomi hat seine eigene Variante desselben Problems. Sein Dashboard meldet, dass MiMo-V2.6-Pro in seinem Reinforcement-Learning-Lauf auf DeepSWE v1.1 von 58,4 auf 72,57 steigt, bewertet auf Xiaomis eigener Testumgebung mit mini-swe-agent als Durchschnitt aus drei. Das ist keine Leaderboard-Einreichung, und keine externe Partei hat es erneut ausgeführt. Also kommt keines der beiden Modelle mit einer einwandfreien Unbedenklichkeitsbescheinigung bei Hersteller-Benchmarks daher. Der Unterschied ist, dass MiMo-V2.6-Pro außerdem mit einer unabhängigen zusammengesetzten Punktzahl kommt, die DeepSeeks Markteinführung zum entsprechenden Zeitpunkt nicht hatte – und wenn man zwischen ihnen auf Basis von Belegen statt Marketing wählt, ist das die Asymmetrie, die Gewicht haben sollte.

Wie das in der Produktion aussieht
Der Modalitätsunterschied ist die praktische Weggabelung, und er fällt seltener zugunsten von DeepSeek aus, als die Zehn-Punkte-Lücke vermuten lässt. Wenn Ihre Pipeline Screenshots, als Bilder gerenderte PDFs, Videoframes oder Audio aufnimmt, verarbeitet MiMo-V2.6-Pro dies nativ in einem Modell, während DeepSeek V4 Pro dies überhaupt nicht verarbeiten kann – Sie bräuchten ein separates Vision-Modell vorgeschaltet, was einen zweiten Vertrag, einen zweiten Fehlermodus und eine zweite Rechnung bedeutet. Wenn Ihre Workload ausschließlich textbasiertes Reasoning ist, ist die zusätzliche Modalität unnötiger Ballast, für den Sie nichts bezahlen.
Die Kosten pro Index-Task sind die andere Zahl, die man im Blick behalten muss. 0,13 $ gegenüber 0,67 $ sind eine fünffache Lücke bei einem kontrollierten, identischen Aufgabensatz, für beide gleich gemessen. DeepSeek fährt einen Abrechnungsplan mit Peak-/Off-Peak-Zeiten, der seinen effektiven Satz je nach Zeitpunkt des Aufrufs erheblich senken kann, sodass sich das Verhältnis in der Praxis zu Off-Peak-Zeiten verringert und zu Peak-Zeiten vergrößert – ein Detail, das zählt, wenn Ihr Traffic stoßweise auftritt und Sie nicht wählen können, wann er ankommt.
Hier hat die DeepSeek-Seite einen echten Vorteil, der nichts mit dem Modell zu tun hat: Sie ist auf unserer Plattform. DeepSeek V4 Pro ist erreichbar als deepseek/deepseek-v4-pro über einen OrcaRouter-Schlüssel zum Listenpreis des Anbieters mit 0 % Aufschlag, mit automatischem Failover über Anbieter hinweg und der Routing-DSL obendrauf – sodass die Peak-/Off-Peak-Rechnung, die Anbieter-Spanne und der Fallback-Pfad alles Dinge sind, die Sie konfigurieren, statt sie zu bauen. MiMo-V2.6-Pro ist nicht auf unserer Plattform, und wir sagen das ganz offen: Es heute zu erreichen bedeutet Xiaomis eigene Plattform oder einen der Drittanbieter-Kataloge, die es führen, und Artificial Analysis zählte zum Zeitpunkt der Erhebung einen einzigen API-Anbieter dafür. Eine Route ist keine Produktionsroute, was das stärkste Argument dafür ist, MiMo-V2.6-Pro als ein Modell zu behandeln, das man jetzt evaluiert und zu dem man mit Bedacht routet, mit etwas anderem dahinter.
Welches, und wann
Wählen Sie DeepSeek V4 Pro, wenn Ihre Arbeit rein textbasiert ist, wenn Sie die Ausgabegrenze von 384K benötigen, wenn Sie von den beiden die kürzeste Zeit bis zum ersten Token wollen oder wenn Sie bereits auf unserer Plattform sind und eine Open-Weights-Spur mit einer Billion Parametern samt Failover und ohne neue Integration wünschen. Es ist nicht ohne Grund der Platzhirsch, und fünf Wochen älter zu sein bedeutet fünf Wochen an Tooling, Quantisierung und Serving-Rezepten, die ein September-Modell noch nicht angesammelt hat.
Wählen Sie MiMo-V2.6-Pro, wenn die Aufgabe multimodal ist, wenn die Kosten pro Aufgabe Ihre Unit Economics dominieren, wenn der Durchsatz wichtiger ist als eine halbe Sekunde Latenz oder wenn Sie den aktuellen Open-Weights-Spitzenreiter auf einem unabhängig gemessenen Index wollen. Die MIT-Lizenz für beide bedeutet, dass die Frage der Gewichte so oder so geklärt ist – Sie können beide auf Ihrer eigenen Hardware ausführen, feinabstimmen und kommerziell vertreiben.
Die erwägenswerte Konfiguration ist überhaupt keine Wahl. Ein Router ermöglicht es Ihnen, die DeepSeek-Spur für reines Text-Reasoning zu Nebenzeittarifen beizubehalten und eine MiMo-Spur für die multimodalen Anfragen hinzuzufügen, mit einem Fallback vor der dünneren Route. Das ist kein Hedging; es bedeutet, jede Anfrage dem Modell zuzuordnen, das sie tatsächlich bewältigt, was eine günstigere und dauerhaftere Antwort ist, als einen Gewinner zu küren und zu hoffen, dass die Arbeitslast niemals ihre Form ändert.

Die Frage, die dieser Vergleich noch nicht beantworten kann
Die meistzitierten Benchmarks beider Modelle sind anbieterdurchgeführt und nicht reproduziert. Bei DeepSeek V4 Pro ist diese Lücke seit August offen und der Grund dafür, dass seine unabhängigen Werte niedriger ausfallen als seine Startzahlen. Bei MiMo-V2.6-Pro existiert der unabhängige Gesamtwert, aber die agentische Aufschlüsselung nicht — Artificial Analysis veröffentlicht eine 46 und nicht die Streuung pro Einzelbewertung darunter, und genau das ist das Detail, das verrät, ob ein Modell in eine Agentenschleife oder eine Frage-Antwort-Pipeline gehört.
Bis diese Spanne veröffentlicht ist und bis jemand Xiaomis DeepSWE-Harness erneut laufen lässt, ist die haltbare Position enger als das Marketing beider Labore: MiMo-V2.6-Pro führt bei einem unabhängigen zusammengesetzten Wert und bei gemessenen Kosten pro Aufgabe, DeepSeek V4 Pro führt bei Reife, Ausgabelänge, First-Token-Latenz und bei der Erreichbarkeit über eine Route, hinter der Redundanz steht. Fünf Wochen sind ein kurzer Vorsprung, und es ist der einzige, den DeepSeek hat.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
