OrcaRouter-Modellradar-Hero-Karte für den Vergleich zwischen MiMo-V2.6-Pro und DeepSeek V4 Pro, mit dem Untertitel „Zwei offene Flaggschiffe, zehn Indexpunkte Abstand.“, mit einem Panel pro Modell und einer Fußzeile, die darauf hinweist, dass beide MIT-lizenziert sind, ein Kontextfenster von 1 Mio. Tokens haben und dass die Werte v4.3.2 sind und nicht mit früheren Indexversionen vergleichbar sind.
Guides & Insights

MiMo-V2.6-Pro vs. DeepSeek V4 Pro: Zwei offene Flaggschiffe, zehn Indexpunkte auseinander

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Xiaomi MiMo-V2.6-Pro und DeepSeek V4 Pro sind von derselben Art – chinesische Mixture-of-Experts-Flaggschiffe mit Billionen Parametern, MIT-lizenziert, 1M-Token-Kontext, offene Gewichte, die man heute herunterladen kann – und sie liegen zehn Punkte auseinander im Artificial Analysis Intelligence Index v4.3.2, 46 gegen 36. Sie sind sich außerdem uneinig darüber, wofür ein Flaggschiff da ist. DeepSeek V4 Pro, veröffentlicht am 13. August 2026, ist ein reines Text-Reasoning-Modell: 1,6 Billionen Parameter, davon 49 Milliarden aktive, und keine Bild-, Audio- oder Videoeingabe an irgendeiner Stelle seiner veröffentlichten Oberfläche. Xiaomi MiMo-V2.6-Pro, veröffentlicht am 21. September 2026, hat 1,02 Billionen Parameter, davon 42 Milliarden aktive, und akzeptiert Text, Bild, Video und Audio. Dieser Unterschied entscheidet über mehr Deployments als die zehn Punkte, und er ist das Erste, was geklärt werden muss, bevor man irgendetwas anderes vergleicht.

Gleiche Lizenz, andere Maschinen

Beginne mit dem, was tatsächlich identisch ist, denn es ist mehr, als man bei zwei konkurrierenden Laboren erwarten würde. Beide werden auf öffentlichen Repositories unter einer MIT-Lizenz-Kennzeichnung ausgeliefert, was kommerziellen Einsatz, Modifikation und weiteres Training ohne Umsatzhürde oder Nutzungsbereichsklausel bedeutet. Beide beanspruchen ein Kontextfenster von 1M Token. Beide sind sparse Mixture-of-Experts-Designs – die Architektur ist in dieser Größenordnung zum Standard geworden, kein Differenzierungsmerkmal. Und beide wurden von Laboren trainiert, die weniger über ihre Methoden veröffentlichen als westliche Frontier-Labore.

• Parameter — MiMo-V2.6-Pro 1,02T gesamt / 42B aktiv; DeepSeek V4 Pro 1,6T gesamt / 49B aktiv

• Eingabemodalität — MiMo-V2.6-Pro: Text, Bild, Video, Audio; DeepSeek V4 Pro: nur Text

• Kontext — 1 Mio. Tokens bei beiden; DeepSeek V4 Pro begrenzt die Ausgabe auf 384K Tokens

• Indexwert — MiMo-V2.6-Pro 46 im Intelligence Index v4.3.2; DeepSeek V4 Pro 36 in derselben Version

• Kosten pro Index-Aufgabe — MiMo-V2.6-Pro 0,13 $; DeepSeek V4 Pro 0,67 $

• Listenpreis — MiMo-V2.6-Pro 0,43 $ / 0,87 $ pro 1 Mio. Tokens; DeepSeek V4 Pro 1,32 $ / 3,96 $, wie Artificial Analysis es aufführt, bevor DeepSeeks eigener Peak-/Off-Peak-Zeitplan greift

• Geschwindigkeit — MiMo-V2.6-Pro 134,3 Ausgabe-Tokens/Sekunde; DeepSeek V4 Pro 97,4

• Zeit bis zum ersten Token — MiMo-V2.6-Pro 2,15 s; DeepSeek V4 Pro 1,62 s

Lesen Sie diese Liste zweimal, denn zwei Zeilen sind kontraintuitiv. Das kleinere Modell erzielt zehn Punkte mehr — 42 Milliarden aktive Parameter, die 49 Milliarden schlagen, sind keine Rundungsdifferenz, sondern ein Ergebnis des Post-Trainings, und es ist das eindeutigste Signal in diesem Vergleich, dass die Qualität des Reinforcement-Learnings die rohe Skalierung als Hebel überholt hat. Und das günstigere Modell ist auch das schnellere, sowohl beim Durchsatz als auch bei den Kosten pro Aufgabe, was das Gegenteil des üblichen Trade-offs ist. Xiaomi verkauft Ihnen keinen Rabatt im Tausch gegen Geduld. DeepSeeks Vorteil ist die Zeit bis zum ersten Token, 1,62 Sekunden gegenüber 2,15 — real, aber die einzige Kategorie, in der V4 Pro führt.

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists 1.02T total and 42B active parameters, text, image, video and audio input, a 1M-token context window, Intelligence Index v4.3.2 score 46, a listed rate of $0.43 / $0.87 per million tokens, $0.13 per index task, 134.3 tokens per second with 2.15 seconds to first token, and a release date of 21 September 2026. The DeepSeek V4 Pro column lists 1.6T total and 49B active parameters, text-only input, a 1M-token context window with output capped at 384K, index score 36, a listed rate of $1.32 / $3.96, $0.67 per index task, 97.4 tokens per second with 1.62 seconds to first token, and a release date of 13 August 2026.

Warum dieselbe Indexversion hier wichtig ist

Der Vergleich von Open-Weights-Modellen über Index-Revisionen hinweg ist der Grund, warum die meisten veröffentlichten Vergleiche schiefgehen – die Versionsnummer ist also keine Fußnote. Artificial Analysis hat den Intelligence Index im September 2026 als v4.3 neu aufgebaut, und die Bewertungen haben sich über diese Grenze hinweg deutlich verändert – Claude Opus 5 verlor zwischen v4.2 und v4.3 drei Punkte, und das Feld der Open-Weights-Modelle wurde neu sortiert. Beide oben genannten Werte sind v4.3.2, was bedeutet, dass die 46 und die 36 direkt miteinander vergleichbar sind. Sie sind nicht mit den älteren Zahlen vergleichbar, die Sie anderswo für eines der beiden Modelle zitiert finden.

Das ist keine hypothetische Annahme. DeepSeek V4 Pro wurde im August 2026 weithin mit 53 auf einer früheren Indexskala gemeldet, und unsere eigene Berichterstattung aus dieser Zeit enthielt das. Auf v4.3.2 steht dasselbe Modell bei 36. Am Modell hat sich nichts geändert; der Maßstab hat sich geändert. Wenn Sie eine Tabelle haben, in der 53 neben einer 46 für MiMo-V2.6-Pro steht, haben Sie einen Vergleich, der Sie auf das falsche Modell verweisen wird. Die richtige Paarung ist 46 gegen 36, und die richtige Schlussfolgerung ist, dass das Modell, das fünf Wochen später mit zwei Dritteln der Parameterzahl veröffentlicht wurde, deutlich vorne liegt.

Die Berichtslücke zwischen den beiden Labors

Es gibt einen zweiten, subtileren Unterschied, und er betrifft die Frage, was jedes Labor bereit ist, überprüfen zu lassen.

Die 46 von MiMo-V2.6-Pro ist eine Messung von Artificial Analysis. Das Evaluierungsinstitut führte seine eigene Suite durch – zehn Evaluierungen in den Bereichen Reasoning, Wissen, Mathematik und Programmierung – an dem veröffentlichten Modell und veröffentlichte das Ergebnis zusammen mit den Betriebszahlen: 134,3 Token/Sekunde, 2,15 Sekunden bis zum ersten Token, ein Cache-Rabatt von 99 %, 0,13 US-Dollar pro Index-Aufgabe und Gesamtkosten der Evaluierung von 206,66 US-Dollar. Das ist die Zahl eines Dritten über das Modell von Xiaomi.

Die herausragenden agentischen Zahlen von DeepSeek V4 Pro stammen von DeepSeek selbst, und die Diskrepanz zwischen ihnen und den unabhängigen wurde dokumentiert. Das Startmaterial des Unternehmens meldet Terminal-Bench 2.1 mit 87,9, DeepSWE mit 62,7, CyberGym mit 83,3 und SWE-bench Verified mit 80,6. Unabhängige Durchläufe setzen Terminal-Bench 2.1 auf 78,7 — etwa neun Punkte unter der Herstellerangabe — und den Artificial Analysis Coding Index auf 68,8. Keine dieser Herstellerzahlen wurde reproduziert, und die Größe der Terminal-Bench-Lücke ist der Grund, den Rest des Sets als Behauptungen statt als Messungen zu behandeln.

Xiaomi hat seine eigene Variante desselben Problems. Sein Dashboard meldet, dass MiMo-V2.6-Pro in seinem Reinforcement-Learning-Lauf auf DeepSWE v1.1 von 58,4 auf 72,57 steigt, bewertet auf Xiaomis eigener Testumgebung mit mini-swe-agent als Durchschnitt aus drei. Das ist keine Leaderboard-Einreichung, und keine externe Partei hat es erneut ausgeführt. Also kommt keines der beiden Modelle mit einer einwandfreien Unbedenklichkeitsbescheinigung bei Hersteller-Benchmarks daher. Der Unterschied ist, dass MiMo-V2.6-Pro außerdem mit einer unabhängigen zusammengesetzten Punktzahl kommt, die DeepSeeks Markteinführung zum entsprechenden Zeitpunkt nicht hatte – und wenn man zwischen ihnen auf Basis von Belegen statt Marketing wählt, ist das die Asymmetrie, die Gewicht haben sollte.

Screenshot of the Artificial Analysis model page for DeepSeek V4 Pro, showing the Intelligence Index score of 36 on version 4.3.2, an open-weights model under the MIT licence, text-only input, 1.6 trillion total and 49 billion active parameters, a 1M-token context window, a listed price of $1.32 per million input tokens and $3.96 per million output tokens, output speed of 97.4 tokens per second and time to first token of 1.62 seconds.

Wie das in der Produktion aussieht

Der Modalitätsunterschied ist die praktische Weggabelung, und er fällt seltener zugunsten von DeepSeek aus, als die Zehn-Punkte-Lücke vermuten lässt. Wenn Ihre Pipeline Screenshots, als Bilder gerenderte PDFs, Videoframes oder Audio aufnimmt, verarbeitet MiMo-V2.6-Pro dies nativ in einem Modell, während DeepSeek V4 Pro dies überhaupt nicht verarbeiten kann – Sie bräuchten ein separates Vision-Modell vorgeschaltet, was einen zweiten Vertrag, einen zweiten Fehlermodus und eine zweite Rechnung bedeutet. Wenn Ihre Workload ausschließlich textbasiertes Reasoning ist, ist die zusätzliche Modalität unnötiger Ballast, für den Sie nichts bezahlen.

Die Kosten pro Index-Task sind die andere Zahl, die man im Blick behalten muss. 0,13 $ gegenüber 0,67 $ sind eine fünffache Lücke bei einem kontrollierten, identischen Aufgabensatz, für beide gleich gemessen. DeepSeek fährt einen Abrechnungsplan mit Peak-/Off-Peak-Zeiten, der seinen effektiven Satz je nach Zeitpunkt des Aufrufs erheblich senken kann, sodass sich das Verhältnis in der Praxis zu Off-Peak-Zeiten verringert und zu Peak-Zeiten vergrößert – ein Detail, das zählt, wenn Ihr Traffic stoßweise auftritt und Sie nicht wählen können, wann er ankommt.

Hier hat die DeepSeek-Seite einen echten Vorteil, der nichts mit dem Modell zu tun hat: Sie ist auf unserer Plattform. DeepSeek V4 Pro ist erreichbar als deepseek/deepseek-v4-pro über einen OrcaRouter-Schlüssel zum Listenpreis des Anbieters mit 0 % Aufschlag, mit automatischem Failover über Anbieter hinweg und der Routing-DSL obendrauf – sodass die Peak-/Off-Peak-Rechnung, die Anbieter-Spanne und der Fallback-Pfad alles Dinge sind, die Sie konfigurieren, statt sie zu bauen. MiMo-V2.6-Pro ist nicht auf unserer Plattform, und wir sagen das ganz offen: Es heute zu erreichen bedeutet Xiaomis eigene Plattform oder einen der Drittanbieter-Kataloge, die es führen, und Artificial Analysis zählte zum Zeitpunkt der Erhebung einen einzigen API-Anbieter dafür. Eine Route ist keine Produktionsroute, was das stärkste Argument dafür ist, MiMo-V2.6-Pro als ein Modell zu behandeln, das man jetzt evaluiert und zu dem man mit Bedacht routet, mit etwas anderem dahinter.

Welches, und wann

Wählen Sie DeepSeek V4 Pro, wenn Ihre Arbeit rein textbasiert ist, wenn Sie die Ausgabegrenze von 384K benötigen, wenn Sie von den beiden die kürzeste Zeit bis zum ersten Token wollen oder wenn Sie bereits auf unserer Plattform sind und eine Open-Weights-Spur mit einer Billion Parametern samt Failover und ohne neue Integration wünschen. Es ist nicht ohne Grund der Platzhirsch, und fünf Wochen älter zu sein bedeutet fünf Wochen an Tooling, Quantisierung und Serving-Rezepten, die ein September-Modell noch nicht angesammelt hat.

Wählen Sie MiMo-V2.6-Pro, wenn die Aufgabe multimodal ist, wenn die Kosten pro Aufgabe Ihre Unit Economics dominieren, wenn der Durchsatz wichtiger ist als eine halbe Sekunde Latenz oder wenn Sie den aktuellen Open-Weights-Spitzenreiter auf einem unabhängig gemessenen Index wollen. Die MIT-Lizenz für beide bedeutet, dass die Frage der Gewichte so oder so geklärt ist – Sie können beide auf Ihrer eigenen Hardware ausführen, feinabstimmen und kommerziell vertreiben.

Die erwägenswerte Konfiguration ist überhaupt keine Wahl. Ein Router ermöglicht es Ihnen, die DeepSeek-Spur für reines Text-Reasoning zu Nebenzeittarifen beizubehalten und eine MiMo-Spur für die multimodalen Anfragen hinzuzufügen, mit einem Fallback vor der dünneren Route. Das ist kein Hedging; es bedeutet, jede Anfrage dem Modell zuzuordnen, das sie tatsächlich bewältigt, was eine günstigere und dauerhaftere Antwort ist, als einen Gewinner zu küren und zu hoffen, dass die Arbeitslast niemals ihre Form ändert.

Decision card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the decision', with two columns. 'Choose MiMo-V2.6-Pro when' lists a multimodal task with screenshots, rendered PDFs, video frames or audio in the same request; cost per task dominating unit economics at $0.13 against $0.67 on an identical task set; throughput mattering more than latency at 134.3 against 97.4 tokens per second; and wanting the current open-weights leader on an independently measured index at 46 against 36. 'Choose DeepSeek V4 Pro when' lists text-only reasoning work; needing the 384K output ceiling; first-token latency being the binding constraint at 1.62s against 2.15s; and wanting a route with failover behind it.

Die Frage, die dieser Vergleich noch nicht beantworten kann

Die meistzitierten Benchmarks beider Modelle sind anbieterdurchgeführt und nicht reproduziert. Bei DeepSeek V4 Pro ist diese Lücke seit August offen und der Grund dafür, dass seine unabhängigen Werte niedriger ausfallen als seine Startzahlen. Bei MiMo-V2.6-Pro existiert der unabhängige Gesamtwert, aber die agentische Aufschlüsselung nicht — Artificial Analysis veröffentlicht eine 46 und nicht die Streuung pro Einzelbewertung darunter, und genau das ist das Detail, das verrät, ob ein Modell in eine Agentenschleife oder eine Frage-Antwort-Pipeline gehört.

Bis diese Spanne veröffentlicht ist und bis jemand Xiaomis DeepSWE-Harness erneut laufen lässt, ist die haltbare Position enger als das Marketing beider Labore: MiMo-V2.6-Pro führt bei einem unabhängigen zusammengesetzten Wert und bei gemessenen Kosten pro Aufgabe, DeepSeek V4 Pro führt bei Reife, Ausgabelänge, First-Token-Latenz und bei der Erreichbarkeit über eine Route, hinter der Redundanz steht. Fünf Wochen sind ein kurzer Vorsprung, und es ist der einzige, den DeepSeek hat.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert