
Xiaomi MiMo-V2.6-Pro vs. Grok 4.7: 30× günstiger pro Aufgabe, und keiner von beiden ist schnell
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 36 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 181 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Xiaomi MiMo-V2.6-Pro und Grok 4.7 erschienen beide am 21. September 2026, liegen beide bei 46 im Artificial Analysis Intelligence Index v4.3.2 und werden beide von der Seite, die sie gemessen hat, als langsam bezeichnet – 43,6 Ausgabe-Token pro Sekunde für MiMo-V2.6-Pro gegenüber einem Median von 67,1, 40 für Grok 4.7 bei xhigh effort. Was sie unterscheidet, sind die Kosten einer Antwort. Der Wert des Evaluators pro Aufgabe beträgt 0,13 $ für den chinesischen offenen Checkpoint und 3,74 $ für das Modell Grok 4.7, ein Faktor von ungefähr 29. Das ist kein Unterschied bei der Rate – oder nicht nur einer: Die Ausgaberate von Grok 4.7 beträgt 6,00 $ pro Million Token gegenüber 0,87 $, was das Siebenfache ist, und der Rest des Faktors ergibt sich daraus, wie viele Token jedes Modell verbraucht, um zu einer Antwort zu gelangen.
Zwei Modelle im selben Monat, auf demselben Index, mit demselben Score – bepreist, als gehörten sie zu unterschiedlichen Jahrzehnten des Marktes. Die interessante Frage ist nicht, welches gewinnt. Sondern welchen Teil dieses 29× man tatsächlich umgehen kann – denn in dieser Paarung ist genau eines der beiden eine Route, die man heute kaufen kann, und es ist das teure.
Gleicher Tag, gleiche Punktzahl, andere Tiere
Grok 4.7 erschien am 21. September 2026 für 2,00 US-Dollar pro Million Eingabe-Tokens und 6,00 US-Dollar pro Million Ausgabe-Tokens, mit einem Kontextfenster von 500.000 Tokens, einem Knowledge-Cutoff vom Mai 2026, 75 % Cache-Rabatt sowie Text- und Bildeingabe mit Textausgabe. Es erzielte 46 auf dem Index bei xhigh-Aufwand, 56 im Coding Agent Index im Grok Build Harness und 1.657 Elo auf AA-Briefcase — Vierter auf dieser Rangliste, hinter drei Anthropic-Einträgen, bei etwa halb so hohen Kosten pro Aufgabe wie Claude Opus 5.
Xiaomi MiMo-V2.6-Pro ist ein sparse Mixture-of-Experts-Checkpoint mit insgesamt 1,02 Billionen Parametern, davon 42 Milliarden aktiv, MIT-Lizenz, 1M-Token-Kontext, Text-, Bild-, Sprach- und Videoeingabe gegenüber Textausgabe, 0,43 $ und 0,87 $ pro Million Tokens mit einem 99 %-Cache-Rabatt, der die effektive Eingaberate bei einem warmen Prompt gegen null sinken lässt. Artificial Analysis führt es auf dem Index an erster Stelle von 114 Open-Weights-Modellen und auf Platz zwölf von 114 bei den Kosten. Es ist über drei API-Anbieter erreichbar. Es ist nicht in unseren Routen, und wir listen ein Modell nicht, bevor ein Anbieter es eingebunden hat.
Die einzige Zeile, die darüber entscheidet
• Kosten pro Index-Aufgabe — MiMo-V2.6-Pro 0,13 $; Grok 4.7 3,74 $ — 29× • Ausgaberate — MiMo-V2.6-Pro 0,87 $ / 1M; Grok 4.7 6,00 $ / 1M — 6,9× • Ausgabe-Tokens beim Index-Lauf — MiMo-V2.6-Pro 140M; Grok 4.7 240M, gegenüber einem Median von 88M • Ausgabegeschwindigkeit — MiMo-V2.6-Pro 43,6 t/s; Grok 4.7 40 t/s — beide unter dem Median • Kontextfenster — MiMo-V2.6-Pro 1M; Grok 4.7 500K • Gewichte — MiMo-V2.6-Pro MIT-lizenziert und herunterladbar; Grok 4.7 proprietär, nur API
Lesen Sie die ersten beiden Aufzählungspunkte zusammen, dann wird die Form der Kluft klar. Zum Listenpreis liegen die beiden bei der Ausgabe um den Faktor 6,9 auseinander. Im Index-Durchlauf liegen sie bei dem, was eine Antwort kostet, um den Faktor 29 auseinander. Der dazwischenliegende Multiplikator ist die Ausführlichkeit: Grok 4.7 erzeugte 240 Millionen Ausgabe-Tokens gegenüber einem Median von 88 Millionen für seine Klasse, und MiMo-V2.6-Pro erzeugte 140 Millionen. Das ist eine 1,71×-Token-Strafe zusätzlich zur 6,9×-Preisstrafe, und 1,71 × 6,9 ist 11,8 — der Rest des Abstands bis 29 kommt von der Eingabeseite, wo der 99-%-Cache-Rabatt von MiMo-V2.6-Pro und sein Eingabetarif von 0,43 $ bei einer Workload mit auch nur irgendeinem wiederholten Präfix die Hauptarbeit leisten.

Weitschweifigkeit ist die Zahl, die Menschen bei der Schätzung weglassen
Kostenmodelle werden üblicherweise aus einer Preisliste und einer angenommenen Token-Anzahl erstellt. Beide Hälften davon sind hier falsch. Die Preisliste ist falsch, weil der Cache-Rabatt keine Fußnote ist – 99 % gegenüber 75 % ist der Unterschied zwischen einem System-Prompt, der Sie bei jedem Aufruf Geld kostet, und einem, der Sie fast nichts kostet. Die Token-Anzahl ist falsch, weil die beiden Modelle nicht die gleiche Anzahl an Tokens für dieselbe Arbeit ausgeben, und der Evaluator hat die Differenz gemessen: 240 Millionen gegenüber 140 Millionen, eine 1,71-fache Spanne bei einem identischen Benchmark.
Keines von beiden ist ein Proxy, den man von einem Datenblatt ablesen kann. Der Verbosity-Rang von Grok 4.7 ist #94 von 210 Modellen seiner Klasse; der Kostenrang von MiMo-V2.6-Pro ist #12 von 114 in seiner Klasse. Ein Team, das die Preisliste von Grok 4.7 zitiert und eine token-neutrale Arbeitslast annimmt, wird ungefähr ein Viertel dessen prognostizieren, was der Index pro Aufgabe tatsächlich ausgegeben hat. Die Korrektur besteht auch nicht darin, die Indexkosten als Ihre Schätzung zu verwenden – sie sind eine Messung der Form eines einzelnen Benchmarks. Sie besteht darin, Ihre eigenen Token-Zahlen auf beiden Seiten zu messen, bevor Sie sich festlegen, denn der Abstand zwischen den beiden Modellen beträgt auf dem Papier 6,9× und in der Praxis 29×, und nur eine dieser Zahlen ist für Ihren Traffic real.

Beide sind langsam, und das ist kein Unentschieden
Artificial Analysis hat Grok 4.7 mit 40 Ausgabe-Tokens pro Sekunde gemessen und bezeichnet es als „unter den langsamsten“; MiMo-V2.6-Pro mit 43,6 und bezeichnet es als „auffallend langsam“. Diese beiden Messwerte liegen nah genug beieinander, dass die Geschwindigkeit nicht als Entscheidungskriterium zwischen ihnen dienen sollte. Die zugrunde liegenden Mediane sind es jedoch nicht: 67,1 für das Open-Weights-Feld, in dem MiMo-V2.6-Pro angesiedelt ist. Beide Modelle liegen deutlich darunter, und MiMo-V2.6-Pro weist zudem eine Zeit bis zum ersten Token von 3,17 Sekunden gegenüber einem Median von 2,31 Sekunden auf – und das ist die Zahl, die in einer interaktiven Schleife schmerzt und nicht im Batchbetrieb.
Die ehrliche Zusammenfassung auf der Latenzseite lautet also: 29× günstiger erkauft Ihnen kein schnelleres Produkt, sondern ein langsameres, das weniger kostet – und wenn Ihre Nutzer einen Cursor beobachten, kann die Wartezeit von 3,17 Sekunden mehr kosten als die eingesparten Tokens. Für nächtliche Batch-Arbeit, Offline-Evaluierung oder jede Pipeline, bei der die Uhr in Stunden gemessen wird, ist der Tausch unkompliziert und die 29× sind nahezu kostenlos.
Was ein Router mit dieser Paarung tun kann und was nicht
Dies ist die Paarung, bei der unser eigener Katalog wirklich einseitig ist, und es lohnt sich, das offen zu sagen. Grok 4.7 ist live auf OrcaRouter als grok/grok-4.7 zu den anbietereigenen Preisen von 2,00 $ / 6,00 $ mit einer maximalen Ausgabe von 450K und einem OpenAI-SDK-kompatiblen Endpunkt unter https://api.orcarouter.ai/v1 — wenn der Vergleich also den Wunsch weckt, das xAI-Modell hinter demselben Schlüssel wie alles andere zu haben, gibt es diesen Weg schon heute. Xiaomi MiMo-V2.6-Pro ist nicht auf unseren Routen; für diese Seite ist die API des Herstellers selbst oder derjenige seiner drei aufgeführten Anbieter, den du bereits nutzt, die Antwort, und wir werden nicht so tun, als wäre es anders.
Wo ein Router in einem Vergleich wie diesem seinen Platz verdient, zeigt sich an den Teilen, die nicht das Modell sind. Ein Schlüssel für 200+ Modelle zum Listenpreis jedes Anbieters mit 0 % Aufschlag bedeutet, dass eine Preissenkung eines Anbieters noch am selben Tag auf Ihrer Rechnung landet und nicht erst bei der nächsten Vertragsverlängerung. Automatisches Failover bedeutet, dass eine degradierende 40 t/s-Route Ihre Pipeline nicht mitreißt. Die Routing-DSL ermöglicht es, die Aufteilung an den veröffentlichten Kosten pro Aufgabe statt an Markentreue festzumachen – günstiges Modell für hohes Volumen, leistungsstarkes Modell für die schwierigen Anfragen, entschieden pro Anfrage. Und für Workloads, bei denen keines der beiden Modelle ganz passt, kann Modellfusion mehrere hinter einem einzigen Aufruf ausführen.

Fragen, die dieser Vergleich üblicherweise aufwirft
Gilt das 29× für meine Arbeitslast? Nur wenn Ihr Token-Mix dem des Index-Laufs ähnelt. Wenn Ihre Ausgaben kurz und Ihre Prompts lang und gecacht sind, fällt das Vielfache in Richtung der Ratenlücke von 6,9× bei der Ausgabe und weitet sich bei der Eingabe, wobei der 99 %-Rabatt von MiMo-V2.6-Pro den entscheidenden Term bildet. Wenn Ihre Ausgaben lange Reasoning-Traces sind, weitet es sich über 29× hinaus, weil die Ausführlichkeitsstrafe von Grok 4.7 proportional zur Ausgabelänge ist.
Ist die 46 auf jeder Seite dieselbe 46? Es ist derselbe Index, dieselbe Version und dieselbe Skala – die zugrunde liegenden Teilwerte lagen bei 46,32 und 46,45, also eine Spanne von 0,13 Punkten, und der Index rundet beide auf 46. Artificial Analysis veröffentlicht für keines der beiden Modelle Aufschlüsselungen pro Evaluation, daher ist der zusammengesetzte Wert die feinste verfügbare Auflösung, und ein Unterschied von 0,13 Punkten sollte nicht als Ranking der Leistungsfähigkeit gelesen werden.
Worauf sollte ein neues Projekt standardmäßig setzen? Wenn die Workload Batch ist, latenz tolerant und kostenempfindlich, ist MiMo-V2.6-Pro mit $0.13 pro Aufgabe der Standard, und die offenen Gewichte bedeuten, dass Sie nicht den Preisen eines einzelnen Anbieters ausgesetzt sind. Wenn Sie speziell das xAI-Modell benötigen — die Ergebnisse des Grok Build Harness, die AA-Briefcase-Platzierung, der 500K-Kontext mit einem Cutoff im Mai 2026 — ist Grok 4.7 heute eine Live-Route auf OrcaRouter, und der Aufpreis pro Aufgabe ist der Preis für genau diese Fähigkeit. Kein Modell hier gewinnt beides.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
