Eine generierte Titelkarte mit der Aufschrift MiMo-V2.6-Pro vs. Grok 4.7, mit dem Untertitel 29x günstiger pro Aufgabe und langsamer auf beiden Seiten darunter sowie drei flachen Linien-Icons über dem Titel, die verglichene Münzstapel, eine Geschwindigkeitsanzeige und ein offenes Vorhängeschloss andeuten. Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

Xiaomi MiMo-V2.6-Pro vs. Grok 4.7: 30× günstiger pro Aufgabe, und keiner von beiden ist schnell

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Xiaomi MiMo-V2.6-Pro und Grok 4.7 erschienen beide am 21. September 2026, liegen beide bei 46 im Artificial Analysis Intelligence Index v4.3.2 und werden beide von der Seite, die sie gemessen hat, als langsam bezeichnet – 43,6 Ausgabe-Token pro Sekunde für MiMo-V2.6-Pro gegenüber einem Median von 67,1, 40 für Grok 4.7 bei xhigh effort. Was sie unterscheidet, sind die Kosten einer Antwort. Der Wert des Evaluators pro Aufgabe beträgt 0,13 $ für den chinesischen offenen Checkpoint und 3,74 $ für das Modell Grok 4.7, ein Faktor von ungefähr 29. Das ist kein Unterschied bei der Rate – oder nicht nur einer: Die Ausgaberate von Grok 4.7 beträgt 6,00 $ pro Million Token gegenüber 0,87 $, was das Siebenfache ist, und der Rest des Faktors ergibt sich daraus, wie viele Token jedes Modell verbraucht, um zu einer Antwort zu gelangen.

Zwei Modelle im selben Monat, auf demselben Index, mit demselben Score – bepreist, als gehörten sie zu unterschiedlichen Jahrzehnten des Marktes. Die interessante Frage ist nicht, welches gewinnt. Sondern welchen Teil dieses 29× man tatsächlich umgehen kann – denn in dieser Paarung ist genau eines der beiden eine Route, die man heute kaufen kann, und es ist das teure.

Gleicher Tag, gleiche Punktzahl, andere Tiere

Grok 4.7 erschien am 21. September 2026 für 2,00 US-Dollar pro Million Eingabe-Tokens und 6,00 US-Dollar pro Million Ausgabe-Tokens, mit einem Kontextfenster von 500.000 Tokens, einem Knowledge-Cutoff vom Mai 2026, 75 % Cache-Rabatt sowie Text- und Bildeingabe mit Textausgabe. Es erzielte 46 auf dem Index bei xhigh-Aufwand, 56 im Coding Agent Index im Grok Build Harness und 1.657 Elo auf AA-Briefcase — Vierter auf dieser Rangliste, hinter drei Anthropic-Einträgen, bei etwa halb so hohen Kosten pro Aufgabe wie Claude Opus 5.

Xiaomi MiMo-V2.6-Pro ist ein sparse Mixture-of-Experts-Checkpoint mit insgesamt 1,02 Billionen Parametern, davon 42 Milliarden aktiv, MIT-Lizenz, 1M-Token-Kontext, Text-, Bild-, Sprach- und Videoeingabe gegenüber Textausgabe, 0,43 $ und 0,87 $ pro Million Tokens mit einem 99 %-Cache-Rabatt, der die effektive Eingaberate bei einem warmen Prompt gegen null sinken lässt. Artificial Analysis führt es auf dem Index an erster Stelle von 114 Open-Weights-Modellen und auf Platz zwölf von 114 bei den Kosten. Es ist über drei API-Anbieter erreichbar. Es ist nicht in unseren Routen, und wir listen ein Modell nicht, bevor ein Anbieter es eingebunden hat.

Die einzige Zeile, die darüber entscheidet

• Kosten pro Index-Aufgabe — MiMo-V2.6-Pro 0,13 $; Grok 4.7 3,74 $ — 29× • Ausgaberate — MiMo-V2.6-Pro 0,87 $ / 1M; Grok 4.7 6,00 $ / 1M — 6,9× • Ausgabe-Tokens beim Index-Lauf — MiMo-V2.6-Pro 140M; Grok 4.7 240M, gegenüber einem Median von 88M • Ausgabegeschwindigkeit — MiMo-V2.6-Pro 43,6 t/s; Grok 4.7 40 t/s — beide unter dem Median • Kontextfenster — MiMo-V2.6-Pro 1M; Grok 4.7 500K • Gewichte — MiMo-V2.6-Pro MIT-lizenziert und herunterladbar; Grok 4.7 proprietär, nur API

Lesen Sie die ersten beiden Aufzählungspunkte zusammen, dann wird die Form der Kluft klar. Zum Listenpreis liegen die beiden bei der Ausgabe um den Faktor 6,9 auseinander. Im Index-Durchlauf liegen sie bei dem, was eine Antwort kostet, um den Faktor 29 auseinander. Der dazwischenliegende Multiplikator ist die Ausführlichkeit: Grok 4.7 erzeugte 240 Millionen Ausgabe-Tokens gegenüber einem Median von 88 Millionen für seine Klasse, und MiMo-V2.6-Pro erzeugte 140 Millionen. Das ist eine 1,71×-Token-Strafe zusätzlich zur 6,9×-Preisstrafe, und 1,71 × 6,9 ist 11,8 — der Rest des Abstands bis 29 kommt von der Eingabeseite, wo der 99-%-Cache-Rabatt von MiMo-V2.6-Pro und sein Eingabetarif von 0,43 $ bei einer Workload mit auch nur irgendeinem wiederholten Präfix die Hauptarbeit leisten.

A two-column scoreboard titled MiMo-V2.6-Pro vs Grok 4.7 - the scoreboard, subtitled Same index score, same month, 29x apart per task. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; cost per index task $0.13; list price $0.43 / $0.87 per 1M; output speed 43.6 tokens per second; 140M output tokens on the index run; 1M context; weights downloadable, and carries a tag reading Open weights - MIT. The right column, Grok 4.7 (xhigh), reads Intelligence Index v4.3.2 46; cost per index task $3.74; list price $2.00 / $6.00 per 1M; output speed 40 tokens per second; 240M output tokens; 500K context; weights not released, and carries a tag reading Proprietary - API only. A footer line reads that index scores, per-task cost, speed and token counts are per Artificial Analysis Intelligence Index v4.3.2, read 25 September 2026, and that both models shipped 21 September 2026. The OrcaRouter logo is composited in the bottom-right corner.

Weitschweifigkeit ist die Zahl, die Menschen bei der Schätzung weglassen

Kostenmodelle werden üblicherweise aus einer Preisliste und einer angenommenen Token-Anzahl erstellt. Beide Hälften davon sind hier falsch. Die Preisliste ist falsch, weil der Cache-Rabatt keine Fußnote ist – 99 % gegenüber 75 % ist der Unterschied zwischen einem System-Prompt, der Sie bei jedem Aufruf Geld kostet, und einem, der Sie fast nichts kostet. Die Token-Anzahl ist falsch, weil die beiden Modelle nicht die gleiche Anzahl an Tokens für dieselbe Arbeit ausgeben, und der Evaluator hat die Differenz gemessen: 240 Millionen gegenüber 140 Millionen, eine 1,71-fache Spanne bei einem identischen Benchmark.

Keines von beiden ist ein Proxy, den man von einem Datenblatt ablesen kann. Der Verbosity-Rang von Grok 4.7 ist #94 von 210 Modellen seiner Klasse; der Kostenrang von MiMo-V2.6-Pro ist #12 von 114 in seiner Klasse. Ein Team, das die Preisliste von Grok 4.7 zitiert und eine token-neutrale Arbeitslast annimmt, wird ungefähr ein Viertel dessen prognostizieren, was der Index pro Aufgabe tatsächlich ausgegeben hat. Die Korrektur besteht auch nicht darin, die Indexkosten als Ihre Schätzung zu verwenden – sie sind eine Messung der Form eines einzelnen Benchmarks. Sie besteht darin, Ihre eigenen Token-Zahlen auf beiden Seiten zu messen, bevor Sie sich festlegen, denn der Abstand zwischen den beiden Modellen beträgt auf dem Papier 6,9× und in der Praxis 29×, und nur eine dieser Zahlen ist für Ihren Traffic real.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 25 September 2026. The header shows Intelligence rank 21 of 210, Speed 159 of 210, Cost 210 of 210, Verbosity 94 of 210, 46 on the Artificial Analysis Intelligence Index, $2.00 input and $6.00 output per 1M tokens with a 75% cache discount, $3.74 per task to evaluate on the Intelligence Index, and 500K context; the summary paragraph calls the model notably slow and very verbose, and the verbosity line shows 240M output tokens generated on the index run against a median of 88M.

Beide sind langsam, und das ist kein Unentschieden

Artificial Analysis hat Grok 4.7 mit 40 Ausgabe-Tokens pro Sekunde gemessen und bezeichnet es als „unter den langsamsten“; MiMo-V2.6-Pro mit 43,6 und bezeichnet es als „auffallend langsam“. Diese beiden Messwerte liegen nah genug beieinander, dass die Geschwindigkeit nicht als Entscheidungskriterium zwischen ihnen dienen sollte. Die zugrunde liegenden Mediane sind es jedoch nicht: 67,1 für das Open-Weights-Feld, in dem MiMo-V2.6-Pro angesiedelt ist. Beide Modelle liegen deutlich darunter, und MiMo-V2.6-Pro weist zudem eine Zeit bis zum ersten Token von 3,17 Sekunden gegenüber einem Median von 2,31 Sekunden auf – und das ist die Zahl, die in einer interaktiven Schleife schmerzt und nicht im Batchbetrieb.

Die ehrliche Zusammenfassung auf der Latenzseite lautet also: 29× günstiger erkauft Ihnen kein schnelleres Produkt, sondern ein langsameres, das weniger kostet – und wenn Ihre Nutzer einen Cursor beobachten, kann die Wartezeit von 3,17 Sekunden mehr kosten als die eingesparten Tokens. Für nächtliche Batch-Arbeit, Offline-Evaluierung oder jede Pipeline, bei der die Uhr in Stunden gemessen wird, ist der Tausch unkompliziert und die 29× sind nahezu kostenlos.

Was ein Router mit dieser Paarung tun kann und was nicht

Dies ist die Paarung, bei der unser eigener Katalog wirklich einseitig ist, und es lohnt sich, das offen zu sagen. Grok 4.7 ist live auf OrcaRouter als grok/grok-4.7 zu den anbietereigenen Preisen von 2,00 $ / 6,00 $ mit einer maximalen Ausgabe von 450K und einem OpenAI-SDK-kompatiblen Endpunkt unter https://api.orcarouter.ai/v1 — wenn der Vergleich also den Wunsch weckt, das xAI-Modell hinter demselben Schlüssel wie alles andere zu haben, gibt es diesen Weg schon heute. Xiaomi MiMo-V2.6-Pro ist nicht auf unseren Routen; für diese Seite ist die API des Herstellers selbst oder derjenige seiner drei aufgeführten Anbieter, den du bereits nutzt, die Antwort, und wir werden nicht so tun, als wäre es anders.

Wo ein Router in einem Vergleich wie diesem seinen Platz verdient, zeigt sich an den Teilen, die nicht das Modell sind. Ein Schlüssel für 200+ Modelle zum Listenpreis jedes Anbieters mit 0 % Aufschlag bedeutet, dass eine Preissenkung eines Anbieters noch am selben Tag auf Ihrer Rechnung landet und nicht erst bei der nächsten Vertragsverlängerung. Automatisches Failover bedeutet, dass eine degradierende 40 t/s-Route Ihre Pipeline nicht mitreißt. Die Routing-DSL ermöglicht es, die Aufteilung an den veröffentlichten Kosten pro Aufgabe statt an Markentreue festzumachen – günstiges Modell für hohes Volumen, leistungsstarkes Modell für die schwierigen Anfragen, entschieden pro Anfrage. Und für Workloads, bei denen keines der beiden Modelle ganz passt, kann Modellfusion mehrere hinter einem einzigen Aufruf ausführen.

Screenshot of the OrcaRouter model page for Grok 4.7, captured 25 September 2026. The page shows the model id grok/grok-4.7, a maximum output of 450K, output text, public benchmarks by grok dated 2026-09-21, a price of $2.00 per 1M input and $6.00 per 1M output, and an OpenAI-SDK-compatible code sample whose base URL is https://api.orcarouter.ai/v1 and whose model field is grok/grok-4.7.

Fragen, die dieser Vergleich üblicherweise aufwirft

Gilt das 29× für meine Arbeitslast? Nur wenn Ihr Token-Mix dem des Index-Laufs ähnelt. Wenn Ihre Ausgaben kurz und Ihre Prompts lang und gecacht sind, fällt das Vielfache in Richtung der Ratenlücke von 6,9× bei der Ausgabe und weitet sich bei der Eingabe, wobei der 99 %-Rabatt von MiMo-V2.6-Pro den entscheidenden Term bildet. Wenn Ihre Ausgaben lange Reasoning-Traces sind, weitet es sich über 29× hinaus, weil die Ausführlichkeitsstrafe von Grok 4.7 proportional zur Ausgabelänge ist.

Ist die 46 auf jeder Seite dieselbe 46? Es ist derselbe Index, dieselbe Version und dieselbe Skala – die zugrunde liegenden Teilwerte lagen bei 46,32 und 46,45, also eine Spanne von 0,13 Punkten, und der Index rundet beide auf 46. Artificial Analysis veröffentlicht für keines der beiden Modelle Aufschlüsselungen pro Evaluation, daher ist der zusammengesetzte Wert die feinste verfügbare Auflösung, und ein Unterschied von 0,13 Punkten sollte nicht als Ranking der Leistungsfähigkeit gelesen werden.

Worauf sollte ein neues Projekt standardmäßig setzen? Wenn die Workload Batch ist, latenz tolerant und kostenempfindlich, ist MiMo-V2.6-Pro mit $0.13 pro Aufgabe der Standard, und die offenen Gewichte bedeuten, dass Sie nicht den Preisen eines einzelnen Anbieters ausgesetzt sind. Wenn Sie speziell das xAI-Modell benötigen — die Ergebnisse des Grok Build Harness, die AA-Briefcase-Platzierung, der 500K-Kontext mit einem Cutoff im Mai 2026 — ist Grok 4.7 heute eine Live-Route auf OrcaRouter, und der Aufpreis pro Aufgabe ist der Preis für genau diese Fähigkeit. Kein Modell hier gewinnt beides.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert