Eine generierte Titelkarte, die Xiaomi MiMo-V2.6-Pro und Grok 4.6 bei hohem Aufwand vergleicht. Die linke Karte zeigt Intelligence Index v4.3.2: 46, Kontextfenster: 1M Tokens, 0,43 $ ein / 0,87 $ aus pro 1M und 134,3 Tokens pro Sekunde; die rechte Karte zeigt Intelligence Index v4.3.2: 44, Kontextfenster: 500K Tokens, 2,00 $ ein / 6,00 $ aus pro 1M und 63,0 Tokens pro Sekunde. Eine Fußzeile lautet: Beide Werte beziehen sich auf den Artificial Analysis Intelligence Index v4.3.2. DeepSWE-Zahlen werden von den Anbietern selbst erhoben und sind nicht vergleichbar. Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

MiMo-V2.6-Pro vs. Grok 4.6: Beide Anbieter haben DeepSWE-Zahlen veröffentlicht, und keiner von beiden steht auf der Bestenliste

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei Anbieter, ein Benchmark, zwei Zahlen, die sich nicht subtrahieren lassen. Das Launch-Material von SpaceXAI für Grok 4.6 meldet 65,9 % auf DeepSWE v1.1. Xiaomis Material für MiMo-V2.6-Pro meldet 72,57 auf DeepSWE v1.1. Zusammen gelesen legen sie nahe, dass das günstigere Open-Weights-Modell das proprietäre Frontier-Modell um fast sieben Punkte schlägt. Genau gelesen sagen sie fast nichts, denn bei der einen Zahl handelt es sich um einen Launch-Deck-Prozentsatz auf dem eigenen Harness des Anbieters und bei der anderen um einen Durchschnitt aus drei Werten aus einem Reinforcement-Learning-Lauf auf Xiaomis eigenem Grader, und keine von beiden wurde beim öffentlichen DeepSWE-Board eingereicht. Der Vergleich zwischen MiMo-V2.6-Pro und Grok 4.6, der einer Prüfung standhält, findet auf dem unabhängigen Index statt, und dort ist die Antwort das Gegenteil der Anbieterzahlen: 46 gegen 44, zu Xiaomis Gunsten, um zwei Punkte.

Grok 4.6 wurde am 12. August 2026 von SpaceXAI veröffentlicht und ist hier der Etablierte – ein ausgeliefertes, breit eingesetztes Frontier-Modell mit dokumentierter Preisliste und Monaten unabhängiger Messungen im Rücken. Xiaomi MiMo-V2.6-Pro wurde am 22. September 2026 allgemein verfügbar, wobei seine Reinforcement-Learning-Checkpoint-Repositories am Tag zuvor erschienen, und es ist der Neuankömmling. Beide sind zu Reasoning fähig, beide sind für lang laufende agentische Arbeit ausgelegt, und die Preislücke zwischen ihnen ist groß genug, dass die Unerfahrenheit des Neuankömmlings das Einzige ist, was den Vergleich zurückhält.

Was jedes Modell tatsächlich ist

Grok 4.6 ist proprietär, nimmt Text- und Bildeingaben entgegen und gibt Text zurück und hat einen Wissensstichtag vom 1. Februar 2026. Sein Kontextfenster umfasst 500.000 Token, was halb so groß ist wie das seiner Hauptkonkurrenten und die mit Abstand folgenreichste Spezifikation auf seinem Datenblatt. Seine Listenpreise betragen 2,00 US-Dollar pro Million Input-Token, 0,50 US-Dollar pro Million gecachter Input-Token und 6,00 US-Dollar pro Million Output-Token unter 200.000 Prompt-Token, mit einem Sprung an dieser Grenze: bei 200K oder darüber werden die Sätze 4,00, 1,00 und 12,00 US-Dollar, und die höhere Stufe berechnet die gesamte Anfrage statt nur den über die Grenze hinausgehenden Teil. Priority-Verarbeitung verdoppelt den Standardtarif. Artificial Analysis ermittelte 63,0 Output-Token pro Sekunde und 42,79 Sekunden bis zum ersten Token bei maximalem Aufwand sowie 2.351,83 US-Dollar für den Durchlauf des vollständigen Index.

Xiaomi MiMo-V2.6-Pro ist ein Sparse-Mixture-of-Experts-Modell mit insgesamt 1,02 Billionen Parametern und 42 Milliarden pro Token aktivierten Parametern, einem Kontextfenster von 1 Mio. Token und nativer Multimodalität über Text, Bild, Video und Audio. Es ist MIT-lizenziert mit herunterladbaren Gewichten, und Xiaomi behielt die Preisgestaltung der vorherigen Generation bei, statt den neuen Checkpoint nach oben umzupreisen – 0,43 $ pro Million Input-Token und 0,87 $ pro Million Output, ein Cache-Rabatt von 99 % und ein gemischter Preis von 0,18 $ bei einem Cache-Hit/Input/Output-Verhältnis von 7:2:1. Artificial Analysis maß 134,3 Output-Token pro Sekunde, 2,15 Sekunden bis zum ersten Token und 206,66 $ für die Ausführung des Index – 0,13 $ pro Aufgabe.

• Gewichte — MiMo-V2.6-Pro MIT-lizenziert und herunterladbar; Grok 4.6 proprietär, nur API

• Parameter — MiMo-V2.6-Pro 1,02 T gesamt / 42 Mrd. aktiv; Grok 4.6 nicht angegeben

• Kontext — MiMo-V2.6-Pro 1 Mio. Tokens; Grok 4.6 500K, mit einem Preiskliff bei 200K Eingabe

• Modalität — MiMo-V2.6-Pro akzeptiert Text, Bild, Video und Audio; die veröffentlichte Eingabeoberfläche von Grok 4.6 ist Text und Bild

• Indexwert — MiMo-V2.6-Pro 46; Grok 4.6 44, beide von Artificial Analysis v4.3.2

• Listenpreis — MiMo-V2.6-Pro 0,43 $ / 0,87 $ pro 1 Mio.; Grok 4.6 2,00 $ / 6,00 $, wobei sich die Preise oberhalb von 200K Eingabe verdoppeln

• Mischpreis — MiMo-V2.6-Pro 0,18 $ pro 1 Mio.; Grok 4.6 1,35 $

• Kosten für den Betrieb des Index — MiMo-V2.6-Pro $206.66; Grok 4.6 $2,351.83

• Geschwindigkeit — MiMo-V2.6-Pro 134,3 Ausgabe-Token/Sekunde; Grok 4.6 63,0

• Zeit bis zum ersten Token — MiMo-V2.6-Pro 2,15 Sekunden; Grok 4.6 42,79 Sekunden

• Wissensstichtag — MiMo-V2.6-Pro nicht veröffentlicht; Grok 4.6 1. Februar 2026

A two-column scoreboard titled MiMo-V2.6-Pro vs Grok 4.6, subtitled Two vendor DeepSWE figures, neither submitted to the public board. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; list price $0.43 / $0.87 per 1M; context window 1M tokens; speed 134.3 tokens per second; DeepSWE v1.1 72.57 vendor-run, avg@3; public DeepSWE entry none. The right column, Grok 4.6 (high), reads Intelligence Index v4.3.2 44; list price $2.00 / $6.00 per 1M; context window 500K tokens; speed 63.0 tokens per second; DeepSWE v1.1 65.9% vendor-reported; public DeepSWE entry ~67% submitted. A footer notes the two DeepSWE figures come from different vendor harnesses with different metrics and must not be subtracted, and that Grok 4.6 list rates double at or above 200K input tokens. The OrcaRouter logo is composited in the bottom-right corner.

Der Benchmark, den beide Anbieter durchgeführt haben, und warum er nicht vergleichbar ist

DeepSWE v1.1 ist eine echte, öffentliche Third-Party-Evaluierung von Coding-Agenten, die von Datacurve durchgeführt wird, und es ist die eine Aufgabenfamilie, gegen die beide Unternehmen Ergebnisse veröffentlicht haben. Das macht sie verlockend. Sie sollte nicht für einen direkten Vergleich herangezogen werden, und der Grund dafür ist nicht, dass einer der Anbieter lügt – sondern dass die beiden Zahlen unterschiedliche Messungen desselben Aufgabennamens beschreiben.

Xiaomis 72,57 ist ein Durchschnitt aus drei Werten auf dem eigenen Harness mit mini-swe-agent, ermittelt während eines Reinforcement-Learning-Laufs statt aus einem eingefrorenen Release Candidate, und wird zusammen mit einem Startwert von 58,4 genannt. Der Lauf ist mit 30 Schritten und ungefähr 750.000 Trajektorien pro Modell dokumentiert und wurde in unter sechs Tagen bei veröffentlichten Ausgaben von etwa 2,62 Millionen US-Dollar für das Pro-Modell abgeschlossen. Er wurde nicht beim Board von Datacurve eingereicht. Die 65,9 % von SpaceXAI für Grok 4.6 sind eine Launch-Deck-Zahl aus dem eigenen Evaluationsset des Anbieters, angegeben neben Zugewinnen gegenüber Grok 4.5 von 11,9 Punkten auf demselben Benchmark — und das öffentliche Board führt eine eingereichte Grok-4.6-Konfiguration mit rund 67 %, was nahe genug an der Anbieterzahl liegt, um darauf hinzudeuten, dass der Harness zumindest grob übereinstimmt. Für die Xiaomi-Zahl gilt das nicht, denn sie hat überhaupt kein öffentliches Gegenstück.

Die ehrliche Aussage lautet also: Auf dem öffentlichen Board ist Grok 4.6 vertreten, und MiMo-V2.6-Pro fehlt. Beim unabhängigen Composite wurden beide tatsächlich vom selben Evaluator getestet, und Xiaomis Modell führt mit zwei Punkten. Diese beiden Fakten stehen nicht im Widerspruch. Sie messen einfach unterschiedliche Dinge, und die zweite ist diejenige, die man zitieren sollte.

Der 500K-Kontext ist die Spezifikation, die echte Workloads entscheidet

Eine halbe Million Token ist nach jedem normalen Maßstab ein großes Kontextfenster und für 2026 ein kleines. Die Modelle, mit denen MiMo-V2.6-Pro gruppiert wird, liegen alle bei 1M, und die praktische Konsequenz zeigt sich genau bei den Workloads, für die Grok 4.6 vermarktet wird. Ein langlaufender Coding-Agent, der ein Repository, ein Tool-Transkript und einen angesammelten Plan vorhält, wird in einer Sitzung 200.000 Prompt-Token überschreiten – und ab dieser Grenze verdoppeln sich die Tarife von Grok 4.6 und gelten rückwirkend für die gesamte Anfrage. Dieselbe Sitzung läuft auf MiMo-V2.6-Pro bis zu einer Million Token ohne Wechsel der Tarifstufe.

Das ist zugleich ein Unterschied in der Spezifikation und in der Preisstruktur, wobei Letzterer beim Vergleich der beworbenen Tarife leicht zu übersehen ist. Ein gemischter Preis von 1,35 $ für Grok 4.6 gegenüber 0,18 $ für MiMo-V2.6-Pro ist ein Unterschied von Faktor 7,5. Bei einem Prompt, der 200K überschreitet, wächst er auf eher das 15-Fache, weil sich der Grok-Tarif verdoppelt und der Xiaomi-Tarif unverändert bleibt.

Das Gegenargument ist ebenfalls festgehalten, und das zu Recht. Grok 4.6s Startthese war Turn-Effizienz statt roher Kontext: In der agentischen Evaluierung, in der es auf identischen Aufgaben gegen Claude Opus 5 gemessen wurde, beendete es die Aufgabe in ungefähr 53 Turns und etwa 500 Millionen Input-Tokens gegenüber ungefähr 103 Turns und zwei Milliarden Tokens für das andere Modell, bei geschätzten 0,84 US-Dollar pro Aufgabe – der niedrigste Wert unter den Frontier-Modellen in diesem Vergleich. Ein Modell, das die Schleife halb so oft durchläuft, braucht nicht so viel Kontext und verbraucht nicht so viele Tokens. Das ist ein echter architektonischer Vorteil und das stärkste Argument für Grok 4.6 gegen jede günstigere Alternative pro Token, einschließlich dieser hier.

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, captured 22 September 2026. The header reads 46 Artificial Analysis Intelligence Index, ranked first of 114 in its class; 134.3 output tokens per second, ranked eleventh of 114; $0.435 input and $0.87 output per 1M tokens with a 99% cache discount; $0.13 cost per Intelligence Index task, ranked twelfth of 114; and 140M output tokens from the Intelligence Index. Technical specifications list reasoning Yes, input modality text, image, speech and video, output modality text, a 1M-token context window, 1.0T total parameters, 42B active parameters, an MIT licence and Hugging Face model weights, under a breadcrumb reading Xiaomi, Open weights model, Released September 2026. A comparison summary notes it cost $206.66 to evaluate MiMo-V2.6-Pro on the Intelligence Index.

Zu jedem einzelnen von ihnen zu gelangen

Grok 4.6 ist auf OrcaRouter als grok/grok-4.6 verfügbar, erreichbar über einen OpenAI-kompatiblen Endpunkt zum Listenpreis des Anbieters mit 0 % Aufschlag – sodass eine Preisänderung von SpaceXAI, einschließlich einer Änderung an dieser 200K-Schwelle, am selben Tag bei uns live ist. Xiaomi MiMo-V2.6-Pro ist nicht auf OrcaRouter. Kein Xiaomi-Modell ist es, und der Weg dorthin führt heute über Xiaomis eigene Plattform oder einen der Drittanbieter-Kataloge, die es listen. Das klar zu sagen ist nützlicher, als eine Modellseite etwas anderes implizieren zu lassen.

Was diese Asymmetrie in der Praxis wert ist, ist ein billiges Experiment. Grok 4.6 ist das Modell, für das Sie möglicherweise bereits bezahlen. MiMo-V2.6-Pro ist eine Verbesserung des Index um zwei Punkte zu einem Bruchteil des Tarifs, diese Woche eingeführt, mit einer einzigen Serving-Route dahinter. Die Frage, die es zu beantworten gilt, ist nicht, welches Modell abstrakt besser ist, sondern wie viel Ihres Grok-Traffics das Xiaomi-Modell bei Ihren eigenen Prompts übernehmen kann – und sie zu beantworten, indem man einen zweiten Vertrag, einen zweiten Schlüssel und eine zweite Abrechnungsbeziehung eröffnet, ist die Reibung, die den Test verhindert. Mit einem einzigen Endpunkt und automatischem Failover über Anbieter hinweg ist der Vergleich eine Konfigurationsänderung, und die Failover-Hälfte ist hier wichtiger als sonst: Ein Modell, das diese Woche ausgeliefert wurde und von nur einem API-Anbieter gelistet war, als Artificial Analysis es erfasste, ist nichts, was man ohne eine Ausweichroute in einen Produktionspfad stellen sollte.

Screenshot of the OrcaRouter model page for Grok 4.6, captured 22 September 2026, showing the breadcrumb Home > Models > SpaceXAI > Grok 4.6, the model id grok/grok-4.6 dated 2026-08-12, the Vision, Tools, JSON and Reasoning capability badges, and the on-this-page index for code samples, pricing, performance, public benchmarks, community buzz, comparisons and FAQ. The rate card sits below the visible area of the capture.

Zu welchem man greifen sollte

Wähle Grok 4.6, wenn Turn-Effizienz das ist, worauf du optimierst — lange Agent-Loops, bei denen die Fähigkeit des Modells, in der Hälfte der Schritte fertig zu werden, mehr wert ist als seine Rate pro Token — oder wenn du ein Modell willst, hinter dem Monate unabhängiger Messungen stehen statt einer Woche. Seine 63 Token pro Sekunde und 42,79 Sekunden bis zum ersten Token machen es in interaktiven Begriffen zu einem Batch- und Offline-Workload-Modell, und sein 500K-Kontext mit einer 200K-Preisschwelle spricht dafür, Prompts kurz zu halten.

Wähle MiMo-V2.6-Pro, wenn du kontextintensive, repetitive Schleifen ausführst, die Groks 200K-Grenze überschreiten würden, wenn du eine First-Token-Latenz benötigst, die niedrig genug ist, dass ein Mensch darauf warten würde, wenn du die Gewichte in deiner eigenen Infrastruktur haben möchtest oder wenn das Volumen den 7,5-fachen Unterschied bei der Mischrate zur entscheidenden Zahl macht. Sein Zwei-Punkte-Vorsprung im Index ist klein genug, dass er für sich genommen nicht der Grund sein sollte; die 206,66 $ gegenüber 2.351,83 $ für die Ausführung derselben Evaluationssuite sind ein besserer Grund.

Was die offene Frage klären würde, ist eine eingereichte DeepSWE-Konfiguration für MiMo-V2.6-Pro. Grok 4.6 hat bereits eine. In dem Moment, in dem Xiaomis Modell auf dem öffentlichen Board mit einem angegebenen Harness, einem Konfidenzintervall und Kosten pro Aufgabe erscheint, sind die 72,57 keine Herstellerangabe mehr, und der obige Vergleich wird zu einem echten – und angesichts der Zwei-Punkte-Differenz im Index könnte er in beide Richtungen ausgehen.

OrcaRouter stellt 200+ Modelle hinter einem einzigen OpenAI-kompatiblen Endpoint zum Listenpreis des Anbieters mit 0 % Aufschlag bereit, sodass eine Preisänderung eines Anbieters noch am selben Tag live ist.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert