
MiMo-V2.6-Pro vs. Grok 4.6: Beide Anbieter haben DeepSWE-Zahlen veröffentlicht, und keiner von beiden steht auf der Bestenliste
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Zwei Anbieter, ein Benchmark, zwei Zahlen, die sich nicht subtrahieren lassen. Das Launch-Material von SpaceXAI für Grok 4.6 meldet 65,9 % auf DeepSWE v1.1. Xiaomis Material für MiMo-V2.6-Pro meldet 72,57 auf DeepSWE v1.1. Zusammen gelesen legen sie nahe, dass das günstigere Open-Weights-Modell das proprietäre Frontier-Modell um fast sieben Punkte schlägt. Genau gelesen sagen sie fast nichts, denn bei der einen Zahl handelt es sich um einen Launch-Deck-Prozentsatz auf dem eigenen Harness des Anbieters und bei der anderen um einen Durchschnitt aus drei Werten aus einem Reinforcement-Learning-Lauf auf Xiaomis eigenem Grader, und keine von beiden wurde beim öffentlichen DeepSWE-Board eingereicht. Der Vergleich zwischen MiMo-V2.6-Pro und Grok 4.6, der einer Prüfung standhält, findet auf dem unabhängigen Index statt, und dort ist die Antwort das Gegenteil der Anbieterzahlen: 46 gegen 44, zu Xiaomis Gunsten, um zwei Punkte.
Grok 4.6 wurde am 12. August 2026 von SpaceXAI veröffentlicht und ist hier der Etablierte – ein ausgeliefertes, breit eingesetztes Frontier-Modell mit dokumentierter Preisliste und Monaten unabhängiger Messungen im Rücken. Xiaomi MiMo-V2.6-Pro wurde am 22. September 2026 allgemein verfügbar, wobei seine Reinforcement-Learning-Checkpoint-Repositories am Tag zuvor erschienen, und es ist der Neuankömmling. Beide sind zu Reasoning fähig, beide sind für lang laufende agentische Arbeit ausgelegt, und die Preislücke zwischen ihnen ist groß genug, dass die Unerfahrenheit des Neuankömmlings das Einzige ist, was den Vergleich zurückhält.
Was jedes Modell tatsächlich ist
Grok 4.6 ist proprietär, nimmt Text- und Bildeingaben entgegen und gibt Text zurück und hat einen Wissensstichtag vom 1. Februar 2026. Sein Kontextfenster umfasst 500.000 Token, was halb so groß ist wie das seiner Hauptkonkurrenten und die mit Abstand folgenreichste Spezifikation auf seinem Datenblatt. Seine Listenpreise betragen 2,00 US-Dollar pro Million Input-Token, 0,50 US-Dollar pro Million gecachter Input-Token und 6,00 US-Dollar pro Million Output-Token unter 200.000 Prompt-Token, mit einem Sprung an dieser Grenze: bei 200K oder darüber werden die Sätze 4,00, 1,00 und 12,00 US-Dollar, und die höhere Stufe berechnet die gesamte Anfrage statt nur den über die Grenze hinausgehenden Teil. Priority-Verarbeitung verdoppelt den Standardtarif. Artificial Analysis ermittelte 63,0 Output-Token pro Sekunde und 42,79 Sekunden bis zum ersten Token bei maximalem Aufwand sowie 2.351,83 US-Dollar für den Durchlauf des vollständigen Index.
Xiaomi MiMo-V2.6-Pro ist ein Sparse-Mixture-of-Experts-Modell mit insgesamt 1,02 Billionen Parametern und 42 Milliarden pro Token aktivierten Parametern, einem Kontextfenster von 1 Mio. Token und nativer Multimodalität über Text, Bild, Video und Audio. Es ist MIT-lizenziert mit herunterladbaren Gewichten, und Xiaomi behielt die Preisgestaltung der vorherigen Generation bei, statt den neuen Checkpoint nach oben umzupreisen – 0,43 $ pro Million Input-Token und 0,87 $ pro Million Output, ein Cache-Rabatt von 99 % und ein gemischter Preis von 0,18 $ bei einem Cache-Hit/Input/Output-Verhältnis von 7:2:1. Artificial Analysis maß 134,3 Output-Token pro Sekunde, 2,15 Sekunden bis zum ersten Token und 206,66 $ für die Ausführung des Index – 0,13 $ pro Aufgabe.
• Gewichte — MiMo-V2.6-Pro MIT-lizenziert und herunterladbar; Grok 4.6 proprietär, nur API
• Parameter — MiMo-V2.6-Pro 1,02 T gesamt / 42 Mrd. aktiv; Grok 4.6 nicht angegeben
• Kontext — MiMo-V2.6-Pro 1 Mio. Tokens; Grok 4.6 500K, mit einem Preiskliff bei 200K Eingabe
• Modalität — MiMo-V2.6-Pro akzeptiert Text, Bild, Video und Audio; die veröffentlichte Eingabeoberfläche von Grok 4.6 ist Text und Bild
• Indexwert — MiMo-V2.6-Pro 46; Grok 4.6 44, beide von Artificial Analysis v4.3.2
• Listenpreis — MiMo-V2.6-Pro 0,43 $ / 0,87 $ pro 1 Mio.; Grok 4.6 2,00 $ / 6,00 $, wobei sich die Preise oberhalb von 200K Eingabe verdoppeln
• Mischpreis — MiMo-V2.6-Pro 0,18 $ pro 1 Mio.; Grok 4.6 1,35 $
• Kosten für den Betrieb des Index — MiMo-V2.6-Pro $206.66; Grok 4.6 $2,351.83
• Geschwindigkeit — MiMo-V2.6-Pro 134,3 Ausgabe-Token/Sekunde; Grok 4.6 63,0
• Zeit bis zum ersten Token — MiMo-V2.6-Pro 2,15 Sekunden; Grok 4.6 42,79 Sekunden
• Wissensstichtag — MiMo-V2.6-Pro nicht veröffentlicht; Grok 4.6 1. Februar 2026

Der Benchmark, den beide Anbieter durchgeführt haben, und warum er nicht vergleichbar ist
DeepSWE v1.1 ist eine echte, öffentliche Third-Party-Evaluierung von Coding-Agenten, die von Datacurve durchgeführt wird, und es ist die eine Aufgabenfamilie, gegen die beide Unternehmen Ergebnisse veröffentlicht haben. Das macht sie verlockend. Sie sollte nicht für einen direkten Vergleich herangezogen werden, und der Grund dafür ist nicht, dass einer der Anbieter lügt – sondern dass die beiden Zahlen unterschiedliche Messungen desselben Aufgabennamens beschreiben.
Xiaomis 72,57 ist ein Durchschnitt aus drei Werten auf dem eigenen Harness mit mini-swe-agent, ermittelt während eines Reinforcement-Learning-Laufs statt aus einem eingefrorenen Release Candidate, und wird zusammen mit einem Startwert von 58,4 genannt. Der Lauf ist mit 30 Schritten und ungefähr 750.000 Trajektorien pro Modell dokumentiert und wurde in unter sechs Tagen bei veröffentlichten Ausgaben von etwa 2,62 Millionen US-Dollar für das Pro-Modell abgeschlossen. Er wurde nicht beim Board von Datacurve eingereicht. Die 65,9 % von SpaceXAI für Grok 4.6 sind eine Launch-Deck-Zahl aus dem eigenen Evaluationsset des Anbieters, angegeben neben Zugewinnen gegenüber Grok 4.5 von 11,9 Punkten auf demselben Benchmark — und das öffentliche Board führt eine eingereichte Grok-4.6-Konfiguration mit rund 67 %, was nahe genug an der Anbieterzahl liegt, um darauf hinzudeuten, dass der Harness zumindest grob übereinstimmt. Für die Xiaomi-Zahl gilt das nicht, denn sie hat überhaupt kein öffentliches Gegenstück.
Die ehrliche Aussage lautet also: Auf dem öffentlichen Board ist Grok 4.6 vertreten, und MiMo-V2.6-Pro fehlt. Beim unabhängigen Composite wurden beide tatsächlich vom selben Evaluator getestet, und Xiaomis Modell führt mit zwei Punkten. Diese beiden Fakten stehen nicht im Widerspruch. Sie messen einfach unterschiedliche Dinge, und die zweite ist diejenige, die man zitieren sollte.
Der 500K-Kontext ist die Spezifikation, die echte Workloads entscheidet
Eine halbe Million Token ist nach jedem normalen Maßstab ein großes Kontextfenster und für 2026 ein kleines. Die Modelle, mit denen MiMo-V2.6-Pro gruppiert wird, liegen alle bei 1M, und die praktische Konsequenz zeigt sich genau bei den Workloads, für die Grok 4.6 vermarktet wird. Ein langlaufender Coding-Agent, der ein Repository, ein Tool-Transkript und einen angesammelten Plan vorhält, wird in einer Sitzung 200.000 Prompt-Token überschreiten – und ab dieser Grenze verdoppeln sich die Tarife von Grok 4.6 und gelten rückwirkend für die gesamte Anfrage. Dieselbe Sitzung läuft auf MiMo-V2.6-Pro bis zu einer Million Token ohne Wechsel der Tarifstufe.
Das ist zugleich ein Unterschied in der Spezifikation und in der Preisstruktur, wobei Letzterer beim Vergleich der beworbenen Tarife leicht zu übersehen ist. Ein gemischter Preis von 1,35 $ für Grok 4.6 gegenüber 0,18 $ für MiMo-V2.6-Pro ist ein Unterschied von Faktor 7,5. Bei einem Prompt, der 200K überschreitet, wächst er auf eher das 15-Fache, weil sich der Grok-Tarif verdoppelt und der Xiaomi-Tarif unverändert bleibt.
Das Gegenargument ist ebenfalls festgehalten, und das zu Recht. Grok 4.6s Startthese war Turn-Effizienz statt roher Kontext: In der agentischen Evaluierung, in der es auf identischen Aufgaben gegen Claude Opus 5 gemessen wurde, beendete es die Aufgabe in ungefähr 53 Turns und etwa 500 Millionen Input-Tokens gegenüber ungefähr 103 Turns und zwei Milliarden Tokens für das andere Modell, bei geschätzten 0,84 US-Dollar pro Aufgabe – der niedrigste Wert unter den Frontier-Modellen in diesem Vergleich. Ein Modell, das die Schleife halb so oft durchläuft, braucht nicht so viel Kontext und verbraucht nicht so viele Tokens. Das ist ein echter architektonischer Vorteil und das stärkste Argument für Grok 4.6 gegen jede günstigere Alternative pro Token, einschließlich dieser hier.

Zu jedem einzelnen von ihnen zu gelangen
Grok 4.6 ist auf OrcaRouter als grok/grok-4.6 verfügbar, erreichbar über einen OpenAI-kompatiblen Endpunkt zum Listenpreis des Anbieters mit 0 % Aufschlag – sodass eine Preisänderung von SpaceXAI, einschließlich einer Änderung an dieser 200K-Schwelle, am selben Tag bei uns live ist. Xiaomi MiMo-V2.6-Pro ist nicht auf OrcaRouter. Kein Xiaomi-Modell ist es, und der Weg dorthin führt heute über Xiaomis eigene Plattform oder einen der Drittanbieter-Kataloge, die es listen. Das klar zu sagen ist nützlicher, als eine Modellseite etwas anderes implizieren zu lassen.
Was diese Asymmetrie in der Praxis wert ist, ist ein billiges Experiment. Grok 4.6 ist das Modell, für das Sie möglicherweise bereits bezahlen. MiMo-V2.6-Pro ist eine Verbesserung des Index um zwei Punkte zu einem Bruchteil des Tarifs, diese Woche eingeführt, mit einer einzigen Serving-Route dahinter. Die Frage, die es zu beantworten gilt, ist nicht, welches Modell abstrakt besser ist, sondern wie viel Ihres Grok-Traffics das Xiaomi-Modell bei Ihren eigenen Prompts übernehmen kann – und sie zu beantworten, indem man einen zweiten Vertrag, einen zweiten Schlüssel und eine zweite Abrechnungsbeziehung eröffnet, ist die Reibung, die den Test verhindert. Mit einem einzigen Endpunkt und automatischem Failover über Anbieter hinweg ist der Vergleich eine Konfigurationsänderung, und die Failover-Hälfte ist hier wichtiger als sonst: Ein Modell, das diese Woche ausgeliefert wurde und von nur einem API-Anbieter gelistet war, als Artificial Analysis es erfasste, ist nichts, was man ohne eine Ausweichroute in einen Produktionspfad stellen sollte.

Zu welchem man greifen sollte
Wähle Grok 4.6, wenn Turn-Effizienz das ist, worauf du optimierst — lange Agent-Loops, bei denen die Fähigkeit des Modells, in der Hälfte der Schritte fertig zu werden, mehr wert ist als seine Rate pro Token — oder wenn du ein Modell willst, hinter dem Monate unabhängiger Messungen stehen statt einer Woche. Seine 63 Token pro Sekunde und 42,79 Sekunden bis zum ersten Token machen es in interaktiven Begriffen zu einem Batch- und Offline-Workload-Modell, und sein 500K-Kontext mit einer 200K-Preisschwelle spricht dafür, Prompts kurz zu halten.
Wähle MiMo-V2.6-Pro, wenn du kontextintensive, repetitive Schleifen ausführst, die Groks 200K-Grenze überschreiten würden, wenn du eine First-Token-Latenz benötigst, die niedrig genug ist, dass ein Mensch darauf warten würde, wenn du die Gewichte in deiner eigenen Infrastruktur haben möchtest oder wenn das Volumen den 7,5-fachen Unterschied bei der Mischrate zur entscheidenden Zahl macht. Sein Zwei-Punkte-Vorsprung im Index ist klein genug, dass er für sich genommen nicht der Grund sein sollte; die 206,66 $ gegenüber 2.351,83 $ für die Ausführung derselben Evaluationssuite sind ein besserer Grund.
Was die offene Frage klären würde, ist eine eingereichte DeepSWE-Konfiguration für MiMo-V2.6-Pro. Grok 4.6 hat bereits eine. In dem Moment, in dem Xiaomis Modell auf dem öffentlichen Board mit einem angegebenen Harness, einem Konfidenzintervall und Kosten pro Aufgabe erscheint, sind die 72,57 keine Herstellerangabe mehr, und der obige Vergleich wird zu einem echten – und angesichts der Zwei-Punkte-Differenz im Index könnte er in beide Richtungen ausgehen.
OrcaRouter stellt 200+ Modelle hinter einem einzigen OpenAI-kompatiblen Endpoint zum Listenpreis des Anbieters mit 0 % Aufschlag bereit, sodass eine Preisänderung eines Anbieters noch am selben Tag live ist.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
