
MiMo-V2.6-Pro vs. Claude Opus 5: 21-mal günstiger, fünf Indexpunkte dahinter
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 632 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 187 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Xiaomi MiMo-V2.6-Pro und Claude Opus 5 sind die beiden Enden eines einzigen Tauschgeschäfts, und das Tauschgeschäft hat einen Preis. Im Artificial Analysis Intelligence Index v4.3.2 erzielt Claude Opus 5 (maximaler Aufwand) 51 Punkte und Xiaomi MiMo-V2.6-Pro 46. Auf der Preisliste kostet Claude Opus 5 $5,00 pro Million Eingabe-Tokens und $25,00 pro Million Ausgabe; MiMo-V2.6-Pro kostet $0,43 und $0,87. Führen Sie die Division durch, und die Antwort lautet 11,6x bei der Eingabe und 28,7x bei der Ausgabe — und 21x beim Mischpreis, den Artificial Analysis für jedes Modell veröffentlicht. Fünf Indexpunkte kosten einundzwanzigmal so viel Geld. Ob das ein Schnäppchen oder eine Verschwendung ist, hängt ganz davon ab, was Ihre Arbeitslast mit dem fünften Punkt macht, und die meisten Teams finden das nie heraus, bevor sie sich festlegen.
Die beiden Modelle, einfach ausgedrückt
Claude Opus 5 ist Anthropics proprietäres Flaggschiff, veröffentlicht am 24. Juli 2026, mit einem Kontextfenster von 1 Mio. Token und nicht offengelegter Parameteranzahl. Xiaomi MiMo-V2.6-Pro ist ein spärliches Mixture-of-Experts-Modell mit insgesamt 1,02 Billionen Parametern und 42 Milliarden aktivierten, mit einem Kontextfenster von 1 Mio. Token, nativer Multimodalität über Text, Bild, Video und Audio sowie unter MIT-Lizenz veröffentlichten Gewichten.
• Gewichte — MiMo-V2.6-Pro MIT-lizenziert und herunterladbar; Claude Opus 5 proprietär, nur über API
• Parameter — MiMo-V2.6-Pro: 1,02 Billionen gesamt / 42 Milliarden aktiv; Claude Opus 5: nicht angegeben
• Kontext — 1 Mio. Token bei beiden; Claude Opus 5 begrenzt die Ausgabe auf 128K bei der Messages API und 300K bei der Batch API
• Modalität — MiMo-V2.6-Pro nimmt Text, Bild, Video und Audio entgegen; die veröffentlichte Eingabeoberfläche von Claude Opus 5 besteht aus Text und Bild
• Listenpreis — MiMo-V2.6-Pro 0,43 $ / 0,87 $ pro 1 Mio. Tokens; Claude Opus 5 5,00 $ / 25,00 $
• Cache — MiMo-V2.6-Pro listet einen Cache-Rabatt von 99 %; Claude Opus 5 liest Cache für 0,50 $ pro 1 Mio., Schreibvorgänge kosten 6,25 $ bei einer TTL von 5 Minuten
• Gemessene Kosten pro Intelligence-Index-Aufgabe — MiMo-V2.6-Pro 0,13 $; Claude Opus 5 5,86 $
• Serving — MiMo-V2.6-Pro 134,3 Ausgabe-Token/Sekunde und 2,15 s bis zum ersten Token; Claude Opus 5 57,9 Token/Sekunde
Das letzte Paar ist dasjenige, das verloren geht. Das günstigere Modell ist auch das schnellere – um den Faktor 2,3 beim Ausgabedurchsatz –, weil es auf Hardware läuft, die Xiaomi und seine Partner kontrollieren, und aggressiv bündeln kann. Claude Opus 5 mit maximalem Aufwand ist ein Reasoning-Modell, das mehr Arbeit pro Token verrichtet; die Geschwindigkeitslücke ist kein Defekt, sondern ein anderes Produkt. Aber es bedeutet, dass die günstige Spur ihren Rabatt nicht mit Latenz bezahlt. Sie bezahlt ihn mit fünf Indexpunkten und mit dem Tail der Aufgaben, in dem dieser fünfte Punkt lebt.

Wo die fünf Punkte tatsächlich liegen
Eine Lücke von fünf Punkten bei einem Composite aus zehn Evaluierungen ist nicht gleichmäßig verteilt, und die aggregierte Kennzahl verbirgt genau das, worauf es ankommt. Beide Modelle wurden auf derselben v4.3.2-Suite getestet, zu der AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience und AA-LCR v1.1 gehören. Die veröffentlichten Seiten schlüsseln die Punktzahlen pro Evaluierung für keines der beiden Modelle auf, was eine echte Einschränkung auf beiden Seiten dieses Vergleichs ist und es wert ist, gesagt zu werden, statt es zu beschönigen.
Was aktenkundig ist, ist richtungsweisend. Claude Opus 5 erreichte mit maximalem Aufwand 49,0 % auf Terminal-Bench 4.0 innerhalb der v4.3-Suite, hinter GPT-6 Astra mit 59,1 % und Claude Fable 5.1 mit 52,0 %. Bei AutomationBench-AA erfüllte Opus 5 in 28,3 % der Workflows jedes Ziel ohne Verstoß gegen Leitplanken, gegenüber 41,6 % für GPT-6 Astra und 32,1 % für Fable 5.1. Das sind harte agentische Zahlen, und sie betreffen genau die Kategorien, in denen eine zusammengesetzte Lücke von fünf Punkten am wenigsten wahrscheinlich gleichmäßig verteilt ist — der eigene Indexeintrag von MiMo-V2.6-Pro veröffentlicht keine vergleichbare agentische Aufschlüsselung.
Die von beiden Unternehmen veröffentlichten Herstellerzahlen sind indes nicht miteinander vergleichbar, und es lohnt sich, offen zu sagen, warum. Anthropics Launch-Material nennt SWE-bench Verified mit 96,0 % und SWE-bench Pro mit 79,2 %; ein Tracker merkt an, dass Opus 5 ohne separaten SWE-bench-Eintrag ausgeliefert wurde, und es gibt keine unabhängig geprüfte SWE-bench-Verified-Zahl dafür. Xiaomis Material berichtet, dass MiMo-V2.6-Pro auf DeepSWE v1.1 während seines RL-Laufs von 58,4 auf 72,57 gestiegen ist – auf Xiaomis eigenem Harness mit mini-swe-agent als Durchschnitt aus drei Durchläufen, nicht beim öffentlichen DeepSWE-Board eingereicht. Zwei Hersteller-Harnesses, zwei verschiedene Aufgaben, keine Überschneidung. 96,0 % neben 72,57 zu stellen und daraus eine Schlussfolgerung zu ziehen, hieße, einen Vergleich zu erfinden, den es nicht gibt.

Der Kostenvergleich, richtig gemacht
Per-Token-Arithmetik unterschätzt die Kluft, weil die beiden Modelle nicht die gleiche Anzahl an Tokens verbrauchen, um die gleiche Aufgabe zu erledigen. Artificial Analysis hat gemessen, was es jeweils tatsächlich kostete, den vollständigen Intelligence Index laufen zu lassen: 0,13 $ für MiMo-V2.6-Pro, 5,86 $ für Claude Opus 5. Das ist eine 45-fache Lücke bei einem kontrollierten, identischen Aufgabensatz, und es ist die fairste einzelne Zahl, die verfügbar ist, weil beide auf dieselbe Weise gemessen wurden.
Stellen Sie dem nun eine plausible Produktionsschleife gegenüber. Ein 30-Schritt-Agentenlauf, der pro Schritt 200.000 Kontext-Tokens liest und pro Schritt 2.000 Tokens schreibt, umfasst 6 Millionen Input-Tokens und 60.000 Output-Tokens pro Lauf. Bei Claude Opus 5 zum Listenpreis sind das 30,00 $ Input und 1,50 $ Output — 31,50 $ pro Lauf, vor jeglichem Caching. Bei MiMo-V2.6-Pro sind es 2,58 $ Input und 0,05 $ Output — 2,63 $. Mit den Cache-Rabatten, die beide Anbieter bieten, bricht die Input-Seite bei beiden Modellen ein, und das Verhältnis verschiebt sich, statt zu verschwinden: Ein Cache-Rabatt von 99 % bei einem günstigen Modell gegenüber einem Cache-Lesevorgang von 0,50 $ bei einem teuren lässt das teure Modell bei einer kontextlastigen Schleife immer noch um eine Größenordnung vorne liegen.
Das ist das ganze Argument für eine günstige Schiene und gegen einen kompletten Umstieg. Wenn Ihre Workload ein Agenten-Loop mit langem Horizont ist, der denselben Kontext hunderte Male erneut liest, ist der Kostenunterschied pro Durchlauf kein Rundungsfehler – er ist der Unterschied zwischen einem Feature, dessen Betrieb pro Nutzer Sie sich leisten können, und einem, dessen Betrieb Sie sich nicht leisten können. Das ist das Argument dafür, MiMo-V2.6-Pro dem Großteil Ihres Traffics vorzuschalten. Es ist kein Argument dafür, Claude Opus 5 zu streichen, denn die Aufgaben, bei denen sich der fünfte Indexpunkt bezahlt macht, sind konstruktionsbedingt genau die Aufgaben, bei denen das Versagen eines günstigen Modells teuer ist.

Wie eine Routing-Entscheidung hier aussieht
Claude Opus 5 ist erreichbar über einen einzigen OrcaRouter-Schlüssel zum Listenpreis des Anbieters mit 0 % Aufschlag, als anthropic/claude-opus-5, wobei die Frontier-Modelle, mit denen Sie es vergleichen würden, daneben auf demselben Schlüssel liegen. Da wir den Listenpreis des Anbieters ohne Aufschlag durchreichen, ist eine Preisänderung eines Anbieters auf beiden Seiten bei uns noch am selben Tag live, statt auf ein neues Angebot zu warten. Die Routing-DSL ist der Ort, an dem der interessante Teil steckt: Sie können die beiden Modelle zu einem Aufruf zusammenfassen, statt zwischen ihnen zu wählen, den Großteil einer Workload auf die günstige Spur schicken und den Rest – die Aufgaben, die einen Selbsttest nicht bestehen oder die ein Komplexitätsprädikat erfüllen – auf die teure Spur routen. Failover ist die andere Hälfte. Claude Opus 5 hat eine breite Anbieterabdeckung; MiMo-V2.6-Pro wurde von einem einzigen API-Anbieter gelistet, als Artificial Analysis es erfasste, was für ein Modell, das Sie in einen Produktionspfad setzen würden, eine dünne Route ist. Ein Router, der ausweichen kann, ist die Voraussetzung dafür, dass die günstige Spur sicher übernommen werden kann.
Es lohnt sich, es klar zu sagen, denn es ist leicht, etwas anderes anzunehmen: Wir hosten MiMo-V2.6-Pro nicht. Um heute darauf zuzugreifen, braucht man Xiaomis eigene Plattform oder einen der Drittanbieter-Kataloge, die es listen. Beim Routing-Argument hier geht es darum, wie man ein Modell wie dieses neben denjenigen einsetzt, die wir tatsächlich anbieten, und nicht um die Behauptung, es sei eines von unseren.
Welches soll man wählen?
Wähle Claude Opus 5, wenn die Fehlerkosten einer Aufgabe die Token-Kosten um so viel übersteigen, dass fünf Indexpunkte eine billige Absicherung sind — langhorizontige agentische Arbeit mit echten Seiteneffekten, Tool-Nutzung, bei der ein falscher Aufruf schlimmer ist als ein langsamer, alles, wofür du ohnehin schon einen Menschen dafür bezahlst, die Ausgabe zu prüfen. Die Zahl von $5.86 pro Index-Aufgabe ist kein Grund, sie zu meiden; sie ist der Preis dieser Stufe, und die Stufe existiert aus einem Grund.
Wählen Sie MiMo-V2.6-Pro, wenn das Volumen die einschränkende Größe ist, wenn die Workload kontextlastig und repetitiv ist, wenn Sie die Gewichte in Ihrer eigenen Infrastruktur haben möchten – die MIT-Lizenz erlaubt kommerziellen Einsatz, Modifikation und weiteres Training – oder wenn Sie etwas bauen, dessen Unit Economics nur bei einem Fünftel eines Cents pro tausend Token funktionieren. Seine 134,3 Token/Sekunde machen es auf eine Weise für interaktive Nutzung nutzbar, wie es die meisten offenen Modelle mit einer Billion Parametern nicht sind.
Nimm beide, wenn du einen Router hast, denn die ehrliche Antwort auf „Welches ist besser?“ lautet, dass sie nicht um dieselben Anfragen konkurrieren. Der Fehlermodus, den es zu vermeiden gilt, ist der teuerste: sich auf das günstige Modell zu standardisieren, weil das Schlagzeilen-Verhältnis 21x beträgt, im dritten Monat festzustellen, dass eine bestimmte Klasse von Anfragen das teure erfordert, und keinen Weg zu haben, sie dorthin zu routen. Der zweite Fehlermodus ist das Spiegelbild – Opus-5-Preise für eine Zusammenfassungsaufgabe zu zahlen, die ein 46-Index-Modell identisch erledigt. Keiner von beiden ist ein Modellproblem. Beide sind Konfigurationsprobleme, und Konfiguration ist der Teil, den du an einem Dienstagnachmittag ändern kannst.
