
MiMo-V2.6-Pro vs. Kimi K3: Zwei Billionen Parameter, offene Gewichte, vierzehnfacher Unterschied bei den Kosten pro Aufgabe
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Beide sind Mixture-of-Experts-Modelle mit offenen Gewichten aus chinesischen Labors und einem Kontextfenster von 1 Mio. Token. Beide sind zum Download verfügbar. Im Artificial Analysis Intelligence Index v4.3.2, abgelesen am 22. September 2026, erzielt MoonshotAIs Kimi K3 44 Punkte und Xiaomis MiMo-V2.6-Pro 46 Punkte. Zwei Punkte. Die gemessenen Kosten für die Ausführung derselben Evaluationssuite gegen jedes Modell betragen 3.658,07 US-Dollar für Kimi K3 und 206,66 US-Dollar für MiMo-V2.6-Pro – ein Faktor von siebzehn. Wenn Sie sich bereits entschieden haben, dass Sie in dieser Klasse offene Gewichte möchten, ist dieses Verhältnis – nicht die zwei Punkte – die Entscheidung.
Kimi K3 ist das etablierte Modell in diesem Paar: veröffentlicht am 16. Juli 2026, mit den vollständigen Gewichten, die am 27. Juli folgten, und Monaten unabhängiger Evaluierung im Rücken. Xiaomi MiMo-V2.6-Pro wurde am 22. September 2026 allgemein verfügbar, wobei die Repositorys mit den Checkpoints des Reinforcement Learnings am Tag zuvor erschienen. Der Vergleich steht somit zwischen einem bewährten offenen Modell zu Premium-Preisen und einem brandneuen zu Niedrigpreisen, und das Interessante daran ist, wie gering die gemessene Leistungslücke letztlich ausfiel.
Was jedes Modell tatsächlich ist
Kimi K3 ist ein multimodales Reasoning-Modell mit offenen Gewichten und 2,8 Billionen Parametern, das bei der Veröffentlichung als erstes offenes Modell in der Drei-Billionen-Klasse beschrieben wurde. Es aktiviert 16 von 896 Experten pro Token – rund 104 Milliarden aktive Parameter – und nutzt Kimi Delta Attention und Attention Residuals, um einen Kontext von 1 Mio. Token effizient zu bewältigen, mit einer Ausgabe von bis zu 1 Mio. Token pro Anfrage. Es ist Always-on-Reasoning mit nativer Vision. Moonshots First-Party-API berechnet 3,00 US-Dollar pro Million Eingabe-Token, 0,30 US-Dollar pro Million gecachter Eingabe und 15,00 US-Dollar pro Million Ausgabe, pauschal ohne Staffelung nach Kontextlänge, und Artificial Analysis meldet einen Cache-Rabatt von 90 % und einen kombinierten Preis von 2,31 US-Dollar. Gemessen wurden 42,8 Ausgabe-Token pro Sekunde – bemerkenswert langsam gegenüber einem Median von 77,9 für Modelle vergleichbarer Größe – und 3,93 Sekunden bis zum ersten Token.
Xiaomi MiMo-V2.6-Pro ist ein Sparse-Mixture-of-Experts-Modell mit insgesamt 1,02 Billionen Parametern und 42 Milliarden pro Token aktivierten Parametern, einem Kontextfenster von 1 Mio. Token und nativer Multimodalität über Text, Bild, Video und Audio. Seine Gewichte tragen ein MIT-Lizenz-Tag. Xiaomi behielt die Preisgestaltung der vorherigen Generation bei, statt den neuen Checkpoint nach oben neu zu bepreisen; deshalb wird es mit $0,43 pro Million Eingabe-Token und $0,87 pro Million Ausgabe-Token bei einem Cache-Rabatt von 99 % und einem kombinierten Preis von $0,18 gelistet. Es erreichte 134,3 Ausgabe-Token pro Sekunde — Elfter von 114 Modellen bei der Geschwindigkeit — und 2,15 Sekunden bis zum ersten Token.
• Aktive Parameter — MiMo-V2.6-Pro 42B pro Token; Kimi K3 etwa 104B, wobei 16 von 896 Experten aktiviert werden
• Parameter insgesamt — MiMo-V2.6-Pro 1,02 Bio.; Kimi K3 2,8 Bio.
• Index-Wert — MiMo-V2.6-Pro 46; Kimi K3 44, beide von Artificial Analysis v4.3.2
• Listenpreis — MiMo-V2.6-Pro 0,43 $ / 0,87 $ pro 1 Mio.; Kimi K3 3,00 $ / 15,00 $, zwischengespeicherte Eingabe 0,30 $
• Mischpreis — MiMo-V2.6-Pro 0,18 $ pro 1 Mio.; Kimi K3 2,31 $
Kosten für den Betrieb des Index — MiMo-V2.6-Pro 206,66 $; Kimi K3 3.658,07 $
• Geschwindigkeit — MiMo-V2.6-Pro 134,3 Ausgabe-Token/Sekunde; Kimi K3 42,8, gegenüber einem Median von 77,9 für diese Größenklasse
• Zeit bis zum ersten Token — MiMo-V2.6-Pro 2,15 Sekunden; Kimi K3 3,93 Sekunden
• Kontext — 1 Mio. Token bei beiden; Kimi K3 gibt pro Anfrage Ausgaben von bis zu 1 Mio. Token aus
• Gewichte — beide herunterladbar; MiMo-V2.6-Pro trägt eine MIT-Kennzeichnung

Geschwindigkeit ist der Unterschied, den der Index verbirgt.
Der Zwei-Punkte-Abstand beim Composite-Wert ist hier die uninteressanteste Zahl, und die 134,3 gegenüber 42,8 Token pro Sekunde ist die interessanteste. Ein Modell, das dreimal schneller generiert, ist nicht dreimal besser, aber es ist der Unterschied zwischen einer Anwendungsklasse, die funktioniert, und einer, die es nicht tut – und die eigene Artificial-Analysis-Seite von Kimi K3 weist es als auffallend langsam für seine Größenklasse aus. Bei einer Agentenschleife mit langem Horizont, die Dutzende sequenzieller Aufrufe ausführt, summiert sich der Durchsatz genauso wie die Latenz: Ein dreifacher Unterschied pro Aufruf ist kein dreifacher End-to-End-Unterschied, aber er ist der Unterschied zwischen einer Sitzung, die ein Nutzer abwartet, und einer, die er abbricht.
Der Vorteil von Kimi K3 liegt auf der Input-Seite der Bilanz. Seine 3,93 Sekunden bis zum ersten Token sind langsamer als die 2,15 von MiMo-V2.6-Pro, aber nicht um die Größenordnung, die beide von einem Frontier-Reasoning-Modell mit maximalem Aufwand trennt. Der Preis, den K3 für seine Größe zahlt, liegt in der Generierung, und Generierung ist das, wofür abgerechnet wird.
Die Lieferantennummern und diejenige, die falsch gelesen wird
Beide Labore veröffentlichten DeepSWE v1.1-Werte aus ihren eigenen Testumgebungen, und die beiden kursieren, als wären sie vergleichbar. Sie sind es nicht, und genau bei diesem Paar richtet dieser Fehler den größten Schaden an, weil die Zahlen so dicht beieinanderliegen.
Xiaomi berichtet, dass MiMo-V2.6-Pro in seinem Reinforcement-Learning-Lauf auf DeepSWE v1.1 von 58,4 auf 72,57 steigt, bewertet mit mini-swe-agent als Durchschnitt aus drei bei Xiaomis eigenem Bewertungssystem. Der Lauf ist mit 30 Schritten und grob 750.000 Trajektorien pro Modell dokumentiert, abgeschlossen in unter sechs Tagen bei veröffentlichten Ausgaben von etwa 2,62 Millionen Dollar für das Pro-Modell und 854.044 Dollar für das kleinere Flash. Eine weit verbreitete Lesart dieses Laufs setzt Kimi K3 auf 68,51 im selben Benchmark, was das Xiaomi-Modell mit vier Punkten Vorsprung zum Sieger machen würde. Diese Lesart ist eine Zahl aus der Community, keine Zahl von Moonshot, und die beiden Messungen verwenden unterschiedliche Metriken – Durchschnitt aus drei gegenüber einer Bestehensquote –, sodass ihre Subtraktion Arithmetik auf nicht zueinander passenden Skalen ist. Keiner der beiden Anbieter hat für diese Modelle eine Konfiguration bei Datacurves öffentlichem Board eingereicht.
Die Zahl, die wirklich vergleichbar ist, ist der Index, denn Artificial Analysis hat beide selbst ausgeführt: 46 für MiMo-V2.6-Pro und 44 für Kimi K3, auf v4.3.2, wobei für keines von beiden die Aufschlüsselung nach Einzelbewertungen veröffentlicht wurde. Diese Zwei-Punkte-Differenz ist klein genug, um innerhalb des Rauschens eines zusammengesetzten Werts aus zehn Bewertungen zu liegen, und die ehrliche Schlussfolgerung ist, dass diese beiden Modelle bei der gemessenen Leistungsfähigkeit praktisch gleichauf liegen.
Was Kimi K3s Premium bietet
Es wäre falsch, die Kostendifferenz als reine Marge zu interpretieren. Kimi K3 ist ein Modell mit 2,8 Billionen Parametern gegenüber Xiaomis 1,02 Billionen, und es aktiviert pro Token etwa zweieinhalb Mal so viele Parameter. Es war das erste offene Modell seiner Größenklasse und verfügt über eine Reihe unabhängiger Ergebnisse, die MiMo-V2.6-Pro einfach noch keine Zeit hatte anzusammeln: Laut der eigenen Berichterstattung von Artificial Analysis belegte es zum Zeitpunkt seiner Veröffentlichung den dritten Platz im Intelligence Index hinter Claude Fable 5 und GPT-5.6 Sol, mit GDPval-AA v2 bei Elo 1668, den ersten Platz bei AutomationBench-AA mit 53 %, den zweiten Platz bei AA-Briefcase mit Elo 1547 und den ersten Platz in der Frontend Code Arena mit 1679. Dabei handelt es sich um unabhängige Messungen, nicht um Marketingaussagen zum Marktstart, und sie beschreiben ein Modell mit einer Breite, die ein Zwei-Punkte-Vorsprung im Composite-Score nicht erfasst.
Dazu gibt es auch noch eine Kapazitätsgeschichte. Die Nachfrage nach Kimi K3 soll zum Start die Bedienkapazität überwältigt haben, was vorübergehende Aussetzungen von API-Abonnements und Upstream-Kapazitätslimits bei einigen Gateways verursachte. Ein Modell, das schwer zu bekommen ist, ist ein Modell, auf dem schwer aufzubauen ist, und das ist ein Verfügbarkeitsproblem und kein Qualitätsproblem.

Ein Endpunkt – und eine klare Antwort darauf, was wir routen
Kimi K3 ist auf OrcaRouter als kimi/kimi-k3 verfügbar — ein OpenAI-kompatibler Schlüssel, der Listenpreis des Anbieters wird ohne Aufschlag weitergegeben, sodass eine Preisänderung von Moonshot am selben Tag auf unserer Seite live ist, und automatisches Failover über Anbieter hinweg deckt die Kapazitätsgrenzen ab, die dieses Modell seit dem Start begleitet haben. Xiaomi MiMo-V2.6-Pro ist nicht auf OrcaRouter. Kein Xiaomi-Modell ist es, und der Weg dorthin führt heute über Xiaomis eigene Plattform oder einen der Drittanbieter-Kataloge, die es führen. Das sollte klar gesagt werden, anstatt eine Modellseite etwas anderes implizieren zu lassen.
Was dieses Paar zu einem guten Beispiel dafür macht, wofür die Routing-Schicht gedacht ist. Zwei offene Modelle, gleichauf bei der einzigen unabhängigen Messgröße, gegen die beide getestet wurden, um den Faktor siebzehn auseinander bei den gemessenen Kosten pro Aufgabe – das ist keine Wahl, das ist eine zweispurige Konfiguration. Legen Sie den Großteil Ihres Verkehrs auf die günstige Spur und leiten Sie den Rest nach einem von Ihnen definierten Prädikat auf die andere, oder führen Sie ein Failover durch, wenn eine Route schlechter wird. Mit den Modellen hinter einem Schlüssel ist das Experiment, das Ihnen sagt, welchen Anteil jedes übernehmen sollte, eine Konfigurationsänderung an Ihren eigenen Prompts statt eines Beschaffungsgesprächs – und wenn Xiaomi MiMo-V2.6-Pro neu bepreist, sobald das Startfenster schließt, oder Moonshot die Preise für K3 als Reaktion auf den Wettbewerb senkt, landen beide Änderungen noch am selben Tag auf unserer Seite statt erst zum nächsten Abrechnungszyklus.

Zu welchem man greifen sollte
Wähle Kimi K3, wenn du die Breite brauchst, die mit einem Modell dieser Größe und dieser unabhängigen Messung einhergeht — Vision, Coding über lange Zeithorizonte hinweg in großen Repositories, agentische Tool-Nutzung — oder wenn du es bereits einsetzt und die Migrationskosten real sind. Von den beiden ist es das gründlicher charakterisierte Modell, und seine Ausgabeobergrenze von 1 Mio. Tokens ist ungewöhnlich. Kalkuliere die Generierungsgeschwindigkeit ein: Mit 42,8 Tokens pro Sekunde ist es in interaktiver Hinsicht ein Batch- und Offline-Workload-Modell, unabhängig davon, was seine Reasoning-Qualität nahelegt.
Wähle MiMo-V2.6-Pro, wenn Durchsatz und Stückkosten die einschränkenden Faktoren sind, wenn die Schleife kontextlastig und repetitiv ist, wenn die Latenz bis zum ersten Token zählt oder wenn du die Gewichte auf deiner eigenen Hardware unter einer permissiven Lizenz haben möchtest. Es ist der seltene Fall eines günstigen Modells, das zugleich das schnelle ist, und beim einzigen unabhängigen Score, den beide Modelle gemeinsam haben, liegt es mit einem Vorsprung vorn, der klein genug ist, um ein Gleichstand zu sein.
Nimm beide, wenn du einen Router hast. Der Fehlermodus, den es zu vermeiden gilt, ist, sich wegen einer Schlagzeilen-Kennzahl auf eines von beiden festzulegen: die Tarife von Kimi K3 für eine Zusammenfassungsaufgabe zu zahlen, die ein 46-Index-Modell identisch erledigt, oder festzustellen, dass eine Coding-Aufgabe im Repository-Maßstab das 2,8T-Modell benötigt, nachdem du alles auf die günstige Spur verschoben hast. Weder das eine noch das andere ist ein Modellproblem, und beides ist Konfiguration.
OrcaRouter stellt 200+ Modelle hinter einem einzigen OpenAI-kompatiblen Endpoint zum Listenpreis des Anbieters mit 0 % Aufschlag bereit, sodass eine Preisänderung eines Anbieters noch am selben Tag live ist.
