Eine generierte Titelkarte, die Xiaomi MiMo-V2.6-Pro und Kimi K3 bei maximalem Aufwand vergleicht. Auf der linken Karte steht Intelligence Index v4.3.2: 46, 1,02T Gesamtparameter, 206,66 $ für den Durchlauf des Index und 134,3 Token pro Sekunde; auf der rechten Karte steht Intelligence Index v4.3.2: 44, 2,8T Gesamtparameter, 3.658,07 $ für den Durchlauf des Index und 42,8 Token pro Sekunde. In einer Fußzeile steht: Beide Ergebnisse auf dem Artificial Analysis Intelligence Index v4.3.2, abgelesen am 22. September 2026. Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

MiMo-V2.6-Pro vs. Kimi K3: Zwei Billionen Parameter, offene Gewichte, vierzehnfacher Unterschied bei den Kosten pro Aufgabe

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Beide sind Mixture-of-Experts-Modelle mit offenen Gewichten aus chinesischen Labors und einem Kontextfenster von 1 Mio. Token. Beide sind zum Download verfügbar. Im Artificial Analysis Intelligence Index v4.3.2, abgelesen am 22. September 2026, erzielt MoonshotAIs Kimi K3 44 Punkte und Xiaomis MiMo-V2.6-Pro 46 Punkte. Zwei Punkte. Die gemessenen Kosten für die Ausführung derselben Evaluationssuite gegen jedes Modell betragen 3.658,07 US-Dollar für Kimi K3 und 206,66 US-Dollar für MiMo-V2.6-Pro – ein Faktor von siebzehn. Wenn Sie sich bereits entschieden haben, dass Sie in dieser Klasse offene Gewichte möchten, ist dieses Verhältnis – nicht die zwei Punkte – die Entscheidung.

Kimi K3 ist das etablierte Modell in diesem Paar: veröffentlicht am 16. Juli 2026, mit den vollständigen Gewichten, die am 27. Juli folgten, und Monaten unabhängiger Evaluierung im Rücken. Xiaomi MiMo-V2.6-Pro wurde am 22. September 2026 allgemein verfügbar, wobei die Repositorys mit den Checkpoints des Reinforcement Learnings am Tag zuvor erschienen. Der Vergleich steht somit zwischen einem bewährten offenen Modell zu Premium-Preisen und einem brandneuen zu Niedrigpreisen, und das Interessante daran ist, wie gering die gemessene Leistungslücke letztlich ausfiel.

Was jedes Modell tatsächlich ist

Kimi K3 ist ein multimodales Reasoning-Modell mit offenen Gewichten und 2,8 Billionen Parametern, das bei der Veröffentlichung als erstes offenes Modell in der Drei-Billionen-Klasse beschrieben wurde. Es aktiviert 16 von 896 Experten pro Token – rund 104 Milliarden aktive Parameter – und nutzt Kimi Delta Attention und Attention Residuals, um einen Kontext von 1 Mio. Token effizient zu bewältigen, mit einer Ausgabe von bis zu 1 Mio. Token pro Anfrage. Es ist Always-on-Reasoning mit nativer Vision. Moonshots First-Party-API berechnet 3,00 US-Dollar pro Million Eingabe-Token, 0,30 US-Dollar pro Million gecachter Eingabe und 15,00 US-Dollar pro Million Ausgabe, pauschal ohne Staffelung nach Kontextlänge, und Artificial Analysis meldet einen Cache-Rabatt von 90 % und einen kombinierten Preis von 2,31 US-Dollar. Gemessen wurden 42,8 Ausgabe-Token pro Sekunde – bemerkenswert langsam gegenüber einem Median von 77,9 für Modelle vergleichbarer Größe – und 3,93 Sekunden bis zum ersten Token.

Xiaomi MiMo-V2.6-Pro ist ein Sparse-Mixture-of-Experts-Modell mit insgesamt 1,02 Billionen Parametern und 42 Milliarden pro Token aktivierten Parametern, einem Kontextfenster von 1 Mio. Token und nativer Multimodalität über Text, Bild, Video und Audio. Seine Gewichte tragen ein MIT-Lizenz-Tag. Xiaomi behielt die Preisgestaltung der vorherigen Generation bei, statt den neuen Checkpoint nach oben neu zu bepreisen; deshalb wird es mit $0,43 pro Million Eingabe-Token und $0,87 pro Million Ausgabe-Token bei einem Cache-Rabatt von 99 % und einem kombinierten Preis von $0,18 gelistet. Es erreichte 134,3 Ausgabe-Token pro Sekunde — Elfter von 114 Modellen bei der Geschwindigkeit — und 2,15 Sekunden bis zum ersten Token.

• Aktive Parameter — MiMo-V2.6-Pro 42B pro Token; Kimi K3 etwa 104B, wobei 16 von 896 Experten aktiviert werden

• Parameter insgesamt — MiMo-V2.6-Pro 1,02 Bio.; Kimi K3 2,8 Bio.

• Index-Wert — MiMo-V2.6-Pro 46; Kimi K3 44, beide von Artificial Analysis v4.3.2

• Listenpreis — MiMo-V2.6-Pro 0,43 $ / 0,87 $ pro 1 Mio.; Kimi K3 3,00 $ / 15,00 $, zwischengespeicherte Eingabe 0,30 $

• Mischpreis — MiMo-V2.6-Pro 0,18 $ pro 1 Mio.; Kimi K3 2,31 $

Kosten für den Betrieb des Index — MiMo-V2.6-Pro 206,66 $; Kimi K3 3.658,07 $

• Geschwindigkeit — MiMo-V2.6-Pro 134,3 Ausgabe-Token/Sekunde; Kimi K3 42,8, gegenüber einem Median von 77,9 für diese Größenklasse

• Zeit bis zum ersten Token — MiMo-V2.6-Pro 2,15 Sekunden; Kimi K3 3,93 Sekunden

• Kontext — 1 Mio. Token bei beiden; Kimi K3 gibt pro Anfrage Ausgaben von bis zu 1 Mio. Token aus

• Gewichte — beide herunterladbar; MiMo-V2.6-Pro trägt eine MIT-Kennzeichnung

A two-column scoreboard titled MiMo-V2.6-Pro vs Kimi K3, subtitled Two open-weight MoEs tied on the only index both were run against. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; total parameters 1.02T; list price $0.43 / $0.87 per 1M; cost to run the index $206.66; speed 134.3 tokens per second; time to first token 2.15 s. The right column, Kimi K3 (max), reads Intelligence Index v4.3.2 44; total parameters 2.8T; list price $3.00 / $15.00 per 1M; cost to run the index $3,658.07; speed 42.8 tokens per second; time to first token 3.93 s. A footer notes both models are open-weights, that MiMo-V2.6-Pro carries an MIT licence tag, and that blended rates per 1M tokens are $0.18 and $2.31. The OrcaRouter logo is composited in the bottom-right corner.

Geschwindigkeit ist der Unterschied, den der Index verbirgt.

Der Zwei-Punkte-Abstand beim Composite-Wert ist hier die uninteressanteste Zahl, und die 134,3 gegenüber 42,8 Token pro Sekunde ist die interessanteste. Ein Modell, das dreimal schneller generiert, ist nicht dreimal besser, aber es ist der Unterschied zwischen einer Anwendungsklasse, die funktioniert, und einer, die es nicht tut – und die eigene Artificial-Analysis-Seite von Kimi K3 weist es als auffallend langsam für seine Größenklasse aus. Bei einer Agentenschleife mit langem Horizont, die Dutzende sequenzieller Aufrufe ausführt, summiert sich der Durchsatz genauso wie die Latenz: Ein dreifacher Unterschied pro Aufruf ist kein dreifacher End-to-End-Unterschied, aber er ist der Unterschied zwischen einer Sitzung, die ein Nutzer abwartet, und einer, die er abbricht.

Der Vorteil von Kimi K3 liegt auf der Input-Seite der Bilanz. Seine 3,93 Sekunden bis zum ersten Token sind langsamer als die 2,15 von MiMo-V2.6-Pro, aber nicht um die Größenordnung, die beide von einem Frontier-Reasoning-Modell mit maximalem Aufwand trennt. Der Preis, den K3 für seine Größe zahlt, liegt in der Generierung, und Generierung ist das, wofür abgerechnet wird.

Die Lieferantennummern und diejenige, die falsch gelesen wird

Beide Labore veröffentlichten DeepSWE v1.1-Werte aus ihren eigenen Testumgebungen, und die beiden kursieren, als wären sie vergleichbar. Sie sind es nicht, und genau bei diesem Paar richtet dieser Fehler den größten Schaden an, weil die Zahlen so dicht beieinanderliegen.

Xiaomi berichtet, dass MiMo-V2.6-Pro in seinem Reinforcement-Learning-Lauf auf DeepSWE v1.1 von 58,4 auf 72,57 steigt, bewertet mit mini-swe-agent als Durchschnitt aus drei bei Xiaomis eigenem Bewertungssystem. Der Lauf ist mit 30 Schritten und grob 750.000 Trajektorien pro Modell dokumentiert, abgeschlossen in unter sechs Tagen bei veröffentlichten Ausgaben von etwa 2,62 Millionen Dollar für das Pro-Modell und 854.044 Dollar für das kleinere Flash. Eine weit verbreitete Lesart dieses Laufs setzt Kimi K3 auf 68,51 im selben Benchmark, was das Xiaomi-Modell mit vier Punkten Vorsprung zum Sieger machen würde. Diese Lesart ist eine Zahl aus der Community, keine Zahl von Moonshot, und die beiden Messungen verwenden unterschiedliche Metriken – Durchschnitt aus drei gegenüber einer Bestehensquote –, sodass ihre Subtraktion Arithmetik auf nicht zueinander passenden Skalen ist. Keiner der beiden Anbieter hat für diese Modelle eine Konfiguration bei Datacurves öffentlichem Board eingereicht.

Die Zahl, die wirklich vergleichbar ist, ist der Index, denn Artificial Analysis hat beide selbst ausgeführt: 46 für MiMo-V2.6-Pro und 44 für Kimi K3, auf v4.3.2, wobei für keines von beiden die Aufschlüsselung nach Einzelbewertungen veröffentlicht wurde. Diese Zwei-Punkte-Differenz ist klein genug, um innerhalb des Rauschens eines zusammengesetzten Werts aus zehn Bewertungen zu liegen, und die ehrliche Schlussfolgerung ist, dass diese beiden Modelle bei der gemessenen Leistungsfähigkeit praktisch gleichauf liegen.

Was Kimi K3s Premium bietet

Es wäre falsch, die Kostendifferenz als reine Marge zu interpretieren. Kimi K3 ist ein Modell mit 2,8 Billionen Parametern gegenüber Xiaomis 1,02 Billionen, und es aktiviert pro Token etwa zweieinhalb Mal so viele Parameter. Es war das erste offene Modell seiner Größenklasse und verfügt über eine Reihe unabhängiger Ergebnisse, die MiMo-V2.6-Pro einfach noch keine Zeit hatte anzusammeln: Laut der eigenen Berichterstattung von Artificial Analysis belegte es zum Zeitpunkt seiner Veröffentlichung den dritten Platz im Intelligence Index hinter Claude Fable 5 und GPT-5.6 Sol, mit GDPval-AA v2 bei Elo 1668, den ersten Platz bei AutomationBench-AA mit 53 %, den zweiten Platz bei AA-Briefcase mit Elo 1547 und den ersten Platz in der Frontend Code Arena mit 1679. Dabei handelt es sich um unabhängige Messungen, nicht um Marketingaussagen zum Marktstart, und sie beschreiben ein Modell mit einer Breite, die ein Zwei-Punkte-Vorsprung im Composite-Score nicht erfasst.

Dazu gibt es auch noch eine Kapazitätsgeschichte. Die Nachfrage nach Kimi K3 soll zum Start die Bedienkapazität überwältigt haben, was vorübergehende Aussetzungen von API-Abonnements und Upstream-Kapazitätslimits bei einigen Gateways verursachte. Ein Modell, das schwer zu bekommen ist, ist ein Modell, auf dem schwer aufzubauen ist, und das ist ein Verfügbarkeitsproblem und kein Qualitätsproblem.

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, captured 22 September 2026. The header reads 46 Artificial Analysis Intelligence Index, ranked first of 114 in its class; 134.3 output tokens per second, ranked eleventh of 114; $0.435 input and $0.87 output per 1M tokens with a 99% cache discount; $0.13 cost per Intelligence Index task, ranked twelfth of 114; and 140M output tokens from the Intelligence Index. Technical specifications list reasoning Yes, input modality text, image, speech and video, output modality text, a 1M-token context window, 1.0T total parameters, 42B active parameters, an MIT licence and Hugging Face model weights, under a breadcrumb reading Xiaomi, Open weights model, Released September 2026. A comparison summary notes it cost $206.66 to evaluate MiMo-V2.6-Pro on the Intelligence Index.

Ein Endpunkt – und eine klare Antwort darauf, was wir routen

Kimi K3 ist auf OrcaRouter als kimi/kimi-k3 verfügbar — ein OpenAI-kompatibler Schlüssel, der Listenpreis des Anbieters wird ohne Aufschlag weitergegeben, sodass eine Preisänderung von Moonshot am selben Tag auf unserer Seite live ist, und automatisches Failover über Anbieter hinweg deckt die Kapazitätsgrenzen ab, die dieses Modell seit dem Start begleitet haben. Xiaomi MiMo-V2.6-Pro ist nicht auf OrcaRouter. Kein Xiaomi-Modell ist es, und der Weg dorthin führt heute über Xiaomis eigene Plattform oder einen der Drittanbieter-Kataloge, die es führen. Das sollte klar gesagt werden, anstatt eine Modellseite etwas anderes implizieren zu lassen.

Was dieses Paar zu einem guten Beispiel dafür macht, wofür die Routing-Schicht gedacht ist. Zwei offene Modelle, gleichauf bei der einzigen unabhängigen Messgröße, gegen die beide getestet wurden, um den Faktor siebzehn auseinander bei den gemessenen Kosten pro Aufgabe – das ist keine Wahl, das ist eine zweispurige Konfiguration. Legen Sie den Großteil Ihres Verkehrs auf die günstige Spur und leiten Sie den Rest nach einem von Ihnen definierten Prädikat auf die andere, oder führen Sie ein Failover durch, wenn eine Route schlechter wird. Mit den Modellen hinter einem Schlüssel ist das Experiment, das Ihnen sagt, welchen Anteil jedes übernehmen sollte, eine Konfigurationsänderung an Ihren eigenen Prompts statt eines Beschaffungsgesprächs – und wenn Xiaomi MiMo-V2.6-Pro neu bepreist, sobald das Startfenster schließt, oder Moonshot die Preise für K3 als Reaktion auf den Wettbewerb senkt, landen beide Änderungen noch am selben Tag auf unserer Seite statt erst zum nächsten Abrechnungszyklus.

Screenshot of the OrcaRouter model page for Kimi K3, captured 22 September 2026, showing the breadcrumb Home > Models > MoonshotAI > Kimi K3, the model id kimi/kimi-k3 dated 2026-07-15, the Vision, Tools, JSON and Reasoning capability badges, and the opening of the model description, which calls Kimi K3 MoonshotAI's flagship and most capable release to date and a 2.8-trillion-parameter mixture-of-experts model. The rate card sits below the visible area of the capture.

Zu welchem man greifen sollte

Wähle Kimi K3, wenn du die Breite brauchst, die mit einem Modell dieser Größe und dieser unabhängigen Messung einhergeht — Vision, Coding über lange Zeithorizonte hinweg in großen Repositories, agentische Tool-Nutzung — oder wenn du es bereits einsetzt und die Migrationskosten real sind. Von den beiden ist es das gründlicher charakterisierte Modell, und seine Ausgabeobergrenze von 1 Mio. Tokens ist ungewöhnlich. Kalkuliere die Generierungsgeschwindigkeit ein: Mit 42,8 Tokens pro Sekunde ist es in interaktiver Hinsicht ein Batch- und Offline-Workload-Modell, unabhängig davon, was seine Reasoning-Qualität nahelegt.

Wähle MiMo-V2.6-Pro, wenn Durchsatz und Stückkosten die einschränkenden Faktoren sind, wenn die Schleife kontextlastig und repetitiv ist, wenn die Latenz bis zum ersten Token zählt oder wenn du die Gewichte auf deiner eigenen Hardware unter einer permissiven Lizenz haben möchtest. Es ist der seltene Fall eines günstigen Modells, das zugleich das schnelle ist, und beim einzigen unabhängigen Score, den beide Modelle gemeinsam haben, liegt es mit einem Vorsprung vorn, der klein genug ist, um ein Gleichstand zu sein.

Nimm beide, wenn du einen Router hast. Der Fehlermodus, den es zu vermeiden gilt, ist, sich wegen einer Schlagzeilen-Kennzahl auf eines von beiden festzulegen: die Tarife von Kimi K3 für eine Zusammenfassungsaufgabe zu zahlen, die ein 46-Index-Modell identisch erledigt, oder festzustellen, dass eine Coding-Aufgabe im Repository-Maßstab das 2,8T-Modell benötigt, nachdem du alles auf die günstige Spur verschoben hast. Weder das eine noch das andere ist ein Modellproblem, und beides ist Konfiguration.

OrcaRouter stellt 200+ Modelle hinter einem einzigen OpenAI-kompatiblen Endpoint zum Listenpreis des Anbieters mit 0 % Aufschlag bereit, sodass eine Preisänderung eines Anbieters noch am selben Tag live ist.