
Grok 4.7 vs. Kimi K3: Halber Preis, halber Kontext, keine Gewichte
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 219 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Nimmt man einen Monat mit 300 Millionen Tokens agentischer Coding-Arbeit und lässt ihn bei beiden Modellen zu deren Listenpreisen laufen, sieht die Wahl nicht mehr nach einer Benchmark-Debatte aus. Grok 4.7, das SpaceXAI am 21. September 2026 veröffentlichte, verlangt 2 Dollar pro Million Eingabe-Tokens und 6 Dollar pro Million Ausgabe-Tokens. Kimi K3, das Moonshot AI am 16. Juli 2026 veröffentlichte, verlangt 3 und 15. In diesem hypothetischen Monat – sagen wir 200 Mio. Input und 100 Mio. Output – kommt Grok 4.7 auf rund 1.000 Dollar und Kimi K3 auf rund 2.100 Dollar. Die Lücke ist kein Rundungsunterschied; sie entspricht dem Budget eines zweiten Modells. Dagegen bietet Kimi K3 ein Kontextfenster von 1.000.000 Tokens statt 500.000, native Videoeingabe ebenso wie Bilder und herunterladbare Gewichte. Grok 4.7 bietet ein schnelleres, günstigeres, geschlossenes Modell, das explizit für die Langhorizont-Arbeit im Terminal trainiert wurde, auf die auch Kimi K3 abzielt. Beide gehören zur Frontier-Klasse. Sie sind nicht derselbe Kauf.
Die beiden Modelle, kurz
Grok 4.7 ist SpaceXAIs Frontier-Modell für Coding und Wissensarbeit, aufgebaut auf einem größeren Basismodell als Grok 4.6 und mit einem längeren Reinforcement-Learning-Lauf, der auf Aufgaben ausgerichtet ist, die Stunden dauern können. Es ist proprietär – keine Gewichte, kein Download – bietet ein Kontextfenster von 500.000 Token, nimmt Text und Bilder entgegen und gibt Text zurück und unterstützt Reasoning-Effort-Stufen von low bis xhigh. Sein zentrales Versprechen sind Geschwindigkeit und Preis: SpaceXAI positioniert es als etwa doppelt so schnell wie vergleichbare Modelle bei etwa halbem Preis.
Kimi K3 ist das Flaggschiff-Open-Mixture-of-Experts-Modell von Moonshot AI, das erste offene Modell in der Drei-Billionen-Parameter-Klasse: insgesamt 2,8 Billionen Parameter bei 104 Milliarden aktiven pro Token, basierend auf Kimi Delta Attention und quantisierungsbewussten MXFP4-Gewichten. Es nimmt Text, Bilder und Videos entgegen, unterstützt einen Kontext von 1.000.000 Token, läuft mit stets aktivem Reasoning und konfigurierbarem Aufwand, und seine Gewichte sind unter der Kimi K3 License herunterladbar – kommerzielle Nutzung erlaubt, mit Einschränkungen. Per Design ist es das Modell, das man mit nach Hause nehmen kann.
Das ist der gesamte strukturelle Unterschied zwischen ihnen. Das eine ist ein billiger, schneller, geschlossener Endpunkt. Das andere ist ein teureres, langsameres, offenes Artefakt mit doppelt so viel Kontext. Alles Folgende ist eine Konsequenz daraus.
Was die Benchmarks tatsächlich vergleichen
Hier gehen die meisten Berichte zu Grok 4.7 versus Kimi K3 schief, deshalb lohnt es sich, deutlich zu werden: Die veröffentlichten Zahlen der beiden Modelle messen größtenteils nicht dieselben Dinge, und mindestens ein Paar, das vergleichbar aussieht, ist es nicht.
Beginne mit dem Paar, das wirklich irreführend ist. Kimi K3s Launch-Material nennt einen Terminal-Bench-2.1-Wert von 88,3. Grok 4.7s Launch-Material nennt Terminal-Bench 4.0 mit 38,0 %. Das sind unterschiedliche Benchmark-Versionen mit unterschiedlichen Aufgabensätzen und unterschiedlicher Bewertung, und sie nebeneinanderzustellen würde nahelegen, dass Kimi K3 ein mehr als doppelt so starkes agentisches Modell ist. Das ist keine haltbare Lesart, und niemand sollte sie wiederholen. Beide Zahlen sind zudem vom Anbieter gemeldet — keine von beiden wurde unabhängig reproduziert.
Vergleichbar ist der unabhängige Composite-Wert, und dort liegen die beiden dicht beieinander. Im aktuellen Artificial Analysis Intelligence Index, Version v4.3.2, erzielt Kimi K3 44 Punkte — den zweiten Platz unter 113 Modellen und die höchste Platzierung, die ein Open-Weights-Modell in der Rangliste erreicht hat. Grok 4.7 erzielt 46 Punkte, den sechzehnten Platz von 655. Nur zwei Punkte Abstand, wobei die Platzierung von Kimi K3 mit maximalem Reasoning-Aufwand erreicht wurde. Im gemischten Composite sind diese Modelle ebenbürtig.
• Unabhängiger zusammengesetzter Wert — Grok 4.7 46 auf dem AA Intelligence Index v4.3.2 vs. Kimi K3 44 auf derselben Version. In der Praxis ein Gleichstand.
• Kontextfenster — Grok 4.7 500.000 Tokens vs. Kimi K3 1.000.000 Tokens. Ein echter, uneingeschränkter Vorteil für Kimi K3 und der eine Unterschied bei den Spezifikationen, an den keine Einschränkung geknüpft ist.
• Eingabemodalitäten — Grok 4.7 Text und Bild vs. Kimi K3 Text, Bild und Video. Kimi K3 ist breiter aufgestellt, wenn in Ihrer Arbeitslast Videos vorkommen.
• Gewichte — Grok 4.7 proprietär, kein Download vs. Kimi K3 offene Gewichte unter der Kimi K3 License. Für eine On-Premises- oder Air-Gapped-Anforderung ist dies die einzige Zeile, die zählt.
• Preis pro Million Tokens – Grok 4.7: 2 $ Eingabe / 6 $ Ausgabe gegenüber Kimi K3: 3 $ Eingabe / 15 $ Ausgabe, wobei Kimis Tarif für zwischengespeicherte Eingaben bei 0,30 $ pro Million liegt. Grok 4.7 ist auf jeder Achse günstiger und bei der Ausgabe drastisch günstiger.
• Steuerung des Reasoning-Aufwands — Grok 4.7 von low bis xhigh vs. Kimi K3 immer aktiv mit konfigurierbarem Aufwand. Funktional ähnlich; der Unterschied ist, dass Grok 4.7 es ermöglicht, das Reasoning herunterzuregeln.
• Vom Anbieter gemeldete agentische Nachweise — Grok 4.7 Terminal-Bench 4.0 38,0 %, CursorBench 4.0 46,3 %, DeepSWE v1.1 71,0 % (alle vom Anbieter gemeldet) vs. Kimi K3 Terminal-Bench 2.1 88,3 %, Frontend Code Arena erster Platz mit 1.679 Elo (vom Anbieter zum Launch gemeldet). Nicht vergleichbar — siehe oben.


Wohin das Geld tatsächlich fließt
Die Preistabelle unterschätzt die Kluft, weil die beiden Modelle Tokens unterschiedlich verbrauchen. Grok 4.7 ist ein wortreicher Reasoner – Artificial Analysis maß 240 Millionen generierte Ausgabe-Tokens beim Durchlaufen seines Intelligence Index, gegenüber einem Median von 92 Millionen über alle Modelle hinweg. Kimi K3 ist die entgegengesetzte Art von teuer: Es ist ein großes, permanent aktives Reasoning-Modell, und bei 15 $ pro Million Ausgabe-Tokens ist Wortreichtum das, was man kauft.
Das ehrliche Kostenmodell ist also nicht „$2/$6 gegenüber $3/$15“. Es sind Ausgabe-Tokens pro abgeschlossener Aufgabe, multipliziert mit dem Ausgabesatz, plus Eingabe-Tokens einschließlich jedes Wiederholungsversuchs, multipliziert mit dem Eingabesatz. Ein Modell, das eine Aufgabe in einem einzigen langen Durchlauf zu $6 pro Million löst, kann ein Modell schlagen, das drei Versuche zu $15 pro Million braucht, und es kann auch gegen dieses verlieren, wenn die Durchläufe des günstigen Modells lang genug sind. Das ist eine Messung, die man im eigenen Repository durchführt, keine, die einem jemand veröffentlicht.
Eine Asymmetrie ist es wert, gekannt zu werden, bevor Sie es ausführen: Grok 4.6, der Vorgänger von Grok 4.7, wendet bei 200.000 Eingabe-Tokens eine Preisklippe an, bei der eine Anfrage, die diese Grenze überschreitet, die gesamte Anfrage zum doppelten Satz neu berechnet. Long-Context-Arbeit auf der Grok-Seite muss gegen die aktuelle Preistabelle für das Modell, das Sie einsetzen, geprüft werden, weil ein Fenster von 500.000 Tokens und eine 200.000-Token-Klippe schlecht zusammenspielen. Die Preisgestaltung von Kimi K3 ist pauschal, was der leisere Vorteil der beiden ist.
Wo jedes einzelne bricht
Beide Modelle haben einen Fehlermodus, den das Launch-Material nicht an die erste Stelle setzt, und es handelt sich um unterschiedliche Fehler.
Kimi K3s Schwachpunkt ist die Zuverlässigkeit unter Dauerlast. Community- und unabhängige Tests zum Marktstart berichteten, dass seine agentische Leistung mit längerer Laufzeit nachlässt – starke Ergebnisse bei einzelnen Durchläufen, schwächere dauerhafte Bestehensraten – und dass seine Ausgabegeschwindigkeit bei etwa 37 bis 38 Token pro Sekunde liegt, was für interaktives Codieren langsam ist. Moonshot musste außerdem kurz nach dem Start neue Endkunden-Abonnements aussetzen, weil die Nachfrage die Kapazität überstieg, was einiges über die Serving-Reserven auf der gehosteten Seite verrät.
Grok 4.7 hat die entgegengesetzte Form: Es ist schnell, günstig und geschlossen, was bedeutet, dass man es nicht inspizieren, nicht selbst ausführen und sich nicht gegen eine Abschaffung absichern kann. SpaceXAI hat bereits öffentlich Grok 4.8, Grok 4.9 und Grok 5 hinter diesem Release eingeordnet, und Grok 4.6 hielt sich nur etwa fünf Wochen, bevor es abgelöst wurde. Alles, was Sie auf Grok 4.7 aufbauen, sollte so gebaut sein, dass die Modell-ID ein Konfigurationswert ist und keine Annahme.
Es gibt eine dritte Überlegung, die nicht bedeutet, dass eines der beiden Modelle versagt: Keines von beiden ist die richtige Antwort für einen zweiwöchigen autonomen Lauf, und beide Anbieter haben genau das demonstriert. Die veröffentlichten 16-Tage- und 48-Stunden-Demos zum autonomen Programmieren wurden von den Anbietern durchgeführt, mit von den Anbietern ausgewählten Aufgaben, ohne unabhängige Reproduktion. Es lohnt sich, sie zu kennen, aber sie taugen nicht als Planungsgrundlage.

Beides ausführen, und warum das die eigentliche Antwort ist
Die Kostenlücke und die Kontextlücke weisen in entgegengesetzte Richtungen, was das Argument dafür ist, sich nicht für eines zu entscheiden. Kimi K3 rechtfertigt seinen Preis bei Arbeiten im Repository-Maßstab, bei denen ein 1M-Fenster bedeutet, dass man die Eingabe nicht in Chunks aufteilen muss, und bei allem, das selbst gehostet werden muss. Grok 4.7 rechtfertigt seinen Preis bei Volumen – Agent-Loops mit vielen Turns, Pipelines mit vielen Tool-Aufrufen und langen Terminal-Sitzungen, in denen Geschwindigkeit und Ausgabekosten dominieren.
Kimi K3 ist auf OrcaRouter verfügbar, was diese Aufteilung zu einer Routing-Entscheidung statt zu einer Beschaffungsentscheidung macht. Es steht im Katalog zum Listenpreis von Moonshot, und da OrcaRouter die Listenpreise der Anbieter mit 0 % Aufschlag weitergibt, ist eine Preissenkung eines Anbieters hier am selben Tag live, an dem sie angekündigt wird, statt erst bei der nächsten Vertragsverlängerung. Für Workloads, bei denen ein Long-Context-Durchlauf und ein Ausführungsdurchlauf zusammenarbeiten statt konkurrieren sollen – ein Modell, das das gesamte Repository im Blick behält, ein anderes, das darauf reagiert –, fasst die Routing-DSL mehrere Modelle in einem einzigen Aufruf zusammen, und Model Fusion ermöglicht es einem Panel von Modellen, gemeinsam zu antworten, wenn die Aufgabe die zusätzlichen Ausgaben wert ist. Ein einziger API-Schlüssel umfasst Kimi K3 plus über 200 weitere Modelle, sodass die Ausführungshälfte dieser Aufteilung von dem Modell kommen kann, das für die Aufgabe am günstigsten und schnellsten ist, statt von dem, das zufällig den Kontext hält.
Eines sollte klar sein: Kimi K3s offene Gewichte sind herunterladbar, aber der gehostete Endpunkt ist das, wohin OrcaRouter leitet. Wenn Ihre Anforderung wirklich On-Premise-Inferenz ist, dann ist das ein Selbsthosting-Projekt auf Ihrer eigenen Hardware, keine Routing-Entscheidung – und es ist das einzige Szenario, in dem dieser Vergleich eine einzige richtige Antwort hat.
Das Urteil – und die eine Zahl, die man im Auge behalten sollte
Wenn Sie nach Kosten und Geschwindigkeit entscheiden, gewinnt Grok 4.7, und zwar deutlich: der halbe Eingabepreis, weniger als der halbe Ausgabepreis, schnellere Bereitstellung und ein Reasoning-Regler, den Sie herunterdrehen können. Wenn Sie nach Kontext, Modalitätsbreite oder der Möglichkeit entscheiden, das Modell selbst zu besitzen, gewinnt Kimi K3 zu denselben Bedingungen. Wenn Sie allein nach der Leistungsfähigkeit entscheiden, besagt die unabhängige Gesamtwertung, dass sie zwei Punkte auseinanderliegen, und Sie sollten nach Ihrer eigenen Bewertung entscheiden statt nach dem Launch-Diagramm eines der beiden Anbieter.
Die Zahl, an der Sie festhalten sollten, ist die von oben: $2/$6 gegenüber $3/$15. Alles andere in diesem Vergleich ist verhandelbar – dieses Verhältnis nicht.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
