Generierte Hero-Titelkarte mit der Überschrift „GPT-6 Luna vs. Kimi K3“ und dem Untertitel „Vierfacher Durchsatz, ein Dreißigstel des Preises“, einer Fußzeile mit dem Text „Preise laut OpenAI und Moonshot AI; Indexzahlen laut Artificial Analysis.“ sowie dem in der unteren rechten Ecke eingefügten OrcaRouter-Logo.
Guides & Insights

GPT-6 Luna vs. Kimi K3: Vierfacher Durchsatz, ein Dreißigstel des Preises, eine echte Ausnahme

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei Modelle, beide innerhalb der letzten drei Monate veröffentlicht, beide als die günstige Stufe einer Frontier-Familie positioniert, und beide auf dieselbe Weise falsch darin, was „günstige Stufe“ bedeutet – nämlich überhaupt nicht. Kimi K3 ist das Open-Weight-Flaggschiff von Moonshot AI, seit dem 27. Juli 2026 unter einer Modified-MIT-Lizenz öffentlich, mit einem Preis von 3,00 $ pro Million Input-Tokens und 15,00 $ pro Million Output bei Cache-Reads zu 0,30 $. GPT-6 Luna ist die Volumen-Stufe des Anbieters, allgemein verfügbar seit dem 22. September 2026 zu 0,10 $ und 0,50 $ bei Cache-Reads zu einem Cent. Dreißigmal beim Input, dreißigmal beim Output, und eine Lizenz auf der einen Seite, die die andere zu keinem Preis bieten kann.

Die Preisliste ist allerdings nicht das, was diese Paarung entscheidet, denn sie ist nicht knapp genug, um den Ausschlag zu geben. Was sie entscheidet, ist eine Zahl, die kein Anbieter in einer Schlagzeile nennt: die gemessene Ausgabegeschwindigkeit. Kimi K3 erzeugt 38,7 Tokens pro Sekunde. GPT-6 Luna erzeugt 153,9. Das ist ein Unterschied um den Faktor vier, und für jeden Workload, bei dem das Modell eine Komponente innerhalb einer Schleife und nicht ein Endpunkt ist, mit dem ein Mensch spricht, verändert ein vierfacher Durchsatzunterschied eher die Architektur als die Rechnung.

Was diese beiden tatsächlich sind

Kimi K3 ist ein Mixture-of-Experts-Modell mit 2,8 Billionen Parametern, von denen pro Token 104 Milliarden Parameter aktiv sind, einem Kontextfenster von 1.048.576 Token, einer Ausgabeobergrenze von 1.048.576 Token und Gewichten, die auf Hugging Face unter einer modifizierten MIT-Lizenz veröffentlicht wurden. Es ist das bestbewertete Open-Weight-Modell auf dem unabhängigen Board – an erster Stelle unter 112 Open-Weight-Modellen – und hält die Spitzenposition in Code Arenas WebDev-Leaderboard mit 1.679 Elo. Moonshot meldet 88,3 % auf Terminal-Bench 2.0, eine Herstellerangabe, die nicht unabhängig reproduziert wurde.

GPT-6 Luna ist die kleine Stufe der GPT-6-Generation von OpenAI, angesiedelt unter GPT-6 Sol zu 2,00 $/10,00 $ und deutlich unter dem Flaggschiff GPT-6 Astra zu 10,00 $/50,00 $. Text- und Bildeingabe, Textausgabe, ein Fenster von 1.050.000 Token mit maximal 922.000 Token Eingabe und einer Obergrenze von 128.000 Token für die Ausgabe, und der Reasoning-Aufwand ist von none über low, medium, high, xhigh bis max auswählbar, wobei medium die Standardeinstellung ist. Es ist geschlossen, hat eine einzige Kennung und ist für jeden mit einem API-Schlüssel verfügbar.

Das eine ist ein Download. Das andere ist ein Endpunkt. Beide sind nach Volumen bepreist. Das ist die Form des Vergleichs.

Die Karten, Zeile für Zeile

Eine Zeile pro Dimension, beide Seiten jeweils aktiviert:

• Eingabe pro 1 Mio. — GPT-6 Luna 0,10 $ vs. Kimi K3 3,00 $

• Output pro 1 Mio. — GPT-6 Luna 0,50 $ vs. Kimi K3 15,00 $

• Cache-Eingabe pro 1 Mio. — GPT-6 Luna 0,01 $ vs. Kimi K3 0,30 $, ein Zehntel des eigenen Eingabetarifs auf beiden Karten

• Langkontext-Klausel — GPT-6 Luna verdoppelt Eingabe und Cache und erhöht die Ausgabe oberhalb von 272.000 Eingabe-Tokens um das 1,5-Fache, angewendet auf die gesamte Anfrage, im Gegensatz zu Kimi K3, für das keine entsprechende Klausel auf seiner Karte veröffentlicht wurde

• Kontextfenster — GPT-6 Luna 1.050.000 Tokens bei 922.000 maximaler Eingabe vs. Kimi K3 1.048.576 Tokens

• Maximale Ausgabe — GPT-6 Luna 128.000 Tokens vs. Kimi K3 1.048.576 Tokens, das Achtfache der Obergrenze

• Intelligence Index, unabhängig — GPT-6 Luna 37 bei maximalem Aufwand vs. Kimi K3 44 bei maximalem Aufwand, gleiche Index-Revision

• Standardaufwand-Score — GPT-6 Luna 29 auf seiner Standardstufe Mittel vs. Kimi K3, gemessen bei dessen maximaler Einstellung

• Kosten pro Index-Aufgabe, unabhängig — GPT-6 Luna etwa 0,07 $ vs. Kimi K3 2,00 $

• Ausgabe-Tokens im Index-Lauf — GPT-6 Luna 150M vs. Kimi K3 160M, gegenüber einem Board-Median von 88M; beide sind weit ausführlicher als das Median-Modell des Boards

• Ausgabegeschwindigkeit, unabhängig — GPT-6 Luna 153,9 Token/Sek. vs. Kimi K3 38,7 Token/Sek.

• Gewichte — GPT-6 Luna geschlossen, nur API vs. Kimi K3 öffentlich auf Hugging Face seit dem 27. Juli 2026

• Lizenz — GPT-6 Luna nicht anwendbar vs. Kimi K3 Modified MIT, das nicht dasselbe Rechtsinstrument wie MIT ist

• Gesamtparameter — GPT-6 Luna nicht offengelegt vs. Kimi K3 2.800 Milliarden, wovon 104 Milliarden pro Token aktiv sind

• Herausragende Belege — GPT-6 Luna Tool-Calling und agentische Loops zu einem Zehntel Cent pro tausend gecachte Eingabe-Tokens gegenüber Kimi K3 Code Arena WebDev #1 mit 1.679 Elo, Terminal-Bench 2.0 88,3 % laut Anbieter, höchster Open-Weight-Score auf dem unabhängigen Board

• Auf OrcaRouter — GPT-6 Luna nicht in unserem Katalog vs. Kimi K3 routingfähig zu Moonshots Listenpreis

Generated two-column scoreboard titled 'GPT-6 Luna vs Kimi K3 - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index at max effort 37, Output speed 153.9 tok/s, Context 1,050,000, Weights closed. Right column Kimi K3 rows: Price in/out $3.00 / $15.00, Cached input $0.30, AA Index at max effort 44, Output speed 38.7 tok/s, Context 1,048,576, Weights Modified MIT. Footer: 'Prices per OpenAI and Moonshot AI; index and speed per Artificial Analysis.'

Durchsatz ist die Spezifikation, mit der niemand Schlagzeilen macht

Ein Modell mit 38,7 Tokens pro Sekunde und ein Modell mit 153,9 Tokens pro Sekunde sind nicht dasselbe Produkt mit unterschiedlichen Preisschildern. Es sind verschiedene Produkte.

Nehmen Sie eine Aufgabe, bei der das Modell eine Antwort mit 1.500 Tokens erzeugen muss – eine Zusammenfassung, eine strukturierte Extraktion, einen Code-Patch samt Erklärung. Bei 153,9 Tokens pro Sekunde dauert diese Antwort etwa zehn Sekunden. Bei 38,7 dauert sie etwa neununddreißig. Keine der beiden Zahlen enthält Denkzeit oder Netzwerklatenz, sodass die reale Lücke proportional größer als das Vierfache ist, nicht kleiner.

Jetzt stecken Sie das in eine Schleife. Ein Agent, der dreißig Modellaufrufe absolviert, um eine Aufgabe zu erledigen – planen, ein Tool auswählen, das Ergebnis lesen, den nächsten Schritt entscheiden, wiederholen –, erzeugt über diese Aufrufe hinweg vielleicht 15.000 Ausgabe-Tokens. GPT-6 Luna braucht etwa 97 Sekunden für die Generierung. Kimi K3 braucht etwa 388. Das ist der Unterschied zwischen einer Aufgabe, auf die ein Nutzer wartet, und einer Aufgabe, die ein Nutzer einplant, und keine noch so permissive Lizenzierung ändert daran etwas.

Die Ausführlichkeit verschärft das Geschwindigkeitsproblem, statt es auszugleichen. Kimi K3 generierte 160 Millionen Ausgabe-Tokens beim Abschluss des unabhängigen Index gegenüber 150 Millionen von GPT-6 Luna – in dieser Bewertung erzeugte das langsamere Modell also sogar etwas mehr Tokens, nicht weniger. Die beiden Modelle sind ähnlich ausführlich; sie sind einfach nicht ähnlich schnell, und bei einer nach Ausgabe bepreisten Karte ist Ausführlichkeit doppelt teuer.

Es lohnt sich, klar zu sagen, dass dies kein Defekt in Kimi K3 ist. Ein Modell mit 2,8 Billionen Parametern, von denen 104 Milliarden aktiv sind, verrichtet pro Token mehr Arbeit als ein Modell einer kleineren Klasse, und der Durchsatzwert ist ein Maß für diese Arbeit. Die entscheidende Frage ist, ob Ihre Arbeitslast diese Arbeit benötigt. Wenn ja, sind 38,7 Token pro Sekunde der Preis für die Leistungsfähigkeit. Wenn nicht, zahlen Sie dreißigfach für eine Abwägung, um die Sie nicht gebeten haben.

Wo K3s sieben Punkte zu Hause sind

Kimi K3 erreicht 44 Punkte auf dem unabhängigen Intelligence Index bei maximalem Aufwand. GPT-6 Luna erreicht 37 bei derselben Einstellung. Sieben Punkte, bei einer zusammengesetzten Kennzahl, bei der ein Punkt innerhalb des Rauschens eines erneuten Durchlaufs liegt – und die beiden trennen bei den Kosten pro abgeschlossener Aufgabe ungefähr das 28-Fache: 2,00 $ gegenüber etwa 0,07 $.

Diese sieben Punkte sind nicht gleichmäßig verteilt. Der Ruf von Kimi K3 konzentriert sich auf Coding und auf agentische Softwarearbeit, und das ist der Grund, warum es das Modell gibt: Im WebDev-Leaderboard von Code Arena steht es mit 1.679 Elo an erster Stelle, und der Terminal-Bench-2.0-Wert des Anbieters von 88,3 % ist eine Coding-Agent-Messung. Die eigene Coding-Position von GPT-6 Luna ist eher ein Schritt zurück als nach vorn – sein Coding Agent Index liegt bei 41, zwei Punkte unter dem GPT-5.6 Luna, den es ersetzt, wobei die Rückgänge sich auf SWE-Atlas-QnA und DeepSWE v1.1 konzentrieren. Wenn Ihre Arbeit darin besteht, dass ein Agent Software gegen ein echtes Repository schreibt, dann sind das eine Sieben-Punkte-Lücke im Index und eine generationsbedingte Regression von zwei Punkten, die in dieselbe Richtung weisen, und das Argument für die günstige Stufe wird deutlich schwächer.

Dort, wo die sieben Punkte nicht liegen, liegt die Art von Arbeit, für die GPT-6 Luna bepreist ist. Klassifizierung, Extraktion, Routing, Massen-Zusammenfassung, die innere Schleife eines Agenten, der ein schnelles Ja oder Nein braucht – bei diesen Aufgaben werden die beiden Modelle in der überwiegenden Mehrheit der Fälle dieselbe brauchbare Ausgabe erzeugen, und der Unterschied wird den Kontakt mit Ihrem eigenen Eval-Set nicht überleben. Der Index misst eine zusammengesetzte Kennzahl, die Long-Horizon-Reasoning und Coding stark gewichtet, und keines von beiden ist das, was eine Routing-Entscheidung erfordert.

Ein Vorbehalt, den man den Indexzahlen auf beiden Seiten mitgeben sollte: Dieses Board ist eine rollierende Bewertung, und seine Revision spielt eine Rolle. Frühere Momentaufnahmen desselben Leaderboards platzierten Kimi K3 deutlich höher als die 44, die unsere heutige Erfassung zeigt, weil sich der Composite-Index, der Harness und das Modellset allesamt verändern. Jeder Vergleich, der sich auf den genauen Abstand zwischen zwei Modellen in einem rollierenden Index stützt, stützt sich auf etwas, das nicht stillhalten wird. Die ehrliche Lesart ist, dass diese beiden an ihren Obergrenzen in benachbarten Fähigkeitsbändern liegen und dass der Index Ihnen nicht sagen kann, welches für Ihre Aufgabe besser ist.

Die Ausnahme: Was Ihnen Modified MIT tatsächlich bringt

Kimi K3s Lizenz ist die eine Dimension, in der GPT-6 Luna zu keinem Preis eine Antwort hat, und sie verdient mehr Präzision, als der Ausdruck „offene Gewichte“ üblicherweise erhält.

Die Gewichte sind öffentlich auf Hugging Face, und die Lizenz ist Modified MIT, nicht MIT. Dieser Unterschied ist wichtig: Eine Modified-MIT-Lizenz bringt typischerweise Bedingungen mit sich – häufig die Anforderung, eine Namensnennung anzuzeigen, wenn das Modell in einem Produkt oberhalb einer bestimmten Größenordnung eingesetzt wird – und wer plant, ein kommerzielles Produkt auf den Gewichten aufzubauen, sollte das tatsächliche Rechtsinstrument lesen statt den Namen der Familie, dem es ähnelt. Das ist kein Grund, es zu meiden. Es ist ein Grund, es in einem Beschaffungsdokument nicht als MIT zu bezeichnen.

Was der Download bringt, ist real und begrenzt. Er verschafft eine Untergrenze bei den Kosten, insofern als eine feste GPU-Kapazität bei ausreichendem Volumen eine verbrauchsabhängige Rechnung unterbieten kann. Er verschafft Unabhängigkeit von der Roadmap eines Anbieters – ein Modell, das Sie selbst hosten, kann Ihnen nicht unter den Füßen weg abgekündigt werden. Er verschafft die Möglichkeit, auf Ihrer eigenen Verteilung feinabzustimmen. Und er verschafft die Option, Prompts innerhalb Ihrer eigenen Grenze zu halten, was für manche Teams den Vergleich beendet, bevor der Preis überhaupt erwähnt wird.

Der Kostenfaktor ist die Hardware. Ein Mixture-of-Experts-Modell mit 2,8 Billionen Parametern und 104 Milliarden aktiven Parametern ist kein Modell, das auf einer Workstation läuft. Es mit Produktionsdurchsatz zu betreiben, ist eine Verpflichtung im Cluster-Maßstab mit Kapitalkosten, Betriebskosten und einem Latenzprofil, das Sie besitzen, statt es zu mieten. Das ist kein Argument gegen das Self-Hosting von Kimi K3 – es ist ein Argument dafür, dass der richtige Vergleich nicht 15,00 $ pro Million Ausgabe-Tokens gegenüber 0,00 $ ist, sondern 15,00 $ pro Million Ausgabe-Tokens gegenüber Vollkosten pro Token, die die Siliziumkosten und das Personal einschließen. Für eine kleine Zahl von Organisationen ist diese Zahl niedriger. Für die meisten ist sie es nicht, und der Break-even-Punkt liegt weiter entfernt, als es die Lizenz vermuten lässt.

Einen von ihnen ausführen, oder beide

Kimi K3 ist bei OrcaRouter zum Listenpreis von Moonshot verfügbar, unter der durchgereichten Preisgestaltung, was bedeutet, dass eine Änderung der Anbietertarife am selben Tag bei uns aktiv ist. Automatisches Failover ist der Teil, der seinen Platz besonders bei diesem Modell verdient: Ein selbstgehosteter oder von Drittanbietern bereitgestellter Kimi-K3-Endpunkt, dessen Leistung nachlässt, ist genau das Szenario, in dem Sie die Route ohne ein Deployment verlegen möchten, und ein Modell mit 38,7 Token pro Sekunde hat weniger Spielraum, einen langsamen Upstream aufzufangen, als ein schnelles Modell.

GPT-6 Luna ist zum Zeitpunkt dieses Textes nicht in unserem Katalog und wird über OpenAIs eigene API erreicht, daher betreibt ein Team, das beide möchte, einen Schlüssel für Kimi K3 neben dem, was es bereits für OpenAI verwendet. Dies ist auch die Paarung, bei der die Routing-DSL etwas tut, was ein fest verdrahteter Split nicht kann: Eine Regel, die Coding- und längerfristige Arbeit an Kimi K3 sendet und alles programmkonsumierte und kurze an GPT-6 Luna, drückt eine Grenze aus, die sich jedes Mal verschiebt, wenn einer der Anbieter etwas ausliefert, und sie verschiebt sich als Konfiguration statt als Codepfad. Modellfusion ist die andere Konfiguration, die hier erwähnenswert ist – ein Gremium aus einem langsamen, sorgfältigen Modell und einem schnellen, günstigen Modell, die gemeinsam antworten, wobei das günstige Mitglied das Volumen bewältigt und das teure die Fälle entscheidet, die zählen, ist eine Form, zu der dieses Modellpaar ungewöhnlich gut passt, weil die Kostenasymmetrie zwischen ihnen groß genug ist, dass es erschwinglich ist, einen Kimi-K3-Aufruf für einen kleinen Bruchteil des Verkehrs auszugeben.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

Welches, und wann

Nehmen Sie GPT-6 Luna, wenn Ihr Workload hochvolumig, von Programmen konsumiert und latenzempfindlich ist. Klassifikation, Extraktion, Routing, Massenzusammenfassung, die innere Schleife eines Agenten. Bei $0.10/$0.50 mit einem gecachten Lesevorgang für einen Cent und dem vierfachen Durchsatz von Kimi K3 ist die Rechnung eindeutig und der Latenzunterschied nicht marginal. Setzen Sie den Effort-Parameter explizit, denn der Standardwert ist medium und die Schlagzeilen-Zahl 37 ist ein Maximum-Effort-Wert, und halten Sie lange Aufrufe auf der richtigen Seite der 272.000-Token-Grenze.

Nimm Kimi K3, wenn du die Gewichte brauchst, wenn deine Arbeit agentisches Coding gegen ein echtes Repository ist, bei dem seine WebDev-Position und die vom Anbieter gemeldeten 88,3 % auf Terminal-Bench 2.0 die entscheidenden Belege sind, wenn du eine Obergrenze für die Ausgabe über 128.000 Tokens benötigst oder wenn deine Organisation keine Prompts an einen geschlossenen Endpunkt senden darf. Akzeptiere 38,7 Tokens pro Sekunde als Teil des Deals und lies die Bedingungen der Modified MIT, statt sie einfach anzunehmen.

Der Fehler, zu dem dieser Vergleich verleitet, besteht darin, die dreißigfache Rate als Antwort auf eine Frage nach der Leistungsfähigkeit zu behandeln. Sie ist die Antwort auf eine Frage nach Tokens. Die Frage nach der Leistungsfähigkeit entscheidet sich daran, ob man die Gewichte oder die Geschwindigkeit braucht, und diese beiden Antworten weisen in entgegengesetzte Richtungen.

Screenshot of the OrcaRouter model page for Kimi K3 showing the breadcrumb Home > Models > MoonshotAI > Kimi K3, a FEATURED badge, the model id kimi/kimi-k3, Vision, Tools, JSON and Reasoning chips, a MoonshotAI attribution dated 2026-07-15, the description of a 2.8-trillion-parameter mixture-of-experts model with a 1M-token context window, input pricing of $3.00 and output of $15.00 per 1M tokens, a p50 time to first token of 8.11s, a p95 of 10.00s, and traffic of 1163.7M tokens over seven days.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert