
GPT-6 vs. Kimi K3: Zwei Millionen-Token-Modelle, die sich unterschiedlich spezialisieren
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
GPT-6 Sol und Kimi K3 sind die beiden Modelle, die am wahrscheinlichsten für dieselbe Aufgabe in die engere Wahl kommen: ein Kontextfenster mit einer Million Tokens, Bildeingabe und ein Preis, der lange Dokumente bezahlbar macht. Sie haben es aus entgegengesetzten Richtungen dorthin geschafft. Kimi K3 ist der Langkontext-Spezialist von MoonshotAI, veröffentlicht am 15. Juli 2026, und seine Modellkarte ist auf Recall ausgerichtet — es erzielt 88,7 % im Langkontext-Recall-Test von Artificial Analysis und liegt damit vor jedem Modell des Anbieters, das wir zum Vergleich heranziehen können. GPT-6 Sol ist der Mittelklasse-Generalist des Anbieters, veröffentlicht am 22. September 2026 für 2,00 $ pro Million Eingabe-Tokens und 10,00 $ pro Million Ausgabe-Tokens, und sein Argument ist die Breite: ein etwas größeres Fenster, ein höherer zusammengesetzter Wert für allgemeines Reasoning und ein günstigeres Ausgabe-Token.
Die ehrliche Einordnung lautet also nicht besser versus schlechter. Es geht um Abruf versus Schlussfolgern, und entschieden wird das dadurch, was man mit der Million Tokens macht, sobald man sie geladen hat.
Die Fenster sind auf dem Papier gleich groß.
Beide Karten nennen grob eine Million Tokens, und der Unterschied ist kosmetisch. Das Fenster von Kimi K3 umfasst 1.048.576 Tokens – genau 2^20, die binäre Million, die jedes Long-Context-Modell angibt. Das von GPT-6 Sol umfasst 1.050.000, eine runde Dezimalzahl, etwa 1.400 Tokens größer. Für jede Arbeitslast, die man tatsächlich unterbringen kann, sind das dieselben Fenster. Entscheide dich nicht deswegen.
Was sich unterscheidet, ist der Rest des Umschlags, und das ist eine kurze Liste.
• Kontext: Kimi K3 1.048.576 Tokens, GPT-6 Sol 1.050.000 – praktisch gleichauf
• Eingabemodalität: Kimi K3 akzeptiert Text und Bilder; GPT-6 Sol akzeptiert Text, Bilder und Dateien
• Ausgabeobergrenze: GPT-6 Sol 128.000 Tokens pro Antwort; das Datenblatt von Kimi K3 veröffentlicht keine maximale Ausgabegröße
• Standardpreis: Kimi K3 3,00 $ Eingabe / 15,00 $ Ausgabe pro Million, GPT-6 Sol 2,00 $ Eingabe / 10,00 $ Ausgabe
• Zwischengespeicherte Eingabe: Kimi K3 0,30 $ pro Million, GPT-6 Sol 0,20 $ pro Million
• Preis für langen Kontext: Kimi K3 nennt einen einzigen Tarif ohne dokumentierte Staffel; GPT-6 Sol berechnet die gesamte Anfrage oberhalb von 272.000 Eingabe-Tokens neu mit 4,00 $ Eingabe / 15,00 $ Ausgabe
• Reasoning-Steuerung: GPT-6 Sol bietet ein konfigurierbares reasoning.effort; Kimi K3 bietet Parameter für Reasoning und Reasoning-Aufwand über dieselbe OpenAI-kompatible Oberfläche
Die fehlende Ausgabeobergrenze bei Kimi K3 sollte man eher benennen als überspielen: MoonshotAI veröffentlicht eine Kontextangabe, aber keine Angabe zur maximalen Ausgabe, weshalb ein System, das für die Budgetierung auf eine harte Ausgabengrenze angewiesen ist, diese nicht einfach von der Karte ablesen kann. Die Long-Context-Stufe ist die andere Asymmetrie, und sie wirkt in eine kontraintuitive Richtung — der Listenpreis von GPT-6 Sol ist niedriger, doch seine Neubepreisung der gesamten Anfrage oberhalb von 272K bedeutet, dass ein Aufruf mit 300.000 Token ab dem ersten Token mit $4.00 / $15.00 abgerechnet wird, während für den einheitlichen Satz von Kimi K3 von $3.00 / $15.00 überhaupt keine Staffelung dokumentiert ist. Bei einem sehr langen Dokument kann Kimi K3 trotz des höheren Listenpreises bei der Eingabe am Ende der günstigere der beiden sein.
Recall ist das eigentliche Produkt von Kimi K3.
Der Grund, zu Kimi K3 zu greifen, ist nicht, dass es ein großes Kontextfenster hat – das haben mehrere Modelle. Der Grund ist, dass es behält, was darin steht. In der Long-Context-Recall-Evaluierung von Artificial Analysis, die im Modellkatalog enthalten ist, erzielt Kimi K3 88,7 % gegenüber 83,7 % für GPT-6 Sol. Das ist ein Abstand von fünf Punkten in genau dem Test, der misst, ob ein Modell ein Detail finden und nutzen kann, das tief in einer langen Eingabe vergraben ist, und es ist die Art von Lücke, die sich in der Produktion als echte Ausfälle zeigt – die Zusammenfassungsfunktion, die die Klausel auf Seite 400 auslässt, die Vertragsprüfung, die den Freistellungsabschnitt übersieht.
Kimi K3 führt auch beim Coding – und das mit einem größeren Vorsprung, als der zusammengesetzte Index vermuten lässt. Im Coding-Index liegt es bei 76,2 und belegt einen Rang innerhalb der Top Ten der bewerteten Modelle, und es erzielt 85,0 % auf terminal-bench v2.1 – dem agentischen Kommandozeilen-Benchmark, von dem der Nutzen eines Coding-Agenten abhängt. Sein GPQA-Diamond-Wert von 93,5 % liegt in der Spitzengruppe des Rankings.
Wo GPT-6 Sol kontert, ist bei den zusammengesetzten Benchmarks und beim wissenschaftlichen Code. Sein Index für allgemeine Intelligenz, 47,6, liegt vier Punkte vor Kimi K3s 43,6 und nahe am obersten Zehntel; bei SciCode liegen beide gleichauf, mit 57,6 % bzw. 59,5 %, was innerhalb der Schwankungsbreite eines einzelnen Durchlaufs liegt; und bei Humanity's Last Exam liegt GPT-6 Sol mit 47,9 % knapp vor Kimi K3s 46,9 %. Keiner dieser Unterschiede in einem einzelnen Benchmark ist groß genug, um allein darauf eine Entscheidung zu stützen.

Kosten nach Workload, nicht nach Preisliste
Preislisten führen in die Irre, weil das Verhältnis von Eingabe- zu Ausgabe-Tokens bei jedem Auftrag anders ist und diese beiden Modelle sich uneinig darüber sind, welche Seite des Geschäfts günstiger ist. Kimi K3 ist günstiger unter der Annahme, dass Ihre Arbeit überwiegend aus Eingaben besteht – lange Dokumente hinein, kurze Antworten hinaus. GPT-6 Sol ist günstiger unter der Annahme, dass Ihre Arbeit ausgewogen oder ausgabelastig ist, weil sein Ausgabetarif um ein Drittel niedriger ist.
• Szenario „Ein Buch lesen und zusammenfassen“ (900K Eingabe, 4K Ausgabe): Kimi K3 ≈ 2,76 $, GPT-6 Sol ≈ 3,64 $, bevor die 272K-Preisanpassung greift; mit der Preisanpassung wechselt der gesamte Aufruf von GPT-6 Sol in die höhere Tarifstufe und die Lücke wird größer
• Ausgewogenes agentisches Szenario (60K Eingabe, 20K Ausgabe): Kimi K3 ≈ 0,48 $, GPT-6 Sol ≈ 0,32 $
• Codegenerierungs-Szenario (30K Eingabe, 60K Ausgabe): Kimi K3 ≈ 0,99 $, GPT-6 Sol ≈ 0,66 $
Das sind reine Token-Berechnungen auf Basis der veröffentlichten Preise des jeweiligen Anbieters und schließen gecachten Input aus, was dem Modell zugutekommt, bei dem man am meisten cachet. Entscheidend ist die Form der Antwort: Bei reiner Long-Input-Recall-Arbeit gewinnt der Pauschaltarif von Kimi K3, und bei allem, das viel zurückliefert, gewinnt der niedrigere Output-Tarif von GPT-6 Sol. Keines von beiden ist universell günstiger, und ein Vergleich, der einen Preissieger kürt, ohne das Token-Verhältnis zu nennen, misst nichts.
Die Herkunft ist Teil der Entscheidung
Kimi K3 wird von MoonshotAI entwickelt, einem chinesischen Labor, und GPT-6 Sol von OpenAI. Dieser Unterschied ist kein Benchmark und er erscheint auch nicht auf einer Preiskarte, aber bei regulierten Workloads entscheidet er über die Shortlist, bevor überhaupt über den Preis gesprochen wird. Die Karte von MoonshotAI im Katalog weist kein Lizenzfeld aus, daher sollte hier nichts als Aussage über die Verfügbarkeit der Gewichte in die eine oder andere Richtung gelesen werden — wenn offene Gewichte für dein Deployment von Bedeutung sind, überprüfe das an der Quelle, statt es aufgrund des Familiennamens anzunehmen.
Für Teams, die beides brauchen – ein Modell aus einem chinesischen Labor für einen Teil einer Pipeline und ein OpenAI-Modell für einen anderen, wobei Routing, Abrechnung und Datenresidenz an einer Stelle geregelt werden –, genau das ist der Grund, warum sich ein einziges Gateway lohnt statt zwei Sätze von Zugangsdaten. Auf OrcaRouter sind sowohl kimi/kimi-k3 als auch GPT-6 Sol live verfügbare Routen im selben Katalog, zum Listenpreis des Anbieters mit 0 % Aufschlag, sodass eine Preisänderung von MoonshotAI oder OpenAI noch am selben Tag aktiv ist. Automatisches Failover bedeutet, dass eine beeinträchtigte Route bei einem der beiden Anbieter die Pipeline nicht lahmlegt, und mit der Routing-DSL können Sie Recall-lastige Arbeit per Regel statt per Vermutung an Kimi K3 und generierungslastige Arbeit an GPT-6 Sol schicken.

Welche soll in die Pipeline aufgenommen werden?
Wählen Sie Kimi K3, wenn es um Retrieval und Retention über sehr lange Eingaben geht – Überprüfung juristischer und medizinischer Dokumente, Codeverständnis über ein gesamtes Repository, Transkriptanalyse über Hunderte von Dokumenten hinweg – und wenn Ihre Prompts so eingabelastig sind, dass der Pauschalpreis von 3,00 $ die Neupreisgestaltung von GPT-6 Sol schlägt. Sein Recall-Vorsprung und sein Top-Ten-Rang beim Programmieren sind die beiden Zahlen, die diese Wahl rechtfertigen.
Wählen Sie GPT-6 Sol, wenn es sich bei der Aufgabe um einen Allzweckassistenten handelt, der auf ein Kontextfenster von einer Million Token zurückgreifen kann: gemischtes Reasoning, Serialisierung nach JSON, agentische Schleifen, die viel zurückschreiben, und jeder Workflow, bei dem eine Obergrenze von 128.000 Token für die Ausgabe ein Vorteil statt einer Einschränkung ist. Es ist günstiger bei der Ausgabe, bietet eine explizite Steuerung des Reasoning-Aufwands und sein zusammengesetzter Index ist das stärkere allgemeine Signal. Wenn eine Pipeline tatsächlich beides leistet, ist die ehrliche Antwort, zu routen statt sich zu entscheiden – was eine Aussage über die Form Ihres Datenverkehrs ist, nicht über eines der beiden Modelle.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
