Eine generierte Hero-Karte mit dem Titel 'Dots vs Kimi K3' und dem Untertitel 'Die eine liest die gesamte Bibliothek, die andere geht hin und findet es'. Eine vertikale Linie teilt die Karte: Das linke Panel, beschriftet mit 'Dots', zeigt 'agiert in 4.000+ Apps – Kontingent nicht veröffentlicht'; das rechte, beschriftet mit 'Kimi K3', zeigt '1 Mio. Kontext – Long-Context-Recall 88,7 – 3,00 $ / 15,00 $'. Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Dots vs. Kimi K3: Der eine liest die ganze Bibliothek, der andere geht hin und findet sie.

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Es gibt eine bestimmte Art von Aufgabe, die nur eine dieser beiden erledigen kann, und es lohnt sich, sie vor allem anderen zu benennen. Kimi K3, veröffentlicht von Moonshot AI am 15. Juli 2026, ist ein Mixture-of-Experts-Modell mit 2,8 Billionen Parametern und einem Kontextfenster von 1.048.576 Tokens, das Text und Bilder annimmt und Text zurückgibt, mit einem Preis von 3,00 US-Dollar pro Million Eingabe-Tokens und 15,00 US-Dollar pro Million Ausgabe-Tokens, wobei gecachte Lesevorgänge 0,30 US-Dollar kosten. Dots ist der Always-on-Agent des Unternehmens, vorgestellt auf dem DevDay am 29. September 2026, mit eigenem Cloud-Computer und Browser, Konnektoren zu mehr als 4.000 Apps und einem Platz in ChatGPT, Slack und Teams; er läuft auf GPT-6 Astra und ist in Pro und Business Premium enthalten. K3 kann ein ganzes Archiv in einer einzigen Anfrage fassen und Fragen dazu beantworten. Ein Dot kann losziehen und das nächste Dokument holen, an das Sie noch nicht gedacht haben. Lesen und Abrufen sind unterschiedliche Aufgaben, und die falsche zu wählen ist der teure Fehler.

Die Zahl, die Kimi K3 uneingeschränkt besitzt

Langkontext-Rückruf ist die Messgröße, die Marketing von Leistungsfähigkeit trennt, denn ein großes Kontextfenster ist schnell behauptet und schwer zu nutzen. K3 erzielt dabei 88,7 – der höchste Wert aller Modelle, die wir führen, über GPT-5.6 Sol mit 84, MiniMax M3 mit 83 und Gemini 3.1 Pro mit 82. Außerdem erreicht es 93,5 auf GPQA Diamond und 59,5 auf SciCode und weist einen Artificial Analysis Coding Index von 76,2 auf, womit es unter 138 gemessenen Modellen auf Platz neun liegt, sowie einen Intelligence Index von 43,6 auf Platz neunzehn von 145. Das sind alles Drittanbieter-Zahlen, die in unserem Katalog mit angegebenen Quellen geführt werden, statt aus einem Launch-Post wiederholt zu werden.

Was man damit gewinnt, ist eine Klasse von Aufgaben, die sich schlicht nicht zerlegen lässt: eine ganze Codebasis lesen, bevor man eine Frage dazu beantwortet, ein Jahr Verträge mit einer neuen Vorlage abgleichen oder eine lange agentische Sitzung halten, ohne dass die Mitte davon aus dem Gedächtnis fällt. K3 ist genau dafür gebaut – Moonshot positioniert es für Programmier-Agenten und langfristige Wissensarbeit – und es ist ungewöhnlich, dass es Sampling-Parameter gänzlich verweigert. Es gibt keine Temperatur, kein top_p, keinen Seed; die Denktiefe ist ein einziger Regler namens reasoning_effort. Das ist ein bewusster Kompromiss: weniger Stellschrauben, mehr Konsistenz über eine lange Sitzung.

A screenshot of the OrcaRouter model page for Kimi K3, showing the identifier 'kimi/kimi-k3' with Vision, Tools, JSON and Reasoning badges, a publication date of 2026-07-15, a description of it as Moonshot AI's flagship 2.8-trillion-parameter MoE with a 1M-token context window and native visual understanding, a side panel reading 1M tokens of context over text and image input, and a price strip reading $3.00 and $15.00 with a p50 time to first token of 8.82 seconds and a seven-day traffic figure of 831.3M tokens.

Wofür ein Punkt gut ist, ohne Marketing formuliert

Ein Dot ist ein Arbeiter mit einem Kalender. Seine Eingaben sind alltäglich – deine Nachrichten, deine App-Daten, eine Aufgabe, die du in einem Satz beschrieben hast – und seine Ausgabe ist eine Veränderung an anderer Stelle: eine verschobene Datei, ein aktualisiertes Ticket, eine Nachricht, die entworfen und nach deiner Freigabe gesendet wird, eine Seite, die in seinem eigenen Browser geöffnet wird. Die Launch-Materialien von OpenAI beschreiben einen, der mehrere Projekte gleichzeitig voranbringt und aus Feedback lernt, und die ehrliche Lesart ist, dass du das Bindegewebe kaufst, nicht die Intelligenz.

Das verbindende Gewebe ist der teure Teil beim Aufbau. Ein Browser, der sich wie der eines Menschen verhält, von den App-Anbietern gepflegte Konnektoren, eine Aktivitätsansicht, Freigabe-Gates, Isolation von deinem eigenen Rechner – nichts davon ist prinzipiell schwierig, und alles davon ist in der Praxis mühsam. Dafür zahlt das Abonnement. Wofür es nicht zahlt, ist Messbarkeit.

• Kosten — enthalten bei Pro oder Business Premium, Kontingent nicht veröffentlicht (Dots) gegenüber 3,00 $ pro Million Eingabe-Tokens und 15,00 $ pro Million Ausgabe-Tokens, Cache-Lesevorgänge 0,30 $ (Kimi K3)

• Obergrenze pro Anfrage – nicht einmal ansatzweise dokumentiert, gegenüber 1.048.576 Tokens Kontext und einer mobilfreundlichen 88,7 beim Long-Context-Recall (Kimi K3)

• Eingabe und Ausgabe — Nachrichten und Daten verbundener Apps hinein, Änderungen innerhalb anderer Software hinaus (Dots) gegenüber Text und Bild hinein, Text hinaus (Kimi K3)

• Sampling-Steuerung — nichts veröffentlicht (Dots) gegenüber keiner Temperatur, keinem top_p und keinem Seed, wobei die Reasoning-Tiefe durch reasoning_effort allein (Kimi K3)

• Geschwindigkeit, die Sie erwarten sollten — für einen Punkt undokumentiert, gegenüber einem Median von 8,82 Sekunden bis zum ersten Token und etwa 39 Ausgabe-Token pro Sekunde in unserer eigenen Sieben-Tage-Messung (Kimi K3)

• Unabhängige Belege — Anbieter-Demos und Fähigkeitsaussagen, kein Benchmark (Dots) gegenüber AA Coding Index 76,2 auf Platz neun von 138, GPQA Diamond 93,5, Langkontext-Recall 88,7 (Kimi K3)

Das, was niemand über den Kauf eines Agenten erwähnt

Ein Abonnement mit einem nicht veröffentlichten Kontingent hat eine Eigenschaft, die eine Preisliste nicht hat: Man kann nicht unterscheiden, ob eine Aufgabe günstig oder teuer war. Jeder Auftrag kostet gleich viel – nichts ist marginal – bis genau zu dem Moment, in dem das nicht mehr der Fall ist, und dann kommt die Antwort als Limit und nicht als Rechnung. Für ein Team, dessen Arbeit explorativ ist, ist das ein Feature. Für ein Team, das Kosten einem Projekt zuordnen muss, ist es eine Lücke in der Buchhaltung.

Hinzu kommt ein Effekt zweiter Ordnung. Wenn die Grenzkosten eines Aufrufs unsichtbar sind, hört man auf zu fragen, ob der Aufruf notwendig war, und die günstigste Optimierung in jeder Pipeline – die Anfrage gar nicht erst zu stellen – steht einem nicht mehr zur Verfügung. Ein nutzungsabhängig abgerechnetes Modell erzwingt diese Frage jedes Mal, wenn jemand die Preisliste liest.

A generated scoreboard titled 'Dots vs Kimi K3 - what each one measures', with two columns. The left column, 'Dots', lists: price included with Pro or Business Premium; allowance not published; cost per task not published; model GPT-6 Astra (vendor-stated); computer its own cloud computer and browser; independent benchmark none. The right column, 'Kimi K3', lists: context 1,048,576 tokens; input text and image; price $3.00 in / $15.00 out per 1M; cached reads $0.30 per 1M; architecture 2.8T total MoE; long-context recall 88.7. A footer reads 'Dots details vendor-stated from OpenAI's DevDay launch; Kimi K3 figures from independent listings as carried in the OrcaRouter catalogue.'

Sie zu komponieren, ohne vorzugeben, dass sie Alternativen sind

Die Form, die funktioniert, ist ein Punkt, der bemerkt, und ein Langkontext-Modell, das liest. Arbeit kommt an – ein Dokument in einem geteilten Laufwerk, eine Nachricht in einem Thread – und der Punkt entscheidet, ob sie von Bedeutung ist. Wenn ja, geht das Dokument zusammen mit allem anderen, was es brauchen könnte, angehängt, in einer einzigen Anfrage an Kimi K3, und die Antwort kommt vollständig in der Quelle verankert zurück statt in einer Zusammenfassung der Quelle. Der Punkt übernimmt das Nachhaken und die langweilige Logistik; das Modell übernimmt das Lesen, in einem Umfang, den keine Schleife aus kleinen Aufrufen korrekt zusammengesetzt hätte.

Kimi K3 wird auf OrcaRouter als kimi/kimi-k3 zu Moonshots Listenpreis ohne Aufschlag weitergeleitet und steht in demselben Katalog wie über 200 weitere Modelle hinter einem einzigen Schlüssel, mit automatischem Failover über die Upstream-Anbieter hinweg, wenn einer ausfällt, und einer Routing-DSL, mit der sich mehrere Modelle zu einem einzigen Aufruf zusammenfassen lassen. Das ist die abgerechnete Hälfte der Pipeline und nichts weiter: dots sind nicht im Katalog, es gibt keinen Endpunkt dafür, und es existiert keine Kennung, mit der sich eine Anfrage darauf richten ließe. Wenn die Leseschicht der Teil ist, den Sie kontrollieren müssen – und für alles, was Sie ein Jahr lang betreiben wollen, ist sie das in der Regel –, dann ist das die Schicht, die Sie besitzen sollten.

Welcher Kauf verschwendet Geld?

Einen dot zu kaufen, um ein großes Korpus zu lesen, ist Verschwendung, weil der dot es abruft und zusammenfasst, statt das Ganze zu behalten, und die Zusammenfassung ist der Ort, an dem das Detail, das man brauchte, stirbt. Kimi K3 zu kaufen, um ein Projekt über fünf Anwendungen hinweg zu verfolgen, ist aus dem spiegelbildlichen Grund Verschwendung: Ein Modell, das antwortet, wenn man es ruft, ruft einen nicht.

Wenn die Aufgabe Abruf und Logistik ist, miete den Arbeiter. Wenn die Aufgabe Verständnis in großem Maßstab ist, kaufe den Zähler und gib ihm alles auf einmal. Die beiden überschneiden sich weit weniger, als das Wort „agentic“ nahelegt, und die Überschneidung ist nicht dort, wo eine von beiden gut ist.

A screenshot of the OrcaRouter model catalogue page headed 'Models', showing the line '206 models · 16 providers · one API key, one bill' above filter controls for input modalities, context length, input price, status and supported parameters, with a grid of model cards visible beneath.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert