Hero-Karte mit dem Titel Claude Sonnet 5.5 vs. Kimi K3, mit dem Untertitel Keines der Modelle akzeptiert deine Temperature-Einstellung, mit Pills mit der Aufschrift $2 / $10 geschlossen vs. $3 / $15 offene Gewichte, Index 56 vs. 44 und keines akzeptiert Temperatur, sowie einer Fußzeile mit Verweis auf Artificial Analysis v4.3.2 und Anbieterpreise.
Guides & Insights

Claude Sonnet 5.5 vs. Kimi K3: Keines der Modelle übernimmt Ihre Temperatureinstellung

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Hier ist ein Vergleich, bei dem die beiden Modelle in einem Punkt übereinstimmen, der Ihren Code so oder so brechen wird. Claude Sonnet 5.5, veröffentlicht am 28. September 2026, lehnt jede Anfrage, die temperature, top_p oder top_k auf einen Nicht-Standardwert setzt, mit einem 400-Fehler ab. Kimi K3, seit Mitte Juli 2026 allgemein verfügbar bei Moonshot AI, akzeptiert überhaupt keine Sampling-Parameter — weder temperature noch top_p noch seed — und legt die Reasoning-Tiefe nur über eine reasoning_effort-Steuerung offen. Zwei verschiedene Labore, zwei verschiedene Architekturen, ein gemeinsames Fazit: Die Sampling-Regler, die die meisten Integrationen noch aus Gewohnheit setzen, gibt es bei beiden nicht mehr.

Das ist nicht der Vergleich, über den alle schreiben. Der Vergleich, über den alle schreiben, ist der Preis: Kimi K3 mit 3 $ pro Million Eingabe-Tokens und 15 $ für Ausgabe gegenüber Claude Sonnet 5.5 mit 2 $ und 10 $, was auf der Preisliste ein klarer Sieg für Anthropic ist. Aber Kimi K3 ist ein Open-Weight-Mixture-of-Experts-Modell mit 2,8 Billionen Parametern, das man herunterladen und innerhalb der eigenen Grenzen betreiben kann, und Claude Sonnet 5.5 ist ein geschlossenes Modell, das auf vier Clouds verfügbar ist. Zwischen einem günstigeren geschlossenen Modell und einem teureren herunterladbaren Modell wird die Entscheidung überhaupt nicht anhand des Preises pro Token getroffen.

Was jedes Einzelne ist, jeweils in einem Absatz.

Claude Sonnet 5.5 ist das zweite Modell in Anthropics 5.5-Generation und folgte fünf Tage nach jenem Start mit Claude Opus 5.5 in die Claude API. Es erscheint als claude-sonnet-5-5 in der Claude API, bei Amazon Bedrock, Google Cloud und Microsoft Foundry, behält ein Kontextfenster von 1 Mio. Token und eine synchrone Ausgabegrenze von 128K und übernimmt die Preisgestaltung von Claude Sonnet 5 exakt: 2 $ Eingabe, 10 $ Ausgabe, 0,20 $ pro Million für Cache-Lesevorgänge. Adaptives Denken ist standardmäßig aktiviert bei high Effort. Es ist mit Null-Datenaufbewahrung verfügbar, und Artificial Analysis gibt ihm einen Intelligence Index von 56 in der Revision v4.3.2 – Platz drei der 216 Modelle, die es misst.

Two-column scoreboard for Claude Sonnet 5.5 and Kimi K3 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, closed weights on four clouds. Right column Kimi K3: input $3.00 per million, output $15.00 per million, 1M-token context, AA Intelligence Index 44, cost per Index task $2.00, open weights under the Kimi K3 License. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Kimi K3 ist das Flaggschiff von Moonshot AI: ein Mixture-of-Experts-Modell mit 2,8 Billionen Parametern, das pro Token rund 104 Milliarden Parameter aktiviert, mit einem Kontextfenster von 1 Mio. Token und nativem visuellen Verständnis. Es ist auf langfristiges Coding und mehrstufige Wissensarbeit ausgelegt, und Moonshot positioniert es namentlich für Programmier-Agent-Harnesse. Es spricht das OpenAI-API-Format, stellt reasoning_effort als seine einzige Reasoning-Steuerung bereit und liegt unter der Kimi-K3-Lizenz als Open-Weight vor – was nicht dasselbe ist wie Open Source, und genau dieser Unterschied ist der Teil, den man lesen sollte, bevor man darauf aufbaut.

Die Tarifkarte und die Zahl darunter

Vergleiche die beiden anhand der Dimensionen, die über ein Gesetz entscheiden, nicht über eine Schlagzeile:

• Input-Preis — Claude Sonnet 5.5 2 $ pro Million vs. Kimi K3 3 $ pro Million

Ausgabepreis — Claude Sonnet 5.5 10 $ pro Million vs. Kimi K3 15 $ pro Million

• Cache-Lesevorgänge — 0,20 $ pro Million vs. 0,30 $ pro Million

• Kontextfenster — 1.000.000 Token vs. 1.048.576 Token

• Gewichte — proprietär, vier gehostete Plattformen vs. Open-Weight unter der Kimi-K3-Lizenz

• Intelligenz-Index — Claude Sonnet 5.5 56 vs. Kimi K3 44 auf derselben v4.3.2-Revision

• Kosten pro Intelligence-Index-Aufgabe — Claude Sonnet 5.5 7,60 $ vs. Kimi K3 2,00 $

• Ausführlichkeit im Index — Claude Sonnet 5.5 410 Mio. Ausgabe-Tokens vs. Kimi K3 160 Mio.

Das letzte Paar ist die Umkehrung, bei der es sich lohnt zu verweilen. Anthropics Modell ist beim Input 50 % günstiger und beim Output ein Drittel günstiger und kostet trotzdem 3,8-mal so viel, um dieselbe Evaluation abzuschließen, weil es 2,6-mal so viele Tokens verbraucht, um dorthin zu gelangen. Beim zusammengesetzten Wert erzielt es außerdem zwölf Punkte mehr, das ist also kein Fall, in dem ein verschwenderisches Modell nichts dafür bekommt. Es ist ein Fall von zwei Modellen, deren Kostenverhalten sich nicht durch das Lesen zweier Preislisten vergleichen lässt, weshalb die Index-Aufgaben-Kennzahl existiert.

Keine dieser beiden Token-Zahlen wird Ihre Token-Zahl sein. Moonshots eigene Dokumentation merkt an, dass die Reasoning-Tiefe von K3 durch reasoning_effort statt durch Sampling festgelegt wird, und dasselbe gilt effektiv für den Effort-Parameter von Claude Sonnet 5.5 — bei beiden Modellen ist der größte einzelne Hebel für Ihre Rechnung also eine Effort-Einstellung, nicht eine Preisverhandlung.

Anthropic Claude Platform documentation page for Claude Sonnet 5.5 showing the summary line the best combination of speed and intelligence, the model ID claude-sonnet-5-5, a 1M-token context window, a 128K maximum output, an input price of $2 per million tokens and an output price of $10 per million tokens, with links to the What is new and Migration guide pages.

Die 400-Fehler im Detail

OrcaRouter model page for kimi/kimi-k3, attributed to MoonshotAI and dated 2026-07-15, showing a 1M-token context window, text and image input, Vision, Tools, JSON and Reasoning capability tags, an input price of $3.00 and output price of $15.00 per million tokens, a p50 time to first token of 8.20 seconds, and 371.9M tokens of traffic in the last seven days.

Die gemeinsame Ablehnung von Sampling-Parametern ist hier die praktischste Überschneidung, denn sie ist der Fehler, der am Morgen nach einem Modellwechsel auftaucht.

Bei Claude Sonnet 5.5 sind die Regeln explizit und unnachgiebig. Ein nicht standardmäßiger Wert für temperature, top_p oder top_k gibt einen 400-Fehler zurück. Das Senden von thinking: {"type": "disabled"} gibt einen 400-Fehler zurück, der auf between_tools, die neue niedrigste Thinking-Einstellung, die bei niedrigem, mittlerem und hohem Effort akzeptiert, aber bei xhigh oder max abgelehnt wird. Erzwungene Tool-Nutzung – tool_choice auf "any" oder auf ein benanntes Tool gesetzt – gibt einen 400-Fehler mit der Meldung "tool_choice: type \"tool\" and \"any\" are not supported for this model" zurück, und die Lösung ist auto sowie strikte Tool-Nutzung oder strukturierte Ausgaben. Und noch mehr: Thinking-Blöcke sind jetzt an das Modell und das Konto gebunden, die sie erzeugt haben, sodass eine Konversation von Claude Sonnet 5 auf Sonnet 5.5 verschoben werden kann, wobei ihr Reasoning intakt bleibt, aber dieses Reasoning nicht auf eine andere Modellfamilie übertragen werden kann, und ein bearbeitetes Präfix kann ein Replay in einen 400-Fehler verwandeln.

Bei Kimi K3 ist die Oberfläche kleiner, aber die Konsequenzen sind ähnlich. Es gibt keine Sampling-Parameter zu senden, also sendet jeder Client, der einen hartcodiert, bereits einen Parameter, den das Modell nicht liest. Die Reasoning-Tiefe ist stattdessen ein Top-Level-reasoning_effort-Feld.

Beide Änderungen weisen in dieselbe Richtung: Der Ansatz mit deterministischen Stellschrauben zur Prompt-Steuerung wird auf der Modellseite durch einen Aufwandsregler ersetzt. Jede Pipeline, die sich mit Temperatur 0,2 und einem festen Seed selbst abgestimmt hat, muss bei beiden dieser Modelle anhand der Aufwandsstufe neu abgestimmt werden, und die Neuabstimmung ist die Migration.

Was offene Gewichte hier tatsächlich bringen

Der Grund, Kimi K3 gegenüber einem günstigeren und besser bewerteten geschlossenen Modell in Betracht zu ziehen, ist nicht die Leistungsfähigkeit und nicht der Preis. Es ist die Grenze.

K3 in Ihrer eigenen Infrastruktur zu betreiben bedeutet, dass Prompts, Dokumente und Ausgaben ein von Ihnen kontrolliertes Netzwerk nie verlassen, was eine andere Compliance-Diskussion ist als eine Zero-Data-Retention-Vereinbarung mit einem Anbieter. Es bedeutet außerdem, dass das Modell nicht unter Ihnen weg abgekündigt werden kann — Claude Sonnet 5.5 kommt mit einer Anthropic-Zusage, nicht vor dem 28. September 2027 abgekündigt zu werden, und ein heruntergeladener Checkpoint hat kein solches Datum. Und es bedeutet, dass die Grenzkostenkurve abflacht: Nach der Hardware sind Tokens kostenlos, und das ist die einzige Struktur, in der ein Modell mit 2,8 Billionen Parametern jemals zur günstigen Option wird.

Die Lizenz ist das, was Sie tatsächlich unterzeichnen. Kimi K3 ist Open-Weight, nicht Open-Source, und Moonshot verwendet den letztgenannten Begriff nicht. Die Kimi-K3-Lizenz ist für die meisten Nutzungen breit gefasst, aber ein Model-as-a-Service-Geschäft über einer rollierenden Umsatzschwelle benötigt eine gesonderte kommerzielle Vereinbarung, und Produkte, die große Nutzer- oder Umsatzschwellen überschreiten, müssen die Namensnennung „Kimi K3“ anzeigen. Es als MIT-lizenziert zu bezeichnen, ist eine Ungenauigkeit aus der K2-Ära, die noch immer kursiert. Wenn Sie vorhaben, auf den Gewichten aufzubauen, statt die API aufzurufen, ist dies eine rechtliche Prüfung und keine Fußnote.

Und die Gewichte sind groß genug, dass Self-Hosting eine Investitionsentscheidung ist. Ein MoE mit 2,8 Billionen Parametern und rund 104 Milliarden aktiven Parametern ist kein Single-Server-Deployment, und der Aufwand, der erforderlich ist, um es aufzusetzen, stellt die eigentlichen Kosten dieser Option dar – Kosten, die den Unterschied von 5 Dollar pro Million bei den Ausgabepreisen in den Schatten stellen.

Wo OrcaRouter passt

Die meisten Teams, die diese beiden Optionen bewerten, wollen nicht zwischen einer verwalteten API und einer Hardware-Beschaffung wählen. Sie wollen routen.

OrcaRouter ist ein OpenAI-kompatibler Endpunkt für über 200 Modelle, bei dem der Listenpreis des Anbieters durchgereicht wird und kein Aufschlag anfällt, sodass eine Änderung der Anbieterpreise auf beiden Seiten noch am selben Tag greift statt erst zum nächsten Rechnungszyklus. Kimi K3 ist seit Juli zu Moonshots eigenem Preis von 3 $ / 15 $ im Katalog, mit einer gemessenen p50-Zeit bis zum ersten Token von rund acht Sekunden und rund 371,9 Millionen Token, die in der letzten Woche darüber liefen. Claude Sonnet 5 – das Modell, auf dem der meiste Claude-API-Verkehr noch läuft, bei gemessenen 150 Ausgabe-Token pro Sekunde – ist seit dem 30. Juni zu Anthropics 2 $ / 10 $ routbar.

Claude Sonnet 5.5 ist noch nicht in unserem Katalog. Wo das zutrifft, sagen Sie es und leiten Sie darum herum: Die eigene API des Anbieters ist der Weg dorthin, und um sie zu testen, ohne sich festzulegen, nimmt man einen Prozentsatz des Traffics hinter automatischem Failover, mit Claude Sonnet 5 oder Kimi K3 als Fallback. Wenn Ihr Grund, sich K3 anzusehen, die Grenze und nicht die Rate ist, sind die Gewichte heute herunterladbar und die API ist eine Übergangslösung – was eine Entscheidung über Ihre Infrastruktur ist, nicht über einen Modellvergleich.

Das Fazit, aufgeschlüsselt nach dem, was Sie tatsächlich kaufen

Wählen Sie Claude Sonnet 5.5, wenn die Arbeit long-context und output-lastig ist, wenn zwölf Punkte beim zusammengesetzten Index das eigentliche Kaufargument sind und wenn eine verwaltete API mit Zero-Data-Retention Ihre Prüfung besteht. Kalkulieren Sie den Token-Verbrauch ein – 410 Mio. Token auf dem Index gegenüber 160 Mio. bei K3 sind ein echter Multiplikator – und planen Sie einen Tag für die Tool-Use- und Thinking-Block-Änderungen ein.

Wählen Sie Kimi K3, wenn die Grenze die Anforderung ist, wenn Sie einen Checkpoint wollen, den kein Anbieter zurückziehen kann, oder wenn Ihre Workload agentisches Coding in hohem Volumen ist, bei dem $2.00 pro Index-Aufgabe gegenüber $7.60 kumulieren. Akzeptieren Sie, dass es ein Modell mit 2,8T Parametern ist, das gehostet werden muss, dass seine Lizenz Namensnennungs- und Umsatzklauseln enthält und dass es beim Composite unter der Anthropic-Stufe liegt.

Was keine der beiden Optionen umgeht, ist der erste Absatz: Die Sampling-Parameter sind bei beiden weg, und der Effort-Regler ist das Bedienelement, das sie ersetzt hat. Egal, welche der beiden du wählst, das ist die Änderung, die dein Code braucht.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert