Karta hero zatytułowana Claude Sonnet 5.5 vs Kimi K3, z podtytułem, że żaden z modeli nie przyjmie twojego ustawienia temperatury, z plakietkami: $2 / $10 zamknięte vs $3 / $15 otwarte wagi, Index 56 vs 44 i żaden nie akceptuje temperatury, oraz stopką cytującą Artificial Analysis v4.3.2 i ceny dostawców.
Guides & Insights

Claude Sonnet 5.5 vs Kimi K3: Żaden z modeli nie przyjmie Twojego ustawienia temperatury

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Claude Sonnet 5.5, wydany 28 września 2026, odrzuca każde żądanie, które ustawia temperature, top_p lub top_k na wartość inną niż domyślna, zwracając błąd 400. Kimi K3, ogólnodostępny od Moonshot AI od połowy lipca 2026, nie przyjmuje żadnych parametrów próbkowania — ani temperature, ani top_p, ani seed — i udostępnia głębokość rozumowania wyłącznie poprzez reasoning_effort — parametr sterujący.

To nie jest porównanie, o którym ktokolwiek pisze. Porównanie, o którym wszyscy piszą, dotyczy ceny: Kimi K3 za 3 dolary za milion tokenów wejściowych i 15 dolarów za wyjściowe w zestawieniu z Claude Sonnet 5.5 za 2 i 10 dolarów, co w cenniku jest bezdyskusyjną wygraną Anthro​pic. Ale Kimi K3 to model mixture-of-experts o otwartych wagach i 2,8 biliona parametrów, który można pobrać i uruchomić w obrębie własnej granicy, a Claude Sonnet 5.5 to model zamknięty dostępny w czterech chmurach. Między tańszym modelem zamkniętym a droższym modelem do pobrania decyzja nie zapada wcale na podstawie ceny za token.

Czym jest każde z nich, po jednym akapicie na każde.

Claude Sonnet 5.5 to drugi model w generacji 5.5 Anthropic, który trafił do Claude API pięć dni po premierze Claude Opus 5.5. Jest udostępniany jako claude-sonnet-5-5 w Claude API, Amazon Bedrock, Google Cloud i Microsoft Foundry, zachowuje okno kontekstowe 1 mln tokenów i synchroniczny limit wyjścia 128 tys., a także utrzymuje dokładnie ceny Claude Sonnet 5: 2 USD za wejście, 10 USD za wyjście, 0,20 USD za milion odczytów z pamięci podręcznej. Myślenie adaptacyjne jest domyślnie włączone przy wysokim wysiłku. Jest dostępny z zerową retencją danych, a Artificial Analysis przyznaje mu Intelligence Index 56 w wersji v4.3.2 — trzecie miejsce wśród 216 modeli, które mierzy.

Two-column scoreboard for Claude Sonnet 5.5 and Kimi K3 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, closed weights on four clouds. Right column Kimi K3: input $3.00 per million, output $15.00 per million, 1M-token context, AA Intelligence Index 44, cost per Index task $2.00, open weights under the Kimi K3 License. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Kimi K3 to flagowy model Moonshot AI: model typu mixture-of-experts z 2,8 biliona parametrów, aktywujący około 104 miliardów parametrów na token, z oknem kontekstowym o rozmiarze 1 mln tokenów i natywnym rozumieniem wizualnym. Powstał z myślą o długoterminowym kodowaniu i wieloetapowej pracy z wiedzą, a Moonshot z nazwy wskazuje go jako narzędzie dla środowisk agentów programistycznych. Mówi formatem API OpenAI, udostępnia reasoning_effort jako jedyną kontrolę rozumowania i ma otwarte wagi na licencji Kimi K3 — co nie jest tym samym co open source, a ta różnica to właśnie to, co warto przeczytać, zanim zaczniesz na nim budować.

Karta stawek i liczba pod nią

Porównaj te dwa pod względem wymiarów, które decydują o ustawie, a nie o nagłówku:

• Cena za dane wejściowe — Claude Sonnet 5.5 2 USD za milion vs Kimi K3 3 USD za milion

• Cena za tokeny wyjściowe — Claude Sonnet 5.5 10 USD za milion vs Kimi K3 15 USD za milion

• Odczyty z pamięci podręcznej — 0,20 USD za milion vs 0,30 USD za milion

• Okno kontekstowe — 1,000,000 tokenów vs 1,048,576 tokenów

• Wagi — zastrzeżone, cztery hostowane platformy vs otwarte wagi na licencji Kimi K3

• Indeks Inteligencji — Claude Sonnet 5.5 56 vs Kimi K3 44 na tej samej wersji v4.3.2

• Koszt na zadanie w Intelligence Index — Claude Sonnet 5.5 $7.60 vs Kimi K3 $2.00

• Gadatliwość w Indeksie — Claude Sonnet 5.5 410 mln tokenów wyjściowych vs Kimi K3 160 mln

Ta ostatnia para to odwrócenie, nad którym warto się zatrzymać. Model Anthropic jest o 50% tańszy na wejściu i o jedną trzecią tańszy na wyjściu, a mimo to kosztuje 3,8 razy więcej, aby ukończyć tę samą ewaluację, ponieważ zużywa 2,6 razy więcej tokenów, żeby do tego dotrzeć. W przypadku wyniku złożonego zdobywa również o dwanaście punktów więcej, więc nie jest to przypadek marnotrawnego modelu, który nic nie kupuje. To przypadek dwóch modeli, których zachowania kosztowego nie można porównać, czytając dwie tabele stawek, dlatego właśnie istnieje wartość dla zadania indeksowego.

Żadna z tych liczb tokenów nie będzie Twoją liczbą tokenów. Dokumentacja samego Moonshot zauważa, że głębokość rozumowania K3 jest ustawiana przez reasoning_effort, a nie przez próbkowanie, i to samo zasadniczo dotyczy parametru effort modelu Claude Sonnet 5.5 — więc w obu modelach największą pojedynczą dźwignią na Twoim rachunku jest ustawienie effort, a nie negocjacja ceny.

Anthropic Claude Platform documentation page for Claude Sonnet 5.5 showing the summary line the best combination of speed and intelligence, the model ID claude-sonnet-5-5, a 1M-token context window, a 128K maximum output, an input price of $2 per million tokens and an output price of $10 per million tokens, with links to the What is new and Migration guide pages.

Błędy 400 w szczegółach

OrcaRouter model page for kimi/kimi-k3, attributed to MoonshotAI and dated 2026-07-15, showing a 1M-token context window, text and image input, Vision, Tools, JSON and Reasoning capability tags, an input price of $3.00 and output price of $15.00 per million tokens, a p50 time to first token of 8.20 seconds, and 371.9M tokens of traffic in the last seven days.

Wspólna odmowa przyjmowania parametrów próbkowania to tutaj najbardziej praktyczna zbieżność, ponieważ właśnie ten błąd ujawnia się następnego ranka po podmianie modelu.

W przypadku Claude Sonnet 5.5 zasady są jednoznaczne i bezwzględne. Niedomyślna wartość parametrów temperature, top_p lub top_k zwraca 400. Wysłanie thinking: {"type": "disabled"} zwraca 400 wskazujące na between_tools, nowe najniższe ustawienie thinking, które jest akceptowane przy poziomach wysiłku low, medium i high, ale odrzucane przy xhigh lub max. Wymuszone użycie narzędzi — tool_choice ustawione na "any" lub na nazwane narzędzie — zwraca 400 z komunikatem "tool_choice: type \"tool\" and \"any\" are not supported for this model", a rozwiązaniem jest auto plus ścisłe użycie narzędzi lub ustrukturyzowane dane wyjściowe. Co więcej: bloki thinking są teraz powiązane z modelem i kontem, które je wygenerowały, więc rozmowę można przenieść z Claude Sonnet 5 na Sonnet 5.5 z zachowanym rozumowaniem, ale nie można przenieść tego rozumowania do innej rodziny modeli, a zmodyfikowany prefiks może sprawić, że ponowne odtworzenie zwróci 400.

W Kimi K3 powierzchnia jest mniejsza, ale konsekwencje są podobne. Nie ma parametrów próbkowania do wysłania, więc każdy klient, który zaszywa jakiś na sztywno, już wysyła parametr, którego model nie odczytuje. Głębokość rozumowania to zamiast tegoreasoning_effort pole najwyższego poziomu

Obie zmiany wskazują w tym samym kierunku: podejście oparte na deterministycznym pokrętle do kontroli promptów zastępowane jest pokrętłem wysiłku po stronie modelu. Każdy pipeline, który dostrajał się za pomocą temperatury 0,2 i stałego ziarna, musi zostać ponownie dostrojony według poziomu wysiłku w obu tych modelach, a tym ponownym dostrojeniem jest migracja.

Co właściwie dają ci tutaj otwarte wagi

Powód, by rozważyć Kimi K3 zamiast tańszego i osiągającego lepsze wyniki modelu zamkniętego, to nie możliwości i nie cena. To granica.

Uruchamianie K3 we własnej infrastrukturze oznacza, że prompty, dokumenty i wyniki nigdy nie opuszczają kontrolowanej przez Ciebie sieci, co jest inną rozmową o zgodności niż umowa o zerowej retencji danych z dostawcą. Oznacza to również, że model nie może zostać wycofany spod Ciebie — Claude Sonnet 5.5 jest objęty zobowiązaniem Anthropic, że nie zostanie wycofany wcześniej niż 28 września 2027 r., a pobrany checkpoint nie ma takiej daty. Oznacza to także, że krzywa kosztu krańcowego się wypłaszcza: po sprzęcie tokeny są darmowe, co jest jedyną strukturą, w której model o 2,8 biliona parametrów kiedykolwiek staje się tanią opcją.

Licencja jest tym, co faktycznie podpisujesz. Kimi K3 ma otwarte wagi, a nie jest open source, i Moonshot nie używa tego ostatniego określenia. Licencja Kimi K3 jest szeroka w przypadku większości zastosowań, ale działalność model-as-a-service powyżej kroczącego progu przychodów wymaga odrębnej umowy komercyjnej, a produkty przekraczające wysokie progi liczby użytkowników lub przychodów muszą wyświetlać atrybucję „Kimi K3”. Nazywanie jej licencją MIT to nieścisłość z ery K2, która wciąż krąży. Jeśli planujesz budować na wagach, a nie wywoływać API, to jest to przegląd prawny, a nie przypis.

A wagi są tak duże, że hostowanie na własnym sprzęcie to decyzja inwestycyjna. MoE o 2,8 bln parametrów i około 104 mld aktywnych parametrów to nie wdrożenie na jednym serwerze, a wysiłek potrzebny do jego uruchomienia jest rzeczywistym kosztem tej opcji — takim, który przyćmiewa różnicę 5 USD za milion w stawkach za tokeny wyjściowe.

Gdzie pasuje OrcaRouter

Większość zespołów oceniających te dwa rozwiązania nie chce wybierać między zarządzanym API a zakupem sprzętu. Chcą routować.

OrcaRouter to jedno endpoint zgodne z OpenAI, obejmujące ponad 200 modeli, z cenami katalogowymi dostawców przekazywanymi bez narzutu, więc zmiana stawek u dostawcy po którejkolwiek stronie wchodzi w życie tego samego dnia, a nie dopiero w kolejnym cyklu fakturowania. Kimi K3 znajduje się w katalogu od lipca w cenie samego Moonshot: 3 USD / 15 USD, ze zmierzonym czasem pierwszego tokena p50 wynoszącym około ośmiu sekund i około 371,9 mln tokenów przepływających przez niego w ostatnim tygodniu. Claude Sonnet 5 — model, na którym nadal opiera się większość ruchu w Claude API, przy zmierzonych 150 tokenach wyjściowych na sekundę — jest dostępny w routingu od 30 czerwca w cenie Anthropic: 2 USD / 10 USD.

Claude Sonnet 5.5 nie ma jeszcze w naszym katalogu. Tam, gdzie to prawda, powiedz to i obejdź to: własne API dostawcy jest do niego drogą, a sposobem na przetestowanie go bez zobowiązań jest przepuszczenie procentu ruchu z automatycznym przełączaniem awaryjnym, z Claude Sonnet 5 lub Kimi K3 jako modelem zapasowym. Jeśli powodem, dla którego patrzysz na K3, jest granica, a nie stawka, wagi są dostępne do pobrania już dziś, a API jest rozwiązaniem tymczasowym — co jest decyzją dotyczącą twojej infrastruktury, a nie porównania modeli.

Werdykt podzielony według tego, co faktycznie kupujesz

Wybierz Claude Sonnet 5.5, gdy praca wymaga długiego kontekstu i dużego wolumenu danych wyjściowych, gdy przedmiotem zakupu jest dwanaście punktów indeksu złożonego i gdy zarządzane API z zerową retencją danych przejdzie twój przegląd. Uwzględnij w budżecie nawyk tokenów — 410 mln tokenów w Index wobec 160 mln w K3 to realny mnożnik — i zaplanuj dzień na zmiany w użyciu narzędzi i blokach myślenia.

Wybierz Kimi K3, gdy wymogiem jest granica, gdy chcesz checkpoint, którego żaden dostawca nie może wycofać, lub gdy Twoim obciążeniem jest kodowanie agentowe o dużym wolumenie, gdzie 2,00 USD za zadanie indeksowania wobec 7,60 USD kumuluje się. Zaakceptuj, że to model o 2,8 bln parametrów do hostowania, że jego licencja zawiera klauzule dotyczące atrybucji i przychodów oraz że w ocenie złożonej wypada poniżej poziomu Anthropic.

To, od czego nie ucieka żaden z tych wyborów, to pierwszy akapit: parametry próbkowania zniknęły w obu przypadkach, a pokrętło wysiłku to element sterujący, który je zastąpił. Którykolwiek z tych dwóch wybierzesz, to jest zmiana, której potrzebuje twój kod.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie