
Claude Sonnet 5.5 vs Kimi K3: Geen van beide modellen neemt je temperatuurinstelling aan
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 984 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 195 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
Hier is een vergelijking waarin de twee modellen het over iets eens zijn dat je code hoe dan ook zal breken. Claude Sonnet 5.5, uitgebracht op 28 september 2026, weigert elk verzoek dat temperature, top_p of top_k op een niet-standaardwaarde instelt, met een 400-fout. Kimi K3, sinds medio juli 2026 algemeen beschikbaar bij Moonshot AI, accepteert helemaal geen samplingparameters — geen temperature, geen top_p, geen seed — en ontsluit de redeneerdiepte alleen via een reasoning_effort-instelling. Twee verschillende labs, twee verschillende architecturen, één gedeelde conclusie: de samplingknoppen die de meeste integraties nog uit gewoonte instellen, zijn bij beide verdwenen.
Dat is niet de vergelijking waar iemand over schrijft. De vergelijking waar iedereen over schrijft is de prijs: Kimi K3 tegen $3 per miljoen inputtokens en $15 output tegenover Claude Sonnet 5.5 tegen $2 en $10, wat een duidelijke overwinning is voor Anthropic op de prijslijst. Maar Kimi K3 is een open-weight model met 2,8 biljoen parameters en een mixture-of-experts dat je kunt downloaden en binnen je eigen grens kunt draaien, en Claude Sonnet 5.5 is een gesloten model dat beschikbaar is op vier clouds. Tussen een goedkoper gesloten model en een duurder downloadbaar model wordt de beslissing helemaal niet genomen op basis van de prijs per token.
Wat elk ervan is, in één alinea per stuk.
Claude Sonnet 5.5 is het tweede model in de 5.5-generatie van Anthropic en verscheen vijf dagen na die lancering op de Claude API, na Claude Opus 5.5. Het wordt uitgebracht als claude-sonnet-5-5 op de Claude API, Amazon Bedrock, Google Cloud en Microsoft Foundry, behoudt een contextvenster van 1M tokens en een synchrone uitvoerlimiet van 128K, en hanteert exact de prijsstelling van Claude Sonnet 5: $2 in, $10 uit, $0,20 per miljoen voor cache-reads. Adaptief denken staat standaard aan op high inspanning. Het is beschikbaar met zero data retention, en Artificial Analysis geeft het een Intelligence Index van 56 in zijn v4.3.2-revisie — derde van de 216 modellen die het meet.

Kimi K3 is het vlaggenschip van Moonshot AI: een mixture-of-experts-model met 2,8 biljoen parameters dat ongeveer 104 miljard parameters per token activeert, met een contextvenster van 1 miljoen tokens en native visueel begrip. Het is gebouwd voor langetermijncodering en meerstaps kenniswerk, en Moonshot positioneert het met naam en toenaam voor harnesses voor programmeeragenten. Het spreekt het OpenAI API-formaat, stelt reasoning_effort beschikbaar als zijn enige reasoningbesturing, en is open-weight onder de Kimi K3-licentie — wat niet hetzelfde is als open-source, en het verschil is het deel dat je moet lezen voordat je erop voortbouwt.
De tariefkaart, en het nummer eronder
Zet de twee naast elkaar op de dimensies die een wetsvoorstel bepalen in plaats van een krantenkop:
• Invoerprijs — Claude Sonnet 5.5 $2 per miljoen vs Kimi K3 $3 per miljoen
• Uitvoerprijs — Claude Sonnet 5.5 $10 per miljoen vs Kimi K3 $15 per miljoen
• Cache-lezingen — $0,20 per miljoen vs. $0,30 per miljoen
• Contextvenster — 1.000.000 tokens vs 1.048.576 tokens
• Gewichten — propriëtair, vier gehoste platforms versus open-weight onder de Kimi K3 License
• Intelligentie-index — Claude Sonnet 5.5 56 vs Kimi K3 44 op dezelfde v4.3.2-revisie
• Kosten per Intelligence Index-taak — Claude Sonnet 5.5 $7,60 vs Kimi K3 $2,00
• Uitvoerigheid op de Index — Claude Sonnet 5.5 410M outputtokens vs Kimi K3 160M
Dat laatste paar is de ommekeer die het waard is om bij stil te staan. Het model van Anthropic is 50% goedkoper op input en een derde goedkoper op output, en kost nog steeds 3,8 keer zoveel om dezelfde evaluatie te voltooien, omdat het 2,6 keer zoveel tokens verbruikt om daar te komen. Op de samengestelde score scoort het ook twaalf punten hoger, dus dit is niet een geval van een verspillend model dat niets oplevert. Het is een geval van twee modellen waarvan het kostengedrag niet kan worden vergeleken door twee tariefkaarten te lezen, en daarom bestaat het cijfer voor de indextaak.
Geen van beide tokenaantallen zal jouw tokenaantal zijn. Moonshots eigen documentatie vermeldt dat de redeneerdiepte van K3 wordt bepaald door reasoning_effort in plaats van door sampling, en hetzelfde geldt in feite voor de effort-parameter van Claude Sonnet 5.5 — dus bij beide modellen is de grootste afzonderlijke hefboom op je factuur een effort-instelling, niet een prijsonderhandeling.

De 400-fouten, in detail

De gedeelde weigering van samplingparameters is hier de meest praktische overlap, want het is de fout die opduikt in de ochtend na een modelwissel.
Op Claude Sonnet 5.5 zijn de regels expliciet en meedogenloos. Een niet-standaard temperature, top_p of top_kgeeft een 400 terug. Het verzenden van thinking: {"type": "disabled"} geeft een 400 terug die wijst naar between_tools, de nieuwe laagste thinking-instelling, die wordt geaccepteerd bij low, medium en high effort maar wordt afgewezen bij xhigh of max. Geforceerd gebruik van tools — tool_choice ingesteld op "any" of op een benoemde tool — geeft een 400 terug met het bericht "tool_choice: type \"tool\" and \"any\" are not supported for this model", en de oplossing is auto plus strikt toolgebruik of gestructureerde outputs. Daar komt nog bij: thinking-blokken zijn nu gebonden aan het model en het account dat ze heeft geproduceerd, dus een gesprek kan met zijn redenering intact van Claude Sonnet 5 naar Sonnet 5.5 worden verplaatst, maar die redenering kan niet naar een andere modelfamilie worden meegenomen, en een bewerkte prefix kan van een replay een 400 maken.
Op Kimi K3 is het oppervlak kleiner, maar de gevolgen zijn vergelijkbaar. Er zijn geen samplingparameters om te verzenden, dus elke client die er een hardcodeert, stuurt al een parameter die het model niet leest. Redeneerdiepte is een top-level reasoning_effort-veld in plaats daarvan.
Beide veranderingen wijzen dezelfde kant op: de benadering met deterministische knoppen voor promptbeheersing wordt vervangen door een inspanningsknop aan de modelzijde. Elke pipeline die zichzelf afstemde met temperatuur 0,2 en een vaste seed, moet voor beide modellen opnieuw worden afgestemd op inspanningsniveau, en die hernieuwde afstemming is de migratie.
Wat open gewichten je hier daadwerkelijk opleveren
De reden om Kimi K3 te overwegen tegenover een goedkoper en hoger scorend gesloten model is niet capaciteit en niet prijs. Het is de grens.
Het draaien van K3 binnen je eigen infrastructuur betekent dat prompts, documenten en outputs nooit een netwerk verlaten dat je zelf beheert, wat een ander compliancegesprek is dan een zero-data-retentionovereenkomst met een leverancier. Het betekent ook dat het model niet onder je vandaan kan worden uitgefaseerd — Claude Sonnet 5.5 gaat gepaard met een toezegging van Anthropic dat uitfasering niet vóór 28 september 2027 plaatsvindt, en een gedownload checkpoint heeft zo'n datum niet. En het betekent dat de marginale kostencurve afvlakt: na hardware zijn tokens gratis, en dat is de enige structuur waarin een model met 2,8 biljoen parameters ooit de goedkope optie wordt.
De licentie is wat je feitelijk ondertekent. Kimi K3 is open-weight, niet open-source, en Moonshot gebruikt de laatste term niet. De Kimi K3-licentie is ruim voor de meeste toepassingen, maar een model-as-a-servicebedrijf boven een doorlopende omzetdrempel heeft een aparte commerciële overeenkomst nodig, en producten die grote gebruikers- of omzetdrempels overschrijden, moeten de naamsvermelding "Kimi K3" tonen. Het MIT-gelicenseerd noemen is een onjuistheid uit het K2-tijdperk die nog steeds rondgaat. Als je van plan bent op de gewichten voort te bouwen in plaats van de API aan te roepen, is dit een juridische beoordeling in plaats van een voetnoot.
En de gewichten zijn groot genoeg dat zelfhosting een kapitaalbeslissing is. Een MoE met 2,8 biljoen parameters en ongeveer 104 miljard actieve parameters is geen implementatie op één server, en de inspanning die nodig is om die op te zetten is de werkelijke kostenpost van de optie — een die het verschil van $5 per miljoen in outputtarieven in het niet doet vallen.
Waar OrcaRouter past
De meeste teams die deze twee evalueren willen niet kiezen tussen een managed API en een hardware-inkoop. Ze willen routeren.
OrcaRouter is één OpenAI-compatibel endpoint voor meer dan 200 modellen, waarbij de listprijs van de provider wordt doorgegeven zonder markup, zodat een tariefwijziging van een leverancier aan beide zijden dezelfde dag ingaat in plaats van bij de volgende factuurcyclus.Kimi K3 staat sinds juli in de catalogus tegen Moonshots eigen $3 / $15, met een gemeten p50-tijd tot de eerste token van ongeveer acht seconden en ongeveer 371,9 miljoen tokens die er de afgelopen week doorheen zijn gestroomd. Claude Sonnet 5 — het model waarop het meeste Claude API-verkeer nog steeds draait, met een gemeten 150 outputtokens per seconde — is sinds 30 juni routeerbaar tegen Anthropic's $2 / $10.
Claude Sonnet 5.5 staat nog niet in onze catalogus. Waar dat geldt, zeg dat en routeer eromheen: de eigen API van de leverancier is de weg ernaartoe, en de manier om het te testen zonder je vast te leggen is een percentage van het verkeer achter automatische failover, met Claude Sonnet 5 of Kimi K3 als fallback. Als je reden om naar K3 te kijken de grens is en niet het tarief, zijn de gewichten vandaag downloadbaar en is de API een noodoplossing — wat een beslissing is over je infrastructuur, niet over een modelvergelijking.
Het oordeel, opgesplitst naar wat je daadwerkelijk koopt.
Kies Claude Sonnet 5.5 wanneer het werk een lange context heeft en outputintensief is, wanneer twaalf punten op de samengestelde index hetgeen is dat wordt aangeschaft, en wanneer een beheerde API met nul dataretentie je beoordeling doorstaat. Begroot het tokenverbruik — 410M tokens op de Index tegenover 160M bij K3 is een echte multiplier — en begroot een dag voor de wijzigingen aan toolgebruik en denkblokken.
Kies Kimi K3 wanneer de grens de vereiste is, wanneer je een checkpoint wilt dat geen enkele leverancier kan uitfaseren, of wanneer je workload agentische coding op grote schaal betreft, waar $2,00 per indextaak tegenover $7,60 zich opstapelt. Accepteer dat het een model met 2,8 biljoen parameters is om te hosten, dat de licentie naamsvermeldings- en omzetclausules bevat, en dat het op de composite onder de Anthropic-tier scoort.
Wat geen van beide keuzes ontloopt, is de eerste alinea: de samplingparameters zijn bij beide verdwenen, en de effort-dial is het bedieningselement dat ze heeft vervangen. Welke van deze twee je ook kiest, dat is de wijziging die je code nodig heeft.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
