Card hero intitolata Claude Sonnet 5.5 vs Kimi K3, sottotitolata: nessuno dei due modelli accetterà la tua impostazione della temperatura, con pillole che riportano $2 / $10 chiusi vs $3 / $15 pesi aperti, Indice 56 vs 44, e nessuno dei due accetta la temperatura, e un piè di pagina che cita Artificial Analysis v4.3.2 e i prezzi dei fornitori.
Guides & Insights

Claude Sonnet 5.5 vs Kimi K3: Nessuno dei due modelli prenderà la tua impostazione della temperatura

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Ecco un confronto in cui i due modelli concordano su qualcosa che, in ogni caso, romperà il tuo codice. Claude Sonnet 5.5, rilasciato il 28 settembre 2026, rifiuta con un errore 400 qualsiasi richiesta che imposti temperature, top_p o top_k a un valore non predefinito. Kimi K3, generalmente disponibile da Moonshot AI da metà luglio 2026, non accetta alcun parametro di campionamento — niente temperature, niente top_p, niente seed — ed espone la profondità di ragionamento solo tramite un controllo reasoning_effort. Due laboratori diversi, due architetture diverse, una conclusione condivisa: le manopole di campionamento che la maggior parte delle integrazioni imposta ancora per abitudine sono sparite su entrambi.

Questo non è il confronto di cui si scrive. Il confronto di cui tutti scrivono è il prezzo: Kimi K3 a 3 $ per milione di token in input e 15 $ in output contro Claude Sonnet 5.5 a 2 $ e 10 $, il che è una vittoria netta per Anthro​pic sul listino prezzi. Ma Kimi K3 è un modello open-weight mixture-of-experts da 2,8 trilioni di parametri che puoi scaricare ed eseguire all'interno del tuo perimetro, e Claude Sonnet 5.5 è un modello chiuso disponibile su quattro cloud. Tra un modello chiuso più economico e uno scaricabile più costoso, la decisione non si basa affatto sul prezzo per token.

Che cos'è ognuno, in un paragrafo ciascuno

Claude Sonnet 5.5 è il secondo modello della generazione 5.5 di Anthropic, arrivato su Claude API cinque giorni dopo il lancio di Claude Opus 5.5. Viene distribuito come claude-sonnet-5-5su Claude API, Amazon Bedrock, Google Cloud e Microsoft Foundry, mantiene una finestra di contesto da 1M di token e un tetto di output sincrono di 128K, e conserva esattamente i prezzi di Claude Sonnet 5: 2 $ in ingresso, 10 $ in uscita, 0,20 $ per milione per le letture dalla cache. Il pensiero adattivo è attivo per impostazione predefinita con sforzo high. È disponibile con conservazione zero dei dati e Artificial Analysis le assegna un Intelligence Index di 56 nella sua revisione v4.3.2 — terzo tra i 216 modelli che misura.

Two-column scoreboard for Claude Sonnet 5.5 and Kimi K3 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, closed weights on four clouds. Right column Kimi K3: input $3.00 per million, output $15.00 per million, 1M-token context, AA Intelligence Index 44, cost per Index task $2.00, open weights under the Kimi K3 License. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Kimi K3 è il modello di punta di Moonshot AI: un modello mixture-of-experts da 2,8 trilioni di parametri che attiva circa 104 miliardi di parametri per token, con una finestra di contesto da 1M di token e comprensione visiva nativa. È pensato per il coding a lungo orizzonte e per il lavoro di conoscenza multi-step, e Moonshot lo posiziona esplicitamente per gli harness degli agenti di programmazione. Parla il formato API di OpenAI, espone reasoning_effort come suo unico controllo di ragionamento, ed è open-weight sotto la Kimi K3 License — che non è la stessa cosa di open source, e la differenza è la parte da leggere prima di costruirci sopra.

Il tariffario, e il numero sotto di esso

Metti a confronto i due sugli aspetti che determinano una bolletta anziché un titolo:

• Prezzo di input — Claude Sonnet 5.5 2 $ per milione vs Kimi K3 3 $ per milione

• Prezzo di output — Claude Sonnet 5.5 $10 per milione vs Kimi K3 $15 per milione

• Letture della cache — $0.20 per milione vs $0.30 per milione

• Finestra di contesto — 1.000.000 token vs 1.048.576 token

• Pesi — proprietari, quattro piattaforme ospitate vs open-weight secondo la Kimi K3 License

• Indice di Intelligenza — Claude Sonnet 5.5 56 vs Kimi K3 44 sulla stessa revisione v4.3.2

• Costo per attività dell'Intelligence Index — Claude Sonnet 5.5 7,60 $ vs Kimi K3 2,00 $

• Verbosità sull'Indice — Claude Sonnet 5.5 410M token di output vs Kimi K3 160M

Quell'ultima coppia è l'inversione su cui vale la pena soffermarsi. Il modello di Anthropic costa il 50% in meno sull'input e un terzo in meno sull'output, eppure costa 3,8 volte tanto completare la stessa valutazione, perché impiega 2,6 volte i token per arrivarci. Sul composito totalizza anche dodici punti in più, quindi non è il caso di un modello dispendioso che non ottiene nulla in cambio. È il caso di due modelli il cui comportamento in termini di costi non può essere confrontato leggendo due listini, ed è per questo che esiste il dato dell'index-task.

Nessuno di quei conteggi di token sarà il tuo conteggio di token. La documentazione di Moonshot stessa rileva che la profondità di ragionamento di K3 è determinata da reasoning_effortanziché dal campionamento, e lo stesso vale di fatto per il parametro effort di Claude Sonnet 5.5 — quindi su entrambi i modelli la più grande singola leva sulla tua fattura è un'impostazione di effort, non una negoziazione sul prezzo.

Anthropic Claude Platform documentation page for Claude Sonnet 5.5 showing the summary line the best combination of speed and intelligence, the model ID claude-sonnet-5-5, a 1M-token context window, a 128K maximum output, an input price of $2 per million tokens and an output price of $10 per million tokens, with links to the What is new and Migration guide pages.

Gli errori 400, nel dettaglio

OrcaRouter model page for kimi/kimi-k3, attributed to MoonshotAI and dated 2026-07-15, showing a 1M-token context window, text and image input, Vision, Tools, JSON and Reasoning capability tags, an input price of $3.00 and output price of $15.00 per million tokens, a p50 time to first token of 8.20 seconds, and 371.9M tokens of traffic in the last seven days.

Il rifiuto condiviso dei parametri di campionamento è la sovrapposizione più pratica qui, perché è il fallimento che si manifesta la mattina dopo un cambio di modello.

Su Claude Sonnet 5.5 le regole sono esplicite e senza pietà. Un valore non predefinito di temperature, top_p o top_k restituisce un 400. L'invio di thinking: {"type": "disabled"} restituisce un 400 che punta a between_tools, la nuova impostazione di thinking più bassa, che è accettata per effort low, medium e high ma rifiutata per xhigh o max. L'uso forzato dei tool — tool_choice impostato su "any" o su un tool denominato — restituisce un 400 con il messaggio "tool_choice: type \"tool\" and \"any\" are not supported for this model", e la soluzione è auto più l'uso di tool in modalità strict o gli output strutturati. E c'è ancora dell'altro: i blocchi di thinking ora sono vincolati al modello e all'account che li ha prodotti, quindi una conversazione può essere spostata da Claude Sonnet 5 a Sonnet 5.5 con il suo reasoning intatto, ma non può portare quel reasoning a una famiglia di modelli diversa, e un prefisso modificato può trasformare un replay in un 400.

Su Kimi K3 la superficie è più piccola ma le conseguenze sono simili. Non ci sono parametri di campionamento da inviare, quindi qualsiasi client che ne codifichi uno in modo fisso sta già inviando un parametro che il modello non legge. La profondità di ragionamento è invece un campo reasoning_effort di primo livello.

Entrambe le modifiche puntano nella stessa direzione: l'approccio delle manopole deterministiche al controllo dei prompt viene sostituito da un selettore dello sforzo lato modello. Qualsiasi pipeline che si sia tarata con temperatura 0,2 e un seed fisso deve essere ritarata in base al livello di sforzo su entrambi questi modelli, e la ritaratura è la migrazione.

Che cosa ti danno davvero i pesi aperti, in questo caso

La ragione per considerare Kimi K3 invece di un modello chiuso più economico e con punteggi più alti non è la capacità, né il prezzo. È il confine.

Eseguire K3 all'interno della propria infrastruttura significa che prompt, documenti e output non lasciano mai una rete sotto il tuo controllo, il che è una conversazione sulla conformità diversa da un accordo di zero-data-retention con un fornitore. Significa anche che il modello non può essere deprecato da un momento all'altro senza che tu possa intervenire — Claude Sonnet 5.5 viene fornito con un impegno di dismissione da parte di Anthropic non prima del 28 settembre 2027, e un checkpoint scaricato non ha una tale data. E significa che la curva dei costi marginali si appiattisce: dopo l'hardware, i token sono gratuiti, che è l'unica struttura in cui un modello da 2,8 trilioni di parametri possa mai diventare l'opzione economica.

La licenza è ciò che stai effettivamente firmando. Kimi K3 è open-weight, non open-source, e Moonshot non usa quest'ultimo termine. La licenza Kimi K3 è ampia per la maggior parte degli usi, ma un'attività di model-as-a-service al di sopra di una soglia di ricavi rolling necessita di un accordo commerciale separato, e i prodotti che superano soglie elevate di utenti o ricavi devono mostrare l'attribuzione "Kimi K3". Definirla con licenza MIT è un'inesattezza dell'era K2 che circola ancora. Se prevedi di costruire sui pesi anziché chiamare l'API, questa è una revisione legale più che una nota a piè di pagina.

E i pesi sono abbastanza grandi che il self-hosting è una decisione di capitale. Un MoE da 2,8T parametri con circa 104B parametri attivi non è un deployment su un singolo server, e lo sforzo necessario per metterlo in piedi è il vero costo dell'opzione — uno che fa impallidire la differenza di 5 $ per milione nelle tariffe di output.

Dove si inserisce OrcaRouter

La maggior parte dei team che valutano questi due non vuole scegliere tra un'API gestita e un approvvigionamento hardware. Vuole instradare.

OrcaRouter è un endpoint compatibile con OpenAI su oltre 200 modelli, con il prezzo di listino del provider passato così com'è e senza ricarichi, così una variazione delle tariffe di un fornitore da una parte o dall'altra arriva lo stesso giorno anziché al ciclo di fatturazione successivo. Kimi K3 è nel catalogo da luglio ai $3 / $15 di Moonshot stesso, con un tempo misurato p50 al primo token di circa otto secondi e all'incirca 371,9 milioni di token transitati nell'ultima settimana. Claude Sonnet 5 — il modello su cui gira ancora la maggior parte del traffico dell'API Claude, a una velocità misurata di 150 token di output al secondo — è instradabile dal 30 giugno ai $2 / $10 di Anthropic.

Claude Sonnet 5.5 non è ancora nel nostro catalogo. Dove è così, dillo e trova una via alternativa: l'API del fornitore stesso è la strada per arrivarci, e il modo per testarlo senza impegnarsi è una percentuale di traffico dietro failover automatico, con Claude Sonnet 5 o Kimi K3 come fallback. Se il motivo per cui guardi a K3 è il limite piuttosto che la tariffa, i pesi sono scaricabili già oggi e l'API è una soluzione temporanea — il che è una decisione sulla tua infrastruttura, non su un confronto tra modelli.

Il verdetto, suddiviso in base a ciò che stai effettivamente acquistando

Scegli Claude Sonnet 5.5 quando il lavoro è a contesto lungo e ad alto output, quando i dodici punti di indice composito sono ciò che si sta acquistando e quando un'API gestita con ritenzione zero dei dati supera la tua revisione. Prevedi nel budget l'abitudine ai token — 410M token sull'Index contro i 160M di K3 è un vero moltiplicatore — e prevedi un giorno per le modifiche a uso degli strumenti e blocchi di pensiero.

Scegli Kimi K3 quando il confine è il requisito, quando vuoi un checkpoint che nessun fornitore può ritirare, o quando il tuo carico di lavoro è coding agentico ad alto volume, dove 2,00 $ per attività di indicizzazione contro 7,60 $ si accumulano in modo composto. Accetta che sia un modello da 2,8T di parametri da ospitare, che la sua licenza abbia clausole di attribuzione e sui ricavi, e che si posizioni sotto la fascia Anthropic nel punteggio composito.

Ciò a cui nessuna delle due scelte sfugge è il primo paragrafo: i parametri di campionamento sono spariti in entrambi i casi, e la manopola dell'effort è il comando che li ha sostituiti. Qualunque delle due tu scelga, è questa la modifica di cui il tuo codice ha bisogno.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno