Una scheda del titolo generata che riporta «Kimi K4» con il sottotitolo «cosa dice la fuga di notizie, e cosa non dice», un badge TRAPELATO / NON VERIFICATO, tre righe impilate che riportano «Nessuna scheda del modello», «Nessun peso» e «Nessun prezzo o route», e una riga a piè di pagina «Al 25 settembre 2026», con il logo OrcaRouter sovrimpresso nell'angolo in basso a destra.
Guides & Insights

Kimi K4: cosa sostiene davvero la fuga di notizie, e perché «meno parametri attivi» sarebbe la vera notizia

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Un singolo post ha messo in circolazione quattro nomi di modelli non annunciati in una volta sola. La lista inizia con K​imi K4, la presunta prossima generazione di Moonshot AI, affiancato da GLM-5.5 Flash e GLM-5.4 di Z.ai e D​eepSeek V4.1P — e l'enfasi dell'autore non è su nessuno dei nomi di punta, ma su un sospetto riguardo all'aritmetica sotto K4: che potrebbe attivare meno parametri rispetto al modello che sostituisce. Questa affermazione non è verificata. Non esiste una model card di K​imi K4, né pesi, né un identificatore API, né un prezzo, né una route, e lo stesso vale per ogni nome di Z.ai nella lista. Quello che vale la pena fare ora è capire quali di queste affermazioni sarebbero verificabili, come si presenta la baseline rilasciata e cosa significherebbe davvero un K4 più sparso.

Il segnale, e il suo livello

Questo è un segnale precoce, e va letto come tale. Il post che lo riporta è una lettura delle convenzioni di denominazione dei modelli più che il resoconto di un avvistamento: segnala "GLM-5.5 Flash, GLM-5.4" come nomenclatura interessante e definisce K​imi K4 "molto strano", poi propone un meccanismo speculativo — meno esperti attivati — senza affermare di aver visto una config, un elenco di checkpoint o un endpoint di staging.

Niente nel registro pubblico contraddice i nomi, e niente li corrobora nemmeno. Questa asimmetria è normale in questa fase di un ciclo di rilascio ed è esattamente il motivo per cui la mossa utile è fissare la baseline e i test, non speculare ulteriormente. Un nome in un post è un'ipotesi su un prodotto, non una prova della sua esistenza.

La baseline rispetto alla quale verrebbe misurato un Kimi K4

Kimi K3 è reale, già rilasciato e documentato in modo insolitamente accurato, il che lo rende un solido punto di riferimento. La model card di Moonshot descrive un modello Mixture-of-Experts da 2,8 trilioni di parametri che attiva 104B parametri per token, distribuiti su 93 layer — uno denso e 92 sparsi. La sparsità è aggressiva ed è dichiarata apertamente: 16 esperti su 896 si attivano per token, oltre a 2 esperti condivisi, a cui Moonshot attribuisce un miglioramento di circa 2,5× nell'efficienza di scaling rispetto a Kimi K2.

Lo stack di attenzione è il punto in cui K3 rompe con la generazione precedente. Dei suoi 92 strati sparsi, 69 usano Kimi Delta Attention — un meccanismo ibrido di attenzione lineare — e 24 usano MLA con gating, una suddivisione 3:1 che mantiene una minoranza di strati ad attenzione completa e spinge il resto sul percorso lineare più economico. Gli strati presentano un residuo di attenzione ogni 12 blocchi, la funzione di attivazione è SiTU-GLU, e l'intero modello è addestrato con pesi MXFP4 e attivazioni MXFP8 nell'ambito dell'addestramento consapevole della quantizzazione. La lunghezza del contesto è di 1.048.576 token, il vocabolario è di 163.840, e la visione passa attraverso un encoder MoonViT-V2 da 401 milioni di parametri, rendendo K3 nativamente in grado di gestire immagini anziché multimodale tramite aggiunta.

Screenshot of the Artificial Analysis model page for Kimi K3 (max), headed "Released July 2026", whose comparison summary reads In $3.00 / Out $15.00 and describes the model as leading on intelligence but expensive next to other open-weight models of similar size, notably slow and somewhat verbose, with text and image input and a 1M-token context window.

Quelli sono i numeri che un successore deve muovere. Nota cosa implicano riguardo all'idea dei "meno parametri attivi": K3 è già un modello straordinariamente sparso. Attiva circa il 3,7% del suo conteggio totale di parametri per token. Un K4 che attivasse meno di 104B non starebbe tagliando il grasso da un design sovradimensionato — starebbe facendo marcia indietro su un rapporto di sparsità che Moonshot ha pubblicamente descritto come un successo, e lo farebbe nella generazione in cui il resto del campo sta andando nella direzione opposta.

Cosa significherebbe "meno parametri attivi" se fosse vero

Sono disponibili due letture, e puntano in direzioni opposte. Quella benevola è architetturale: Moonshot potrebbe estendere ulteriormente l’ibrido KDA, sostituendo più layer di full-attention con layer lineari e ribilanciando il budget degli esperti in modo che un minor numero di attivazioni garantisca un contesto più lungo, un’impronta di serving più economica o un miglior rapporto qualità-per-flop. In quest’ottica, un minor numero di parametri attivi è un affinamento della stessa tesi che K3 già enuncia — ovvero che la sparsità è una strategia di scaling, non un compromesso.

L'altra lettura è che K4 non sia affatto un successore uniforme. La linea di K​imi si è già ramificata una volta quest'anno, e i resoconti hanno variamente accennato a K3.1, K3.2 e K4 come a tre prodotti diversi. Un K4 che attiva meno di K3, in una famiglia che include una variante di coding separata, è almeno tanto coerente con un riposizionamento quanto con un aggiornamento diretto. Entrambe le letture sono speculazioni. Nessuna delle due è risolta da un post.

C’è anche un aspetto legato alla licenza che nessuno ha affrontato. I pesi di K3 sono distribuiti con la Kimi K3 License, una licenza personalizzata "other" anziché una open source standard, ed è il primo modello aperto di classe 3T. Che un K4 più sparso erediti quella licenza, o la restringa, per chiunque costruisca sui pesi conta più di qualche punto di punteggio dell’indice.

A generated two-column scoreboard titled "Kimi K3 vs Kimi K4 — the scoreboard", with six shared rows: Status (K3 "released 15 July 2026" vs K4 "unreleased"), Total parameters ("2.8T" vs "unverified"), Activated parameters ("104B" vs "unverified"), Experts per token ("16 of 896" vs "unverified"), Context ("1M tokens" vs "unverified") and Price ("$3 / $15" vs "none"), with the footer line "Kimi K3 figures per Moonshot's model card; Kimi K4 has no model card, weights or price."

Gli altri tre nomi nello stesso post

GLM-5.5 Flash e GLM-5.4 sono la coppia più sorprendente, e non per i numeri. Il tetto dichiarato da Z.ai è GLM-5.3, pubblicato il 14 agosto 2026 con 743 miliardi di parametri, seguito da GLM-5.3-Flash il 26 agosto, con le release dei pesi BF16 e Flash-BF16 arrivate il 25 agosto. La documentazione di Z.ai elenca esattamente tre identificatori di modello attuali: glm-5.3, glm-5.3-flash e glm-5.2. Non esiste alcun GLM-5.4, né GLM-5.5, né GLM-5.5 Flash — e la direzione della denominazione è la parte strana, dato che una generazione 5.5 che precede una 5.4 non è il modo in cui Z.ai ha mai numerato una famiglia. Numeri di versione che compaiono fuori ordine in una fuga di notizie sono un errore tipico: tendono a essere prodotti adiacenti, nomi in codice interni o un'etichetta di livello di servizio, piuttosto che un nuovo modello di base.

D​eepSeek V4.1P è il nome a cui l'autore del segnale dice di essere più interessato, ed è il più facile dei quattro da verificare. La documentazione API di D​eepSeek nomina esattamente due stringhe di modello attuali: deepseek-flash e deepseek-v4-pro. Il suffisso "P" non ha alcun corrispettivo in nessun identificatore D​eepSeek, e il rilascio di pesi più recente nella stessa organizzazione di D​eepSeek è DeepSeek-V4.1-Flash, pubblicato il 10 settembre 2026. Un V4.1P sarebbe molto plausibilmente un fratello di fascia Pro di quel modello — ma "molto plausibilmente" è un'ipotesi su una stringa, non un prodotto.

Come faresti a sapere che qualcosa di tutto questo è reale?

I quattro nomi falliscono lo stesso test allo stesso modo, il che rende l'attesa semplice anziché angosciante. Un vero rilascio lascia artefatti, e ciascuno di essi è economico da verificare:

• Una model card nella stessa organizzazione Hugging Face del fornitore. L'ultima voce di Moonshot è Kimi-K3, creata il 13 giugno 2026; le più recenti di Z.ai sono la famiglia GLM-5.3 del 25 agosto; la più recente di D​eepSeek è DeepSeek-V4.1-Flash dal 10 settembre. Non esiste nulla di più recente in nessuna delle tre.

• Una configurazione che chiude la questione. Nello specifico per K4, i campi da cercare sono num_experts e num_experts_per_token — quelli di K3 riportano 896 e 16. Una configurazione K4 con un valore per token inferiore è l'affermazione di questa fuga di notizie che viene confermata o smentita in un singolo file.

• Un modello instradabile. Un nome che compare in un catalogo è un nome con un prezzo, una finestra di contesto e un provider alle spalle; un nome che esiste solo in un post non ha nulla di tutto ciò.

Screenshot of the OrcaRouter model page for kimi/kimi-k3 by MoonshotAI, dated 2026-07-15, with Vision, Tools, JSON and Reasoning capability chips and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

Cosa puoi instradare oggi

La versione pratica di questa fuga di notizie è che la generazione che descrive non è quella su cui puoi costruire. Quella attiva è la precedente, e il compito del router è trasformare il divario tra generazioni in una decisione di routing anziché in un progetto di migrazione. Kimi K3 è disponibile ora con il suo contesto completo da 1M di token e visione nativa, al prezzo di 3,00 $ per milione di token di input e 15,00 $ per milione di token di output, con le letture della cache a 0,30 $ — fatturate alla tariffa del provider senza alcun ricarico, motivo per cui una variazione di prezzo del fornitore su K3 arriva sulla tua fattura lo stesso giorno anziché al successivo ciclo di riprezzamento. Kimi K3 su OrcaRouter contiene la scheda tecnica completa e la tariffa attuale.

Lo stesso vale per il resto della gamma. GLM-5.3, GLM-5.3-Flash e DeepSeek V4.1 Flash sono tutti instradabili insieme a Kimi K3, tramite un unico endpoint compatibile con OpenAI che copre oltre 200 modelli, con failover automatico quando un provider peggiora e un DSL di routing per esprimere preferenze — tetti di costo, soglie minime di qualità, budget di latenza — come policy anziché logica per singola chiamata. Quando compariranno Kimi K4, GLM-5.5 Flash o DeepSeek V4.1P, la migrazione sarà solo un cambio di stringa nella policy di routing e nulla più. La fusione dei modelli ti consente di combinare gli output di più modelli sullo stesso endpoint quando un'attività ne trae beneficio.

Per essere espliciti su ciò che questo non è: nessuno dei quattro nomi trapelati è una route su OrcaRouter oggi. Non li ospitiamo e non possiamo servirli.

Il risultato finale

L'affermazione interessante qui non sono i numeri di versione. È il meccanismo — un flagship di nuova generazione che attiva meno parametri rispetto al suo predecessore sarebbe una dichiarazione del fatto che Moonshot ritiene che la sparsità, e non il conteggio grezzo delle attivazioni, sia l'asse su cui vale la pena spingere, e la suddivisione di K3 in 16 esperti su 896 è già un argomento in quella direzione. Ogni parte dell'affermazione è non verificata: K​imi K4, GLM-5.5 Flash, GLM-5.4 e D​eepSeek V4.1P non hanno model card, né pesi, né identificatori API, né prezzi, e i cataloghi degli stessi fornitori si fermano una generazione prima in ciascun caso. Considerate i nomi come l'anteprima di una domanda, non come una risposta — e se oggi avete bisogno di pesi aperti di classe frontier con contesto da 1M, Kimi K3 è il modello che esiste già.

Quando arriva un K​imi K4, il failover automatico è ciò che impedisce alla migrazione di trasformarsi in un incidente