
Kimi K4: cosa sostiene davvero la fuga di notizie, e perché «meno parametri attivi» sarebbe la vera notizia
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 506 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 183 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Un singolo post ha messo in circolazione quattro nomi di modelli non annunciati in una volta sola. La lista inizia con Kimi K4, la presunta prossima generazione di Moonshot AI, affiancato da GLM-5.5 Flash e GLM-5.4 di Z.ai e DeepSeek V4.1P — e l'enfasi dell'autore non è su nessuno dei nomi di punta, ma su un sospetto riguardo all'aritmetica sotto K4: che potrebbe attivare meno parametri rispetto al modello che sostituisce. Questa affermazione non è verificata. Non esiste una model card di Kimi K4, né pesi, né un identificatore API, né un prezzo, né una route, e lo stesso vale per ogni nome di Z.ai nella lista. Quello che vale la pena fare ora è capire quali di queste affermazioni sarebbero verificabili, come si presenta la baseline rilasciata e cosa significherebbe davvero un K4 più sparso.
Il segnale, e il suo livello
Questo è un segnale precoce, e va letto come tale. Il post che lo riporta è una lettura delle convenzioni di denominazione dei modelli più che il resoconto di un avvistamento: segnala "GLM-5.5 Flash, GLM-5.4" come nomenclatura interessante e definisce Kimi K4 "molto strano", poi propone un meccanismo speculativo — meno esperti attivati — senza affermare di aver visto una config, un elenco di checkpoint o un endpoint di staging.
Niente nel registro pubblico contraddice i nomi, e niente li corrobora nemmeno. Questa asimmetria è normale in questa fase di un ciclo di rilascio ed è esattamente il motivo per cui la mossa utile è fissare la baseline e i test, non speculare ulteriormente. Un nome in un post è un'ipotesi su un prodotto, non una prova della sua esistenza.
La baseline rispetto alla quale verrebbe misurato un Kimi K4
Kimi K3 è reale, già rilasciato e documentato in modo insolitamente accurato, il che lo rende un solido punto di riferimento. La model card di Moonshot descrive un modello Mixture-of-Experts da 2,8 trilioni di parametri che attiva 104B parametri per token, distribuiti su 93 layer — uno denso e 92 sparsi. La sparsità è aggressiva ed è dichiarata apertamente: 16 esperti su 896 si attivano per token, oltre a 2 esperti condivisi, a cui Moonshot attribuisce un miglioramento di circa 2,5× nell'efficienza di scaling rispetto a Kimi K2.
Lo stack di attenzione è il punto in cui K3 rompe con la generazione precedente. Dei suoi 92 strati sparsi, 69 usano Kimi Delta Attention — un meccanismo ibrido di attenzione lineare — e 24 usano MLA con gating, una suddivisione 3:1 che mantiene una minoranza di strati ad attenzione completa e spinge il resto sul percorso lineare più economico. Gli strati presentano un residuo di attenzione ogni 12 blocchi, la funzione di attivazione è SiTU-GLU, e l'intero modello è addestrato con pesi MXFP4 e attivazioni MXFP8 nell'ambito dell'addestramento consapevole della quantizzazione. La lunghezza del contesto è di 1.048.576 token, il vocabolario è di 163.840, e la visione passa attraverso un encoder MoonViT-V2 da 401 milioni di parametri, rendendo K3 nativamente in grado di gestire immagini anziché multimodale tramite aggiunta.

Quelli sono i numeri che un successore deve muovere. Nota cosa implicano riguardo all'idea dei "meno parametri attivi": K3 è già un modello straordinariamente sparso. Attiva circa il 3,7% del suo conteggio totale di parametri per token. Un K4 che attivasse meno di 104B non starebbe tagliando il grasso da un design sovradimensionato — starebbe facendo marcia indietro su un rapporto di sparsità che Moonshot ha pubblicamente descritto come un successo, e lo farebbe nella generazione in cui il resto del campo sta andando nella direzione opposta.
Cosa significherebbe "meno parametri attivi" se fosse vero
Sono disponibili due letture, e puntano in direzioni opposte. Quella benevola è architetturale: Moonshot potrebbe estendere ulteriormente l’ibrido KDA, sostituendo più layer di full-attention con layer lineari e ribilanciando il budget degli esperti in modo che un minor numero di attivazioni garantisca un contesto più lungo, un’impronta di serving più economica o un miglior rapporto qualità-per-flop. In quest’ottica, un minor numero di parametri attivi è un affinamento della stessa tesi che K3 già enuncia — ovvero che la sparsità è una strategia di scaling, non un compromesso.
L'altra lettura è che K4 non sia affatto un successore uniforme. La linea di Kimi si è già ramificata una volta quest'anno, e i resoconti hanno variamente accennato a K3.1, K3.2 e K4 come a tre prodotti diversi. Un K4 che attiva meno di K3, in una famiglia che include una variante di coding separata, è almeno tanto coerente con un riposizionamento quanto con un aggiornamento diretto. Entrambe le letture sono speculazioni. Nessuna delle due è risolta da un post.
C’è anche un aspetto legato alla licenza che nessuno ha affrontato. I pesi di K3 sono distribuiti con la Kimi K3 License, una licenza personalizzata "other" anziché una open source standard, ed è il primo modello aperto di classe 3T. Che un K4 più sparso erediti quella licenza, o la restringa, per chiunque costruisca sui pesi conta più di qualche punto di punteggio dell’indice.

Gli altri tre nomi nello stesso post
GLM-5.5 Flash e GLM-5.4 sono la coppia più sorprendente, e non per i numeri. Il tetto dichiarato da Z.ai è GLM-5.3, pubblicato il 14 agosto 2026 con 743 miliardi di parametri, seguito da GLM-5.3-Flash il 26 agosto, con le release dei pesi BF16 e Flash-BF16 arrivate il 25 agosto. La documentazione di Z.ai elenca esattamente tre identificatori di modello attuali: glm-5.3, glm-5.3-flash e glm-5.2. Non esiste alcun GLM-5.4, né GLM-5.5, né GLM-5.5 Flash — e la direzione della denominazione è la parte strana, dato che una generazione 5.5 che precede una 5.4 non è il modo in cui Z.ai ha mai numerato una famiglia. Numeri di versione che compaiono fuori ordine in una fuga di notizie sono un errore tipico: tendono a essere prodotti adiacenti, nomi in codice interni o un'etichetta di livello di servizio, piuttosto che un nuovo modello di base.
DeepSeek V4.1P è il nome a cui l'autore del segnale dice di essere più interessato, ed è il più facile dei quattro da verificare. La documentazione API di DeepSeek nomina esattamente due stringhe di modello attuali: deepseek-flash e deepseek-v4-pro. Il suffisso "P" non ha alcun corrispettivo in nessun identificatore DeepSeek, e il rilascio di pesi più recente nella stessa organizzazione di DeepSeek è DeepSeek-V4.1-Flash, pubblicato il 10 settembre 2026. Un V4.1P sarebbe molto plausibilmente un fratello di fascia Pro di quel modello — ma "molto plausibilmente" è un'ipotesi su una stringa, non un prodotto.
Come faresti a sapere che qualcosa di tutto questo è reale?
I quattro nomi falliscono lo stesso test allo stesso modo, il che rende l'attesa semplice anziché angosciante. Un vero rilascio lascia artefatti, e ciascuno di essi è economico da verificare:
• Una model card nella stessa organizzazione Hugging Face del fornitore. L'ultima voce di Moonshot è Kimi-K3, creata il 13 giugno 2026; le più recenti di Z.ai sono la famiglia GLM-5.3 del 25 agosto; la più recente di DeepSeek è DeepSeek-V4.1-Flash dal 10 settembre. Non esiste nulla di più recente in nessuna delle tre.
• Una configurazione che chiude la questione. Nello specifico per K4, i campi da cercare sono num_experts e num_experts_per_token — quelli di K3 riportano 896 e 16. Una configurazione K4 con un valore per token inferiore è l'affermazione di questa fuga di notizie che viene confermata o smentita in un singolo file.
• Un modello instradabile. Un nome che compare in un catalogo è un nome con un prezzo, una finestra di contesto e un provider alle spalle; un nome che esiste solo in un post non ha nulla di tutto ciò.

Cosa puoi instradare oggi
La versione pratica di questa fuga di notizie è che la generazione che descrive non è quella su cui puoi costruire. Quella attiva è la precedente, e il compito del router è trasformare il divario tra generazioni in una decisione di routing anziché in un progetto di migrazione. Kimi K3 è disponibile ora con il suo contesto completo da 1M di token e visione nativa, al prezzo di 3,00 $ per milione di token di input e 15,00 $ per milione di token di output, con le letture della cache a 0,30 $ — fatturate alla tariffa del provider senza alcun ricarico, motivo per cui una variazione di prezzo del fornitore su K3 arriva sulla tua fattura lo stesso giorno anziché al successivo ciclo di riprezzamento. Kimi K3 su OrcaRouter contiene la scheda tecnica completa e la tariffa attuale.
Lo stesso vale per il resto della gamma. GLM-5.3, GLM-5.3-Flash e DeepSeek V4.1 Flash sono tutti instradabili insieme a Kimi K3, tramite un unico endpoint compatibile con OpenAI che copre oltre 200 modelli, con failover automatico quando un provider peggiora e un DSL di routing per esprimere preferenze — tetti di costo, soglie minime di qualità, budget di latenza — come policy anziché logica per singola chiamata. Quando compariranno Kimi K4, GLM-5.5 Flash o DeepSeek V4.1P, la migrazione sarà solo un cambio di stringa nella policy di routing e nulla più. La fusione dei modelli ti consente di combinare gli output di più modelli sullo stesso endpoint quando un'attività ne trae beneficio.
Per essere espliciti su ciò che questo non è: nessuno dei quattro nomi trapelati è una route su OrcaRouter oggi. Non li ospitiamo e non possiamo servirli.
Il risultato finale
L'affermazione interessante qui non sono i numeri di versione. È il meccanismo — un flagship di nuova generazione che attiva meno parametri rispetto al suo predecessore sarebbe una dichiarazione del fatto che Moonshot ritiene che la sparsità, e non il conteggio grezzo delle attivazioni, sia l'asse su cui vale la pena spingere, e la suddivisione di K3 in 16 esperti su 896 è già un argomento in quella direzione. Ogni parte dell'affermazione è non verificata: Kimi K4, GLM-5.5 Flash, GLM-5.4 e DeepSeek V4.1P non hanno model card, né pesi, né identificatori API, né prezzi, e i cataloghi degli stessi fornitori si fermano una generazione prima in ciascun caso. Considerate i nomi come l'anteprima di una domanda, non come una risposta — e se oggi avete bisogno di pesi aperti di classe frontier con contesto da 1M, Kimi K3 è il modello che esiste già.
Quando arriva un Kimi K4, il failover automatico è ciò che impedisce alla migrazione di trasformarsi in un incidente
