
GLM-5.3 vs Kimi K3: Spremere una base da 743B o costruirne una da 2.8T — Quale scommessa ripaga?
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0455Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0247Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0247Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0157Intelligenza82Codice
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2646Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1849Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1541Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1251Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0547Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligenza49Codice
La corsa cinese agli open-weight si è appena divisa in due risposte alla stessa domanda. Moonshot AI ha costruito Kimi K3 da zero — una base mixture-of-experts da 2,8 trilioni di parametri, il più grande modello open-weight mai rilasciato, annunciato il 16 luglio 2026 con i pesi pubblicati il 27 luglio. GLM-5.3 è la scommessa opposta: Z.ai ha mantenuto l'esatta base da 743 miliardi di parametri che alimentava GLM-5.2 e ha dedicato l'intero ciclo di rilascio al post-training, sostenendo che il tetto di intelligenza del modello base non è mai stato il problema. Entrambi sono modelli di punta con contesto da 1M, incentrati su coding e agenti, ed entrambi affermano di essere il miglior modello open per il coding sul mercato. Non possono entrambi essere il modo migliore per spendere lo stesso budget, e i benchmark si dividono davvero esattamente a metà — il che rende questo meno un confronto e più un referendum su come costruire il prossimo modello di frontiera.
Due scommesse su come costruire un modello di frontiera
Z.ai definisce GLM-5.3 un "deep dig" piuttosto che un aggiornamento generazionale. La base è, byte per byte, lo stesso modello da 743B di GLM-5.2; la differenza è interamente nel post-training, eseguito tramite il framework open-source slime su compiti che coprono intere sessioni di ingegneria — diagnosticare, correggere, verificare e rilasciare su cluster reali, sistemi di storage e codebase, alcuni dei quali richiedono diversi giorni di lavoro di un ingegnere senior. I guadagni dichiarati dal fornitore sono notevoli: un balzo del 50% sul proprio Code Bench, Terminal-Bench 3.0 da 4.6 a 28.3, DeepSWE v1.1 da 46.2 a 66.9, e una capacità cyber che ha imposto una revisione di sicurezza prima del rilascio dei pesi. Moonshot ha seguito la strada opposta. Kimi K3 è una base completamente nuova — 2.8T di parametri totali con circa 104B attivi per token (16 esperti su 896), un'architettura Kimi Delta Attention, input nativo di immagini e video, ragionamento sempre attivo che non può essere disattivato e una finestra di contesto da 1M sia in input che in output. Mentre Z.ai scommette che più dello stesso modello sia sufficiente, Moonshot scommette che la base stessa fosse il soffitto.

Il confronto diretto, con provenienza allegata
L'unico posto in cui entrambi i modelli compaiono sulla stessa pagina è la tabella di lancio di Z.ai, quindi è da lì che provengono i numeri a confronto — etichettati come dichiarati dal fornitore, non verificati in modo indipendente. Le cifre individuali di Kimi K3 coincidono con quanto Moonshot ha pubblicato a luglio e con quanto misura Artificial Analysis, ma nessun laboratorio neutrale ha ancora testato entrambi.
• Terminal-Bench 3.0 — GLM-5.3 a 28.3 contro Kimi K3 a 17.4 (tabella di Z.ai). Il divario di codifica più grande dell'incontro, sulla versione più recente e più difficile.
• Terminal-Bench 2.1 — GLM-5.3 a 88.2 contro Kimi K3 a 88.3. Un testa a testa.
• DeepSWE v1.1 — GLM-5.3 a 66.9 contro Kimi K3 a 67.5. Kimi di un soffio.
• SWE-Marathon v1.1 — GLM-5.3 a 42.5 contro Kimi K3 a 48.1. La migliore vittoria di Kimi nel coding.
• ExploitGym — GLM-5.3 a 105/130 contro Kimi K3 a 36/70. Una vittoria quasi totale per GLM.
• GDPval-AA v2 (lavoro cognitivo) — GLM-5.3 con 1.769 contro Kimi K3 con 1.682.
• Accesso — GLM-5.3: abbonamento al Coding Plan, pesi limitati fino a circa il 28 agosto. Kimi K3: API attiva a $3 / $15, pesi scaricabili dal 27 luglio.

Il fossato di sicurezza è la vera separazione
Se si eliminano i benchmark di codifica, la differenza decisiva è la cybersecurity. GLM-5.3 riporta 84.5 su CyberGym contro l'80.0 di Kimi K3, e il suo punteggio ExploitBench di 54.4 è quasi il doppio del 32.2 di Kimi K3. Su ExploitGym il divario non è una differenza, è un'altra categoria: 105 e 130 contro 36 e 70 nelle esecuzioni da 2 e 6 ore. È per questo che i due lanci risultano così diversi nella pratica: i pesi di Kimi K3 sono pubblicamente disponibili con una licenza MIT modificata, mentre quelli di GLM-5.3 sono trattenuti per un rafforzamento della sicurezza, proprio perché Z.ai afferma che il modello è così bravo a trovare e sfruttare vulnerabilità che rilasciare subito i pesi sarebbe sembrato irresponsabile. Se il tuo lavoro comporta il controllo del codice altrui, o la difesa del tuo da ricerche automatizzate di vulnerabilità, questa è la voce più rilevante dell'intero confronto — ed è anche quella meno verificata in modo indipendente.
Dove Kimi K3 contrattacca
Le vittorie di Kimi K3 si concentrano dove GLM-5.3 è più debole: il lavoro su repository a lungo orizzonte. Ha il vantaggio su DeepSWE e SWE-Marathon, è in testa su Toolathlon Verified, e la sua finestra di output da 1M token significa che può scrivere un intero codebase o una lunga traccia di agente in un'unica passata. Il suo ragionamento sempre attivo trasmette l'intera traccia all'API, che gli sviluppatori hanno definito molto più utile per il debug degli agenti rispetto alle opache spiegazioni riassuntive — con il problema operativo che devi rimettere i campi di ragionamento parola per parola nelle chiamate di strumento, e non esiste prefill dell'assistente. Nell'Intelligence Index di Artificial Analysis, Kimi K3 si attesta a 57, quarto in assoluto, con un costo di circa 0,94 $ per attività misurato sul suo set standard. È anche il modello più costoso mai rilasciato da un laboratorio cinese: 3 $ per milione di token di input e 15 $ per milione di output, una tariffa di livello Sonnet, mentre GLM-5.3 non può ancora essere prezzato per token perché esiste solo all'interno di un piano in abbonamento.
La realtà dell'accesso e dei costi
Kimi K3 è su OrcaRouter proprio ora al prezzo di listino di Moonshot — $3/$15 per milione di token, $0,30 per le letture in cache, ricarico 0% — quindi il lavoro degli agenti con contesto da 1M è richiamabile con la stessa chiave del resto del tuo stack, e i pesi open sono l'opzione di uscita se vuoi fare self-hosting. GLM-5.3 è quello difficile da ottenere: un abbonamento mensile da $18 a $168 con un sistema a punti che consuma crediti a 6,9x in input e 24x in output, prezzi fuori punta che dimezzano i consumi al di fuori della fascia 14:00–18:00 ora cinese, e nessuna API per token finché la revisione di sicurezza non viene superata. Il layer di routing in realtà livella questa asimmetria per la finestra di due settimane: quando l'API di GLM-5.3 arriva sulla stessa chiave, una chiamata di pannello può eseguire entrambi i modelli di punta open per il coding sui tuoi task e lasciare che il giudice li riconcili — e se non puoi aspettare, i pesi già rilasciati di Kimi K3 lo rendono l'unico dei due che puoi portare completamente on-premises oggi.

Quale scommessa sta pagando
Il verdetto onesto dopo una settimana è che entrambe le scommesse stanno dando i loro frutti, ma su carichi di lavoro diversi. Se il tuo lavoro è fortemente incentrato sul terminale, legato al mondo della sicurezza e orchestrato da agenti, GLM-5.3 è la direzione più solida sulla base delle prove pubblicate da Z.ai — e il divario nella cybersecurity è abbastanza ampio da valere la pena aspettare due settimane per i pesi e verificare di persona. Se il tuo lavoro riguarda sessioni prolungate su repository, input multimodali, o qualsiasi cosa in cui ti servono i pesi in mano oggi, Kimi K3 è l'unico dei due realmente disponibile — e i suoi successi nella profonda analisi dei repository sono quelli che puoi verificare subito dalla sua API live. L'unica cosa da tenere a mente: ogni numero in questo confronto testa a testa proviene dalla tabella di Z.ai, quindi considera i delta di coding come indicativi finché un laboratorio indipendente non testa entrambi. È esattamente il tipo di verifica che l'attesa di due settimane porterà.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
