
GLM-5.2 vs Kimi K3: più economico e più veloce, o più grande e migliore
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GLM-5.2 e Kimi K3 sono arrivati a un mese di distanza l'uno dall'altro a metà 2026 e si invertono a vicenda quasi perfettamente. Kimi K3, rilasciato il 2026-07-16 con i pesi aperti resi disponibili in seguito il 2026-07-27, è il più grande e sulla carta il modello migliore: 2,8 trilioni di parametri, 104 miliardi dei quali attivi, e il punteggio più alto su praticamente ogni benchmark su cui i due sono stati messi alla prova. GLM-5.2 è disponibile dal 2026-06-16, è il più piccolo dei due con 753 miliardi di parametri e 40 miliardi attivi, costa circa un terzo in meno per token di output, risponde più rapidamente alla mediana e viene distribuito con licenza MIT anziché con una licenza su misura con trigger sui ricavi.
Questa è la decisione in un paragrafo. Quello che segue sono le prove che ne stanno alla base — l'aritmetica dei prezzi su un lavoro che potresti davvero eseguire, le misurazioni in cui i due sono così vicini che la differenza è rumore, e un numero molto diffuso che non è confrontabile con il numero stampato accanto.
Dove si trovano i due
Entrambi sono generalmente disponibili tramite le API dei rispettivi fornitori, entrambi sono instradabili su OrcaRouter e entrambi hanno pesi scaricabili. Le differenze che contano prima di avvicinarsi anche solo a un benchmark:
• Rilasciato — GLM-5.2 il 2026-06-16 vs Kimi K3 il 2026-07-16 (pagine del modello su Artificial Analysis; la pagina del modello di OrcaRouter per Kimi K3 lo data un giorno prima, 2026-07-15)
• Pesi — GLM-5.2 aperto con licenza MIT vs Kimi K3 aperto con la licenza Kimi K3, che richiede un accordo separato oltre i 20 milioni di dollari di ricavi annui da model-as-a-service e un'attribuzione ben visibile oltre i 100 milioni di utenti mensili (la ricerca e sviluppo interna è esente)
• Dimensione — GLM-5.2 753B totale / 40B attivi vs Kimi K3 2,8T totale / 104B attivi
• Contesto — GLM-5.2 1.000.000 token vs Kimi K3 1.048.576 token
• Input — GLM-5.2 testo in ingresso, testo in uscita vs Kimi K3 testo e immagini in ingresso, testo in uscita
• Output massimo pubblicato — GLM-5.2 128.000 token vs non pubblicato sulla pagina OrcaRouter di Kimi K3
Su OrcaRouter entrambi stanno dietro un'unica chiave su un unico endpoint compatibile con OpenAI all'indirizzo https://api.orcarouter.ai/v1, e passiamo direttamente il prezzo di listino del provider senza aggiungere alcun ricarico — quindi ogni cifra riportata di seguito è il numero del fornitore, non il nostro.
Quanto costa un milione di token, su un lavoro che costa qualcosa
Prima i listini dei fornitori, letti direttamente dalle loro pagine di prezzo il 23 settembre 2026. Z.ai indica GLM-5.2 a 1,40 $ per milione di token di input, 0,26 $ per milione di token di input in cache e 4,40 $ per milione di token di output. Moonshot indica Kimi K3 a 3,00 $ di input, 0,30 $ di lettura cache, 15,00 $ di output — più un costo di scrittura in cache di 3,00 $ per milione per una cache di cinque minuti e di 6,00 $ per milione per una cache di un'ora. Si tratta di prezzi pubblicati, non verificati in modo indipendente, e ciascuno dei due fornitori può modificarli.
Mettili su un lavoro che consiste principalmente nella lettura: una revisione di codebase da 600.000 token con una risposta scritta da 8.000 token. Su GLM-5.2 sono 0,6 × 1,40 $ = 0,84 $ di input più 0,008 × 4,40 $ = 0,035 $ di output, ovvero circa 0,88 $. Su Kimi K3 sono 0,6 × 3,00 $ = 1,80 $ più 0,008 × 15,00 $ = 0,12 $, ovvero circa 1,92 $. Circa 2,2 volte il costo per lo stesso lavoro.
Ora eseguilo di nuovo con la base di codice già presente nella cache del provider. La voce di input si riduce alla tariffa di lettura della cache, e i due prezzi che erano distanti 2,1x diventano $0,26 contro $0,30 per milione — un divario del 15%. Questo è il numero di cui si parla meno nel confronto ed è quello che conta di più per un agente che rilegge lo stesso contesto a ogni turno. Ha anche un asterisco: Kimi K3 fattura separatamente la scrittura della cache e la pagina di GLM-5.2 non pubblicizza affatto un costo di scrittura, quindi un avvio a freddo costa su Kimi K3 sensibilmente più di quanto suggerisca il prezzo di copertina di $3,00.
• Una lettura da 600k token con una risposta da 8k — GLM-5.2 circa $0,88 contro Kimi K3 circa $1,92
• La stessa riga di input memorizzata nella cache — GLM-5.2 $0,16 vs Kimi K3 $0,18 per 600k token

Il modello indipendente concorda sulla direzione ma non sull’entità. Artificial Analysis combina i token cache-hit, di input e di output in un rapporto 7:2:1 e aggiunge i token di ragionamento che un modello effettivamente consuma, e le sue cifre per questi due — rilevate il 2026-09-23 secondo il suo indice v4.3.2 — collocano GLM-5.2 a $0,902 per milione di token combinati contro i $2,31 di Kimi K3, e il costo per completare una delle sue attività di valutazione a $0,96 contro $2,00. Eseguire una volta l’intero Intelligence Index costa $1.559 su GLM-5.2 e $3.658 su Kimi K3.
C'è un dettaglio controintuitivo nascosto in quel modello di costo. Kimi K3 utilizza meno token di output per attività rispetto a GLM-5.2 — 48.000 contro 64.000 — e meno token di ragionamento, 32.000 contro 51.000. È il modello più economico per unità di lavoro e costa comunque all'incirca il doppio per attività, perché il suo prezzo per token è 2,1 volte in input e 3,4 volte in output. Economico per attività ed economico per token sono proprietà diverse, e questo è un abbinamento in cui puntano in direzioni opposte.
La finestra di contesto, e ciò che effettivamente ci entra
I due distano meno del 5% l'uno dall'altro sulla carta: 1.000.000 di token contro 1.048.576. Riportarlo come una vittoria di Kimi K3 sarebbe sciocco. Entrambi sono modelli da un milione di token e la finestra non è un fattore distintivo; la domanda onesta è che cosa ciascuno possa ancora fare con il testo sepolto nel mezzo.
È questo che misura la valutazione del ragionamento a contesto lungo di Artificial Analysis, ed è uno dei divari più ampi nel dataset: Kimi K3 ottiene l'89%, contro il 78% di GLM-5.2. Se il tuo lavoro consiste nel caricare un grande corpus e porre domande che richiedono di collegare fatti che si trovano agli estremi opposti del corpus, i 48.576 token extra non sono il motivo per scegliere Kimi K3: lo è il margine di undici punti sul contesto lungo.
Anche il limite inferiore sotto la finestra differisce. GLM-5.2 pubblica un output massimo di 128.000 token; la pagina di Kimi K3 non pubblica un valore equivalente, quindi non ne forniremo uno. Se stai generando documenti lunghi invece di leggerli, vale la pena confrontare quell'asimmetria con il tuo carico di lavoro prima di acquistare l'uno o l'altro.
Velocità: l'unico asse che GLM-5.2 domina in modo assoluto
Due misurazioni indipendenti puntano qui nella stessa direzione, cosa che vale la pena dire proprio perché non concordano su tutto.
I nostri dati di routing, nei sette giorni fino al 2026-09-23, mostrano GLM-5.2 rispondere in una mediana di 3,28 secondi al primo token contro gli 8,09 secondi di Kimi K3, e in streaming a 68,1 token al secondo contro 43,4. Il tempo p95 al primo token di entrambi i modelli è esattamente di 10,00 secondi. Artificial Analysis, misurando separatamente, riporta GLM-5.2 a 68,2 token di output al secondo contro i 36,7 di Kimi K3, a 41,29 secondi end-to-end contro 72,13 e a 33,95 secondi alla prima risposta contro 58,52.

Le due fonti divergono su un punto, e vale la pena segnalarlo anziché attenuarlo. Artificial Analysis colloca Kimi K3 leggermente avanti sul tempo grezzo al primo token, 4,08 secondi contro 4,62, mentre il nostro routing ha GLM-5.2 quasi due volte e mezzo più veloce al p50. Endpoint diversi, provider upstream diversi, finestre diverse. Considera solida la direzione del throughput — GLM-5.2 comodamente più veloce — e considera qualsiasi singolo valore di tempo al primo token, nostro o loro, come una proprietà di una particolare settimana.
C'è anche un numero sulla nostra pagina di GLM-5.2 che non abbiamo intenzione di omettere silenziosamente: negli stessi sette giorni mostra un tasso di errore del 9,2%, contro lo 0,26% di Kimi K3. Un divario di queste dimensioni è tanto probabile che sia una settimana storta per i provider upstream che servono GLM-5.2 quanto una proprietà del modello, e sette giorni non sono una finestra abbastanza lunga per distinguere la differenza. È il tipo di problema che il routing esiste per risolvere — quando un provider fallisce una richiesta su undici, il failover automatico sposta il traffico senza che nessuno debba allertare il reperibile.

Benchmark: un vero e proprio dominio, più ristretto di quanto dica il titolo
Kimi K3 vince quasi su tutto ciò su cui sono stati eseguiti entrambi i modelli. Questi sono dati di Artificial Analysis secondo la revisione dell'indice v4.3.2, con entrambi i modelli nella loro configurazione di massimo ragionamento, rilevati il 2026-09-23:
• Indice di Intelligenza — Kimi K3 44 vs GLM-5.2 34
• AA-Briefcase v1.1 — 1510 vs 1233
• GDPval-AA v2.1 — 1524 vs 1358
• AutomationBench-AA — 58% vs 28%
• Terminal-Bench 4.0 — 13% vs 1%
• SciCode — 59% vs 51%
• L'ultimo esame dell'umanità — 47% vs 41%
• GDP.pdf — 22% vs 10%
• AA-LCR v1.1 — 89% contro 78%
• CritPt — 23% vs 21%
Due avvertenze prima che qualcuno faccia uno screenshot di quella lista.
Innanzitutto, la revisione dell'indice. La copertura del lancio di luglio di Kimi K3 lo riportava a 57 sull'Intelligence Index, con GLM-5.2 a 51. Le pagine live di oggi dicono 44 e 34. Non sono la stessa misurazione — Artificial Analysis rivede l'indice e ricalcola i punteggi dei modelli rispetto a esso, e mettere una cifra di luglio accanto a una di settembre è l'errore più facile da fare con questo accostamento. La direzione è stabile in ogni istantanea; i numeri assoluti non sono confrontabili tra le revisioni.
Secondo, i livelli. Terminal-Bench 4.0 al 13% e all'1% è una valutazione difficile, e a quell'altitudine il rapporto ti dice più di entrambi i numeri. AA-Omniscience, che verifica se un modello conosce i limiti della propria conoscenza, pone GLM-5.2 a 4 contro il 20 di Kimi K3 — un livello minimo di cui vale la pena essere consapevoli se prevedi di eseguirne uno dei due senza supervisione.
Un'altra cosa che Artificial Analysis registra a proposito della scheda GLM-5.2: contrassegna la configurazione di massimo ragionamento come deprecata a favore del più recente GLM-5.3. Ciò non cambia nessuno dei dati sopra riportati, che sono un'istantanea di GLM-5.2 così come è stato misurato, ma significa che la roadmap di Z.ai ha superato questo modello. Su un endpoint instradato ciò costa una stringa di modello anziché una migrazione, ed è il principale argomento per non codificare in modo fisso nessuno di questi due nomi nella propria applicazione.
Agenti e uso degli strumenti: dove il divario è più ampio
Se un blocco di quella tabella dovesse decidere l'acquisto, è questo. Il lavoro agentico a lungo termine è dove il margine di Kimi K3 è più ampio e più costante:
• AutomationBench-AA — 58% vs 28%, un divario di 30 punti
• GDPval-AA v2.1 — 1524 vs 1358
• AA-Briefcase v1.1 — 1510 vs 1233
• Terminal-Bench 4.0 — 13% vs 1%
Il materiale di rilascio di Moonshot si basa sulla stessa narrazione — il rilascio dei pesi di K3 è arrivato insieme a un report tecnico che copre lo stack di addestramento expert-parallel del fornitore e un harness agente-ambiente — ma il materiale del fornitore è materiale del fornitore, e le cifre sopra sono quelle indipendenti.
L'aggregatore di terze parti LLM Stats, che esegue il proprio composito su un set di benchmark condiviso, giunge alla stessa conclusione da una direzione diversa: degli undici benchmark che valuta per entrambi i modelli, Kimi K3 si aggiudica tutti e undici, e i suoi punteggi di categoria mettono Kimi K3 in vantaggio su uso di strumenti (30.8 vs 19.6), agenti (38.3 vs 29.6) e programmazione (42.3 vs 34.8). Quelli sono i compositi di LLM Stats secondo la sua stessa ponderazione, su un set condiviso che non è grande, quindi trattali come corroborazione piuttosto che come risultato di laboratorio. Undici su undici non è comunque una vittoria di stretta misura.
Programmazione
Stessa direzione, margine più ridotto. Nelle valutazioni di coding che Artificial Analysis assegna a entrambi, Kimi K3 guida SciCode 59% contro 51%; sull'insieme condiviso di LLM Stats si aggiudica DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench e Terminal-Bench 2.1. I numeri lusinghieri di GLM-5.2 — 99,2% su AIME 2026, 94,4% su HMMT 2025, 91,2% su GPQA come riportati dagli aggregatori di terze parti — sono dichiarati dal fornitore e non riprodotti, e la maggior parte di essi misura matematica da competizione anziché ingegneria del software.
La lettura pratica: per un agente di codifica che viene eseguito a lungo, modifica molti file e deve riprendersi dai propri errori, il margine agentico di Kimi K3 è il segnale più rilevante rispetto ai punteggi in matematica di entrambi i modelli. Per un assistente di codice veloce, economico e in gran parte single-shot, il vantaggio di throughput di GLM-5.2 vale più del costo del divario nei benchmark.
Dove sono abbastanza vicini da non avere importanza
Prezzo dell'input in cache — 0,26 $ contro 0,30 $ per milione, un divario del 15% rispetto a un divario di 3,4x sull'output
• Finestra di contesto — 1.000.000 vs 1.048.576 token
• p95 tempo al primo token — 10,00 s vs 10,00 s sul nostro routing
• CritPt — 23% vs 21%
• Matematica — LLM Stats colloca GLM-5.2 marginalmente in vantaggio sul proprio composito di matematica (41,4 vs 40,9), mentre Kimi K3 guida su matematica con immagini; in base alle evidenze disponibili, nessuno dei due modelli domina l'aritmetica
Chiunque ti dica che uno di questi modelli è il doppio dell'altro su tutti i fronti sta leggendo una singola riga della tabella.
Scegli GLM-5.2 se…
Sei tu che paghi il conto, e il conto è il vincolo. GLM-5.2 ha un prezzo per l'output pari a circa un terzo, è più economico anche sulla voce della cache, ha licenza MIT senza trigger sui ricavi da verificare, è più veloce alla mediana e molto più veloce in streaming, e la sua finestra da un milione di token è vicina a quella di Kimi K3 quanto basta perché la differenza non decida mai nulla. Se il tuo carico di lavoro è testo in ingresso e testo in uscita, e si tratta soprattutto di lettura più che di lunghe catene di chiamate a strumenti, i punti in più nei benchmark di Kimi K3 sono punti che la tua applicazione non raccoglierà mai.
Scegli Kimi K3 se…
Il lavoro è agentico e lungo. Il divario di 30 punti su AutomationBench, i vantaggi su GDPval e AA-Briefcase, il margine di undici punti nel ragionamento a contesto lungo e la dominanza sul set condiviso di LLM Stats puntano tutti nella stessa direzione: Kimi K3 è il modello migliore a cui affidare un compito multi-step e poi andarsene. È anche l'unico dei due che accetta immagini. Per questo pagherai all'incirca il doppio per compito, e se il tuo working set è pesantemente in cache pagherai meno del doppio — ma la ragione per sceglierlo non è il prezzo, e non è la velocità.
Entrambi sono instradabili su OrcaRouter da un'unica chiave verso un unico endpoint compatibile con OpenAI, ai prezzi di listino dei provider, senza alcun ricarico aggiuntivo, ed entrambi stanno dietro lo stesso failover automatico. È il modo più economico per scoprire quale dei due il tuo carico di lavoro vuole davvero, perché passare dall'uno all'altro è una stringa di modello, non un contratto.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
