
Nex-N2.5 Pro vs GLM-5.2: lo stesso 82,7 su Terminal-Bench, due provenienze molto diverse
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0455Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0247Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0247Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0157Intelligenza82Codice
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2646Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1849Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1541Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1251Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0547Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligenza49Codice
Due modelli agentici a pesi aperti, una coincidenza sospetta: Nex-N2.5 Pro e GLM-5.2 si attestano entrambi a 82.7 su Terminal-Bench 2.1. Nex-AGI dichiara 82.7 per Nex-N2.5 Pro sulla propria scheda modello, misurato sull'harness NexCUA dell'alleanza stessa, che il pubblico non ha mai visto. Il miglior dato dichiarato da Z.ai per GLM-5.2 sulla stessa suite è anch'esso 82.7 — e quando un harness indipendente ha rieseguito il modello, si è fermato a 77.9, circa cinque punti sotto il numero del fornitore. Un pareggio perfetto tra un dato che nessuno può verificare e un dato che si è già ridotto quando è stato verificato non è affatto un pareggio. È la dimostrazione più chiara possibile del perché la differenza tra "pesi aperti" e "pesi che prima o poi esisteranno" decide questo confronto prima ancora che venga letta una singola riga di benchmark.
Entrambi i modelli si trovano nello stesso quartiere commerciale e non potrebbero essere più diversi per natura. Nex-N2.5 Pro, annunciato l'8 settembre 2026, è un modello multimodale per l'uso del computer: 397 miliardi di parametri totali con circa 17 miliardi attivi, costruito sulla base della linea Qwen3.5, progettato per leggere uno schermo e guidare una sessione browser o desktop con un ciclo di feedback visivo. GLM-5.2 è il modello di punta con licenza MIT di Z.ai (Zhipu AI) per ragionamento e coding a lungo orizzonte: circa 743 miliardi di parametri totali con circa 40 miliardi attivi, solo testo, in GA dal 16 giugno 2026, e il modello che per mesi ha ancorato i punteggi indipendenti della fascia open-weights. Uno guarda il mondo attraverso i pixel e agisce su di esso. L'altro pensa in testo e produce codice. La licenza di entrambi dice che puoi costruirci un business; la differenza è che su uno di essi quella licenza è attualmente una promessa.
Lo stesso numero, due provenienze diverse
Parti dal pareggio, perché è ciò che spiega l'intero confronto. La scheda di Nex-AGI elenca Terminal-Bench 2.1 a 82,7 per Nex-N2.5 Pro, insieme a OSWorld-2 a 56,4, SWE-Bench Pro a 61,2 e BrowseComp a 89,7 — tutti prodotti tramite l'harness NexCUA e nessuno riprodotto in modo indipendente nei primi giorni di vita del modello, per il semplice motivo che i pesi non sono scaricabili. La cifra di Z.ai di 82,7 per GLM-5.2 su Terminal-Bench 2.1 è il miglior dato dichiarato dal fornitore stesso, ma si riferisce a un modello che chiunque può scaricare da Hugging Face e rieseguire questo pomeriggio; la misurazione indipendente condotta con l'harness, pari a 77,9, esiste già ed è di circa cinque punti inferiore a quanto dichiara Z.ai. Quando un dato dichiarato da un fornitore si riduce sotto i test indipendenti, non è uno scandalo — è la normale tassa sull'autovalutazione. Quando un dato di un fornitore concorrente non può nemmeno essere testato, l'assenza della tassa è il problema, non un segno che il dato sia immacolato.

Leggi le righe circostanti allo stesso modo. GLM-5.2 detiene la lettura di indice indipendente più alta mai prodotta dal livello open — i bassi anni 50 nell'attuale Intelligence Index di Artificial Analysis — motivo per cui è stato il modello open di riferimento per mesi, pur non essendo la nuova release più appariscente. Nex-N2.5 Pro non ha alcuna voce di indice indipendente. Nelle righe in cui entrambi i fornitori dichiarano numeri, quello verificabile è quello dell'incumbent; nelle righe in cui solo Nex-AGI ha pubblicato, i numeri non sono riprodotti. Non è un verdetto su quale modello sia più intelligente. È un verdetto su quale modello ti è consentito verificare.
Le schede tecniche concordano più di quanto ci si aspetterebbe.
Togliendo i benchmark, i due modelli si allineano strettamente sui fondamenti:
• Rilasciati — Nex-N2.5 Pro: 8 settembre 2026 (endpoint ospitati attivi, pesi in sospeso). GLM-5.2: GA 16 giugno 2026, pesi disponibili.
• Licenza — Nex-N2.5 Pro: Apache-2.0, pesi in arrivo. GLM-5.2: MIT, scaricabile ora.
• Scala — Nex-N2.5 Pro: 397B totali / ~17B attivi. GLM-5.2: ~743B totali / ~40B attivi.
• Modalità — Nex-N2.5 Pro: input testo e immagini, output testo, ciclo di visione per uso computer. GLM-5.2: modello di ragionamento solo testo.
• Contesto / output — Nex-N2.5 Pro: contesto da 262.144 token. GLM-5.2: contesto da 1 milione di token, limite massimo di output di 128K.
• Controllo del ragionamento — Nex-N2.5 Pro: nessuno / medio (adattivo, predefinito) / alto. GLM-5.2: controlli dello sforzo di ragionamento sulla stessa stringa del modello.
• Prezzo per 1M token — Nex-N2.5 Pro: piano gratuito ospitato, nessun prezzo di listino. GLM-5.2: $1.40 input / $4.40 output, $0.26 input in cache.
I profili differiscono per come differiscono i ruoli dei due modelli: GLM-5.2 porta alle lunghe sessioni di ingegneria un contesto testuale di un intero milione di token e un tetto di output di 128K, mentre Nex-N2.5 Pro scambia la dimensione del contesto con un canale visivo e una finestra più piccola da 262K, pensata per carichi di lavoro a dimensione di schermo. Nessuna delle due specifiche è sbagliata: sono pensate per compiti diversi.
Open weights, due significati diversi

È qui che il confronto smette del tutto di essere una questione di numeri. GLM-5.2 è aperto come si rilascia un prodotto su cui costruire un business: licenza MIT, pesi su Hugging Face, nessuna restrizione all'uso commerciale, nessuna clausola di condivisione dei dati, nessun fornitore che ti guarda alle spalle. Puoi scaricarlo, metterlo a punto, servirlo entro i tuoi confini di conformità o portarlo su qualsiasi host preferisci — e poiché i pesi sono pubblici, il suo prezzo ha un pavimento sotto di sé che nessun singolo fornitore può alzare. Nex-N2.5 Pro è promesso sotto Apache-2.0, una licenza altrettanto permissiva, ma il banner sulla sua scheda Hugging Face dice che i pesi sono in arrivo, e nessuna data è allegata. Per un team soggetto a regole di governance dei dati, o per uno che vuole eliminare del tutto i prezzi per token su larga scala, quella differenza è l'intera decisione: GLM-5.2 è un modello che puoi possedere oggi, e Nex-N2.5 Pro è un modello che ti è stato promesso. Anche i conti del self-hosting favoriscono il nuovo arrivato quando i pesi finalmente arriveranno — 17B di parametri attivi su un nodo con otto H100 è un'impronta molto più accessibile della configurazione da ~40B attivi di GLM-5.2 — ma "quando i pesi arriveranno" sta facendo un bel po' di lavoro in quella frase.
Le famiglie si stanno muovendo in direzioni opposte.
Entrambi i modelli fanno parte di famiglie in rapida evoluzione, e le traiettorie puntano in direzioni diverse. La discendenza di GLM-5.2 è trasparente e iterativa: Z.ai ha rilasciato GLM-5.3 ad agosto come aggiornamento post-training della stessa base 5.2 e GLM-5.3 Flash all'inizio di settembre, quindi i pesi 5.2 su cui costruisci oggi sono il fondamento che la famiglia continua a migliorare — la tua conoscenza dell'architettura e i tuoi fine-tuning vengono portati avanti. La famiglia di Nex-AGI punta su una generazione completamente nuova: Nex-N2.5 Mini a 35B, Nex-N2.5 Pro a 397B e un Nex-N2.5 Max solo testo a 1.6T la cui base è DeepSeek-V4-Pro-Base, con i pesi Pro che consentirebbero a chiunque di validare le affermazioni della famiglia ancora non pubblicati. Un team che sceglie una piattaforma su cui costruire sta scegliendo tra una discendenza con una roadmap pubblicata di aggiornamenti e un primo rilascio il cui secondo atto non è ancora arrivato.
Quale si guadagna un posto nella tua build?
Se il tuo requisito è «il modello deve essere nostro» — per la governance dei dati, per l'audit, per un prodotto di cui non vuoi che un singolo fornitore abbia il controllo — allora GLM-5.2 non è la scelta migliore in questo confronto; è l'unica scelta, perché è l'unico modello tra questi che puoi scaricare. È anche l'unico con un punteggio indipendente, con un prezzo di listino Z.ai di $1,40 per milione di token di input e $4,40 per milione di token di output. Se il tuo requisito è un agente multimodale per l'uso del computer che col tempo potrebbe scalzare i leader a codice chiuso, Nex-N2.5 Pro è la tesi a lungo termine più interessante — un operatore visivo da 17B di parametri attivi, proveniente da un'alleanza che sa chiaramente cosa vuole costruire — ma una tesi non è una dipendenza, e un endpoint ospitato gratuitamente non è una base.

Il modo pratico per agire su tutto questo è costruire su ciò che esiste e misurare la promessa quando si concretizza. GLM-5.2 è su OrcaRouter al prezzo di listino di Z.ai — gli stessi $1,40 / $4,40, senza alcun ricarico — e, poiché è open-weights, è anche auto-ospitabile se vuoi che la misurazione includa il tuo stack di serving. È il punto di riferimento contro cui far girare oggi il tuo workload agentico reale, con il DSL di routing già pronto per il giorno in cui Nex-N2.5 Pro comparirà su un provider a listino: quando ciò accadrà, cambiare il confronto sarà una regola di routing, non una migrazione. Finché gli shard non vengono rilasciati e un harness indipendente non conferma — o corregge — quel 82,7, Nex-N2.5 Pro vs GLM-5.2 è un confronto tra un modello che puoi verificare e un numero che non puoi.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
