Nex-N2.5 Pro vs GLM-5.2 hero — una title card generata con la scritta 'Nex-N2.5 Pro vs GLM-5.2', il sottotitolo 'Due modelli agentici open-weights, una coincidenza sospetta a 82.7' e il sopratitolo 'Nex-AGI vs Z.ai — settembre 2026'.
Guides & Insights

Nex-N2.5 Pro vs GLM-5.2: lo stesso 82,7 su Terminal-Bench, due provenienze molto diverse

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due modelli agentici a pesi aperti, una coincidenza sospetta: Nex-N2.5 Pro e GLM-5.2 si attestano entrambi a 82.7 su Terminal-Bench 2.1. Nex-AGI dichiara 82.7 per Nex-N2.5 Pro sulla propria scheda modello, misurato sull'harness NexCUA dell'alleanza stessa, che il pubblico non ha mai visto. Il miglior dato dichiarato da Z.ai per GLM-5.2 sulla stessa suite è anch'esso 82.7 — e quando un harness indipendente ha rieseguito il modello, si è fermato a 77.9, circa cinque punti sotto il numero del fornitore. Un pareggio perfetto tra un dato che nessuno può verificare e un dato che si è già ridotto quando è stato verificato non è affatto un pareggio. È la dimostrazione più chiara possibile del perché la differenza tra "pesi aperti" e "pesi che prima o poi esisteranno" decide questo confronto prima ancora che venga letta una singola riga di benchmark.

Entrambi i modelli si trovano nello stesso quartiere commerciale e non potrebbero essere più diversi per natura. Nex-N2.5 Pro, annunciato l'8 settembre 2026, è un modello multimodale per l'uso del computer: 397 miliardi di parametri totali con circa 17 miliardi attivi, costruito sulla base della linea Qwen3.5, progettato per leggere uno schermo e guidare una sessione browser o desktop con un ciclo di feedback visivo. GLM-5.2 è il modello di punta con licenza MIT di Z.ai (Zhipu AI) per ragionamento e coding a lungo orizzonte: circa 743 miliardi di parametri totali con circa 40 miliardi attivi, solo testo, in GA dal 16 giugno 2026, e il modello che per mesi ha ancorato i punteggi indipendenti della fascia open-weights. Uno guarda il mondo attraverso i pixel e agisce su di esso. L'altro pensa in testo e produce codice. La licenza di entrambi dice che puoi costruirci un business; la differenza è che su uno di essi quella licenza è attualmente una promessa.

Lo stesso numero, due provenienze diverse

Parti dal pareggio, perché è ciò che spiega l'intero confronto. La scheda di Nex-AGI elenca Terminal-Bench 2.1 a 82,7 per Nex-N2.5 Pro, insieme a OSWorld-2 a 56,4, SWE-Bench Pro a 61,2 e BrowseComp a 89,7 — tutti prodotti tramite l'harness NexCUA e nessuno riprodotto in modo indipendente nei primi giorni di vita del modello, per il semplice motivo che i pesi non sono scaricabili. La cifra di Z.ai di 82,7 per GLM-5.2 su Terminal-Bench 2.1 è il miglior dato dichiarato dal fornitore stesso, ma si riferisce a un modello che chiunque può scaricare da Hugging Face e rieseguire questo pomeriggio; la misurazione indipendente condotta con l'harness, pari a 77,9, esiste già ed è di circa cinque punti inferiore a quanto dichiara Z.ai. Quando un dato dichiarato da un fornitore si riduce sotto i test indipendenti, non è uno scandalo — è la normale tassa sull'autovalutazione. Quando un dato di un fornitore concorrente non può nemmeno essere testato, l'assenza della tassa è il problema, non un segno che il dato sia immacolato.

A two-column scoreboard titled 'Nex-N2.5 Pro vs GLM-5.2 — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; License Apache-2.0 pending; Params 397B / ~17B active; Modality text + image (computer use); Terminal-Bench 2.1 82.7 vendor; Price free hosted / no list. Right column GLM-5.2: GA Jun 16 2026; License MIT live now; Params ~743B / ~40B active; Modality text only; Terminal-Bench 2.1 82.7 claimed / 77.9 independent; Price $1.40 / $4.40 per 1M. Footer: 'Nex and Z.ai figures vendor-reported; 77.9 per the OrcaRouter harness.'

Leggi le righe circostanti allo stesso modo. GLM-5.2 detiene la lettura di indice indipendente più alta mai prodotta dal livello open — i bassi anni 50 nell'attuale Intelligence Index di Artificial Analysis — motivo per cui è stato il modello open di riferimento per mesi, pur non essendo la nuova release più appariscente. Nex-N2.5 Pro non ha alcuna voce di indice indipendente. Nelle righe in cui entrambi i fornitori dichiarano numeri, quello verificabile è quello dell'incumbent; nelle righe in cui solo Nex-AGI ha pubblicato, i numeri non sono riprodotti. Non è un verdetto su quale modello sia più intelligente. È un verdetto su quale modello ti è consentito verificare.

Le schede tecniche concordano più di quanto ci si aspetterebbe.

Togliendo i benchmark, i due modelli si allineano strettamente sui fondamenti:

Rilasciati — Nex-N2.5 Pro: 8 settembre 2026 (endpoint ospitati attivi, pesi in sospeso). GLM-5.2: GA 16 giugno 2026, pesi disponibili.

Licenza — Nex-N2.5 Pro: Apache-2.0, pesi in arrivo. GLM-5.2: MIT, scaricabile ora.

Scala — Nex-N2.5 Pro: 397B totali / ~17B attivi. GLM-5.2: ~743B totali / ~40B attivi.

Modalità — Nex-N2.5 Pro: input testo e immagini, output testo, ciclo di visione per uso computer. GLM-5.2: modello di ragionamento solo testo.

Contesto / output — Nex-N2.5 Pro: contesto da 262.144 token. GLM-5.2: contesto da 1 milione di token, limite massimo di output di 128K.

Controllo del ragionamento — Nex-N2.5 Pro: nessuno / medio (adattivo, predefinito) / alto. GLM-5.2: controlli dello sforzo di ragionamento sulla stessa stringa del modello.

Prezzo per 1M token — Nex-N2.5 Pro: piano gratuito ospitato, nessun prezzo di listino. GLM-5.2: $1.40 input / $4.40 output, $0.26 input in cache.

I profili differiscono per come differiscono i ruoli dei due modelli: GLM-5.2 porta alle lunghe sessioni di ingegneria un contesto testuale di un intero milione di token e un tetto di output di 128K, mentre Nex-N2.5 Pro scambia la dimensione del contesto con un canale visivo e una finestra più piccola da 262K, pensata per carichi di lavoro a dimensione di schermo. Nessuna delle due specifiche è sbagliata: sono pensate per compiti diversi.

Open weights, due significati diversi

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

È qui che il confronto smette del tutto di essere una questione di numeri. GLM-5.2 è aperto come si rilascia un prodotto su cui costruire un business: licenza MIT, pesi su Hugging Face, nessuna restrizione all'uso commerciale, nessuna clausola di condivisione dei dati, nessun fornitore che ti guarda alle spalle. Puoi scaricarlo, metterlo a punto, servirlo entro i tuoi confini di conformità o portarlo su qualsiasi host preferisci — e poiché i pesi sono pubblici, il suo prezzo ha un pavimento sotto di sé che nessun singolo fornitore può alzare. Nex-N2.5 Pro è promesso sotto Apache-2.0, una licenza altrettanto permissiva, ma il banner sulla sua scheda Hugging Face dice che i pesi sono in arrivo, e nessuna data è allegata. Per un team soggetto a regole di governance dei dati, o per uno che vuole eliminare del tutto i prezzi per token su larga scala, quella differenza è l'intera decisione: GLM-5.2 è un modello che puoi possedere oggi, e Nex-N2.5 Pro è un modello che ti è stato promesso. Anche i conti del self-hosting favoriscono il nuovo arrivato quando i pesi finalmente arriveranno — 17B di parametri attivi su un nodo con otto H100 è un'impronta molto più accessibile della configurazione da ~40B attivi di GLM-5.2 — ma "quando i pesi arriveranno" sta facendo un bel po' di lavoro in quella frase.

Le famiglie si stanno muovendo in direzioni opposte.

Entrambi i modelli fanno parte di famiglie in rapida evoluzione, e le traiettorie puntano in direzioni diverse. La discendenza di GLM-5.2 è trasparente e iterativa: Z.ai ha rilasciato GLM-5.3 ad agosto come aggiornamento post-training della stessa base 5.2 e GLM-5.3 Flash all'inizio di settembre, quindi i pesi 5.2 su cui costruisci oggi sono il fondamento che la famiglia continua a migliorare — la tua conoscenza dell'architettura e i tuoi fine-tuning vengono portati avanti. La famiglia di Nex-AGI punta su una generazione completamente nuova: Nex-N2.5 Mini a 35B, Nex-N2.5 Pro a 397B e un Nex-N2.5 Max solo testo a 1.6T la cui base è DeepSeek-V4-Pro-Base, con i pesi Pro che consentirebbero a chiunque di validare le affermazioni della famiglia ancora non pubblicati. Un team che sceglie una piattaforma su cui costruire sta scegliendo tra una discendenza con una roadmap pubblicata di aggiornamenti e un primo rilascio il cui secondo atto non è ancora arrivato.

Quale si guadagna un posto nella tua build?

Se il tuo requisito è «il modello deve essere nostro» — per la governance dei dati, per l'audit, per un prodotto di cui non vuoi che un singolo fornitore abbia il controllo — allora GLM-5.2 non è la scelta migliore in questo confronto; è l'unica scelta, perché è l'unico modello tra questi che puoi scaricare. È anche l'unico con un punteggio indipendente, con un prezzo di listino Z.ai di $1,40 per milione di token di input e $4,40 per milione di token di output. Se il tuo requisito è un agente multimodale per l'uso del computer che col tempo potrebbe scalzare i leader a codice chiuso, Nex-N2.5 Pro è la tesi a lungo termine più interessante — un operatore visivo da 17B di parametri attivi, proveniente da un'alleanza che sa chiaramente cosa vuole costruire — ma una tesi non è una dipendenza, e un endpoint ospitato gratuitamente non è una base.

Screenshot of the OrcaRouter model page for GLM-5.2 (z-ai/glm-5.2), marked FEATURED, showing the header stats $1.40 input and $4.40 output per million tokens and the byline 'by Z.ai - 2026-06-16'.

Il modo pratico per agire su tutto questo è costruire su ciò che esiste e misurare la promessa quando si concretizza. GLM-5.2 è su OrcaRouter al prezzo di listino di Z.ai — gli stessi $1,40 / $4,40, senza alcun ricarico — e, poiché è open-weights, è anche auto-ospitabile se vuoi che la misurazione includa il tuo stack di serving. È il punto di riferimento contro cui far girare oggi il tuo workload agentico reale, con il DSL di routing già pronto per il giorno in cui Nex-N2.5 Pro comparirà su un provider a listino: quando ciò accadrà, cambiare il confronto sarà una regola di routing, non una migrazione. Finché gli shard non vengono rilasciati e un harness indipendente non conferma — o corregge — quel 82,7, Nex-N2.5 Pro vs GLM-5.2 è un confronto tra un modello che puoi verificare e un numero che non puoi.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno