L'hero di 'Nex-N2.5 Pro vs Claude Opus 5' è una card di titolo generata che riporta 'Nex-N2.5 Pro vs Claude Opus 5', con sottotitolo 'L'anteprima gratuita e aperta di computer-use vs il leader nei benchmark che puoi instradare oggi' e sopratitolo 'Anthropic vs Nex-AGI — settembre 2026'.
Guides & Insights

Nex-N2.5 Pro contro Claude Opus 5: Nex-AGI ha scelto il metro di paragone, e il metro di paragone ha vinto

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Nex-AGI ha scelto il metro di paragone, e il metro di paragone ha vinto. Quando l’alleanza open-model con sede a Shanghai ha presentato Nex-N2.5 Pro l’8 settembre 2026, la tabella computer-use della scheda del modello metteva Claude Opus 5 nella colonna di confronto e Nex-N2.5 Pro nello slot del contendente: 68,3 per Claude Opus 5 contro 56,4 per Nex-N2.5 Pro su OSWorld-2, entrambe le cifre esattamente come Nex-AGI le aveva stampate sulla propria scheda. Le classifiche indipendenti, da allora, hanno ampliato anziché ridurre il divario: l’istantanea OSWorld 2.0 del 29 agosto di BenchLM colloca Claude Opus 5 al primo posto tra i quindici modelli elencati, con 70,6. Concedere dodici punti al leader del settore sul benchmark che hai scelto di pubblicare non è la consueta coreografia di lancio, ed è per questo che la parte interessante di Nex-N2.5 Pro vs Claude Opus 5 non è il punteggio. È ciò che i due lati di quel punteggio rappresentano davvero: un modello aperto di computer-use con 397 miliardi di parametri che nessuno al di fuori dell’alleanza è ancora riuscito a eseguire o verificare, e l’ammiraglia chiusa di Anthropic che guida il benchmark e che sostiene il traffico di produzione da fine luglio.

Premessa onesta: questa non è una sfida tra due quantità misurate, perché solo uno dei due contendenti è stato misurato da qualcuno diverso dal suo creatore. Nex-N2.5 Pro è un modello sparso a miscela di esperti, con circa 17 miliardi di parametri attivi su un totale di 397 miliardi, addestrato successivamente dalla linea Qwen3.5, e punta direttamente all'uso operativo di computer e browser su lunghi orizzonti temporali, con un ciclo di feedback visivo. Oggi viene servito tramite endpoint hosted gratuiti che i link Nex-AGI forniscono dalla sua scheda modello, mentre i pesi con licenza Apache-2.0 su cui si basa la famiglia restano indicati come "in arrivo" senza alcuna data. Claude Opus 5 è il fiore all'occhiello produttivo di Anthropic per ragionamento impegnativo, codifica e lavoro agenziale — un modello chiuso con contesto da 1 milione di token, un controllo del pensiero adattivo, un prezzo documentato e settimane di voci nelle classifiche pubbliche e traffico produttivo alle spalle. Ogni vantaggio in questo confronto appartiene a uno di questi due fatti: un modello è eseguibile e verificabile, l'altro non è né l'uno né l'altro.

Il benchmark su cui entrambe le parti concordano

I benchmark di utilizzo del computer premiano lo stesso comportamento che questi modelli sono progettati per vendere: un agente che osserva uno schermo, decide un'azione, la esegue e rilegge lo schermo modificato per verificare se l'azione ha funzionato. Nex-N2.5 Pro è architettato esattamente attorno a quel ciclo — la visione non è una modalità di input aggiunta a posteriori, ma il canale di feedback su cui l'agente verifica. Claude Opus 5 tratta lo stesso ciclo come un carico di lavoro tra molti, ma capita che sia molto bravo in questo, ed è per questo che Nex-AGI lo ha usato come punto di riferimento fin dall'inizio.

I due numeri non provengono, a rigor di termini, dallo stesso harness. Nex-AGI ha prodotto i propri risultati OSWorld-2 tramite il proprio harness di valutazione NexCUA, che l'azienda dichiara di voler rendere open-source ma che non ha ancora rilasciato, e il 56,4 di Nex-N2.5 Pro è un output del fornitore non replicato. Il 70,6 di Claude Opus 5 su BenchLM è uno snapshot di terze parti di OSWorld 2.0, datato 29 agosto 2026, ed è coerente con il 68,3 che Nex-AGI stessa cita dalle classifiche. Harness diversi e versioni leggermente differenti del benchmark fanno sì che il divario esatto — dodici punti nella scheda di Nex-AGI, più vicino a quattordici su BenchLM — debba essere letto come indicativo. Ma non è in discussione che Nex-N2.5 Pro, stando ai migliori numeri disponibili da entrambe le parti, si collochi al di sotto dell'attuale agente all'avanguardia per l'uso del computer.

A two-column scoreboard titled 'Nex-N2.5 Pro vs Claude Opus 5 — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Params 397B total / ~17B active; Focus computer use; OSWorld 2.0 56.4 vendor-reported; Weights Apache-2.0 pending; Price free hosted / no list price. Right column Claude Opus 5: Released Jul 24 2026; Params undisclosed; Focus general plus computer use; OSWorld 2.0 70.6 per BenchLM; Weights closed; Price $5.00 / $25.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Opus OSWorld per BenchLM Aug 29.'

Due risposte a 'posso eseguirlo oggi'

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

Questo è il bivio che decide davvero la partita per un team operativo, e non favorisce il nuovo arrivato. La scheda Hugging Face di Nex-N2.5 Pro mostra ancora il banner che annuncia l'arrivo imminente dei pesi sotto licenza Apache-2.0, senza alcuna data di rilascio indicata. Le uniche build attive sono gli endpoint ospitati gratuitamente che Nex-AGI collega dalla scheda: chiamabili, ma di proprietà di qualcun altro, senza prezzo di listino, senza termini di servizio su cui un team possa contare per pianificare, e senza alcun modo di riprodurre un singolo valore di benchmark sul proprio hardware. Quando i pesi finalmente arriveranno, la ricetta di serving documentata prevede un singolo nodo di otto GPU H100 su un'immagine SGLang personalizzata — un'infrastruttura reale ma ordinaria per un MoE da 397B, ed è esattamente ciò che rende interessante il design con 17B attivi. Fino ad allora, Nex-N2.5 Pro è un'anteprima interrogabile, non un modello su cui costruire.

Claude Opus 5 è l'opposto su ciascuna di quelle righe. È stato servito tramite l'API di Anthropic e su piattaforme instradate dal 24 luglio, il suo prezzo è pubblico e stabile, i suoi pesi sono chiusi e rimarranno chiusi, e ognuno dei suoi numeri può essere verificato oggi eseguendolo. L'ecosistema circostante — Claude Code, gli strumenti MCP e lo sciame di agenti di produzione che lo hanno stressato per sei settimane — è esattamente lo storico accumulato che un modello vecchio di un giorno non può vantare. Per un team il cui requisito è "il modello deve funzionare il prossimo trimestre", quello storico è l'intera partita.

La scheda tecnica, per quella che è.

Metti le due buste una accanto all'altra:

Rilasciato — Nex-N2.5 Pro: 8 settembre 2026 (endpoint ospitati attivi, pesi in attesa). Claude Opus 5: 24 luglio 2026, generalmente disponibile.

Scala — Nex-N2.5 Pro: 397B totali / ~17B MoE attivi. Claude Opus 5: numero di parametri non divulgato.

Modalità — Nex-N2.5 Pro: input di testo e immagini, output di testo, visione centrale nel suo ciclo di utilizzo del computer. Claude Opus 5: input di testo e immagini, output di testo, con una forte analisi visiva.

Context / output — Nex-N2.5 Pro: 262,144-token context, documented serving length. Claude Opus 5: 1M-token context, 128K-token output ceiling.

Controllo del ragionamento — Nex-N2.5 Pro: un selettore reasoning_effort con nessuno / medio (adattivo, predefinito) / alto. Claude Opus 5: pensiero adattivo per impostazione predefinita, con un controllo esplicito dello sforzo da minimo a massimo.

Pesi — Nex-N2.5 Pro: Apache-2.0, in arrivo, nessuna data. Claude Opus 5: chiuso.

Prezzo per 1 milione di token — Nex-N2.5 Pro: livello gratuito ospitato, nessun prezzo di listino pubblicato. Claude Opus 5: $5.00 per l'input / $25.00 per l'output, $0.50 per le letture in cache, $6.25 per le scritture in cache.

I profili sono abbastanza diversi da far compiere alla scheda tecnica un lavoro concreto: Opus 5 offre una finestra da un milione di token e un tetto di output di 128K per le lunghe sessioni degli agenti, mentre il contesto da 262K e il livello gratuito di Nex-N2.5 Pro si adattano ad automazioni di portata più ridotta e guidate dallo schermo. Nessuna specifica rende l'altra superflua; i modelli non concordano su ciò su cui un agente spende il proprio contesto.

Leggere onestamente il tabellone dei punteggi di Nex-AGI.

Il resto della scheda merita di essere letto con lo stesso filtro. Le altre righe di computer-use di Nex-N2.5 Pro — OSWorld-G 87.4, OSWorld-Verified 82.2, WebArena-Verified 67.6, WebTest 52.8, Vision2Web 68.2 — e le sue righe di coding — Terminal-Bench 2.1 a 82.7, SWE-Bench Pro a 61.2, BrowseComp a 89.7 — sono tutte misurazioni del vendor effettuate tramite l'harness dell'alleanza stessa, non riprodotte nelle prime 48 ore. L'unica conclusione che un lettore neutrale può trarre dalla scheda è che Nex-AGI ritiene Nex-N2.5 Pro un solido modello di computer-use di fascia media, che resta indietro rispetto all'agente di frontiera sulla riga che conta di più. Si tratta di un posizionamento coerente, persino conservativo, per un modello open da 397B. È anche un'affermazione che attende un secondo laboratorio.

Il denaro, quando una parte non ha prezzo.

Non c'è un confronto di prezzi onesto da fare qui, perché solo una delle due parti ha un prezzo. {{1}}Il piano gratuito ospitato di Nex-N2.5 Pro non dice nulla sul valore del modello{{/1}} — {{2}}gli endpoint di anteprima gratuiti sono il modo in cui i fornitori raccolgono traffico e feedback{{/2}}, e {{3}}Nex-AGI non ha pubblicato alcuna tariffa a pagamento per token per la famiglia{{/3}}. {{4}}Claude Opus 5 costa $5.00 per milione di token in input e $25.00 per milione in output al prezzo di listino di Anthropic{{/4}}, con {{5}}letture dalla cache a $0.50{{/5}}, {{6}}ed è questa la cifra che un budget deve assorbire{{/6}}. {{7}}Se oggi stai pagando quella fattura per agenti che usano il computer{{/7}} {{8}}e vuoi sapere se un modello open da 17B di parametri attivi potrebbe fare lo stesso lavoro a costi inferiori{{/8}}, {{9}}la risposta è: forse{{/9}}, {{10}}ma non puoi scoprirlo finché i pesi non vengono rilasciati e qualcuno di indipendente non esegue il modello{{/10}}. {{11}}Il confronto dei prezzi è rinviato, non risolto{{/11}}, {{12}}e trattare un endpoint gratuito come prova di economicità sarebbe un errore di categoria{{/12}}.

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5) showing the header stats $5.00 input and $25.00 output per million tokens and the byline 'by Anthropic - 2026-07-24'.

Quello che puoi fare oggi è impostare l'A/B per il giorno in cui diventerà possibile. Claude Opus 5 è su OrcaRouter al prezzo di listino di Anthropic — gli stessi $5.00 / $25.00, passati senza alcun ricarico, quindi una fattura qui corrisponde a quella di Anthropic e si adegua quando Anthropic si adegua. Un'unica chiave API lo mette dietro lo stesso endpoint di altri 200+ modelli, con failover automatico se un provider ha un intoppo e il DSL di routing se vuoi Opus per le chiamate difficili e un modello più economico per quelle di routine. Nex-N2.5 Pro non è su OrcaRouter — abbiamo controllato la nostra directory dei modelli prima di scrivere, e nessun modello nex-agi è ancora elencato lì. Nel momento in cui un provider lo offrirà a listino, apparirà qui lo stesso giorno, e il confronto onesto che questo articolo non può ancora eseguire diventa una regola di routing invece che una migrazione.

Chi dovrebbe agire, e chi dovrebbe aspettare

Se il tuo team esegue oggi workload di computer-use o agentic-coding in produzione e ha bisogno di un modello con un prezzo noto, un profilo di errore noto e un track record indipendente, Claude Opus 5 è la scelta razionale in questo confronto, e nulla nelle prime 48 ore di Nex-N2.5 Pro cambia le cose. Se il tuo team sta valutando modelli open di computer-use per una futura implementazione, Nex-N2.5 Pro merita un posto nella watch list — un MoE multimodale da 397B con un footprint di self-hosting ragionevole e una storia di benchmark di fascia media plausibile è esattamente il tipo di modello open che ridisegna la curva dei costi, a patto che i pesi arrivino davvero e che i numeri della scheda sopravvivano a una verifica indipendente. La posizione razionale è entrambe le cose insieme: tenere il leader consolidato sul percorso critico e lasciare che sia il giorno in cui i pesi verranno rilasciati a decidere se il nuovo arrivato merita una prova. Questo è l'unico confronto di questo matchup che non è ancora avvenuto — ed è quello che conterà davvero.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno