Nex-N2.5 Pro vs GPT-5.6 Sol hero — una scheda titolo generata che recita 'Nex-N2.5 Pro vs GPT-5.6 Sol' con il sottotitolo 'Un modello open di un giorno contro il record di produzione più profondo del settore' e un sopratitolo 'OpenAI vs Nex-AGI — settembre 2026'.
Guides & Insights

Nex-N2.5 Pro vs GPT-5.6 Sol: il numero del produttore del nuovo arrivato è inferiore a quello indipendente dell'incumbent.

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Prendete l'unico benchmark in cui entrambi hanno un numero e metteteli fianco a fianco: l'ordine delle operazioni è sbagliato per un lancio. La scheda di Nex-AGI assegna a Nex-N2.5 Pro un 56.4 su OSWorld-2, misurato sull'harness NexCUA dell'alleanza stessa, che il pubblico non ha mai visto. La leaderboard OSWorld 2.0 di BenchLM, aggiornata al 29 agosto, colloca GPT-5.6 Sol a 62.6 — un numero indipendente che supera apertamente quello dichiarato dal vendor del nuovo arrivato. Sul terreno di casa del modello vecchio di un giorno — l'uso del computer tramite lettura dello schermo, l'unica cosa per cui è stato progettato — il generalista maturo con cui viene confrontato non ha nemmeno bisogno di un asterisco per risultare in vantaggio. Nex-N2.5 Pro contro GPT-5.6 Sol non è una gara equilibrata su nessuna dimensione misurata da qualcuno diverso dal produttore del nuovo arrivato. È un caso di studio su quanto valga un record di produzione, e vale la pena leggerlo solo per questo motivo.

I due modelli sono a malapena rivali per intento. Nex-N2.5 Pro, annunciato l'8 settembre 2026, è un modello sparse mixture-of-experts da 397 miliardi di parametri con circa 17 miliardi di parametri attivi, multimodale (testo e immagini in ingresso, testo in uscita), post-addestrato dalla famiglia Qwen3.5, e costruito per controllare computer e browser attraverso un ciclo di feedback visivo. I suoi pesi con licenza Apache-2.0 sono ancora contrassegnati come "in arrivo" su Hugging Face, e le sue uniche build attive sono endpoint ospitati gratuitamente che Nex-AGI collega dalla sua scheda. GPT-5.6 Sol è il fiore all'occhiello di OpenAI per "il lavoro più difficile" — ragionamento profondo a più passaggi, ingegneria del software su larga scala e flussi di lavoro agentici a lungo orizzonte — disponibile nell'API dal 9 luglio, con pesi chiusi, e che ora porta il peso di essere stato il punto di riferimento all'avanguardia finché OpenAI non ha rilasciato GPT-6 Astra il 3 settembre. Mentre Nex-N2.5 Pro è uno specialista che non ha ancora rilasciato i propri pesi, GPT-5.6 Sol è un generalista comprovato, distribuito per due mesi sul traffico di produzione più esigente del settore.

GPT-5.6 Sol è il modello con un file.

Cominciamo da ciò che Sol ha e Nex-N2.5 Pro non ha: un record. Dal 9 luglio, GPT-5.6 Sol è stato sottoposto a harness indipendenti, stressato dai ricercatori di sicurezza e integrato in framework per agenti e flussi di lavoro Codex. Le sue misurazioni indipendenti sono approfondite e pubbliche: 61 sull'Artificial Analysis Intelligence Index al massimo del ragionamento, 88.0 su Terminal-Bench 2.1 e 73.0 su DeepSWE misurati dallo stesso harness indipendente, e una velocità di output misurata intorno ai 71 token al secondo con un costo di circa $0.95 per attività dell'Intelligence Index. Nulla di tutto ciò lo rende imbattibile — OpenAI ha da allora posizionato GPT-6 Astra al di sopra di esso — ma ognuno di quei numeri è una misurazione prodotta da qualcuno diverso da OpenAI. Nex-N2.5 Pro non ha alcuna voce indipendente da nessuna parte, per una ragione strutturale: nessuno al di fuori dell'alleanza può eseguirlo.

L'unico benchmark in cui entrambi hanno un numero.

Il confronto su OSWorld è la lettura più chiara disponibile, quindi merita che le sue precisazioni vengano dichiarate prima di usarlo. Il punteggio di 56,4 di Nex-N2.5 Pro è la misurazione di Nex-AGI su OSWorld-2 attraverso il suo harness NexCUA. Il punteggio di 62,6 di GPT-5.6 Sol proviene dalla classifica OSWorld 2.0 di BenchLM, uno snapshot di terze parti datato 29 agosto 2026, che elenca quindici modelli e colloca Claude Opus 5 al primo posto con 70,6, GPT-5.6 Sol al secondo con 62,6 e GPT-5.6 Terra al terzo con 50,2. "OSWorld-2" e "OSWorld 2.0" sono molto vicini ma non è dimostrato che siano identici, quindi il divario esatto di quattro-sei punti va letto come indicativo, non come preciso. Ciò che sopravvive alle precisazioni è l'ordinamento: in base al miglior numero che ciascuna parte può produrre, una cifra Sol indipendente batte una cifra del vendor Nex sul benchmark che Nex ha scelto di pubblicare. Un nuovo arrivato il cui numero è inferiore al numero indipendente dell'incumbent non ha presentato un caso convincente per il passaggio.

A two-column scoreboard titled 'Nex-N2.5 Pro vs GPT-5.6 Sol — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Weights Apache-2.0 pending; OSWorld 2.0 56.4 vendor-reported; AA Index no score yet; Context 262,144; Price free hosted / no list. Right column GPT-5.6 Sol: Released Jul 9 2026; Weights closed; OSWorld 2.0 62.6 independent; AA Index 61 (max); Context ~1.05M; Price $4.00 / $20.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Sol OSWorld per BenchLM Aug 29 and Index per Artificial Analysis.'

Buste specifiche

Il resto della scheda tecnica prosegue nella stessa direzione:

Rilasciato — Nex-N2.5 Pro: 8 settembre 2026 (endpoint ospitati attivi, pesi in attesa). GPT-5.6 Sol: 9 luglio 2026, generalmente disponibile.

Scala — Nex-N2.5 Pro: 397B totali / ~17B attivi MoE. GPT-5.6 Sol: numero di parametri non divulgato.

Modalità — Nex-N2.5 Pro: input di testo e immagini, output di testo, loop di visione per l'uso del computer. GPT-5.6 Sol: input di testo, immagini e file, output di testo, con chiamata di strumenti e modalità JSON.

Contesto / outputNex-N2.5 Pro: contesto di 262.144 token. GPT-5.6 Sol: contesto di ~1,05M token, tetto di output di 128K.

Controllo del ragionamento — Nex-N2.5 Pro: nessuno / medio (adattivo, predefinito) / alto. GPT-5.6 Sol: sforzo di ragionamento fino al massimo, più un livello separato di elaborazione rapida.

Pesi — Nex-N2.5 Pro: Apache-2.0, in arrivo. GPT-5.6 Sol: chiuso.

Prezzo per 1M token — Nex-N2.5 Pro: livello gratuito ospitato, nessun prezzo di listino. GPT-5.6 Sol: prezzo di listino promozionale di $4,00 / $20,00 dal 21 agosto; $0,40 per input in cache; oltre i 272K token di input, la tariffazione torna a $8,00 / $30,00.

Il contesto di ~1,05 milioni di token e il tetto di output di 128K di Sol fanno impallidire la finestra di 262K di Nex-N2.5 Pro per i lavori a lungo orizzonte, e il prezzo di Sol, benché tutt'altro che economico, è un numero fisso che un budget può mettere in conto. Il livello gratuito di Nex-N2.5 Pro è l'unico numero a suo favore, e non è un prezzo.

Quanto vale un punteggio vecchio di un giorno

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

Ogni affermazione di benchmark associata a Nex-N2.5 Pro — OSWorld-2 a 56,4, Terminal-Bench 2.1 a 82,7, SWE-Bench Pro a 61,2, BrowseComp a 89,7 — condivide una proprietà: a produrla è stata Nex-AGI, tramite un'infrastruttura di test che l'alleanza dice di voler rendere open-source, ma che non ha ancora rilasciato. Nessuna di queste cifre è stata riprodotta in modo indipendente, perché nessuna può esserlo: i pesi non sono scaricabili e al banner "prossimamente" non è associata alcuna data. Questo conta più in questo confronto che nella maggior parte degli altri, perché il modello con cui Nex-N2.5 Pro viene confrontato ha la più lunga storia di valutazioni indipendenti del settore. Quando l'intera base di prove dello sfidante è auto-dichiarata e quella dell'incumbent non lo è, l'onere della prova ricade interamente sullo sfidante, e un endpoint gratuito non lo assolve. Nel momento in cui gli shard arriveranno e un laboratorio indipendente eseguirà Nex-N2.5 Pro, i numeri di questo articolo diventeranno verificabili e il confronto diventerà reale. Fino ad allora, "punteggio vecchio di un giorno" è l'espressione esatta: un punteggio che non può essere ispezionato su un modello che non può essere eseguito.

Prezzo, percorso e forma della decisione

Il costo è l'aspetto in cui le due parti sono meno confrontabili, perché solo una delle due ha un costo. Il prezzo di GPT-5.6 Sol, pari a $4.00 / $20.00, è il prezzo di listino promozionale di OpenAI, in vigore dal 21 agosto e dichiarato valido almeno fino al 21 novembre, in calo rispetto a $5.00 / $30.00 — un taglio che ha reso il modello di punta notevolmente più accessibile per il lavoro agentico ad alto volume, e che un router pass-through riflette lo stesso giorno in cui OpenAI lo attua. Sol è disponibile su OrcaRouter a quel prezzo di listino, senza ricarichi, con il livello batch e il livello veloce accessibili tramite la stessa chiave API di oltre 200 altri modelli; un team può quindi instradare le richieste che richiedono la profondità di OpenAI verso Sol e tutto il resto verso modelli più economici. Nex-N2.5 Pro non ha un prezzo di listino, ma solo i suoi endpoint hosted gratuiti — un buon modo per valutare un modello e una base inadeguata per un budget di produzione. Non puoi pianificare una spesa attorno a un numero che non esiste, e non puoi pianificare un'architettura attorno a pesi che non sono stati rilasciati.

Screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), marked FEATURED, showing the header stats $4.00 input and $20.00 output per million tokens and the byline 'by OpenAI - 2026-07-09'.

La decisione che questo confronto in realtà impone riguarda il rischio, non la capacità. Se ti serve un modello che ci sarà ancora il prossimo trimestre, con un prezzo noto, un profilo di guasto noto e mesi di test avversariali alle spalle, GPT-5.6 Sol è la scelta razionale — e il lancio di GPT-6 Astra da parte di OpenAI a un livello superiore non fa che rafforzare questa tesi, perché Sol è ora il cavallo di battaglia collaudato, con il taglio di prezzo mirato direttamente al volume di produzione. Se stai costruendo agenti in grado di usare il computer su pesi aperti e puoi permetterti di aspettare qualcosa di verificabile, Nex-N2.5 Pro merita di essere osservato — uno specialista multimodale con 17B attivi è esattamente il tipo di modello che ha ripetutamente sottoquotato la frontiera chiusa sul fronte dei costi. Ma osservare è la parola chiave. Su ogni dimensione misurata da chiunque altro oltre al suo creatore, Nex-N2.5 Pro è in ritardo rispetto al modello che ha il file, e finché i pesi non verranno rilasciati, il confronto finisce qui.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno