Una card hero per 'Nex-N2.5 Mini' con il sottotitolo 'Open weights landed at launch - the small computer-use agent', chip con le scritte 'APACHE-2.0', '35B TOTAL / ~3B ACTIVE' e '262K CONTEXT', e un nastro con la dicitura 'IMAGE + TEXT INPUT - 2x H100 REFERENCE', con il logo OrcaRouter posizionato in basso a destra.
Guides & Insights

Nex-N2.5 Mini: pesi aperti disponibili al lancio — l'agente di utilizzo del computer più piccolo di Nex-AGI è la rampa d'accesso.

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il modo per scoprire se gli agenti open per l'uso del computer sono pronti è ora un modello che puoi scaricare lo stesso giorno in cui viene annunciato. Nex-AGI ha presentato la sua famiglia Nex-N2.5 l'8 settembre 2026 — tre livelli agentici, Nex-N2.5 Mini, Nex-N2.5 Pro e Nex-N2.5 Max — e il livello con la storia "scarica ed esegui" è il più piccolo. Nex-N2.5 Mini ha i suoi pesi Apache-2.0 pubblicati su Hugging Face in sedici shard BF16, circa 35 miliardi di parametri con circa 3 miliardi attivi per token secondo quanto riportato, e un deployment di riferimento con due H100. Il suo fratello multimodale più grande, Nex-N2.5 Pro, è ancora contrassegnato come "coming soon" al momento in cui scriviamo, mentre il Nex-N2.5 Max, solo testo da 1,6 trilioni di parametri, è disponibile anch'esso ma richiede sedici H200 su due nodi prima di girare. Per chiunque voglia testare la tesi alla base della famiglia — che i modelli agentici open possano reggere nell'uso del computer su lunghi orizzonti, anziché limitarsi a rispondere a domande — la Mini è il punto di ingresso.

Chi è Nex-AGI? Il nome è nuovo e il lancio ha il sapore di un primo rilascio pubblico. La copertura mediatica dell'annuncio descrive il progetto come una collaborazione tra diverse organizzazioni di Shanghai — Shanghai Innovation Institute, Shanghai Qiji Zhifeng, Mosi Intelligence e Kuafu Technology — con la famiglia presentata come open-source e il team che opera sotto l'handle @NexEcosystem. La scheda del modello presenta Nex-N2.5-mini e Nex-N2.5-Pro come il proseguimento delle "fondamenta multimodali di Nex-N2", la precedente release di Nex i cui pesi sono già open. Ciò che è davvero nuovo qui è l'impostazione: Nex-AGI afferma di aver costruito questi modelli per compiti a lungo orizzonte in ambienti del mondo reale — usare un computer, pilotare un browser, eseguire e testare codice e correggere la rotta in base a ciò che vede sullo schermo — e ha pubblicato i pesi per rendere verificabile questa affermazione.

Tre livelli, un annuncio

La famiglia si divide per scala e per modalità, e le differenze contano più del nome condiviso:

• Nex-N2.5 Mini — circa 35B totali / ~3B attivi, un modello multimodale che accetta immagini e testo, pensato per l'uso visivo del computer, la navigazione e le attività che richiedono feedback da un'interfaccia. Il deployment di riferimento è un singolo nodo con due H100.

• Nex-N2.5 Pro — riportati 397B totali / ~17B attivi, anche multimodale, per carichi di lavoro più pesanti di utilizzo del computer. Il deployment di riferimento è su otto H100. I suoi pesi non erano scaricabili al lancio.

• Nex-N2.5 Max — 1.6T totali / ~49B attivi, solo testo, e secondo quanto affermato da Nex-AGI, è il suo "primo sforzo completo di post-addestramento su scala di trilioni di parametri." La scheda afferma che è costruito su una base DeepSeek-V4-Pro-Base. Il deployment di riferimento è 16×H200 su due nodi.

Tutti e tre sono mixture-of-experts. Mini e Pro appartengono alla famiglia di modelli Qwen3.5 — i materiali di lancio di Nex-AGI descrivono entrambi come post-addestrati da varianti Qwen3.5, e la configurazione della Mini stessa porta un tag di architettura qwen3_5_moe — mentre Max è l'elemento anomalo basato su DeepSeek. Quindi la famiglia non è una ricetta unica in tre formati; è due ricette, con i livelli multimodali «che fanno cose sullo schermo» che condividono un'unica discendenza e il gigante del ragionamento testuale che segue l'altra.

Cosa è in realtà il Nex-N2.5 Mini che è stato spedito

Il repository Hugging Face per nex-agi/Nex-N2.5-mini è un checkpoint reale e scaricabile, non un segnaposto — 16 shard safetensors per circa 70 GB totali, BF16, licenza Apache-2.0, creato per la prima volta l'8 settembre. Il file di configurazione è abbastanza specifico da poter progettare in base ad esso:

• Architettura — Qwen3_5MoeForConditionalGeneration, la famiglia qwen3_5_moe, con uno stack di visione: la scheda lo etichetta come image-text-to-text e il repository include preprocessor_config.json insieme alla configurazione del testo.

• Forma — 40 strati, dimensione nascosta 2048, attenzione a query raggruppate con 16 teste di query e 2 teste KV, un vocabolario di 248.320.

• MoE — 256 esperti instradati con 8 attivi per token più un esperto condiviso, dimensione intermedia 512 — il profilo ad attivazione sparsa che rende eseguibile su due H100 un modello di "classe 35B" con ~3B parametri attivi.

Contesto — max_position_embeddings di 262.144 token nella configurazione rilasciata, lo stesso valore 262K che compare nelle ricette di distribuzione dell'intera famiglia.

• Pesi e licenza — BF16, Apache-2.0, non soggetto a gating; il repository rimanda anche a un mirror ModelScope e a un’organizzazione GitHub (nex-agi) che contiene le ricette di deployment della famiglia.

La documentazione di deployment di Nex-AGI è la parte che la maggior parte dei rilasci open source sbaglia, e questa riesce a fare insolitamente bene. Il Mini viene servito tramite un'immagine Docker SGLang personalizzata (nexagi/sglang:v0.5.18-nex-patch) su un singolo nodo con due H100 usando tensor parallelism 2. Il campionamento consigliato è temperatura 0.7, top_p 0.95, top_k 40. La chiamata degli strumenti avviene tramite il parser qwen3_coder di SGLang, e il modello espone tre modalità di ragionamento tramite un campo reasoning_effort: "none" per il non-thinking, "medium" (il default adattivo) e "high" per il thinking sempre attivo. Per un piccolo modello agentico, quel controllo della modalità di thinking fa la differenza tra un agent loop utilizzabile e uno lento, ed è integrato nella ricetta di serving invece di essere lasciato all'utente.

A single-column scoreboard titled 'Nex-N2.5 Mini - the scoreboard' with rows 'Params: 35B total / ~3B active (vendor-reported)', 'Architecture: qwen3_5_moe MoE - 256 experts / 8 active', 'Context: 262,144 tokens', 'Input: image + text', 'License: Apache-2.0 - BF16 weights live' and 'OSWorld-Verified: 71.2 (vendor-reported)', with a footer 'Specs from the HF config; benchmarks are Nex-AGI-reported, no independent run yet.'

Weights: cosa è effettivamente scaricabile

Vale la pena chiarire con precisione lo stato dei tre livelli al giorno del lancio, perché l'annuncio e i repository non combaciano del tutto. Al momento in cui scriviamo, il Mini è completamente scaricabile con licenza Apache-2.0 — è su questo che si basa questo articolo. Anche Nex-N2.5 Max è disponibile, con il suo repository Hugging Face che contiene 644 shard safetensors, anche se riprodurre la sua scala da mille miliardi di parametri è un progetto da 16×H200. Nex-N2.5 Pro è il modello che manca all'appello: il suo repository Hugging Face esiste, ma contiene solo il README e le figure, nessuno shard del modello, e la scheda riporta ancora che i pesi sono in arrivo. Se il livello che ti interessa è quello multimodale grande, è questo il punto da tenere d'occhio — i materiali di lancio descrivono Pro come il modello più forte della famiglia per l'uso del computer, ed è quello che non puoi ancora eseguire localmente.

A screenshot of the Hugging Face repository page for nex-agi/Nex-N2.5-mini (captured September 9, 2026), showing the model header with Text Generation / Transformers / Safetensors / qwen3_5_moe / image-text-to-text / conversational tags and 'License: apache-2.0', and the Files & versions tree for the main branch listing config.json, README.md, chat_template.jinja and the figures directory.

I numeri riportati da Nex-AGI — e l'avvertenza che li accompagna

La scheda del modello di Nex-AGI include una tabella di benchmark completa per il Mini, e ogni dato in essa riportato è dichiarato dal fornitore stesso. Al momento in cui scriviamo non era stato pubblicato alcun test indipendente, e la scheda precisa esplicitamente che i punteggi provengono dalle classifiche ufficiali dei benchmark e dai più recenti rapporti di valutazione dove disponibili, e dalle valutazioni interne di Nex-AGI negli altri casi. I risultati di coding sono stati prodotti con l'harness NexAU del team; i risultati relativi all'uso del computer e del browser sono stati ottenuti con l'harness NexCUA, che — secondo la scheda — verrà reso open-source. Considera le righe principali come il caso migliore dichiarato dal fornitore, finché una parte neutrale non le riproduce.

Con questa impostazione, le righe riportate per il Mini sono: per il lavoro su testo e codice, Terminal-Bench 2.1 a 73.4, SWE-Bench Pro a 43.8, DeepSWE v1.1 a 36.1, AutomationBench v1.0.6 a 32.3, Toolathlon Verified a 54.6, BrowseComp a 83.4 e un punteggio GDPval-AA v2 di 1446. Sul versante multimodale/uso del computer, i dati che catturano l'attenzione sono OSWorld-Verified a 71.2, WebArena-Verified a 63.4, WebTest a 48.6 (eseguito in modalità oracle rispetto a liste di controllo ground-truth), OSWorld-G a 82.9 e OmniDoc a 89.7, insieme a risultati più modesti per OSWorld-2 (30.5) e Vision2Web (52.9).

Due note di lettura. In primo luogo, OSWorld-Verified e OSWorld-2 sono suite diverse — l'una è un sottoinsieme verificato valutato in base allo stato dell'ambiente risultante, l'altra un'esecuzione più recente e generalmente più severa — quindi un 71,2 su una e un 30,5 sull'altra non sono contraddittori; sono test differenti, e la tabella di Nex li tiene in colonne separate. In secondo luogo, in ogni riga della tabella di famiglia, Mini ottiene punteggi inferiori a Pro e Max, e la cima di ogni colonna appartiene a un incumbent di frontiera come Claude Opus 5 o GPT-5.6 Sol. La storia di Mini non è che batte i modelli di frontiera; è che un modello open da ~3B attivi riporta punteggi competitivi sui benchmark di computer-use con un'ingombro di due H100. Se questo regga è esattamente la domanda a cui i pesi open ti permettono di rispondere da solo.

Eseguendo Nex-N2.5 Mini oggi

La configurazione a due H100 rende il Mini il modo più economico per toccare con mano l'affermazione centrale della famiglia. Poiché l'architettura è una Qwen3.5-MoE standard con un parser per chiamate di strumenti qwen3_coder, si carica nel fork Nex-AGI di SGLang senza codice di inferenza personalizzato, e le impostazioni consigliate sono pubblicate invece di essere lasciate al reverse-engineering. L'aspettativa onesta da definire prima di iniziare è che un checkpoint vecchio di un giorno con un harness nuovo di zecca è un esperimento, non una dipendenza. I download sul repo del Mini sono ancora a una cifra e nessun terzo aveva rilasciato una valutazione indipendente quando questo articolo è stato scritto — che è lo stato normale per un modello rilasciato ieri, e il motivo per cui l'ingombro a due H100 conta: puoi eseguire l'esperimento tu stesso questa settimana invece di aspettare che lo faccia qualcun altro.

A screenshot of the nex-agi collections page on Hugging Face (captured September 9, 2026), showing the Nex-N2.5 collection 'updated about 7 hours ago' with the three model entries nex-agi/Nex-N2.5-Max (Text Generation, 1.6T), nex-agi/Nex-N2.5-Pro and nex-agi/Nex-N2.5-mini, alongside the earlier Nex-N2, Nex-N1.1 and Nex-N1 collections listed on the left.

Se preferisci confrontare il Mini con gli agenti frontier nella sua tabella di benchmark piuttosto che ottimizzare a mano un singolo deployment, è lì che un livello di routing dimostra il suo valore. Quando un provider di hosting elenca Nex-N2.5 Mini — e gli incumbent con cui viene confrontato sono già raggiungibili tramite router — un'unica API su 200+ modelli, con i prezzi di listino del provider applicati a markup 0% e failover automatico, è il modo conveniente per eseguire lo stesso compito su molti di essi senza una seconda integrazione. Su OrcaRouter, questa è la configurazione standard per ogni modello che instradiamo: la stessa chiave, la stessa forma di chiamata, il prezzo del vendor senza alcuna aggiunta. Questo aspetto conta soprattutto per un modello ancora non collaudato come questo, perché è il failover a permetterti di provarlo su un percorso reale senza scommettere l'intero percorso su di esso.

Chi dovrebbe tirare questi pesi?

Scaricali se il tuo lavoro riguarda agenti che usano il computer, automazione del browser o uso di strumenti basato su input visivi, e vuoi un modello con licenza permissiva e auto-ospitabile da confrontare nei benchmark con i leader ospitati. La licenza Apache-2.0 elimina il consueto attrito per un rilascio da parte di un laboratorio cinese, il requisito di due H100 è alla portata di un team serio che sviluppa agenti, e il controllo dello sforzo di ragionamento insieme a un vero parser per le chiamate a strumenti lo rendono un banco di prova credibile, non un giocattolo. Rimanda se ti serve il modello più forte della famiglia per l'uso del computer: quello è il ruolo di Pro, e i pesi di Pro sono quelli ancora in sospeso. E tieni l'etichetta del fornitore su ogni riga dei benchmark finché una valutazione indipendente non conferma i risultati; un 71,2 su OSWorld-Verified da un modello open con ~3B parametri attivi è un'affermazione sorprendente, ed è esattamente il tipo di affermazione che vale la pena verificare nella tua infrastruttura di test prima di costruirci sopra.

Cosa tenere d'occhio. Il rilascio dei pesi del modello Pro è il segnale di gran lunga più importante: trasforma la famiglia da “Mini più un gigante da mille miliardi di parametri” nella gamma completa descritta nei materiali di lancio. Il secondo è l'open-sourcing dell'harness NexCUA, senza il quale i dati relativi all'uso del computer non possono essere riprodotti in modo indipendente con lo stesso protocollo. Il terzo è la prima esecuzione neutrale — da parte di Artificial Analysis, di un laboratorio universitario o di un professionista che pubblichi una propria riproduzione OSWorld-Verified. Quando uno qualsiasi di questi tre segnali arriverà, la domanda posta da questo lancio — se i modelli agenzici open source abbiano davvero colmato il divario rispetto agli stack ospitati per l'uso del computer — smetterà di essere una questione di tabelle fornite dai vendor.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube