
Nex-N2.5 Mini: pesi aperti disponibili al lancio — l'agente di utilizzo del computer più piccolo di Nex-AGI è la rampa d'accesso.
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Intelligenza49Codice
Il modo per scoprire se gli agenti open per l'uso del computer sono pronti è ora un modello che puoi scaricare lo stesso giorno in cui viene annunciato. Nex-AGI ha presentato la sua famiglia Nex-N2.5 l'8 settembre 2026 — tre livelli agentici, Nex-N2.5 Mini, Nex-N2.5 Pro e Nex-N2.5 Max — e il livello con la storia "scarica ed esegui" è il più piccolo. Nex-N2.5 Mini ha i suoi pesi Apache-2.0 pubblicati su Hugging Face in sedici shard BF16, circa 35 miliardi di parametri con circa 3 miliardi attivi per token secondo quanto riportato, e un deployment di riferimento con due H100. Il suo fratello multimodale più grande, Nex-N2.5 Pro, è ancora contrassegnato come "coming soon" al momento in cui scriviamo, mentre il Nex-N2.5 Max, solo testo da 1,6 trilioni di parametri, è disponibile anch'esso ma richiede sedici H200 su due nodi prima di girare. Per chiunque voglia testare la tesi alla base della famiglia — che i modelli agentici open possano reggere nell'uso del computer su lunghi orizzonti, anziché limitarsi a rispondere a domande — la Mini è il punto di ingresso.
Chi è Nex-AGI? Il nome è nuovo e il lancio ha il sapore di un primo rilascio pubblico. La copertura mediatica dell'annuncio descrive il progetto come una collaborazione tra diverse organizzazioni di Shanghai — Shanghai Innovation Institute, Shanghai Qiji Zhifeng, Mosi Intelligence e Kuafu Technology — con la famiglia presentata come open-source e il team che opera sotto l'handle @NexEcosystem. La scheda del modello presenta Nex-N2.5-mini e Nex-N2.5-Pro come il proseguimento delle "fondamenta multimodali di Nex-N2", la precedente release di Nex i cui pesi sono già open. Ciò che è davvero nuovo qui è l'impostazione: Nex-AGI afferma di aver costruito questi modelli per compiti a lungo orizzonte in ambienti del mondo reale — usare un computer, pilotare un browser, eseguire e testare codice e correggere la rotta in base a ciò che vede sullo schermo — e ha pubblicato i pesi per rendere verificabile questa affermazione.
Tre livelli, un annuncio
La famiglia si divide per scala e per modalità, e le differenze contano più del nome condiviso:
• Nex-N2.5 Mini — circa 35B totali / ~3B attivi, un modello multimodale che accetta immagini e testo, pensato per l'uso visivo del computer, la navigazione e le attività che richiedono feedback da un'interfaccia. Il deployment di riferimento è un singolo nodo con due H100.
• Nex-N2.5 Pro — riportati 397B totali / ~17B attivi, anche multimodale, per carichi di lavoro più pesanti di utilizzo del computer. Il deployment di riferimento è su otto H100. I suoi pesi non erano scaricabili al lancio.
• Nex-N2.5 Max — 1.6T totali / ~49B attivi, solo testo, e secondo quanto affermato da Nex-AGI, è il suo "primo sforzo completo di post-addestramento su scala di trilioni di parametri." La scheda afferma che è costruito su una base DeepSeek-V4-Pro-Base. Il deployment di riferimento è 16×H200 su due nodi.
Tutti e tre sono mixture-of-experts. Mini e Pro appartengono alla famiglia di modelli Qwen3.5 — i materiali di lancio di Nex-AGI descrivono entrambi come post-addestrati da varianti Qwen3.5, e la configurazione della Mini stessa porta un tag di architettura qwen3_5_moe — mentre Max è l'elemento anomalo basato su DeepSeek. Quindi la famiglia non è una ricetta unica in tre formati; è due ricette, con i livelli multimodali «che fanno cose sullo schermo» che condividono un'unica discendenza e il gigante del ragionamento testuale che segue l'altra.
Cosa è in realtà il Nex-N2.5 Mini che è stato spedito
Il repository Hugging Face per nex-agi/Nex-N2.5-mini è un checkpoint reale e scaricabile, non un segnaposto — 16 shard safetensors per circa 70 GB totali, BF16, licenza Apache-2.0, creato per la prima volta l'8 settembre. Il file di configurazione è abbastanza specifico da poter progettare in base ad esso:
• Architettura — Qwen3_5MoeForConditionalGeneration, la famiglia qwen3_5_moe, con uno stack di visione: la scheda lo etichetta come image-text-to-text e il repository include preprocessor_config.json insieme alla configurazione del testo.
• Forma — 40 strati, dimensione nascosta 2048, attenzione a query raggruppate con 16 teste di query e 2 teste KV, un vocabolario di 248.320.
• MoE — 256 esperti instradati con 8 attivi per token più un esperto condiviso, dimensione intermedia 512 — il profilo ad attivazione sparsa che rende eseguibile su due H100 un modello di "classe 35B" con ~3B parametri attivi.
Contesto — max_position_embeddings di 262.144 token nella configurazione rilasciata, lo stesso valore 262K che compare nelle ricette di distribuzione dell'intera famiglia.
• Pesi e licenza — BF16, Apache-2.0, non soggetto a gating; il repository rimanda anche a un mirror ModelScope e a un’organizzazione GitHub (nex-agi) che contiene le ricette di deployment della famiglia.
La documentazione di deployment di Nex-AGI è la parte che la maggior parte dei rilasci open source sbaglia, e questa riesce a fare insolitamente bene. Il Mini viene servito tramite un'immagine Docker SGLang personalizzata (nexagi/sglang:v0.5.18-nex-patch) su un singolo nodo con due H100 usando tensor parallelism 2. Il campionamento consigliato è temperatura 0.7, top_p 0.95, top_k 40. La chiamata degli strumenti avviene tramite il parser qwen3_coder di SGLang, e il modello espone tre modalità di ragionamento tramite un campo reasoning_effort: "none" per il non-thinking, "medium" (il default adattivo) e "high" per il thinking sempre attivo. Per un piccolo modello agentico, quel controllo della modalità di thinking fa la differenza tra un agent loop utilizzabile e uno lento, ed è integrato nella ricetta di serving invece di essere lasciato all'utente.

Weights: cosa è effettivamente scaricabile
Vale la pena chiarire con precisione lo stato dei tre livelli al giorno del lancio, perché l'annuncio e i repository non combaciano del tutto. Al momento in cui scriviamo, il Mini è completamente scaricabile con licenza Apache-2.0 — è su questo che si basa questo articolo. Anche Nex-N2.5 Max è disponibile, con il suo repository Hugging Face che contiene 644 shard safetensors, anche se riprodurre la sua scala da mille miliardi di parametri è un progetto da 16×H200. Nex-N2.5 Pro è il modello che manca all'appello: il suo repository Hugging Face esiste, ma contiene solo il README e le figure, nessuno shard del modello, e la scheda riporta ancora che i pesi sono in arrivo. Se il livello che ti interessa è quello multimodale grande, è questo il punto da tenere d'occhio — i materiali di lancio descrivono Pro come il modello più forte della famiglia per l'uso del computer, ed è quello che non puoi ancora eseguire localmente.

I numeri riportati da Nex-AGI — e l'avvertenza che li accompagna
La scheda del modello di Nex-AGI include una tabella di benchmark completa per il Mini, e ogni dato in essa riportato è dichiarato dal fornitore stesso. Al momento in cui scriviamo non era stato pubblicato alcun test indipendente, e la scheda precisa esplicitamente che i punteggi provengono dalle classifiche ufficiali dei benchmark e dai più recenti rapporti di valutazione dove disponibili, e dalle valutazioni interne di Nex-AGI negli altri casi. I risultati di coding sono stati prodotti con l'harness NexAU del team; i risultati relativi all'uso del computer e del browser sono stati ottenuti con l'harness NexCUA, che — secondo la scheda — verrà reso open-source. Considera le righe principali come il caso migliore dichiarato dal fornitore, finché una parte neutrale non le riproduce.
Con questa impostazione, le righe riportate per il Mini sono: per il lavoro su testo e codice, Terminal-Bench 2.1 a 73.4, SWE-Bench Pro a 43.8, DeepSWE v1.1 a 36.1, AutomationBench v1.0.6 a 32.3, Toolathlon Verified a 54.6, BrowseComp a 83.4 e un punteggio GDPval-AA v2 di 1446. Sul versante multimodale/uso del computer, i dati che catturano l'attenzione sono OSWorld-Verified a 71.2, WebArena-Verified a 63.4, WebTest a 48.6 (eseguito in modalità oracle rispetto a liste di controllo ground-truth), OSWorld-G a 82.9 e OmniDoc a 89.7, insieme a risultati più modesti per OSWorld-2 (30.5) e Vision2Web (52.9).
Due note di lettura. In primo luogo, OSWorld-Verified e OSWorld-2 sono suite diverse — l'una è un sottoinsieme verificato valutato in base allo stato dell'ambiente risultante, l'altra un'esecuzione più recente e generalmente più severa — quindi un 71,2 su una e un 30,5 sull'altra non sono contraddittori; sono test differenti, e la tabella di Nex li tiene in colonne separate. In secondo luogo, in ogni riga della tabella di famiglia, Mini ottiene punteggi inferiori a Pro e Max, e la cima di ogni colonna appartiene a un incumbent di frontiera come Claude Opus 5 o GPT-5.6 Sol. La storia di Mini non è che batte i modelli di frontiera; è che un modello open da ~3B attivi riporta punteggi competitivi sui benchmark di computer-use con un'ingombro di due H100. Se questo regga è esattamente la domanda a cui i pesi open ti permettono di rispondere da solo.
Eseguendo Nex-N2.5 Mini oggi
La configurazione a due H100 rende il Mini il modo più economico per toccare con mano l'affermazione centrale della famiglia. Poiché l'architettura è una Qwen3.5-MoE standard con un parser per chiamate di strumenti qwen3_coder, si carica nel fork Nex-AGI di SGLang senza codice di inferenza personalizzato, e le impostazioni consigliate sono pubblicate invece di essere lasciate al reverse-engineering. L'aspettativa onesta da definire prima di iniziare è che un checkpoint vecchio di un giorno con un harness nuovo di zecca è un esperimento, non una dipendenza. I download sul repo del Mini sono ancora a una cifra e nessun terzo aveva rilasciato una valutazione indipendente quando questo articolo è stato scritto — che è lo stato normale per un modello rilasciato ieri, e il motivo per cui l'ingombro a due H100 conta: puoi eseguire l'esperimento tu stesso questa settimana invece di aspettare che lo faccia qualcun altro.

Se preferisci confrontare il Mini con gli agenti frontier nella sua tabella di benchmark piuttosto che ottimizzare a mano un singolo deployment, è lì che un livello di routing dimostra il suo valore. Quando un provider di hosting elenca Nex-N2.5 Mini — e gli incumbent con cui viene confrontato sono già raggiungibili tramite router — un'unica API su 200+ modelli, con i prezzi di listino del provider applicati a markup 0% e failover automatico, è il modo conveniente per eseguire lo stesso compito su molti di essi senza una seconda integrazione. Su OrcaRouter, questa è la configurazione standard per ogni modello che instradiamo: la stessa chiave, la stessa forma di chiamata, il prezzo del vendor senza alcuna aggiunta. Questo aspetto conta soprattutto per un modello ancora non collaudato come questo, perché è il failover a permetterti di provarlo su un percorso reale senza scommettere l'intero percorso su di esso.
Chi dovrebbe tirare questi pesi?
Scaricali se il tuo lavoro riguarda agenti che usano il computer, automazione del browser o uso di strumenti basato su input visivi, e vuoi un modello con licenza permissiva e auto-ospitabile da confrontare nei benchmark con i leader ospitati. La licenza Apache-2.0 elimina il consueto attrito per un rilascio da parte di un laboratorio cinese, il requisito di due H100 è alla portata di un team serio che sviluppa agenti, e il controllo dello sforzo di ragionamento insieme a un vero parser per le chiamate a strumenti lo rendono un banco di prova credibile, non un giocattolo. Rimanda se ti serve il modello più forte della famiglia per l'uso del computer: quello è il ruolo di Pro, e i pesi di Pro sono quelli ancora in sospeso. E tieni l'etichetta del fornitore su ogni riga dei benchmark finché una valutazione indipendente non conferma i risultati; un 71,2 su OSWorld-Verified da un modello open con ~3B parametri attivi è un'affermazione sorprendente, ed è esattamente il tipo di affermazione che vale la pena verificare nella tua infrastruttura di test prima di costruirci sopra.
Cosa tenere d'occhio. Il rilascio dei pesi del modello Pro è il segnale di gran lunga più importante: trasforma la famiglia da “Mini più un gigante da mille miliardi di parametri” nella gamma completa descritta nei materiali di lancio. Il secondo è l'open-sourcing dell'harness NexCUA, senza il quale i dati relativi all'uso del computer non possono essere riprodotti in modo indipendente con lo stesso protocollo. Il terzo è la prima esecuzione neutrale — da parte di Artificial Analysis, di un laboratorio universitario o di un professionista che pubblichi una propria riproduzione OSWorld-Verified. Quando uno qualsiasi di questi tre segnali arriverà, la domanda posta da questo lancio — se i modelli agenzici open source abbiano davvero colmato il divario rispetto agli stack ospitati per l'uso del computer — smetterà di essere una questione di tabelle fornite dai vendor.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
