
Nex-N2.5 Mini: Öppna vikter tillgängliga vid lansering — Nex-AGI:s minsta datoranvändningsagent är inkörsporten.
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Intelligens49Kodning
Det sätt att ta reda på om öppna datoranvändningsagenter är redo är nu en modell som du kan hämta samma dag som den tillkännages. Nex-AGI introducerade sin Nex-N2.5-familj den 8 september 2026 — tre agentiska nivåer, Nex-N2.5 Mini, Nex-N2.5 Pro och Nex-N2.5 Max — och nivån med nedladdnings-och-kör-historien är den minsta. Nex-N2.5 Mini har sina Apache-2.0-vikter live på Hugging Face i sexton BF16-delar, cirka 35 miljarder parametrar med rapporterade ~3 miljarder aktiva per token, och en referensdistribution med två H100:er. Dess större multimodala syskon Nex-N2.5 Pro är fortfarande märkt "kommer snart" när detta skrivs, medan den textbaserade Nex-N2.5 Max med 1,6 biljoner parametrar också är uppe men kräver sexton H200:er över två noder innan den körs. För den som testar tesen bakom familjen — att öppna agentiska modeller kan hålla måttet vid långvarig datoranvändning snarare än att bara svara på frågor — är Mini ingången.
Vem är Nex-AGI? Namnet är nytt, och lanseringen har karaktären av en första offentlig utgivning. Rapporteringen om tillkännagivandet beskriver satsningen som ett samarbete mellan flera Shanghai-organisationer – Shanghai Innovation Institute, Shanghai Qiji Zhifeng, Mosi Intelligence och Kuafu Technology – där modellfamiljen positioneras som öppen källkod och teamet verkar under kontot @NexEcosystem. Modelkortet anger att Nex-N2.5-mini och Nex-N2.5-Pro fortsätter ”de multimodala grunderna i Nex-N2,” den tidigare Nex-utgåvan vars vikter redan är öppna. Det som verkligen är nytt här är inramningen: Nex-AGI säger att de byggt dessa modeller för långsiktiga uppgifter i verkliga miljöer – att hantera en dator, köra en webbläsare, exekvera och testa kod, samt korrigera kursen utifrån vad den ser på skärmen – och de har publicerat vikterna för att göra påståendet testbart.
Tre nivåer, ett tillkännagivande
Familjen delas upp efter skala och modalitet, och skillnaderna betyder mer än det gemensamma namnet:
• Nex-N2.5 Mini — cirka 35B totalt / ~3B aktiva, en multimodal modell som tar emot bilder och text, avsedd för visuell datoranvändning, surfning och uppgifter som kräver feedback från ett gränssnitt. Referensdistributionen är en enda nod med två H100:er.
• Nex-N2.5 Pro — rapporterad 397B totalt / ~17B aktiva, även multimodal, för tyngre datoranvändningsarbetsbelastningar. Referensdistributionen är åtta H100:ar. Dess vikter gick inte att ladda ner vid lanseringen.
• Nex-N2.5 Max — 1,6T totalt / ~49B aktiva, textbaserad, och enligt Nex-AGI:s beskrivning dess ”första kompletta efterträningsarbete i trillion-parameterskala.” Kortet anger att den är byggd på en DeepSeek-V4-Pro-Base-grund. Referensdistributionen är 16×H200 över två noder.
Alla tre är mixture-of-experts. Mini och Pro bygger på Qwen3.5-modellfamiljen – Nex-AGI:s lanseringsmaterial beskriver båda som post-tränade från Qwen3.5-varianter, och Minis egen konfiguration har en qwen3_5_moe-arkitekturtagg – medan Max är den DeepSeek-baserade avvikaren. Så familjen är inte ett recept i tre storlekar; det är två recept, där de multimodala ”göra saker på skärmen”-nivåerna delar en härstamning och textresonemangsjätten en annan.
Vad Nex-N2.5 Mini som skickades faktiskt är
Hugging Face-repot för nex-agi/Nex-N2.5-mini är en riktig, nedladdningsbar checkpoint, inte en platshållare — 16 safetensors-shards på totalt cirka 70 GB, BF16, licens Apache-2.0, först skapad den 8 september. Konfigurationsfilen är tillräckligt specifik att designa mot:
Arkitektur — Qwen3_5MoeForConditionalGeneration, i familjen qwen3_5_moe, med en vision-stack: modellkortet märker den som image-text-to-text, och repo:t levererar preprocessor_config.json tillsammans med textkonfigurationen.
• Form — 40 lager, dold storlek 2048, grupperad query-uppmärksamhet med 16 query-huvuden och 2 KV-huvuden, en vokabulär på 248 320.
• MoE — 256 dirigerade experter med 8 aktiva per token plus en delad expert, intermediär storlek 512 — den sparsamt aktiverade profilen som gör en ~3B-aktiv modell i ”35B-klassen” körbar på två H100:er.
Kontext — max_position_embeddings på 262 144 tokens i den publicerade konfigurationen, samma 262K-siffra som återkommer i familjens distributionsrecept.
• Vikter och licens — BF16, Apache-2.0, ingen åtkomstspärr; repot pekar också på en ModelScope-spegel och på en GitHub-organisation (nex-agi) som innehåller familjens driftsättningsrecept.
Nex-AGI:s driftsättningsdokumentation är den del där de flesta öppna releaser brister, och den här lyckas ovanligt väl. Mini serveras via en anpassad SGLang Docker-avbildning (nexagi/sglang:v0.5.18-nex-patch) på en enda nod med två H100:er och tensor-parallellism 2. Rekommenderad sampling är temperatur 0,7, top_p 0,95 och top_k 40. Verktygsanrop sker via SGLang:s qwen3_coder-parser, och modellen exponerar tre resonemangslägen via ett reasoning_effort-fält — "none" för icke-tänkande, "medium" (det adaptiva standardvärdet) och "high" för alltid-på-tänkande. För en liten agentisk modell är kontrollen över resonemangsläget skillnaden mellan en användbar agentloop och en långsam sådan, och den är inbakad i serveringsreceptet snarare än överlåten till användaren.

Vikter: vad som faktiskt går att ladda ner
Lanseringsdagens status för de tre nivåerna är värd att precisera, eftersom tillkännagivandet och repositoryerna inte riktigt stämmer överens. I skrivande stund är Mini fullt nedladdningsbar under Apache-2.0 — det är vad den här artikeln bygger på. Nex-N2.5 Max är också uppe, med en Hugging Face-repository som innehåller 644 safetensors-delar, även om dess fotavtryck med biljoner parametrar kräver ett 16×H200-projekt att återskapa. Nex-N2.5 Pro är undantaget: dess Hugging Face-repository finns men innehåller bara README och figurer, inga modelldelar, och modellkortet säger fortfarande att vikterna är på väg. Om den nivå du bryr dig om är den stora multimodala, är det glappet att bevaka — lanseringsmaterialet beskriver Pro som familjens starkaste datoranvändningsmodell, och det är den du ännu inte kan köra lokalt.

Siffrorna som Nex-AGI rapporterade — och varningen som följer med dem
Nex-AGI:s modellkort innehåller en fullständig benchmarktabell för Mini, och varje siffra i den är leverantörens egna rapportering. Ingen oberoende körning hade publicerats när detta skrevs, och kortet är tydligt med att poängen kommer från officiella benchmark-topplistor och de senaste utvärderingsrapporterna där sådana finns, samt från Nex-AGI:s egna utvärderingar i övrigt. Kodningsresultaten producerades med teamets NexAU-harness; resultat för dator- och webbläsaranvändning erhölls med hjälp av NexCUA-harnessen, som enligt kortet kommer att göras open source. Behandla rubrikraderna som leverantörens bästa scenario tills en oberoende part har reproducerat dem.
Med den utgångspunkten ser Minis rapporterade siffror ut så här: för text- och koduppgifter Terminal-Bench 2.1 på 73,4, SWE-Bench Pro på 43,8, DeepSWE v1.1 på 36,1, AutomationBench v1.0.6 på 32,3, Toolathlon Verified på 54,6, BrowseComp på 83,4 samt ett GDPval-AA v2-resultat på 1446. På den multimodala/datoranvändande sidan är uppmärksamhetsskaparna OSWorld-Verified på 71,2, WebArena-Verified på 63,4, WebTest på 48,6 (körd i oracle-läge mot faktiska svarslistor), OSWorld-G på 82,9 och OmniDoc på 89,7, tillsammans med mer blygsamma resultat som OSWorld-2 (30,5) och Vision2Web (52,9).
Två noteringar. För det första är OSWorld-Verified och OSWorld-2 olika testsviter – den ena är en verifierad delmängd som bedöms utifrån det resulterande miljötillståndet, den andra en nyare och generellt sett hårdare körning – alltså är 71,2 på den ena och 30,5 på den andra inte motsägelsefulla; det rör sig om olika tester, och i Nex egen tabell står de i separata kolumner. För det andra ligger Mini poängmässigt under Pro och Max i varje rad i familjetabellen, och överst i varje kolumn ligger en etablerad frontlinjemodell som Claude Opus 5 eller GPT-5.6 Sol. Berättelsen om Mini handlar inte om att den slår frontlinjemodellerna; den handlar om att en öppen modell med ~3B aktiva parametrar rapporterar konkurrenskraftiga resultat på benchmarks för datoranvändning med ett fotavtryck på två H100. Huruvida det håller streck är precis den fråga som de öppna vikterna låter dig besvara själv.
Kör Nex-N2.5 Mini idag
Receptet med två H100 gör Mini till det billigaste sättet att få praktisk erfarenhet av familjens kärnpåstående. Eftersom arkitekturen är standard-Qwen3.5-MoE med en qwen3_coder-parser för verktygsanrop, läses den in i Nex-AGI:s SGLang-fork utan anpassad inferenskod, och de rekommenderade inställningarna är publicerade snarare än lämnade åt reverse engineering. Den ärliga förväntningen att ställa innan du börjar är att en dagsgammal checkpoint med en helt ny utvärderingsmiljö är ett experiment, inte ett beroende. Nedladdningarna på Mini-repot är fortfarande ensiffriga och ingen tredje part hade släppt en oberoende utvärdering när detta skrevs – vilket är det normala tillståndet för en modell som släpptes igår, och anledningen till att fotavtrycket med två H100 spelar roll: du kan köra experimentet själv den här veckan i stället för att vänta på att någon annan gör det.

Om du hellre vill jämföra Mini mot frontier-agenterna i dess egen benchmark-tabell än att manuellt finjustera en enskild driftsättning, är det där ett routningslager kommer till sin rätt. När en hostingleverantör listar Nex-N2.5 Mini — och de etablerade modeller som den mäts mot redan går att nå via routrar — är ett API för 200+ modeller, med leverantörens listpriser som förs vidare med 0 % påslag och automatisk failover, det billiga sättet att köra samma uppgift mot flera av dem utan en andra integration. På OrcaRouter är det standardupplägget för varje modell vi routar: samma nyckel, samma anropsformat, leverantörens eget pris utan något påslag. Det spelar störst roll för en obeprövad modell som den här, eftersom failover är det som låter dig prova den på en riktig väg utan att satsa hela vägen på den.
Vem ska dra dessa vikter?
Hämta dem om ditt arbete rör computer-use-agenter, webbläsarautomatisering eller visuellt grundad verktygsanvändning och du vill ha en permissivt licensierad, självhostningsbar modell att benchmarka mot de ledande hostade modellerna. Apache-2.0-licensen tar bort den vanliga friktionen för en utgivning från ett kinesiskt labb, resurskravet på två H100:er är inom räckhåll för ett seriöst agentteam, och möjligheten att styra resoneringsinsatsen tillsammans med en riktig verktygsanropsparser gör den till en trovärdig testbädd snarare än en leksak. Avvakta om du behöver den starkaste computer-use-modellen i familjen — det är Pro:s roll, och det är Pro:s vikter som fortfarande väntar. Och behåll leverantörsetiketten på varje benchmarkrad tills en oberoende körning bekräftar siffrorna; ett resultat på 71,2 på OSWorld-Verified från en öppen modell med ~3B aktiva parametrar är ett slående påstående, precis den typen av påstående som är värt att verifiera i din egen testmiljö innan du bygger vidare på det.
Vad du ska hålla utkik efter härnäst. Pro-viktminskningen är den enskilt största signalen — den förvandlar familjen från ”Mini plus en biljonparametrig jätte” till det fullständiga modellutbud som lanseringsmaterialet beskriver. För det andra är öppnandet av NexCUA-harnessen, utan vilken siffrorna för datoranvändning inte kan reproduceras oberoende under samma protokoll. För det tredje är den första neutrala körningen, från Artificial Analysis, ett universitetslaboratorium eller en utövare som publicerar sin OSWorld-Verified-reproduktion. När något av dessa tre inträffar, slutar den fråga som denna lansering ställer — huruvida öppna agentiska modeller verkligen har minskat avståndet till värdbaserade stackar för datoranvändning — att vara en fråga om leverantörstabeller.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
