Hero för 'Nex-N2.5 Pro vs Claude Opus 5' — ett genererat titelkort med rubriken 'Nex-N2.5 Pro vs Claude Opus 5', underrubriken 'Den kostnadsfria öppna förhandsversionen av datoranvändning mot benchmarkledaren du kan dirigera till idag' och överrubriken 'Anthropic vs Nex-AGI — September 2026'.
Guides & Insights

Nex-N2.5 Pro vs Claude Opus 5: Nex-AGI valde måttstocken, och måttstocken vann

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Nex-AGI valde måttstocken, och måttstocken vann. När den Shanghaibaserade alliansen för öppna modeller lanserade Nex-N2.5 Pro den 8 september 2026, placerade modellkortets computer-use-tabell Claude Opus 5 i jämförelsekolumnen och Nex-N2.5 Pro på utmanarplatsen: 68,3 för Claude Opus 5 mot 56,4 för Nex-N2.5 Pro på OSWorld-2, båda siffrorna exakt som Nex-AGI hade angett på sitt eget kort. De oberoende topplistorna har sedan dess vidgat snarare än minskat gapet — BenchLMs ögonblicksbild av OSWorld 2.0 från den 29 augusti rankar Claude Opus 5 som etta bland de femton modeller som listas, på 70,6. Att ligga tolv poäng efter fältledaren på just det riktmärke du valt att publicera är inte den sedvanliga lanseringskoreografin, vilket är anledningen till att det intressanta med Nex-N2.5 Pro vs Claude Opus 5 inte är resultatet. Det är vad de två sidorna av det resultatet faktiskt är: en öppen computer-use-modell med 397 miljarder parametrar som ingen utanför alliansen ännu har kunnat köra eller verifiera, och Anthropics stängda flaggskepp som toppar riktmärket och har burit produktionstrafik sedan slutet av juli.

Den ärliga sammanfattningen direkt: detta är inte en rivalitet mellan två uppmätta storheter, eftersom endast den ena sidan har uppmätts av någon annan än dess skapare. Nex-N2.5 Pro är en gles mixture-of-experts-modell, med cirka 17 miljarder aktiva parametrar av totalt 397B, eftertränad från Qwen3.5-linjen, riktad rakt mot långsiktig dator- och webbläsarhantering med en visuell återkopplingsslinga. Den serveras idag via kostnadsfria värdbaserade slutpunkter som Nex-AGI länkar från sitt modellkort, medan Apache-2.0-vikterna som familjen är baserad på fortfarande är märkta ”kommer snart” utan datum. Claude Opus 5 är Anthropics produktionsflaggskepp för krävande resonemang, kodning och agentiskt arbete – en sluten modell med 1M-tokens kontext, en adaptiv tankedial, ett dokumenterat pris och veckor av offentliga leaderboard-resultat och produktionstrafik bakom sig. Varje fördel i denna match tillhör ett av dessa två faktum: den ena modellen är körbar och verifierbar, och den andra är varken det.

Det riktmärke som båda sidorna är överens om

Benchmarks för datoranvändning belönar samma beteende som dessa modeller är byggda för att sälja: en agent som tittar på en skärm, bestämmer sig för en åtgärd, utför den och läser av den uppdaterade skärmen för att kontrollera om åtgärden fungerade. Nex-N2.5 Pro är uppbyggd kring exakt den loopen — vision är inte en inmatningsmodalitet som bultats fast på den, utan den återkopplingskanal som agenten verifierar mot. Claude Opus 5 behandlar samma loop som en av många arbetsuppgifter, men råkar vara mycket bra på den, vilket är anledningen till att Nex-AGI från första början använde den som referenspunkt.

De två siffrorna kommer strängt taget inte från samma utvärderingsramverk. Nex-AGI tog fram sina OSWorld-2-siffror med sitt eget utvärderingsramverk NexCUA, som företaget säger kommer att bli öppen källkod men som ännu inte har släppts, och 56,4 för Nex-N2.5 Pro är ett icke reproducerat leverantörsresultat. De 70,6 poäng som Claude Opus 5 uppnådde på BenchLM är en ögonblicksbild av OSWorld 2.0 från tredje part, daterad den 29 augusti 2026, och de överensstämmer med 68,3 som Nex-AGI själv citerar från leaderboardkällor. Olika utvärderingsramverk och något olika benchmarkversioner innebär att den exakta skillnaden — tolv poäng på Nex-AGI:s eget modellkort, närmare fjorton på BenchLM — bör läsas som riktningsgivande. Men det är inte omtvistat att Nex-N2.5 Pro, enligt de bästa siffror som finns tillgängliga på båda håll, ligger under den nuvarande främsta agenten för datoranvändning.

A two-column scoreboard titled 'Nex-N2.5 Pro vs Claude Opus 5 — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Params 397B total / ~17B active; Focus computer use; OSWorld 2.0 56.4 vendor-reported; Weights Apache-2.0 pending; Price free hosted / no list price. Right column Claude Opus 5: Released Jul 24 2026; Params undisclosed; Focus general plus computer use; OSWorld 2.0 70.6 per BenchLM; Weights closed; Price $5.00 / $25.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Opus OSWorld per BenchLM Aug 29.'

Två svar på "kan jag köra det idag"

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

Detta är den fork som faktiskt avgör matchen för ett professionellt team, och den gynnar inte nykomlingen. Nex-N2.5 Pro:s modellkort på Hugging Face visar fortfarande en banner om att vikterna är på väg snart under en Apache-2.0-licens, utan något releasedatum. De enda live-versionerna är de kostnadsfria hostade endpoints som Nex-AGI länkar från kortet — anropbara, men ägda av någon annan, utan listpris, utan tjänstevillkor som ett team kan planera kring, och utan möjlighet att reproducera en enda benchmarksiffra på egen hårdvara. När vikterna väl kommer är den dokumenterade serveringsmetoden en enda nod med åtta H100:or på en anpassad SGLang-image — ett verkligt men rutinmässigt fotavtryck för en 397B MoE, och precis därför den 17B-aktiva designen är intressant. Tills dess är Nex-N2.5 Pro en förhandsversion du kan anropa, inte en modell du kan bygga på.

Claude Opus 5 är motsatsen på varenda en av dessa rader. Den har varit tillgänglig via Anthropics API och på routade plattformar sedan 24 juli, priset är offentligt och stabilt, vikterna är stängda och kommer att förbli stängda, och alla dess siffror kan kontrolleras idag genom att köra den. Det omgivande ekosystemet – Claude Code, MCP-verktyg och den svärm av produktionsagenter som har pressat den i sex veckor – är precis den ackumulerade meritlista som en endagsgammal modell inte kan göra anspråk på. För ett team vars krav är ”modellen måste fungera nästa kvartal” är den meritlistan hela avgörandet.

Specifikationsbladet, sådant det nu är.

Lägg de två kuverten bredvid varandra:

Släppt — Nex-N2.5 Pro: 8 september 2026 (hosted endpoints är live, vikter väntas). Claude Opus 5: 24 juli 2026, allmänt tillgänglig.

Skala — Nex-N2.5 Pro: 397B totalt / ~17B aktiv MoE. Claude Opus 5: parameterantal ej offentliggjort.

Modalitet — Nex-N2.5 Pro: text och bild in, text ut, vision central för dess datoranvändningsloop. Claude Opus 5: text och bild in, text ut, med stark visuell analys.

Kontext / utdata — Nex-N2.5 Pro: kontext på 262 144 tokens, dokumenterad servinglängd. Claude Opus 5: kontext på 1M tokens, utdatatak på 128K tokens.

Resonemangskontroll — Nex-N2.5 Pro: en växlare för reasoning_effort med none / medium (adaptivt, standard) / high. Claude Opus 5: adaptivt tänkande som standard med ett explicit reglage för ansträngning från låg till max.

Vikter — Nex-N2.5 Pro: Apache-2.0, kommer snart, inget datum. Claude Opus 5: stängd.

Pris per 1M tokens — Nex-N2.5 Pro: gratis värdbaserad nivå, inget listpris publicerat. Claude Opus 5: $5,00 för indata / $25,00 för utdata, $0,50 för cachade läsningar, $6,25 för cache-skrivningar.

Gränserna är tillräckligt olika för att specifikationsbladet gör verklig nytta: Opus 5 har ett fönster på en miljon token och ett utdatatak på 128K för långa agent-sessioner, medan Nex-N2.5 Pros 262K-kontext och gratisnivå passar skärmdriven automation med mindre omfattning. Ingen av specifikationerna gör den andra överflödig; modellerna är oense om vad en agent använder sin kontext till.

Att ärligt läsa Nex-AGI:s egen resultattavla

Resten av kortet är värt att läsa med samma filter. Nex-N2.5 Pros andra rader för datoranvändning — OSWorld-G 87.4, OSWorld-Verified 82.2, WebArena-Verified 67.6, WebTest 52.8, Vision2Web 68.2 — och dess kodningsrader — Terminal-Bench 2.1 på 82.7, SWE-Bench Pro på 61.2, BrowseComp på 89.7 — är alla leverantörsmätningar genom alliansens egen testmiljö, utan oberoende reproduktion under de första 48 timmarna. Den enda slutsats en neutral läsare kan dra från kortet är att Nex-AGI anser att Nex-N2.5 Pro är en stark modell i mellanklassen för datoranvändning som ligger efter frontmodellen på den rad som betyder mest. Det är en sammanhängande, till och med konservativ, positionering för en 397B öppen modell. Det är också ett påstående som väntar på ett andra laboratorium.

Pengarna, när den ena sidan saknar pris.

Det finns ingen ärlig prisjämförelse att göra här, eftersom bara en sida har ett pris. Nex-N2.5 Pros kostnadsfria värdnivå säger dig ingenting om vad modellen är värd — gratis förhandsvisningsändpunkter är hur leverantörer samlar in trafik och feedback, och Nex-AGI har inte publicerat något betalt per-token-pris för modellfamiljen. Claude Opus 5 kostar 5,00 USD per miljon input-tokens och 25,00 USD per miljon output-tokens enligt Anthropics listpris, med cacheavläsningar på 0,50 USD, och det är den siffran en budget måste bära. Om du betalar den räkningen idag för computer-use-agenter och vill veta om en 17B-aktiv öppen modell kan göra samma jobb billigare, är svaret: möjligen, men du kan inte få reda på det förrän modellvikterna släpps och någon oberoende part kör den. Prisjämförelsen är uppskjuten, inte avgjord, och att behandla en gratis ändpunkt som bevis på billighet vore ett kategorifel.

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5) showing the header stats $5.00 input and $25.00 output per million tokens and the byline 'by Anthropic - 2026-07-24'.

Vad du kan göra idag är att sätta upp A/B-testet för den dag det blir möjligt. Claude Opus 5 ligger på OrcaRouter till Anthropics listpris — samma $5.00 / $25.00, vidarebefordrat utan påslag, så en faktura här matchar Anthropics och ändras den dag Anthropic ändrar den. En API-nyckel placerar den bakom samma endpoint som 200+ andra modeller, med automatisk failover om en leverantör får problem, och routing-DSL:en om du vill ha Opus på de svåra anropen och en billigare modell på de rutinmässiga. Nex-N2.5 Pro finns inte på OrcaRouter — vi kontrollerade vår modellkatalog innan vi skrev, och ingen nex-agi-modell är listad där ännu. I samma stund som en leverantör erbjuder den till listpris, kommer den att dyka upp här samma dag, och den ärliga jämförelse som denna artikel ännu inte kan göra blir en routingregel istället för en migrering.

Vem bör agera, och vem bör vänta

Om ditt team idag kör produktionsarbetsbelastningar för datoranvändning eller agentisk kodning och behöver en modell med ett känt pris, en känd felprofil och en oberoende meritlista, är Claude Opus 5 det rationella valet i denna jämförelse, och ingenting i Nex-N2.5 Pros första 48 timmar ändrar på det. Om ditt team utvärderar öppna datoranvändningsmodeller för ett framtida bygge, hör Nex-N2.5 Pro hemma på bevakningslistan – en 397B multimodal MoE med ett rimligt fotavtryck för självhostning och en trovärdig benchmarkhistoria för mellanklassen är precis den typ av öppen modell som omformar en kostnadskurva, förutsatt att vikterna faktiskt anländer och att modellkortets siffror överlever en oberoende körning. Den rationella positionen är båda samtidigt: behåll den beprövade ledaren på den kritiska linjen, och låt dagen då vikterna landar avgöra om nykomlingen förtjänar en utvärdering. Det är den enda jämförelsen i denna matchning som ännu inte har ägt rum – och det är den som faktiskt kommer att spela roll.