De hero 'Nex-N2.5 Pro vs Claude Opus 5' — een gegenereerde titelkaart waarop 'Nex-N2.5 Pro vs Claude Opus 5' staat, met als ondertitel 'De gratis open computer-use-preview vs de benchmarkleider die je vandaag kunt inzetten' en als overline 'Anthropic vs Nex-AGI — september 2026'.
Guides & Insights

Nex-N2.5 Pro versus Claude Opus 5: Nex-AGI koos de meetlat, en de meetlat won

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Nex-AGI koos de meetlat, en de meetlat won. Toen de in Shanghai gevestigde alliantie voor open modellen Nex-N2.5 Pro op 8 september 2026 introduceerde, zette de computer-use-tabel op de modelkaart Claude Opus 5 in de vergelijkingskolom en Nex-N2.5 Pro in het uitdagerslot: 68,3 voor Claude Opus 5 tegenover 56,4 voor Nex-N2.5 Pro op OSWorld-2, beide cijfers exact zoals Nex-AGI ze op de eigen kaart had afgedrukt. De onafhankelijke leaderboards hebben de kloof sindsdien eerder vergroot dan verkleind — de OSWorld 2.0-snapshot van BenchLM van 29 augustus plaatst Claude Opus 5 op de eerste plaats van de vijftien modellen die het opsomt, met 70,6. Twaalf punten prijsgeven aan de koploper op de benchmark die je zelf hebt gekozen om te publiceren, is niet de gebruikelijke choreografie rond een lancering — en daarom is het interessante deel van Nex-N2.5 Pro versus Claude Opus 5 niet de score. Het is wat de twee kanten van die score werkelijk zijn: een open computer-use-model met 397 miljard parameters dat buiten de alliantie nog niemand heeft kunnen draaien of verifiëren, en het gesloten vlaggenschip van Anthropic dat de benchmark aanvoert en sinds eind juli productieverkeer draait.

De eerlijke samenvatting vooraf: dit is geen rivaliteit tussen twee gemeten grootheden, want slechts één kant ervan is door iemand anders dan de maker gemeten. Nex-N2.5 Pro is een sparse mixture-of-experts-model, met ruwweg 17 miljard actieve parameters onder een totaal van 397B, verder getraind vanuit de Qwen3.5-lijn, gericht op langetermijnbediening van computers en browsers met een visuele terugkoppellus. Het wordt vandaag aangeboden via gratis gehoste endpoints, Nex-AGI-links uit de modelkaart, terwijl de Apache-2.0-gewichten waar de familie op is gebaseerd, gemarkeerd blijven als “binnenkort beschikbaar” zonder datum. Claude Opus 5 is Anthropic's productievlaggenschip voor veeleisende redeneer-, codeer- en agentische taken — een gesloten model met een context van 1M tokens, een adaptieve-denk-knop, een gedocumenteerde prijs en weken aan openbare leaderboardresultaten en productieverkeer achter zich. Elk voordeel in deze vergelijking is toe te schrijven aan een van die twee feiten: het ene model is uitvoerbaar en verifieerbaar, en het andere is geen van beide.

De benchmark waar beide partijen het over eens zijn

Computer-use-benchmarks belonen hetzelfde gedrag dat deze modellen moeten verkopen: een agent die naar een scherm kijkt, een actie kiest, die uitvoert en het veranderde scherm leest om te controleren of de actie werkte. Nex-N2.5 Pro is rond precies die lus gebouwd — visie is geen inputmodaliteit die eraan vastgeschroefd zit, het is het feedbackkanaal waartegen de agent controleert. Claude Opus 5 behandelt dezelfde lus als één workload tussen vele, maar is er toevallig heel goed in, en dat is precies waarom Nex-AGI het in de eerste plaats als referentiepunt gebruikte.

De twee getallen komen strikt genomen niet uit dezelfde testomgeving. Nex-AGI heeft zijn OSWorld-2-cijfers geproduceerd via zijn eigen NexCUA-evaluatieomgeving, waarvan het zegt dat het die open-source zal maken maar nog niet heeft vrijgegeven, en de 56,4 voor Nex-N2.5 Pro is niet-gereproduceerde output van de leverancier. De 70,6 van Claude Opus 5 op BenchLM is een momentopname van derden van OSWorld 2.0, gedateerd 29 augustus 2026, en die komt overeen met de 68,3 die Nex-AGI zelf aanhaalt uit leaderboard-bronnen. Verschillende testomgevingen en enigszins afwijkende benchmarkversies betekenen dat het exacte verschil — twaalf punten op Nex-AGI's eigen kaart, dichter bij veertien op BenchLM — als richtinggevend moet worden gelezen. Maar het staat niet ter discussie dat Nex-N2.5 Pro, volgens de beste beschikbare cijfers aan beide kanten, onder de huidige frontier computer-use-agent ligt.

A two-column scoreboard titled 'Nex-N2.5 Pro vs Claude Opus 5 — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Params 397B total / ~17B active; Focus computer use; OSWorld 2.0 56.4 vendor-reported; Weights Apache-2.0 pending; Price free hosted / no list price. Right column Claude Opus 5: Released Jul 24 2026; Params undisclosed; Focus general plus computer use; OSWorld 2.0 70.6 per BenchLM; Weights closed; Price $5.00 / $25.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Opus OSWorld per BenchLM Aug 29.'

Twee antwoorden op "kan ik het vandaag draaien"

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

Dit is de fork die daadwerkelijk bepaalt hoe de matchup uitpakt voor een werkend team, en hij is niet in het voordeel van de nieuwkomer. De Hugging Face-kaart van Nex-N2.5 Pro vermeldt nog steeds dat de gewichten binnenkort beschikbaar komen onder een Apache-2.0-licentie, zonder een releasedatum. De enige live builds zijn de gratis gehoste endpoints die Nex-AGI vanaf de kaart linkt — aanroepbaar, maar eigendom van iemand anders, zonder catalogusprijs, zonder servicevoorwaarden waar een team op kan plannen, en zonder de mogelijkheid om ook maar één benchmarkcijfer op je eigen hardware te reproduceren. Wanneer de gewichten daadwerkelijk verschijnen, bestaat het gedocumenteerde servingrecept uit één node met acht H100's op een aangepaste SGLang-image — een reële maar alledaagse voetafdruk voor een 397B-MoE, en precies waarom het ontwerp met 17B actieve parameters interessant is. Tot die tijd is Nex-N2.5 Pro een preview die je kunt bevragen, geen model waarop je kunt bouwen.

Claude Opus 5 is op elk van die punten het tegenovergestelde. Het wordt sinds 24 juli via de API van Anthropic en op doorstuurplatforms aangeboden, de prijs is openbaar en stabiel, de gewichten zijn gesloten en blijven gesloten, en elk van de getallen kan vandaag worden gecontroleerd door het model te draaien. Het omringende ecosysteem — Claude Code, MCP-tooling en de zwerm productieagenten die er zes weken lang op hebben gehamerd — is precies het opgebouwde trackrecord dat een model van één dag oud niet kan claimen. Voor een team met als vereiste dat “het model volgend kwartaal moet werken”, draait het helemaal om dat trackrecord.

Het specificatieblad, voor zover het er is

Leg de twee enveloppen naast elkaar:

Uitgebracht — Nex-N2.5 Pro: 8 september 2026 (gehoste endpoints live, gewichten volgen nog). Claude Opus 5: 24 juli 2026, algemeen beschikbaar.

Scale — Nex-N2.5 Pro: 397B totaal / ~17B actief MoE. Claude Opus 5: aantal parameters niet bekendgemaakt.

Modaliteit — Nex-N2.5 Pro: tekst en beeld in, tekst uit, visie centraal in de computergebruikscyclus. Claude Opus 5: tekst en beeld in, tekst uit, met sterke visuele analyse.

Context / uitvoer — Nex-N2.5 Pro: context van 262.144 tokens, gedocumenteerde serveerlengte. Claude Opus 5: context van 1M tokens, uitvoerlimiet van 128K tokens.

Redeneercontrole — Nex-N2.5 Pro: een reasoning_effort-schakelaar met none / medium (adaptief, standaard) / high. Claude Opus 5: standaard adaptief denken, met een expliciete inspanningsregelaar van laag tot maximaal.

Gewichten — Nex-N2.5 Pro: Apache-2.0, binnenkort, nog geen datum. Claude Opus 5: gesloten.

Prijs per 1M tokens — Nex-N2.5 Pro: gratis gehoste laag, geen catalogusprijs gepubliceerd. Claude Opus 5: $5,00 voor invoer / $25,00 voor uitvoer, $0,50 voor lezen uit cache, $6,25 voor schrijven naar cache.

De profielen verschillen genoeg dat het specificatieblad echt werk verricht: Opus 5 brengt een venster van een miljoen tokens en een outputplafond van 128K naar lange agentsessies, terwijl Nex-N2.5 Pro's 262K context en gratis laag beter passen bij kleinschaligere, schermgestuurde automatisering. Geen van beide specificaties maakt de andere overbodig; de modellen verschillen van mening over waar een agent zijn context aan besteedt.

Nex-AGI's eigen scorebord eerlijk lezen

De rest van de kaart is het waard om met dezelfde filter te worden gelezen. De andere computer-use-rijen van Nex-N2.5 Pro — OSWorld-G 87.4, OSWorld-Verified 82.2, WebArena-Verified 67.6, WebTest 52.8, Vision2Web 68.2 — en de coderingsrijen — Terminal-Bench 2.1 op 82.7, SWE-Bench Pro op 61.2, BrowseComp op 89.7 — zijn allemaal leveranciersmetingen via de eigen harness van de alliantie, die in de eerste 48 uur niet zijn gereproduceerd. De enige conclusie die een neutrale lezer uit de kaart kan trekken, is dat Nex-AGI gelooft dat Nex-N2.5 Pro een sterk computer-use-model uit het middensegment is dat achterblijft bij de frontier-agent op de rij die er het meest toe doet. Dat is een coherente, zelfs conservatieve positionering voor een open 397B-model. Het is ook een bewering die wacht op een tweede laboratorium.

Het geld, wanneer één kant geen prijs heeft.

Hier valt geen eerlijke prijsvergelijking te maken, want slechts één kant heeft een prijs. De gratis gehoste laag van Nex-N2.5 Pro zegt je niets over wat het model waard is — gratis preview-eindpunten zijn hoe leveranciers verkeer en feedback verzamelen, en Nex-AGI heeft geen betaald tarief per token voor de familie gepubliceerd. Claude Opus 5 kost $5,00 per miljoen input en $25,00 per miljoen output tegen de lijstprijs van Anthropic, met cache reads op $0,50, en dat is het bedrag dat een budget moet opvangen. Als je die rekening vandaag betaalt voor computer-use-agents en wilt weten of een open model met 17B actieve parameters hetzelfde werk goedkoper kan doen, is het antwoord: mogelijk, maar je komt er pas achter zodra de gewichten zijn vrijgegeven en een onafhankelijke partij het model draait. De prijsvergelijking is uitgesteld, niet beslecht, en een gratis eindpunt als bewijs van goedkoopheid behandelen zou een categoriefout zijn.

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5) showing the header stats $5.00 input and $25.00 output per million tokens and the byline 'by Anthropic - 2026-07-24'.

Wat je vandaag kunt doen, is de A/B opzetten voor de dag dat het mogelijk wordt. Claude Opus 5 staat op OrcaRouter tegen de lijstprijs van Anthropic — dezelfde $5.00 / $25.00, zonder opslag doorberekend, zodat een factuur hier overeenkomt met die van Anthropic en meebeweegt op de dag dat Anthropic beweegt. Met één API-sleutel zit het achter hetzelfde endpoint als 200+ andere modellen, met automatische failover als een provider hapert, en de routing-DSL als je Opus wilt inzetten voor de lastige aanvragen en een goedkoper model voor de routinematige. Nex-N2.5 Pro staat niet op OrcaRouter — we hebben onze modeldirectory gecontroleerd voordat we dit schreven, en er staat nog geen nex-agi-model in vermeld. Op het moment dat een provider het tegen de lijstprijs aanbiedt, verschijnt het hier dezelfde dag, en de eerlijke vergelijking die dit artikel nog niet kan uitvoeren, wordt dan een routeringsregel in plaats van een migratie.

Wie moet handelen, en wie moet wachten?

Als je team vandaag productieworkloads voor computer-use of agentic-coding draait en een model nodig heeft met een bekende prijs, een bekend faalprofiel en een onafhankelijke staat van dienst, dan is Claude Opus 5 in dit duel de rationele keuze, en niets in de eerste 48 uur van Nex-N2.5 Pro verandert die conclusie. Als je team open computer-use-modellen evalueert voor een toekomstige implementatie, hoort Nex-N2.5 Pro thuis op de watchlist — een 397B multimodale MoE met een realistische self-hosting-voetafdruk en een aannemelijk verhaal op mid-tier-benchmarks is precies het soort open model dat een kostencurve hervormt, mits de gewichten daadwerkelijk arriveren en de cijfers op de modelkaart een onafhankelijke toets doorstaan. Het rationele standpunt is allebei tegelijk: houd de bewezen leider op het kritieke pad, en laat de dag waarop de gewichten landen bepalen of de nieuwkomer een proef verdient. Dat is de enige vergelijking in dit duel die nog niet heeft plaatsgevonden — en dat is de vergelijking die er daadwerkelijk toe zal doen.