
Nex-N2.5 Pro vs. Claude Opus 5: Nex-AGI wählte den Maßstab, und der Maßstab gewann
- openaiNEUOpenAI: GPT-6 Astra2026-09-0455Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0247Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0247Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0157Intelligenz82Coding
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2646Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1541Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1251Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0547Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligenz49Coding
Nex-AGI hat sich den Maßstab ausgesucht, und der Maßstab hat gewonnen. Als das in Shanghai ansässige Open-Model-Bündnis Nex-N2.5 Pro am 8. September 2026 vorstellte, führte die Computer-Use-Tabelle auf der Modellkarte Claude Opus 5 in der Vergleichsspalte und Nex-N2.5 Pro in der Kandidatenzeile auf: 68,3 für Claude Opus 5 gegenüber 56,4 für Nex-N2.5 Pro auf OSWorld-2 – beide Zahlen exakt so, wie Nex-AGI sie auf der eigenen Karte angegeben hatte. Die unabhängigen Bestenlisten haben den Abstand seither eher vergrößert als verkleinert – der OSWorld-2.0-Snapshot von BenchLM vom 29. August stuft Claude Opus 5 mit 70,6 auf den ersten Platz unter den fünfzehn dort aufgeführten Modellen ein. Dem Spitzenreiter auf dem Benchmark, den man selbst zur Veröffentlichung gewählt hat, zwölf Punkte einzuräumen, ist nicht die übliche Choreografie einer Produkteinführung. Deshalb ist das Interessante an Nex-N2.5 Pro vs. Claude Opus 5 nicht die Punktzahl. Es ist das, was die beiden Seiten dieser Punktzahl tatsächlich sind: ein offenes Computer-Use-Modell mit 397 Milliarden Parametern, das bislang niemand außerhalb des Bündnisses ausführen oder verifizieren konnte, und das geschlossene Anthropic-Flaggschiff, das die Bestenliste anführt und seit Ende Juli Produktionslast trägt.
Die ehrliche Zusammenfassung vorab: Dies ist keine Rivalität zwischen zwei gemessenen Größen, denn nur eine der beiden Seiten wurde von irgendjemandem außer ihrem Hersteller vermessen. Nex-N2.5 Pro ist ein Sparse-Mixture-of-Experts-Modell mit etwa 17 Milliarden aktiven Parametern bei insgesamt 397 Milliarden, nachtrainiert aus der Qwen3.5-Linie und gezielt auf langfristige Computer- und Browserbedienung mit visueller Rückkopplungsschleife ausgelegt. Es wird derzeit über kostenlose gehostete Endpunkte bereitgestellt, die Nex-AGI von seiner Modellkarte aus verlinkt, während die Apache-2.0-Gewichte, auf denen die Familie beruhen soll, weiterhin ohne Datum als „Coming Soon“ markiert sind. Claude Opus 5 ist Anthropics Produktions-Flaggschiff für anspruchsvolles Denken, Programmierung und agentische Arbeit – ein geschlossenes Modell mit einem 1M-Token-Kontext, einem Regler für adaptives Denken, einem dokumentierten Preis und Wochen öffentlicher Leaderboard-Einträge und Produktionstraffic im Rücken. Jeder Vorteil in diesem Vergleich beruht auf einer dieser beiden Tatsachen: Das eine Modell ist lauffähig und verifizierbar, das andere beides nicht.
Der Benchmark, auf den sich beide Seiten einigen
Computer-Use-Benchmarks belohnen genau das Verhalten, zu dessen Verkauf diese Modelle gebaut wurden: einen Agenten, der auf einen Bildschirm schaut, eine Aktion auswählt, sie ausführt und den veränderten Bildschirm liest, um zu prüfen, ob die Aktion funktioniert hat. Nex-N2.5 Pro ist genau um diesen Loop herum architekturiert – Visuelle Wahrnehmung ist dabei keine nachträglich angeflanschte Eingabemodalität, sondern der Feedback-Kanal, über den der Agent den Erfolg seiner Aktionen prüft. Claude Opus 5 behandelt denselben Loop als eine Aufgabe unter vielen, ist darin aber zufälligerweise sehr gut, weshalb Nex-AGI genau dieses Modell von vornherein als Referenzpunkt nutzte.
Die beiden Zahlen stammen streng genommen nicht aus derselben Testumgebung. Nex-AGI hat seine OSWorld-2-Werte mit der eigenen NexCUA-Evaluierungsumgebung erzeugt, die es eigenen Angaben zufolge als Open Source veröffentlichen will, aber noch nicht freigegeben hat, und die 56,4 für Nex-N2.5 Pro ist eine nicht reproduzierte Herstellerangabe. Die 70,6 von Claude Opus 5 auf BenchLM ist eine Drittanbieter-Momentaufnahme von OSWorld 2.0 vom 29. August 2026 und stimmt mit den 68,3 überein, die Nex-AGI selbst aus Leaderboard-Quellen zitiert. Unterschiedliche Testumgebungen und leicht unterschiedliche Benchmark-Versionen bedeuten, dass die genaue Lücke – zwölf Punkte auf Nex-AGIs eigener Karte, auf BenchLM eher vierzehn – als richtungsweisend zu verstehen ist. Es steht jedoch außer Frage, dass Nex-N2.5 Pro nach den besten verfügbaren Zahlen auf beiden Seiten unter dem derzeitigen führenden Computer-Use-Agenten liegt.

Zwei Antworten auf „Kann ich es heute ausführen?"

Das ist der Fork, der den Vergleich für ein produktiv arbeitendes Team tatsächlich entscheidet – und er verschafft dem Neuling keinen Vorteil. Nex-N2.5 Pros Modellkarte auf Hugging Face wirbt weiterhin damit, dass die Gewichte unter einer Apache-2.0-Lizenz in Kürze verfügbar sein werden, ohne ein Veröffentlichungsdatum zu nennen. Die einzigen funktionsfähigen Builds sind die kostenlosen gehosteten Endpunkte, die Nex-AGI von der Karte aus verlinkt – abrufbar, aber im Besitz anderer, ohne Listenpreis, ohne Servicebedingungen, an denen sich ein Team bei der Planung orientieren kann, und ohne die Möglichkeit, einen einzigen Benchmark-Wert auf eigener Hardware zu reproduzieren. Wenn die Gewichte schließlich erscheinen, sieht das dokumentierte Serving-Rezept einen einzelnen Knoten mit acht H100 auf einem angepassten SGLang-Image vor – ein realer, aber typischer Ressourcenbedarf für ein 397B-MoE-Modell, und genau deshalb ist das Design mit 17B aktiven Parametern interessant. Bis es so weit ist, ist Nex-N2.5 Pro eine Vorschau, die man abfragen kann, kein Modell, auf dem man aufbauen kann.
Claude Opus 5 ist bei jeder dieser Zeilen das Gegenteil. Es wird seit dem 24. Juli über die API von Anthropic und auf gerouteten Plattformen angeboten, sein Preis ist öffentlich und stabil, seine Gewichte sind geschlossen und bleiben geschlossen, und jede seiner Kennzahlen lässt sich heute überprüfen, indem man es ausführt. Das umgebende Ökosystem – Claude Code, MCP-Tooling und der Schwarm von Produktionsagenten, die es sechs Wochen lang stark beansprucht haben – ist genau die angesammelte Erfolgsbilanz, die ein Modell, das erst einen Tag alt ist, nicht vorweisen kann. Für ein Team, dessen Anforderung lautet: „Das Modell muss im nächsten Quartal funktionieren“, ist diese Erfolgsbilanz das A und O.
Das Datenblatt, so wie es ist.
Legen Sie die beiden Umschläge nebeneinander:
• Veröffentlicht — Nex-N2.5 Pro: 8. September 2026 (gehostete Endpunkte aktiv, Gewichte ausstehend). Claude Opus 5: 24. Juli 2026, allgemein verfügbar.
• Modellgröße — Nex-N2.5 Pro: 397B Gesamtparameter / ~17B aktive MoE-Parameter. Claude Opus 5: Parameterzahl nicht veröffentlicht.
• Modalität — Nex-N2.5 Pro: Text- und Bildeingabe, Textausgabe; Bildverständnis ist zentral für seine Computer-Use-Schleife. Claude Opus 5: Text- und Bildeingabe, Textausgabe, mit starker visueller Analyse.
• Kontext / Ausgabe — Nex-N2.5 Pro: 262.144-Token-Kontext, dokumentierte Serving-Länge. Claude Opus 5: 1M-Token-Kontext, 128K-Token-Ausgabeobergrenze.
• Reasoning-Steuerung — Nex-N2.5 Pro: ein reasoning_effort-Schalter mit none / medium (adaptiv, Standard) / high. Claude Opus 5: adaptives Denken standardmäßig mit einem expliziten Regler für niedrigen bis maximalen Aufwand.
• Gewichte — Nex-N2.5 Pro: Apache-2.0, bald verfügbar, ohne Datum. Claude Opus 5: geschlossen.
• Preis pro 1 Mio. Tokens — Nex-N2.5 Pro: kostenloser gehosteter Tarif, kein Listenpreis veröffentlicht. Claude Opus 5: 5,00 $ Eingabe / 25,00 $ Ausgabe, 0,50 $ Cache-Lesezugriffe, 6,25 $ Cache-Schreibzugriffe.
Die Leistungsgrenzen unterscheiden sich deutlich genug, dass das Datenblatt echte Arbeit leistet: Opus 5 bringt ein Millionen-Token-Fenster und eine 128K-Ausgabegrenze für lange Agent-Sitzungen, während Nex-N2.5 Pros 262K-Kontext und kostenlose Stufe eher für Automatisierung mit kleinerem Umfang und bildschirmgesteuerte Abläufe geeignet sind. Keine der beiden Spezifikationen macht die andere überflüssig; die Modelle sind sich uneinig, wofür ein Agent seinen Kontext verwendet.
Nex-AGIs eigene Anzeigetafel ehrlich lesen
Der Rest der Karte ist es wert, mit demselben Filter gelesen zu werden. Die übrigen Computer-Use-Zeilen von Nex-N2.5 Pro — OSWorld-G 87,4, OSWorld-Verified 82,2, WebArena-Verified 67,6, WebTest 52,8, Vision2Web 68,2 — sowie seine Coding-Zeilen — Terminal-Bench 2.1 mit 82,7, SWE-Bench Pro mit 61,2, BrowseComp mit 89,7 — sind allesamt Herstellermessungen über die eigene Testumgebung der Allianz und wurden in den ersten 48 Stunden nicht reproduziert. Die einzige Schlussfolgerung, die ein neutraler Leser aus der Karte ziehen kann, ist, dass Nex-AGI der Ansicht ist, Nex-N2.5 Pro sei ein starkes Computer-Use-Modell der mittleren Klasse, das dem Frontier-Agent in genau der Zeile hinterherhinkt, die am meisten zählt. Das ist eine kohärente, sogar konservative Positionierung für ein offenes 397B-Modell. Es ist zugleich eine Behauptung, die auf ein zweites Labor wartet.
Das Geld, wenn eine Seite keinen Preis hat.
Es gibt hier keinen ehrlichen Preisvergleich, denn nur eine Seite hat einen Preis. Die kostenlose gehostete Stufe von Nex-N2.5 Pro sagt nichts darüber aus, was das Modell wert ist – über kostenlose Vorschau-Endpunkte sammeln Anbieter Traffic und Feedback, und Nex-AGI hat für die Modellfamilie keinen kostenpflichtigen Preis pro Token veröffentlicht. Claude Opus 5 kostet 5,00 US-Dollar pro Million Input-Token und 25,00 US-Dollar pro Million Output-Token zum Listenpreis von Anthropic, Cache-Reads kosten 0,50 US-Dollar – und genau diese Zahl muss ein Budget verkraften. Wenn Sie diese Rechnung heute für Computer-Use-Agenten bezahlen und wissen möchten, ob ein offenes Modell mit 17B aktiven Parametern dieselbe Arbeit billiger erledigen könnte, lautet die Antwort: möglicherweise, aber herausfinden können Sie es erst, wenn die Gewichte veröffentlicht werden und eine unabhängige Person das Modell ausführt. Der Preisvergleich ist aufgeschoben, nicht entschieden – und einen kostenlosen Endpunkt als Beleg für Billigkeit zu behandeln, wäre ein Kategorienfehler.

Was Sie heute tun können: Den A/B-Test für den Tag einrichten, an dem er möglich wird. Claude Opus 5 ist über OrcaRouter zum Listenpreis von Anthropic verfügbar – dieselben $5,00/$25,00, ohne Aufschlag weitergereicht. Eine Rechnung hier entspricht also exakt der von Anthropic und passt sich an dem Tag an, an dem Anthropic sie anpasst. Ein einziger API-Schlüssel stellt es hinter denselben Endpunkt wie 200+ andere Modelle – mit automatischem Failover, wenn ein Provider aussetzt, und der Routing-DSL, falls Sie Opus für die schwierigen Anfragen und ein günstigeres Modell für die Routineanfragen einsetzen möchten. Nex-N2.5 Pro ist nicht bei OrcaRouter – wir haben vor dem Schreiben unser Modellverzeichnis geprüft, und dort ist noch kein nex-agi-Modell gelistet. In dem Moment, in dem ein Provider es zum Listenpreis anbietet, wird es hier noch am selben Tag erscheinen – und der ehrliche Vergleich, den dieser Artikel noch nicht anstellen kann, wird zu einer Routing-Regel statt zu einer Migration.
Wer sollte handeln, und wer sollte warten?
Wenn Ihr Team heute produktive Computer-Use- oder Agentic-Coding-Workloads betreibt und ein Modell mit bekanntem Preis, bekanntem Fehlerprofil und unabhängiger Erfolgsbilanz benötigt, ist Claude Opus 5 in diesem Duell die rationale Wahl – und daran ändern auch die ersten 48 Stunden von Nex-N2.5 Pro nichts. Wenn Ihr Team offene Computer-Use-Modelle für einen künftigen Build evaluiert, gehört Nex-N2.5 Pro auf die Beobachtungsliste: ein multimodales MoE mit 397B Parametern, einem vernünftigen Self-Hosting-Footprint und einer plausiblen Benchmark-Geschichte im Mittelfeld ist genau die Art von offenem Modell, die eine Kostenkurve neu formt – vorausgesetzt, die Gewichte treffen tatsächlich ein und die Zahlen der Modellkarte überstehen einen unabhängigen Testlauf. Die rationale Position ist beides zugleich: den bewährten Spitzenreiter auf dem kritischen Pfad zu halten und den Tag, an dem die Gewichte eintreffen, darüber entscheiden zu lassen, ob der Neuling eine Erprobung verdient. Das ist der eine Vergleich in diesem Duell, der noch nicht stattgefunden hat – und es ist genau der, der am Ende wirklich zählen wird.
