Eine Hero-Titelkarte für 'Nex-N2.5 Mini' mit dem Untertitel 'Offene Gewichte zum Start verfügbar – der kleine Computer-Use-Agent', Chips mit der Aufschrift 'APACHE-2.0', '35B GESAMT / ~3B AKTIV' und '262K KONTEXT', sowie ein Band mit der Aufschrift 'BILD + TEXT-EINGABE – 2x H100-REFERENZ', mit dem OrcaRouter-Logo unten rechts eingebettet.
Guides & Insights

Nex-N2.5 Mini: Open Weights zum Start verfügbar — Nex-AGIs kleinster Computer-Use-Agent ist der Einstieg.

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Der Weg herauszufinden, ob offene Computer-Use-Agenten bereit sind, führt nun über ein Modell, das man noch am selben Tag seiner Ankündigung herunterladen kann. Nex-AGI stellte seine Nex-N2.5-Familie am 8. September 2026 vor – drei agentische Stufen, Nex-N2.5 Mini, Nex-N2.5 Pro und Nex-N2.5 Max – und die Stufe mit der Download-und-lauf-lassen-Geschichte ist die kleinste. Nex-N2.5 Mini hat seine Apache-2.0-Gewichte auf Hugging Face live in sechzehn BF16-Shards, rund 35 Milliarden Parameter mit gemeldeten ~3 Milliarden aktiven pro Token und einer Referenzimplementierung mit zwei H100. Sein größeres multimodales Geschwistermodell Nex-N2.5 Pro ist zum Zeitpunkt dieses Artikels noch als „coming soon“ markiert, während das reine Textmodell Nex-N2.5 Max mit 1,6 Billionen Parametern ebenfalls verfügbar ist, aber sechzehn H200 über zwei Knoten benötigt, bevor es läuft. Für alle, die die These hinter der Familie testen wollen – dass offene agentische Modelle bei langfristiger Computer-Nutzung durchhalten und nicht nur Fragen beantworten – ist das Mini der Einstieg.

Wer ist Nex-AGI? Der Name ist neu, und die Veröffentlichung hat den Anschein einer ersten öffentlichen Premiere. Die Berichterstattung über die Ankündigung beschreibt das Vorhaben als eine Zusammenarbeit mehrerer Organisationen aus Shanghai – des Shanghai Innovation Institute, von Shanghai Qiji Zhifeng, Mosi Intelligence und Kuafu Technology – wobei die Modellfamilie als Open Source positioniert ist und das Team unter dem Handle @NexEcosystem auftritt. Im Modellsteckbrief wird Nex-N2.5-mini und Nex-N2.5-Pro zugeschrieben, „die multimodalen Grundlagen von Nex-N2“ fortzuführen – der früheren Nex-Veröffentlichung, deren Gewichte bereits offen zugänglich sind. Was hier wirklich neu ist, ist der Rahmen: Nex-AGI sagt, die Modelle seien für langfristige Aufgaben in realen Umgebungen gebaut worden – einen Computer bedienen, einen Browser steuern, Code ausführen und testen sowie den Kurs anhand dessen korrigieren, was auf dem Bildschirm zu sehen ist – und die Gewichte wurden veröffentlicht, um diese Behauptung überprüfbar zu machen.

Drei Stufen, eine Ankündigung

Die Familie teilt sich nach Maßstab und Modalität auf, und die Unterschiede wiegen schwerer als der gemeinsame Name:

• Nex-N2.5 Mini — insgesamt etwa 35B / ~3B aktiv, ein multimodales Modell, das Bilder und Text verarbeitet und auf visuelle Computernutzung, Surfen und Aufgaben ausgerichtet ist, die Rückmeldung von einer Schnittstelle benötigen. Die Referenzbereitstellung ist ein einzelner Knoten mit zwei H100.

• Nex-N2.5 Pro — Berichten zufolge gesamt 397B / ~17B aktiv, ebenfalls multimodal, für schwerere Computer-Use-Workloads. Die Referenzbereitstellung besteht aus acht H100s. Die Gewichte waren zum Start nicht herunterladbar.

• Nex-N2.5 Max — 1.6T Gesamt / ~49B aktiv, nur Text, und laut Nex-AGI sein „erster vollständiger Post-Training-Ansatz im Billionen-Parameter-Maßstab.“ Das Datenblatt besagt, dass es auf einem DeepSeek-V4-Pro-Base-Fundament basiert. Das Referenz-Deployment umfasst 16×H200 über zwei Knoten.

Alle drei sind Mixture-of-Experts-Modelle. Mini und Pro basieren auf der Qwen3.5-Modellfamilie – die Launch-Materialien von Nex-AGI beschreiben beide als aus Qwen3.5-Varianten post-trainiert, und die eigene Konfiguration des Mini trägt ein qwen3_5_moe-Architektur-Tag – während Max der auf DeepSeek basierende Außenseiter ist. Die Familie ist also nicht ein Rezept in drei Größen, sondern zwei Rezepte: Die multimodalen Stufen, die „Dinge auf dem Bildschirm erledigen“ können, teilen sich eine Abstammungslinie, während der Textreasoning-Riese eine andere hat.

Was das Nex-N2.5 Mini, das ausgeliefert wurde, tatsächlich ist

Das Hugging-Face-Repository für nex-agi/Nex-N2.5-mini ist ein echtes, herunterladbares Checkpoint und kein Platzhalter – 16 Safetensors-Shards mit insgesamt etwa 70 GB, BF16, Lizenz Apache-2.0, erstmals erstellt am 8. September. Die Konfigurationsdatei ist spezifisch genug, um darauf zu designen:

Architektur — Qwen3_5MoeForConditionalGeneration, die qwen3_5_moe-Familie, mit einem Vision-Stack: Die Karte kennzeichnet es als Bild-Text-zu-Text, und das Repository enthält preprocessor_config.json zusammen mit der Textkonfiguration.

• Form — 40 Schichten, eine verborgene Größe von 2048, Grouped-Query-Attention mit 16 Query-Köpfen und 2 KV-Köpfen sowie ein Vokabular von 248.320.

• MoE — 256 geroutete Experten mit 8 aktiven pro Token, plus ein gemeinsamer Experte, Zwischengröße 512 — das spärlich aktivierte Profil, das ein Modell der „35B-Klasse“ mit ~3B aktiven Parametern auf zwei H100s lauffähig macht.

Kontext — max_position_embeddings von 262.144 Token in der veröffentlichten Konfiguration, dieselbe 262K-Zahl, die in den Deployment-Rezepten der Familie auftaucht.

• Gewichte und Lizenz — BF16, Apache-2.0, nicht gated; das Repo verweist außerdem auf einen ModelScope-Mirror und auf eine GitHub-Organisation (nex-agi), die die Deployment-Rezepte der Familie enthält.

Nex-AGIs Bereitstellungsdokumentation ist der Teil, den die meisten Open Releases falsch machen – und dieser hier macht ihn ungewöhnlich richtig. Das Mini wird über ein benutzerdefiniertes SGLang-Docker-Image (nexagi/sglang:v0.5.18-nex-patch) auf einem einzelnen Knoten mit zwei H100s mithilfe von Tensor-Parallelität 2 ausgeliefert. Das empfohlene Sampling ist Temperatur 0,7, Top-p 0,95, Top-k 40. Der Tool-Aufruf läuft über den qwen3_coder-Parser von SGLang, und das Modell bietet über ein reasoning_effort-Feld drei Denkmodi an – „none" für Nicht-Denken, „medium" (der adaptive Standard) und „high" für dauerhaft aktives Denken. Bei einem kleinen agentischen Modell ist diese Denkmodus-Steuerung der Unterschied zwischen einer brauchbaren Agenten-Schleife und einer langsamen, und sie ist im Serving-Rezept integriert, statt dem Nutzer überlassen zu bleiben.

A single-column scoreboard titled 'Nex-N2.5 Mini - the scoreboard' with rows 'Params: 35B total / ~3B active (vendor-reported)', 'Architecture: qwen3_5_moe MoE - 256 experts / 8 active', 'Context: 262,144 tokens', 'Input: image + text', 'License: Apache-2.0 - BF16 weights live' and 'OSWorld-Verified: 71.2 (vendor-reported)', with a footer 'Specs from the HF config; benchmarks are Nex-AGI-reported, no independent run yet.'

Gewichte: Was tatsächlich heruntergeladen werden kann

Der Status der drei Stufen zum Starttag ist eine präzise Darstellung wert, denn die Ankündigung und die Repositorien stimmen nicht ganz überein. Zum Zeitpunkt dieses Artikels ist die Mini-Version vollständig unter Apache-2.0 herunterladbar — darauf basiert dieser Artikel. Nex-N2.5 Max ist ebenfalls verfügbar; sein Hugging-Face-Repository enthält 644 Safetensors-Shards, auch wenn die Reproduktion seines Billionen-Parameter-Umfangs ein 16×H200-Projekt ist. Nex-N2.5 Pro ist der Nachzügler: Sein Hugging-Face-Repository existiert zwar, enthält aber nur die README und Abbildungen, keine Modell-Shards, und auf der Karte steht weiterhin, dass die Gewichte kommen. Wenn die Stufe, die Sie interessiert, die große multimodale ist, ist das die Lücke, die man beobachten sollte — das Launch-Material beschreibt Pro als das stärkste Computer-Use-Modell der Familie, und es ist dasjenige, das Sie noch nicht lokal ausführen können.

A screenshot of the Hugging Face repository page for nex-agi/Nex-N2.5-mini (captured September 9, 2026), showing the model header with Text Generation / Transformers / Safetensors / qwen3_5_moe / image-text-to-text / conversational tags and 'License: apache-2.0', and the Files & versions tree for the main branch listing config.json, README.md, chat_template.jinja and the figures directory.

Die von Nex-AGI berichteten Zahlen — und die Einschränkung, die mit ihnen einhergeht.

Das Modellkarten-Dokument von Nex-AGI enthält eine vollständige Benchmark-Tabelle für das Mini-Modell, und jede darin enthaltene Zahl stammt aus der eigenen Berichterstattung des Anbieters. Zum Zeitpunkt der Erstellung dieses Textes war kein unabhängiger Durchlauf veröffentlicht, und die Karte weist ausdrücklich darauf hin, dass die Ergebnisse aus offiziellen Benchmark-Bestenlisten und den neuesten verfügbaren Evaluierungsberichten stammen, soweit vorhanden, sowie aus Nex-AGIs eigenen Evaluierungen in anderen Bereichen. Die Ergebnisse zur Code-Erstellung wurden mit dem NexAU-Harness des Teams erzeugt; die Ergebnisse zur Computer- und Browser-Nutzung wurden mit dem NexCUA-Harness erzielt, von dem die Karte angibt, dass er als Open Source verfügbar gemacht wird. Behandeln Sie die wichtigsten Zeilen als den bestmöglichen Fall des Anbieters, bis eine neutrale Partei sie reproduziert.

Mit dieser Einordnung lauten die gemeldeten Ergebnisse des Mini wie folgt: Bei Text- und Code-Aufgaben erreicht Terminal-Bench 2.1 73,4, SWE-Bench Pro 43,8, DeepSWE v1.1 36,1, AutomationBench v1.0.6 32,3, Toolathlon Verified 54,6, BrowseComp 83,4 und GDPval-AA v2 eine Punktzahl von 1446. Auf der multimodalen/Computer-Use-Seite sind die Blickfänge OSWorld-Verified mit 71,2, WebArena-Verified mit 63,4, WebTest mit 48,6 (im Oracle-Modus gegen Ground-Truth-Checklisten ausgeführt), OSWorld-G mit 82,9 und OmniDoc mit 89,7, während OSWorld-2 (30,5) und Vision2Web (52,9) bescheidener ausfallen.

Zwei Hinweise zur Einordnung. Erstens: OSWorld-Verified und OSWorld-2 sind unterschiedliche Suiten — die eine ist eine verifizierte Teilmenge, die anhand des resultierenden Umgebungszustands bewertet wird, die andere ein neuerer und insgesamt strengerer Durchlauf —, daher sind 71,2 auf der einen und 30,5 auf der anderen kein Widerspruch; es sind unterschiedliche Tests, und Nex’ eigene Tabelle führt sie in getrennten Spalten. Zweitens: In jeder Zeile der Familientabelle schneidet das Mini unter Pro und Max ab, und die Spitze jeder Spalte gehört einem etablierten Frontier-Modell wie Claude Opus 5 oder GPT-5.6 Sol. Beim Mini geht es nicht darum, dass es Frontier-Modelle schlägt, sondern dass ein offenes Modell mit ~3 Mrd. aktiven Parametern bei Computer-Use-Benchmarks konkurrenzfähige Werte mit einem Footprint von zwei H100 erzielt. Ob das Bestand hat, ist genau die Frage, die du dank der offenen Gewichte selbst beantworten kannst.

Nex-N2.5 Mini läuft heute

Das Zwei-H100-Rezept macht das Mini zum günstigsten Weg, um praktisch mit dem Kernanspruch der Familie zu arbeiten. Da die Architektur ein Standard-Qwen3.5-MoE mit einem qwen3_coder-Tool-Call-Parser ist, lädt sie im Nex-AGI-SGLang-Fork ohne eigenen Inferenzcode, und die empfohlenen Einstellungen werden veröffentlicht statt dem Reverse-Engineering überlassen. Die ehrliche Erwartung, die man sich vor dem Start setzen sollte, ist, dass ein einen Tag alter Checkpoint mit einem brandneuen Harness ein Experiment ist und keine Abhängigkeit. Die Downloads im Mini-Repo liegen weiterhin im einstelligen Bereich, und als dies geschrieben wurde, hatte noch kein Dritter eine unabhängige Bewertung veröffentlicht – das ist der normale Zustand für ein gestern veröffentlichtes Modell und der Grund, warum der Zwei-H100-Fußabdruck wichtig ist: Du kannst das Experiment diese Woche selbst ausführen, anstatt darauf zu warten, dass es jemand anderes tut.

A screenshot of the nex-agi collections page on Hugging Face (captured September 9, 2026), showing the Nex-N2.5 collection 'updated about 7 hours ago' with the three model entries nex-agi/Nex-N2.5-Max (Text Generation, 1.6T), nex-agi/Nex-N2.5-Pro and nex-agi/Nex-N2.5-mini, alongside the earlier Nex-N2, Nex-N1.1 and Nex-N1 collections listed on the left.

Wenn Sie das Mini lieber in seiner eigenen Benchmark-Tabelle mit den Frontier-Agenten vergleichen möchten, als eine einzelne Bereitstellung von Hand zu tunen, dann ist genau das ein Fall, in dem sich eine Routing-Schicht bezahlt macht. Wenn ein Hosting-Anbieter Nex-N2.5 Mini ins Programm nimmt – und die etablierten Modelle, gegen die es gemessen wird, sind über Router bereits erreichbar –, dann ist eine einzige API für 200+ Modelle, bei der die Listenpreise der Anbieter mit 0 % Aufschlag durchgereicht werden und automatisches Failover greift, der kostengünstige Weg, denselben Task gegen mehrere von ihnen laufen zu lassen, ohne eine zweite Integration. Auf OrcaRouter ist genau das die Standardkonfiguration für jedes Modell, das wir routen: derselbe Schlüssel, dasselbe Aufrufformat, der eigene Preis des Anbieters – ganz ohne Zuschlag. Genau das ist bei einem unerprobten Modell wie diesem am wichtigsten, denn Failover ermöglicht es, das Modell auf einem echten Pfad auszuprobieren, ohne den Pfad darauf zu verwetten.

Wer sollte diese Gewichte ziehen?

Laden Sie sie herunter, wenn Sie mit Computer-Use-Agenten, Browser-Automatisierung oder visuell gestützter Tool-Nutzung arbeiten und ein permissiv lizenziertes, selbst hostbares Modell als Benchmark gegen die gehosteten Spitzenreiter einsetzen möchten. Die Apache-2.0-Lizenz beseitigt die üblichen Hürden bei einer Veröffentlichung aus einem chinesischen Labor, der Bedarf an zwei H100 liegt für ein ernsthaftes Agententeam in Reichweite, und die Steuerung des Reasoning-Aufwands und ein echter Tool-Call-Parser machen es zu einer glaubwürdigen Testplattform statt zu einem Spielzeug. Halten Sie sich zurück, wenn Sie das stärkste Computer-Use-Modell der Familie brauchen – das ist Pros Rolle, und Pros Gewichte stehen noch aus. Und lassen Sie das Herstellerlabel in jeder Benchmark-Zeile stehen, bis ein unabhängiger Lauf diese Werte bestätigt; eine 71,2 auf OSWorld-Verified von einem offenen Modell mit ~3B aktiven Parametern ist eine bemerkenswerte Angabe – genau diese Art von Angabe sollten Sie in Ihrer eigenen Testumgebung verifizieren, bevor Sie darauf aufbauen.

Was als Nächstes zu beobachten ist. Die Veröffentlichung der Pro-Gewichte ist das mit Abstand größte Signal – sie verwandelt die Familie von „Mini plus einem Billionen-Parameter-Riesen“ in das vollständige Lineup, das die Launch-Materialien beschreiben. An zweiter Stelle steht das Open-Sourcing des NexCUA-Harness, ohne das die Computer-Use-Zahlen unter demselben Protokoll nicht unabhängig reproduziert werden können. An dritter Stelle steht der erste neutrale Durchlauf – von Artificial Analysis, einem Universitätslabor oder einem Praktiker, der seine OSWorld-Verified-Reproduktion veröffentlicht. Sobald einer dieser drei Punkte eintritt, hört die Frage, die dieser Launch aufwirft – ob offene agentische Modelle die Lücke zu gehosteten Computer-Use-Stacks wirklich geschlossen haben – auf, eine Sache von Anbieter-Tabellen zu sein.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert