Nex-N2.5 Pro gegen GPT-5.6 Sol-Held — eine generierte Titelkarte mit der Aufschrift „Nex-N2.5 Pro vs. GPT-5.6 Sol{{1}}“{{/1}} und dem Untertitel „Ein {{2}}einen Tag altes Open Model{{/2}} gegen den {{3}}tiefsten Produktionsrekord der Branche{{/3}}“ sowie einer {{4}}Überschrift „OpenAI vs. Nex-AGI — September 2026“{{/4}}.
Guides & Insights

Nex-N2.5 Pro vs GPT-5.6 Sol: Die Herstellernummer des Neulings hinkt der unabhängigen Nummer des Platzhirsches hinterher.

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zieht man den einzigen Benchmark heran, bei dem beide eine Zahl vorweisen, so zeigt der direkte Vergleich: Die Reihenfolge der Schritte ist für einen Launch falsch. Nex-AGIs Modellkarte verleiht Nex-N2.5 Pro eine 56,4 auf OSWorld-2, gemessen an der eigenen NexCUA-Testumgebung der Allianz, die die Öffentlichkeit nicht gesehen hat. BenchLMs OSWorld-2.0-Bestenliste, aktualisiert am 29. August, führt GPT-5.6 Sol mit 62,6 – eine unabhängige Zahl, die die Herstellerzahl des Neulings klar übertrifft. Auf dem heimischen Terrain des einen Tag alten Modells – der Computernutzung durch Bildschirmlesen, genau der Sache, für die es entwickelt wurde – braucht der ausgereifte Generalist, mit dem es verglichen wird, nicht einmal ein Sternchen, um vorne zu liegen. Nex-N2.5 Pro gegen GPT-5.6 Sol ist in keiner Dimension, die von jemand anderem als dem Hersteller des Neulings gemessen wurde, ein knapper Wettkampf. Das ist eine Fallstudie über den Wert einer Produktionsbilanz, und allein deshalb lesenswert.

Die beiden Modelle sind in ihrer Zielsetzung kaum Rivalen. Nex-N2.5 Pro, angekündigt am 8. September 2026, ist ein Sparse-Mixture-of-Experts-Modell mit 397 Milliarden Parametern und etwa 17 Milliarden aktiven Parametern, multimodal (Text- und Bildeingabe, Textausgabe), nachtrainiert aus der Qwen3.5-Linie und dafür gebaut, Computer und Browser über eine visuelle Rückkopplungsschleife zu bedienen. Seine Apache-2.0-Gewichte sind auf Hugging Face weiterhin als „coming soon“ markiert, und seine einzigen Live-Builds sind kostenlose gehostete Endpunkte, die Nex-AGI von seiner Karte aus verlinkt. GPT-5.6 Sol ist OpenAIs Flaggschiff für „die härtesten Aufgaben“ – tiefes mehrstufiges Denken, groß angelegte Softwareentwicklung und langfristige agentische Workflows – seit dem 9. Juli in der API, mit geschlossenen Gewichten, und trägt nun die Bürde, bis OpenAI am 3. September GPT-6 Astra veröffentlichte, der Referenzpunkt an der Spitze gewesen zu sein. Wo Nex-N2.5 Pro ein Spezialist ist, der seine eigenen Gewichte nicht veröffentlicht hat, ist GPT-5.6 Sol ein bewährter Generalist, der seit zwei Monaten für den anspruchsvollsten Produktionsverkehr der Branche ausgeliefert wird.

GPT-5.6 Sol ist das Modell mit einer Datei.

Beginnen wir mit dem, was Sol vorweisen kann und Nex-N2.5 Pro nicht: eine Erfolgsbilanz. Seit dem 9. Juli wird GPT-5.6 Sol durch unabhängige Testumgebungen geschickt, von Sicherheitsforschern auf Herz und Nieren geprüft und in Agent-Frameworks und Codex-Workflows integriert. Seine unabhängigen Messwerte sind tiefgehend und öffentlich: 61 im Artificial Analysis Intelligence Index bei maximalem Reasoning, 88,0 in Terminal-Bench 2.1 und 73,0 in DeepSWE, gemessen mit derselben unabhängigen Testumgebung, sowie eine gemessene Ausgabegeschwindigkeit von rund 71 Tokens pro Sekunde bei Kosten von ungefähr 0,95 $ pro Intelligence-Index-Aufgabe. Nichts davon macht es unschlagbar — OpenAI hat seitdem GPT-6 Astra darüber positioniert —, aber jede dieser Zahlen ist eine Messung, die jemand anderes als OpenAI durchgeführt hat. Nex-N2.5 Pro hat keinen unabhängigen Eintrag irgendwo, und zwar aus einem strukturellen Grund: Niemand außerhalb der Allianz kann es ausführen.

Der einzige Benchmark, bei dem beide eine Zahl haben

Der OSWorld-Vergleich ist die sauberste verfügbare Messgröße, daher verdient er es, dass seine Einschränkungen genannt werden, bevor er verwendet wird. Nex-N2.5 Pros 56,4 ist Nex-AGIs eigene Messung auf OSWorld-2 über dessen NexCUA-Harness. GPT-5.6 Sols 62,6 stammt vom OSWorld-2.0-Leaderboard von BenchLM, einem Drittanbieter-Snapshot vom 29. August 2026, der fünfzehn Modelle auflistet und Claude Opus 5 mit 70,6 auf Platz eins führt, gefolgt von GPT-5.6 Sol mit 62,6 auf Platz zwei und GPT-5.6 Terra mit 50,2 auf Platz drei. „OSWorld-2" und „OSWorld 2.0" sind nahe Verwandte, aber nicht nachweislich identisch, daher sollte die genaue Lücke von vier bis sechs Punkten eher als richtungsweisend denn als präzise gelesen werden. Was die Einschränkungen übersteht, ist die Reihenfolge: Nach der besten Zahl, die jede Seite vorweisen kann, schlägt ein unabhängiger Sol-Wert einen herstellereigenen Nex-Wert auf dem Benchmark, den Nex zur Veröffentlichung gewählt hat. Ein Neuling, dessen eigene Zahl niedriger ist als die unabhängige Zahl des Amtsinhabers, hat kein überzeugendes Argument für einen Wechsel vorgebracht.

A two-column scoreboard titled 'Nex-N2.5 Pro vs GPT-5.6 Sol — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Weights Apache-2.0 pending; OSWorld 2.0 56.4 vendor-reported; AA Index no score yet; Context 262,144; Price free hosted / no list. Right column GPT-5.6 Sol: Released Jul 9 2026; Weights closed; OSWorld 2.0 62.6 independent; AA Index 61 (max); Context ~1.05M; Price $4.00 / $20.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Sol OSWorld per BenchLM Aug 29 and Index per Artificial Analysis.'

Spezifikationsumschläge

Der Rest des Datenblatts läuft in dieselbe Richtung:

Veröffentlicht — Nex-N2.5 Pro: 8. September 2026 (gehostete Endpunkte aktiv, Gewichte ausstehend). GPT-5.6 Sol: 9. Juli 2026, allgemein verfügbar.

Skalierung — Nex-N2.5 Pro: 397B gesamt / ~17B aktiv (MoE). GPT-5.6 Sol: Parameterzahl nicht offengelegt.

Modalität — Nex-N2.5 Pro: Text- und Bildeingabe, Textausgabe, Computer-Use-Vision-Loop. GPT-5.6 Sol: Text-, Bild- und Dateieingabe, Textausgabe, mit Tool-Aufruf und JSON-Modus.

Kontext/Ausgabe — Nex-N2.5 Pro: 262.144-Token-Kontext. GPT-5.6 Sol: ~1,05M-Token-Kontext, 128K-Ausgabegrenze.

Reasoning-Steuerung — Nex-N2.5 Pro: keine / mittel (adaptiv, Standard) / hoch. GPT-5.6 Sol: Reasoning-Aufwand bis zum Maximum, plus eine separate schnelle Verarbeitungsstufe.

Gewichte — Nex-N2.5 Pro: Apache-2.0, demnächst verfügbar. GPT-5.6 Sol: geschlossen.

Preis pro 1M Tokens — Nex-N2.5 Pro: kostenloser gehosteter Tarif, kein Listenpreis. GPT-5.6 Sol: $4.00 / $20.00 Sonderlistenpreis seit 21. August, $0.40 für gecachte Eingaben, Umstufung auf $8.00 / $30.00 bei über 272K Eingabe-Tokens.

Sols ~1,05 Millionen Token umfassender Kontext und die Ausgabegrenze von 128K stellen Nex-N2.5 Pros 262K-Fenster für langfristige Aufgaben in den Schatten, und Sols Preis, wenn auch alles andere als günstig, ist eine feste Größe, mit der ein Budget kalkulieren kann. Der kostenlose Tarif von Nex-N2.5 Pro ist die einzige Zahl auf seiner Seite, und das ist kein Preis.

Was ein einen Tag alter Spielstand wert ist

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

Jede Benchmark-Behauptung zu Nex-N2.5 Pro — OSWorld-2 bei 56,4, Terminal-Bench 2.1 bei 82,7, SWE-Bench Pro bei 61,2, BrowseComp bei 89,7 — hat eine gemeinsame Eigenschaft: Nex-AGI hat sie hervorgebracht, über eine Testumgebung, die das Bündnis als Open Source veröffentlichen will, aber noch nicht veröffentlicht hat. Keiner dieser Werte wurde unabhängig reproduziert, und keiner kann es werden: Die Gewichte sind nicht herunterladbar, und an dem Banner „Bald verfügbar“ hängt kein Datum. Das ist in diesem Vergleich wichtiger als in den meisten anderen, denn das Modell, mit dem Nex-N2.5 Pro verglichen wird, hat die längste unabhängige Bilanz der Branche. Wenn die gesamte Evidenzbasis des Herausforderers auf Selbstauskünften beruht und die des Amtsinhabers nicht, liegt die Beweislast vollständig beim Herausforderer – und ein kostenloser Endpunkt entbindet nicht davon. In dem Moment, in dem die Shards verfügbar sind und ein unabhängiges Labor Nex-N2.5 Pro ausführt, werden die Zahlen in diesem Artikel überprüfbar und der Vergleich real. Bis dahin ist „Eintages-Wert“ der zutreffende Begriff – ein Wert, der nicht an einem Modell geprüft werden kann, das nicht ausgeführt werden kann.

Preis, Route und die Form der Entscheidung

Kosten sind der Bereich, in dem die beiden Seiten am wenigsten vergleichbar sind, denn nur eine Seite hat überhaupt einen Preis. GPT-5.6 Sol kostet 4,00 $ / 20,00 $ – das ist OpenAIs Promotions-Listenpreis, der seit dem 21. August gilt und laut Ankündigung mindestens bis zum 21. November laufen soll, gesenkt von 5,00 $ / 30,00 $. Eine Preissenkung, die das Flaggschiff für hochvolumige Agenten-Workloads deutlich erschwinglicher gemacht hat – und die ein Pass-through-Router am selben Tag abbildet, an dem OpenAI sie vornimmt. Sol ist bei OrcaRouter zu diesem Listenpreis ohne Aufschlag erhältlich; Batch-Tier und Fast-Tier sind hinter demselben API-Schlüssel verfügbar wie bei 200+ anderen Modellen. Ein Team kann also die Anfragen, die OpenAIs Tiefe erfordern, an Sol weiterleiten und alles Übrige über günstigere Modelle laufen lassen. Nex-N2.5 Pro hat keinen Listenpreis, sondern nur seine kostenlosen gehosteten Endpunkte – eine gute Möglichkeit, ein Modell zu testen, aber eine schlechte Grundlage für ein Produktionsbudget. Man kann keine Ausgaben um eine Zahl herum planen, die es nicht gibt, und keine Architektur um Gewichte herum planen, die nicht veröffentlicht wurden.

Screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), marked FEATURED, showing the header stats $4.00 input and $20.00 output per million tokens and the byline 'by OpenAI - 2026-07-09'.

Die Entscheidung, die dieses Duell tatsächlich erzwingt, betrifft Risiko, nicht Leistungsfähigkeit. Wenn Sie ein Modell benötigen, das auch im nächsten Quartal noch da ist, mit bekanntem Preis, bekanntem Ausfallverhalten und Monaten adversarischer Tests hinter sich, ist GPT-5.6 Sol die rationale Wahl – und OpenAIs Veröffentlichung von GPT-6 Astra darüber stärkt dieses Argument nur, denn Sol ist nun das bewährte Arbeitspferd, dessen Preissenkung genau auf Produktionsvolumen abzielt. Wenn Sie Computer-Use-Agenten auf offenen Gewichten aufbauen und es sich leisten können, auf etwas Verifizierbares zu warten, ist Nex-N2.5 Pro einen Blick wert – ein multimodaler Spezialist mit 17B aktiven Parametern ist genau die Art von Modell, die die geschlossene Spitzenklasse bei den Kosten wiederholt unterboten hat. Aber Beobachten ist das entscheidende Wort. In jeder Dimension, die von irgendjemandem außer seinem Hersteller gemessen wird, hinkt Nex-N2.5 Pro dem Modell mit der Datei hinterher, und bis die Gewichte veröffentlicht werden, endet der Vergleich dort.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert