
Nex-N2.5 Pro vs. MiniMax M3: die behauptete 34-Punkte-Lücke und das Modell, das Sie tatsächlich herunterladen können
- openaiNEUOpenAI: GPT-6 Astra2026-09-0455Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0247Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0247Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0157Intelligenz82Coding
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2646Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1541Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1251Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0547Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligenz49Coding
Die auffälligste Zahl in diesem Vergleich ist 56,4 zu 22,3 – und zugleich die am wenigsten überprüfbare. Das sind die OSWorld-2-Werte, die Nex-AGIs Nex-N2.5 Pro und MiniMax M3 auf der eigenen Benchmark-Karte des neuen Modells vorweisen: Nex-N2.5 Pro bei 56,4, MiniMax M3 bei 22,3 – eine Lücke von 34 Punkten bei der Long-Horizon-Computer-Use-Benchmark, an der sich inzwischen jeder ernsthafte GUI-Agent messen lassen muss. Das am 8. September 2026 vorgestellte Nex-N2.5 Pro ist ein multimodaler Agent mit 397 Mrd. Gesamtparametern und ~17 Mrd. aktiven Parametern; seine Gewichte sind weiterhin als „coming soon“ gelistet. Das am 1. Juni 2026 veröffentlichte MiniMax M3 ist ein multimodales Open-Weight-Flaggschiff mit 428 Mrd. Gesamtparametern und ~23 Mrd. aktiven Parametern, das auch Videoeingaben unterstützt, über MiniMax Sparse Attention einen 1M-Token-Kontext bereitstellt und seit Anfang Juni heruntergeladen werden kann. Eines dieser beiden Modelle kannst du dir vom Hub laden und noch heute Abend ausführen. Das andere ist eine gehostete Vorschau mit einem Versprechen. Und die 34-Punkte-Lücke, die den Vergleich lesenswert macht, stammt vom Anbieter des Modells, das du nicht ausführen kannst – bei einer Benchmark, bei der selbst die Zahl des bisherigen Spitzenreiters nur vom Anbieter gemeldet wird.
Hier geht es also wirklich darum, wie man einen dramatischen, nicht verifizierbaren Vorsprung gegen einen bescheidenen, teilweise verifizierbaren abwägt — und darum, was die Existenz des billigen Modells für das Verkaufsargument des teuren Modells bedeutet. MiniMax M3 ist das Gegengewicht, gegen das sich jeder Spezialist mit ausstehenden Gewichten argumentativ zur Wehr setzen muss: Es erledigt bereits den größten Teil der Arbeit, kostet fast nichts, und seine Dateien liegen auf deiner Festplatte. Damit Nex-N2.5 Pro relevant ist, muss die 34-Punkte-Behauptung die drei folgenden Prüfungen überstehen.
Zuerst prüfen: Messen die Zahlen überhaupt dasselbe?
OSWorld-2 ist die langfristig angelegte, reale Erweiterung der ursprünglichen OSWorld-Benchmark — ein Agent bedient echte Desktop-Software über mehrstufige Aufgaben hinweg und wird danach bewertet, ob er echte Arbeit erledigt, nicht ob er den richtigen Knopf klickt. Sie ist deutlich schwerer als ihr Vorgänger, und es ist die Benchmark, bei der Nex-AGI behauptet, dass sich seine Pro-Stufe von den multimodalen Mitbewerbern abhebt. Aber man sollte sich ansehen, woher die beiden Zeilen stammen. Die 56,4 von Nex-N2.5 Pro ist Nex-AGIs eigene Messung über die interne NexCUA-Testumgebung, die laut Karte „bald“ als Open Source veröffentlicht werden soll. Die 22,3 von MiniMax M3 ist ein Wert, den Nex-AGI für ein Konkurrenzmodell veröffentlicht hat — MiniMax selbst hat kein OSWorld-2-Ergebnis publiziert, und die öffentliche Computer-Use-Kennzahl von M3 stammt aus dem älteren, einfacheren OSWorld-Verified, das Nex' Karte ebenfalls aufführt: 75,2 für M3 gegenüber 82,2 für Pro. Beide Zeilen in der Schlagzeile 56,4 zu 22,3 stammen aus derselben Testumgebung, vom selben Anbieter, am selben Tag, über ein Modell, das ihm gehört, und ein Modell, das ihm nicht gehört. Das macht den Abstand nicht unecht — Testumgebungen existieren genau dazu, Modelle unter identischen Bedingungen zu vergleichen. Es bedeutet aber, dass die Zahl ein kontrollierter Vergleich eines einzelnen Anbieters ist, nicht ein Ergebnis, das ein externes Labor bestätigt hat, und der Abstand ist genau so vertrauenswürdig wie die Testumgebung, die ihn hervorgebracht hat.
Zweiter Check: Was liefert das Modell, das du tatsächlich ausführen kannst?
MiniMax M3 braucht seine OSWorld-2-Zeile nicht, um nützlich zu sein, denn die Argumente für das Modell stützen sich auf Dinge, die man durch Herunterladen überprüfen kann. Es hat insgesamt 428B Parameter (davon ~23B aktive), basiert auf MiniMax Sparse Attention und bietet einen 1M-Token-Kontext sowie ein 512K-Ausgabebudget; es nimmt Text, Bild und Video als Eingabe auf und gibt Text aus; seine Gewichte sind seit der ersten Juniwoche auf Hugging Face verfügbar; sein Listenpreis in der MiniMax-API beträgt 0,30 $ pro Million Eingabe-Tokens und 1,20 $ pro Million Ausgabe-Tokens, bei 0,06 $ für gecachte Eingaben – etwa ein Fünftel des Ausgabepreises der günstigsten geschlossenen Frontier-Modelle, wobei Video separat abgerechnet wird. Sein unabhängiges Abschneiden ist real, aber bescheiden: Mit 44 Punkten auf dem Artificial Analysis Intelligence Index liegt es im Mittelfeld der Flaggschiffe, unterhalb des 56–61-Bereichs, den die geschlossenen Spitzenreiter belegen. Seine wichtigsten agentischen Kennzahlen – 75,2 OSWorld-Verified laut Nex’ Karte, ~70 nach MiniMax’ eigener Angabe, 83,5 BrowseComp – sind vom Anbieter gemeldet und wurden nicht reproduziert; sie tragen dasselbe Sternchen wie Nex. Der Unterschied ist, dass sich M3s Angaben auf ein Modell beziehen, das man selbst ausführen und erneut testen kann – weshalb „vom Anbieter gemeldet“ bei Modellen mit herunterladbaren Gewichten weniger schmerzt.

Dritte Prüfung: Was würden Sie tatsächlich mit jedem einzelnen tun?
• Heute kaufen — MiniMax M3: echte Gewichte, eine Preisliste, eine funktionierende API. Nex-N2.5 Pro: eine kostenlose gehostete Vorschau und eine Roadmap.
• Computernutzung — MiniMax M3: ein Generalist, der mit Screenshots und Videos umgeht und bei GUI-Benchmarks im Mittelfeld landet. Nex-N2.5 Pro: ein vision-nativer Agent, der für die visuelle Feedback-Schleife entwickelt wurde und den klassenbesten OSWorld-2-Rang für sich beansprucht.
• Preis — MiniMax M3: $0.30 / $1.20, Cache $0.06 — billig genug, um es für lange Agenten-Schleifen zu verwenden. Nex-N2.5 Pro: noch kein veröffentlichter Preis; das Effizienzargument (17B aktiv auf einem einzelnen 8×H100-Knoten) ist eine Prognose, keine Rechnung.
• Kontext — MiniMax M3: 1M Token, wobei Anfragen über 512K mit 2× abgerechnet werden. Nex-N2.5 Pro: 262K-Familienkonfiguration.
• Eingaben — MiniMax M3: Text, Bild und Video, nativ. Nex-N2.5 Pro: Bild und Text, ausgerichtet auf die Wahrnehmung auf Bildschirmebene.
• Überprüfbarkeit — MiniMax M3: selbst hostbar, sodass jede Behauptung intern überprüfbar ist. Nex-N2.5 Pro: keine Gewichte verfügbar, sodass jede Behauptung nur Nex-AGIs Wort ist.
• Unabhängiger Index — MiniMax M3: 44 (AA). Nex-N2.5 Pro: noch keiner.
Warum der günstige etablierte Anbieter der härtere Gegner ist
Es gibt einen Grund, warum Nex-AGI MiniMax M3 in seine multimodale Tabelle aufgenommen hat, statt es zu ignorieren: M3 ist der Preisanker, der den Aufpreis eines Computer-Use-Spezialisten schwer zu rechtfertigen macht. Wenn ein Generalist, der 0,30 $/1,20 $ kostet und Videoeingaben akzeptiert, auch nur 70–75 % dessen schafft, was ein dedizierter GUI-Agent von sich behauptet, muss der Spezialist bei der eigentlichen Aufgabe dramatisch besser sein, um seinen Platz zu verdienen – und die Modellkarte von Nex-N2.5 Pro gibt an, dass er es auf OSWorld-2 um 34 Punkte ist. Doch ein 34-Punkte-Vorsprung, den der Herausforderer für sein noch nicht veröffentlichtes Modell angibt, ist eine Hypothese, während M3s Index von 44, seine offenen Gewichte und sein Preis Fakten sind, auf die man bauen kann. Die wirtschaftlich rationale Haltung ist nicht, die Hypothese abzutun – sondern darauf zu bestehen, dass sie einen unabhängigen Durchlauf übersteht, bevor sie irgendjemandem Geld kostet.
Den Vergleich mit Ihrem eigenen Schlüssel ausführen
The routing layer is where a price-anchored comparison like this gets tested without committing to either side. MiniMax M3 is on OrcaRouter at MiniMax's list price — $0.30 / $1.20, passed through at 0% markup, so the day MiniMax changes a rate the change is live on the same key you already use for the rest of the catalog. Nex-N2.5 Pro is not offered through us, so you reach it through Nex-AGI's hosted preview until the promised weights appear. The experiment that actually answers this matchup: point your high-volume, long-context agent traffic at MiniMax M3 through the one endpoint, run a smaller evaluation branch against Nex-N2.5 Pro's preview, and compare them on your own task mix while automatic failover keeps both honest — a 34-point vendor claim is worth exactly as much as your own reproduction of it, and M3 is cheap enough that reproducing the test costs almost nothing. When Pro's weights land, the eight-H100 recipe is the real deliverable to check: whether the 17B-active specialist holds its OSWorld-2 lead when someone other than Nex-AGI runs it.


Das Urteil, das die Beweise stützen
Was den derzeit tatsächlich umsetzbaren Teil angeht, gewinnt MiniMax M3 dieses Duell kampflos: Es ist zum Download verfügbar, kostet nur ein Fünftel des bei Spitzenmodellen üblichen Preises, verarbeitet Video, hat einen unabhängigen Index, und seine Computer-Use-Behauptungen – auch wenn sie nur vom Anbieter stammen – deuten auf ein Modell, das Sie noch diese Woche in Ihrem eigenen Stack testen können. Nex-N2.5 Pro ist das interessantere Modell, aber der schlechtere Kauf: ein auf Computer-Use spezialisiertes Modell mit nativem Bildverständnis, dessen eigene Modellkarte eine in seiner Klasse führende OSWorld-2-Punktzahl beansprucht und dessen Gewichte noch nicht existieren. Behandeln Sie die Lücke von 56.4 zu 22.3 als die beste verfügbare Hypothese darüber, wohin die Entwicklung von Computer-Use führt, und nicht als ein Ergebnis, auf das Sie bauen können – und betrachten Sie MiniMax M3 als den Grund, warum der Spezialist, wenn er schließlich erscheint, diese Lücke auf einem fremden Prüfstand nachweisen muss, um einen Preis über $0.30/$1.20 zu rechtfertigen.
