
Nex-N2.5 Pro vs DeepSeek V4 Pro: Nur einer dieser Sätze offener Gewichte ist tatsächlich offen.
- openaiNEUOpenAI: GPT-6 Astra2026-09-0455Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0247Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0247Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0157Intelligenz82Coding
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2646Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1541Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1251Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0547Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligenz49Coding
Hier ist das Familiengeheimnis, das diesen Vergleich seltsamer macht, als er aussieht: Nex-AGIs eigenes Nex-N2.5 Max, die oberste Stufe der Familie, zu der auch Nex-N2.5 Pro gehört, ist selbst durch Post-Training aus DeepSeek-V4-Pro-Base hervorgegangen. Die Berichterstattung über die Release-Notes vom 8. September sagt das offen: Mini und Pro sind aus Qwen3.5-Varianten gebaut, während das rein textbasierte 1.6T Max auf der offenen Basis fußt, die DeepSeek im August veröffentlicht hat. Wenn also Nex-N2.5 Pro mit DeepSeek V4 Pro verglichen wird, beobachtet der Leser, wie ein Open-Model-Projekt sich die Grundlage des anderen für seine Flaggschiff-Stufe borgt und dann versucht, den Spender in der Stufe darunter auszustechen. Das ist keine Beleidigung; so funktioniert die Open-Weights-Ökonomie, und es ist der ehrlichste mögliche Rahmen für einen Vergleich, bei dem beide Modelle offen lizenziert sind und nur eines davon heute tatsächlich heruntergeladen werden kann.
Die Asymmetrie ist die ganze Geschichte. DeepSeek V4 Pro – der 0813-Build, der am 13. August allgemein verfügbar (GA) wurde – hat derzeit MIT-lizenzierte Gewichte auf Hugging Face liegen: ein großes Mixture-of-Experts-Modell mit insgesamt rund 1,6 Billionen Parametern (davon etwa 49 Milliarden aktiv), einem 1M-Token-Kontext, einer 384K-Ausgabegrenze und einer offiziellen API dahinter. Nex-N2.5 Pro, am 8. September angekündigt, ist ein Sparse-MoE mit 397 Milliarden Parametern, davon rund 17 Milliarden aktiv. Es ist multimodal, während DeepSeek rein textbasiert ist, und zielt auf Computer-Use-Agenten ab statt auf allgemeine Werkzeugnutzung. Auf seiner Hugging-Face-Karte ist weiterhin ein Banner mit dem Hinweis zu sehen, dass die Gewichte unter Apache-2.0 bald veröffentlicht werden – allerdings ohne Datum –, während nur kostenlose gehostete Endpunkte das Modell bereitstellen. Dieselbe philosophische Verpflichtung zu offenen Gewichten. Ein völlig anderer Stand der Bereitstellung.
Zwei Lizenzen – doch nur ein Satz Gewichte wurde tatsächlich veröffentlicht.
Der Lizenzunterschied wiegt weniger schwer als der Unterschied bei der Bereitstellung, aber er setzt die Rahmenbedingungen. DeepSeek V4 Pro ist MIT-lizenziert – Sie können die Shards heute herunterladen, selbst hosten, feinjustieren und darauf ein Geschäft aufbauen, ohne irgendjemanden um Erlaubnis zu bitten. Und da die Gewichte veröffentlicht sind, kontrolliert kein einzelner Anbieter den Preis. Nex-N2.5 Pro wird unter Apache-2.0 versprochen, der ebenso permissiven Lizenz, die das Bündnis gewählt hat, doch die Angabe auf der Karte ist eindeutig: Die Gewichte sind nicht herunterladbar, und es ist kein Datum angegeben. Für ein Team, dessen Anforderung lautet „Das Modell muss uns gehören“, ist dieser Vergleich derzeit kein Wettbewerb – DeepSeek V4 Pro ist der einzige Kandidat, den man tatsächlich besitzen kann. Der praktische Vorbehalt wirkt in beide Richtungen: Das Selbst-Hosten eines ~1,6T-MoE ist ernsthafte Infrastruktur, daher ist für die meisten Teams die MIT-Lizenz weniger als Hosting-Plan von Bedeutung, sondern vielmehr als Garantie gegen Vendor-Lock-in und als Preisuntergrenze. Nex-N2.5 Pro, wenn seine Shards erscheinen, wird das besser selbst-hostbare Design sein – 17B aktive Parameter auf einem Acht-H100-Knoten sind eine weitaus kleinere Einheit als DeepSeeks Referenz-Footprint.
Die Zeilen, in denen sich die beiden unterscheiden.
Side by side, die beiden Modelle überschneiden sich {{1}}kaum in ihrem Verwendungszweck{{/1}}:
• Veröffentlicht — Nex-N2.5 Pro: 8. September 2026 (gehostete Endpunkte live, Gewichte ausstehend). DeepSeek V4 Pro: 13. August 2026 (0813 GA-Build), Gewichte live.
• Größe — Nex-N2.5 Pro: 397B gesamt / ~17B aktiv. DeepSeek V4 Pro: ~1.6T gesamt / ~49B aktiv.
• Modalität — Nex-N2.5 Pro: Text- und Bildeingabe, Textausgabe; entwickelt für die Computernutzung durch Bildschirmlesen. DeepSeek V4 Pro: nur Text in seiner öffentlichen API — keine native Vision-, Bild- oder Audioeingabe.
• Kontext / Ausgabe — Nex-N2.5 Pro: 262.144-Token-Kontext. DeepSeek V4 Pro: 1M-Token-Kontext, bis zu 384K Ausgabe-Token.
• Reasoning-Steuerung — Nex-N2.5 Pro: keine / mittel (adaptiv, standardmäßig) / hoch. DeepSeek V4 Pro: niedriger / hoher / maximaler Reasoning-Aufwand über denselben Modell-String.
• Gewichte — Nex-N2.5 Pro: Apache-2.0, erscheint bald. DeepSeek V4 Pro: MIT, jetzt herunterladbar.
• API-Oberfläche — Nex-N2.5 Pro: OpenAI-kompatible Chat-Aufrufe auf kostenlosen gehosteten Endpunkten. DeepSeek V4 Pro: native OpenAI Responses API plus Anthropic-kompatible Endpunkte, Tool-Aufrufe und JSON-Ausgabe.
Zwei wirklich verschiedene Produkte teilen sich das Wort „open“. Nex-N2.5 Pro ist dafür gebaut, auf einen Bildschirm zu schauen und ihn zu bedienen; DeepSeek V4 Pro ist dafür gebaut, zu denken, Code zu schreiben und Tools aufzurufen — der Unterschied zwischen einem Operator und einem Analysten.

Was wird gemessen, und was wird geliehen?

Die Benchmark-Lage ist ebenso einseitig wie die Lage bei der Bereitstellung. DeepSeek V4 Pro hat eine gemessene, unabhängige Präsenz: einen Eintrag im Artificial Analysis Intelligence Index, wochenlangen Presse- und Produktionsbetrieb seit der 0813-GA sowie Codierungs-Benchmarkwerte des Anbieters – Terminal-Bench 2.1 bei 87,9 und DeepSWE bei 62,7 laut DeepSeeks eigener Berichterstattung – die zumindest auf einem Modell beruhen, das jeder herunterladen und erneut ausführen kann. Nex-N2.5 Pro hat nichts davon. Seine Schlagzeilenwerte – OSWorld-2 bei 56,4, Terminal-Bench 2.1 bei 82,7, SWE-Bench Pro bei 61,2, BrowseComp bei 89,7 – sind allesamt eigene Messungen von Nex-AGI über seine NexCUA-Testumgebung, die das Bündnis nach eigenen Angaben als Open Source veröffentlichen will, aber noch nicht veröffentlicht hat. In den ersten 48 Stunden nach dem Start hatte kein unabhängiges Labor Nex-N2.5 Pro ausgeführt, weil niemand außerhalb des Bündnisses dazu in der Lage ist.
Liest man die beiden Behauptungen nebeneinander, ist die ehrliche Schlussfolgerung nicht: „DeepSeek ist intelligenter“, sondern: „Die Zahlen von DeepSeek sind überprüfbar, die von Nex-N2.5 Pro nicht.“ Wo sich die beiden Anbieterangaben überschneiden — Terminal-Bench 2.1 — beansprucht DeepSeek 87,9 gegenüber 82,7 von Nex-N2.5 Pro, eine Lücke von fünf Punkten zugunsten des etablierten Anbieters, die genau in die Richtung weist, die ein vorsichtiger Leser erwarten sollte: Das ausgelieferte Modell misst in der gemeinsamen Zeile höher als das noch nicht ausgelieferte.
Der Preis: eine reelle Zahl, eine geplante Zahl und keine Zahl
DeepSeek V4 Pro hat keinen einheitlichen Preis – und genau das ist die eigentliche Geschichte. Beim GA-Release am 0813 führte die offizielle API 0,435 $ pro Million Input und 0,87 $ pro Million Output; am 16. August stellte DeepSeek die V4-Familie auf ein Peak/Off-Peak-Modell um, sodass die offizielle API jetzt außerhalb der Spitzenzeiten 0,66 $ Input / 1,98 $ Output und zu Spitzenzeiten 1,32 $ / 3,96 $ verlangt, mit gecachtem Input zu 0,022 $ außerhalb der Spitzenzeiten und 0,044 $ zu Spitzenzeiten. Je nachdem, wann du DeepSeek direkt aufrufst, kostet dasselbe Modell zwischen etwa 50 % mehr und dem Viereinhalbfachen des Einführungspreises. Auch der Route spielt eine Rolle: Die OrcaRouter-Modellseite für DeepSeek V4 Pro listet derzeit pauschal 0,44 $ Input / 0,88 $ Output pro Million – der Tarif des Anbieters ohne Aufschlag durchgereicht – und unterbietet damit sogar den offiziellen Off-Peak-Tarif. Diese Flat-Route ist der Preis, den es zu schlagen gilt, wenn du Kosten pro Token vergleichst, und sie ist eine Zahl, die es nur gibt, weil eine Routing-Ebene dir den echten Tarif des Anbieters zeigt, statt einen neu bepreisten.

Nex-N2.5 Pro hat keinen Preis, den man neben all das stellen kann. Die gehostete Stufe ist kostenlos, und Nex-AGI hat für die Modellfamilie keinen Preis pro Token veröffentlicht; daher ist die Wirtschaftlichkeit des Modells schlicht unbekannt – die kostenlosen Endpunkte beweisen, dass der Build funktioniert, mehr nicht. Wenn die Gewichte veröffentlicht werden und ein Anbieter Nex-N2.5 Pro zu einem Listenpreis anbietet, wird der ehrliche Vergleich möglich; bis dahin ist „kostenlos“ ein Vorschau-Mechanismus, kein Marktsignal.
Zwei verschiedene Arten von Agenten
Sich zwischen diesen beiden zu entscheiden bedeutet, sich zwischen zwei Jobs zu entscheiden, nicht zwischen zwei Punktzahlen. Nex-N2.5 Pro ist für den Agenten, der einen Computer bedient: Es liest einen Bildschirm, bewegt einen Cursor, bearbeitet eine Datei, prüft das visuelle Ergebnis und macht weiter – die demonstrierte Sitzung mit 468 Aktionen in Pokemon Platinum zeigt die Form dieses Anspruchs. DeepSeek V4 Pro ist für den Agenten, der eine API bedient: Es denkt nach, schreibt Code über mehrere Dateien hinweg, ruft Tools auf und erzeugt lange strukturierte Ausgaben, alles über den Textkanal, dem sein Ausgabelimit von 384K und sein Kontext von 1M dienen sollen. Ein Team, das Browserautomatisierung entwickelt, sollte Nex-N2.5 Pro beobachten. Ein Team, das einen Coding- oder Wissensarbeits-Agenten entwickelt, sollte DeepSeek V4 Pro mit der geschlossenen Spitzenklasse vergleichen – und Nex-N2.5 Pro ist für diesen Job noch kein Kandidat: Es kann das Bild nicht aus dem Prozess nehmen, und seine Coding-Behauptungen sind sowohl geringer als auch weniger verifiziert als die des Modells, mit dem es verglichen wird.
Das Fazit: Auf das eine warten, das andere bauen.
DeepSeek V4 Pro ist in diesem Vergleich heute das einzig rationale Build-Ziel. Seine Gewichte sind herunterladbar, sein Preis ist bekannt – und über die flache OrcaRouter-Route günstiger als im eigenen Spitzenlast-Tarif von DeepSeek – und seine Behauptungen können von jedem an einem Nachmittag verifiziert werden. Es ist auch der natürliche Ausgangspunkt, um zu messen, was offene Computer-Use-Systeme kosten werden: Leiten Sie den Traffic seines Coding-Agenten durch OrcaRouter mit automatischem Failover um die ~500-Concurrency-Grenze der offiziellen API herum, und Sie haben eine funktionierende Open-Weights-Baseline zu einem realen Preis. Nex-N2.5 Pro ist die interessantere langfristige Wette, gerade weil es das spezialisiertere Design ist – ein multimodaler Operator mit 17B aktiven Parametern, der die geschlossenen Computer-Use-Führer unterbieten könnte, so wie DeepSeek die geschlossenen Generalisten unterboten hat – aber ein nicht verifizierbarer kostenloser Endpunkt ist kein Fundament. Wenn die Apache-2.0-Shards eintreffen und eine unabhängige Testumgebung diese OSWorld-2-Zahl ermittelt, verändert sich dieser Vergleich über Nacht. Bis dahin ist es ein Vergleich zwischen einem Modell, das man besitzen kann, und einem Modell, das man nur beobachten kann.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
