Hero-Titelkarte für den Nemotron-4-Leak-Artikel: Überschrift ‚Nemotron 4', Untertitel ‚NVIDIAs Familie mit offenen Gewichten und einer Billion Parametern — gemeldet, nicht veröffentlicht', und zwei Chips mit den Beschriftungen ‚gemeldet' und ‚unveröffentlicht'. OrcaRouter-Logo unten rechts.
Guides & Insights

Nemotron 4 Leak: NVIDIAs Open-Weights-Antwort mit 1 Billion Parametern auf die Frontier

Autor

Jim Song

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

1 Billion Parameter. Das ist die gemeldete Untergrenze für das größte Nemotron-4-Modell, das Flaggschiff von NVIDIAs nächster Open-Weights-Familie – und die Zahl klingt nur groß, bis man sie neben das legt, was bereits ausgeliefert wurde. Im vergangenen Monat hat Moonshot AI Kimi K3 mit insgesamt 2,8 Billionen Parametern ausgeliefert, Alibaba hat Qwen3.8-Max mit 2,4 Billionen vorgestellt, und NVIDIAs eigenes aktuelles Flaggschiff, Nemotron 3 Ultra, liegt bei 550 Milliarden. The Information berichtete am 11. August 2026 – unter Berufung auf mehrere Mitarbeiter, die an dem Projekt arbeiten –, dass Nemotron 4 NVIDIAs Antwort ist: eine Open-Weights-Familie, deren größtes Modell voraussichtlich bei etwa 1 Billion Parametern beginnen wird, etwa doppelt so viel wie Nemotron 3 Ultra.

Bisher ist nichts davon ausgeliefert worden. NVIDIA hat bestätigt, dass es eine Nemotron-4-Familie entwickelt, aber weder das Parameterziel, das Budget, den Zeitplan noch die Allianzdetails bestätigt, die The Information namentlich nicht genannten Mitarbeitern zuschreibt. Behandeln Sie jede Zahl in diesem Artikel als „berichtet“, nicht als „spezifiziert“. Der Sinn eines Leak-Berichts besteht darin, den kleinen bestätigten Kern vom größeren berichteten Hof zu trennen – und Ihnen zu sagen, welche Teile relevant sind, wenn das echte Datenblatt erscheint.

Der Einzeiler-Leak, aufgeschlüsselt

Zuerst der Name, denn er wird Sie in den Suchergebnissen verwirren: NVIDIA hat bereits im Juni 2024 ein Modell namens Nemotron-4-340B veröffentlicht. Das neue Nemotron 4 ist eine andere, größere Familie – der Nachfolger der Nemotron-3-Reihe (Nano, Super, Ultra), die dieses Jahr erschienen ist – und verwendet den Namen „Nemotron 4“ erneut für die darauffolgende Generation. Dieser Artikel handelt von dem neuen.

Was The Information tatsächlich berichtete: NVIDIA entwickelt Nemotron 4 als eine Familie von Open-Source-Modellen, die an die Spitze der Open-Weight-Bestenliste zielen soll, und das Flaggschiff soll voraussichtlich "mindestens 1 Billion Parameter" haben. NVIDIA hat kein Veröffentlichungsdatum festgelegt, hat noch nicht mit dem endgültigen Trainingslauf begonnen – ein Prozess, von dem Mitarbeiter erwarten, dass er Monate dauern wird – und hat bisher nur die Vortrainingsdaten und die Architektur festgelegt; die Spezifikation ist noch in Bewegung. Zwei Mitarbeiter sagten, die Familie könnte bereits im späten Herbst fertig sein; andere rechnen mit einem späteren Zeitpunkt.

Der Bericht enthält außerdem ein Budget: rund 28 Milliarden Dollar für mehrjährige Cloud-Service-Verträge, die bis Anfang 2031 laufen – etwa dreimal so viel, wie NVIDIA ein Jahr zuvor offengelegt hatte –, wovon rund 7 Milliarden Dollar auf das laufende Geschäftsjahr entfallen. Er stellt außerdem fest, dass das Forschungspapier des bisherigen Flaggschiffs 570 Autoren auflistete und Nemotron 4 noch mehr einbezieht – ein ehemaliger Mitarbeiter sagte The Information: „Jeder möchte beteiligt sein.“ All dies wurde von NVIDIA nicht gemeldet.

Comparison scoreboard 'Nemotron 3 Ultra vs Nemotron 4 — shipped vs reported': Parameters 550B total / 55B active vs at least 1T total / TBD active; Release June 4, 2026 vs no date set; Weights open now vs not yet; Status shipped and verifiable vs employee-reported; License OpenMDW-1.1 vs not announced; Price ~$0.68 / $2.68 per 1M vs nothing hosted yet. Footer: Nemotron 3 Ultra figures per NVIDIA and Artificial Analysis; Nemotron 4 per The Information, unconfirmed.

Warum die Größenangabe der am wenigsten interessante Teil ist

Die naheliegende Geschichte ist: „NVIDIA geht in Richtung Billionen-Parameter.“ Die weniger naheliegende ist, dass die Open-Weight-Front dort zuerst angekommen ist. Kimi K3 hat seine Gewichte am 27. Juli veröffentlicht – mit 2,8 Billionen Gesamtparametern, davon etwa 104 Milliarden aktive pro Token in einer Mixture-of-Experts-Konfiguration – und Alibabas Qwen3.8-Max, vorgestellt am 19. Juli, ist ein Modell mit 2,4 Billionen Gesamtparametern und rund 95 Milliarden aktiven. Dagegen würde ein Nemotron-4-Flaggschiff mit „mindestens 1 Billion“ Nemotron 3 Ultra zwar verdoppeln, aber immer noch hinter den Größenführern zurückbleiben – und beide dieser Führer sind chinesisch.

Screenshot of the Artificial Analysis models page comparing intelligence index, price per 1M tokens, output speed, and context window across frontier models, with Claude Opus 5 leading the intelligence highlights.

Das macht die Gesamtparameterzahl völlig zur falschen Betrachtungsweise. Bei einem Mixture-of-Experts-Modell bestimmen die aktiven Parameter pro Token die Kosten und die Geschwindigkeit, nicht die plakative Gesamtzahl. Ein Nemotron 4 mit insgesamt 1 Billion Parametern könnte auf etwa 100 Milliarden aktive Parameter kommen – genau in der Liga von Kimi K3 und Qwen3.8-Max – oder auf die Hälfte davon. Die Zahl, die als Nächstes durchsickert, ist die entscheidende, und sie ist noch nicht durchgesickert.

Infographic 'The trillion-parameter open frontier' listing four models with total-parameter counts: Kimi K3 2.8T (Moonshot AI), Qwen3.8-Max 2.4T (Alibaba), Nemotron 4 at least 1T total, reported (NVIDIA), Nemotron 3 Ultra 550B (NVIDIA), with footer 'Total-parameter counts; Nemotron 4 per The Information, unconfirmed.'

Auch die andere Richtung ist erwähnenswert: DeepSeek V4-Flash, das am 31. Juli unter einer MIT-Lizenz erschien, ging den entgegengesetzten Weg — insgesamt 284 Milliarden Parameter, ausgerichtet auf den Preis statt auf Skalierung, mit geschätzten Kosten von etwa 0,14 $ pro Million Input-Tokens. Der Markt belohnt beide Extreme. Skalierung ist nicht die Strategie; sie ist eine Strategie.

NVIDIAs Position erklärt den Schritt. The Information berichtet, dass Nemotron 3 Ultra unter den US-amerikanischen Open-Weight-Modellen den zweiten Platz belegt – hinter Thinking Machines' Inkling – und außerhalb der Top-Riege des globalen Open-Leaderboards liegt. Nemotron 4 ist der Versuch, wieder ins Gespräch um die Spitzenmodelle zu kommen, und NVIDIAs eigene Führungskräfte rahmen es als Souveränitäts-Play: VP für generative KI Kari Briski sagte, NVIDIA investiere in Nemotron, weil „jedes Unternehmen und jedes Land zugängliche Open-Source-Spitzenmodelle braucht, um Sicherheit zu stärken, Innovation zu beschleunigen und eine Grundlage zu schaffen, auf die sie sich von Generation zu Generation verlassen können.“ Jensen Huang hat auf X denselben Standpunkt vertreten und argumentiert, offene Modelle „stärken Sicherheit und Cybersicherheit, beschleunigen Innovation und Verbreitung und ermöglichen Souveränität.“ Die strukturelle Spannung ist real – NVIDIA besitzt Berichten zufolge rund 30 Milliarden Dollar von OpenAI – aber die Wette ist, dass offene Modelle den GPU-Kuchen vergrößern statt schrumpfen. Wie LMArena-CEO Anastasios Angelopoulos es formulierte: „Egal welches Unternehmen ein großartiges Open-Source-Modell macht, NVIDIA gewinnt.“

Die Nemotron-Koalition ist der Teil, den man beobachten sollte.

Nemotron 4 ist kein Soloprojekt, und genau das übersehen die meisten Berichte. Auf der GTC am 16. März 2026 kündigte NVIDIA die Nemotron Coalition an — acht Gründungsmitglieder: Black Forest Labs, Cursor, LangChain, Mistral AI, Perplexity, Reflection AI, Sarvam und Thinking Machines Lab — die sich zusammengeschlossen haben, um Forschung, Daten und Rechenleistung hinter „führenden offenen Modellen“ zu bündeln. Das erste Projekt ist ein Basismodell, das von Mistral AI und NVIDIA gemeinsam entwickelt und auf NVIDIA DGX Cloud trainiert wird; die Coalition gibt an, dass es als Open Source veröffentlicht wird und die Nemotron-4-Familie untermauern wird.

{{1}}The Information ergänzt die Arbeitsdetails:{{/1}} Reflection, Cursor, Thinking Machines und Mistral sind {{2}}bestätigte Mitwirkende{{/2}}; Prime Intellect hat 300.000 Simulationsumgebungen für das Training beigesteuert; Cognition hat darüber gesprochen, Code-Trainingsdaten bereitzustellen. Der CEO von Prime Intellect, Vincent Weisser, bezeichnete das Bündnis als kollektive Maßnahme gegen ein, wie er es nannte, „gottähnliches“ Modellmonopol. {{3}}Was das operativ bedeutet:{{/3}} Nemotron 4 könnte als Konsortiumsgrundlage ausgeliefert werden, die jedes Mitglied für sein eigenes Produkt nachtrainiert, anstatt als Checkpoint eines einzelnen Anbieters. Das würde „Open-Weights-NVIDIA-Modell“ {{4}}zur falschen Kategorie{{/4}} machen — die Basis ist das interessante Artefakt.

Bestätigt, gemeldet, unbekannt

• Bestätigt — NVIDIA arbeitet an einer Nemotron-4-Familie (Unternehmensangabe). Die Nemotron Coalition existiert und baut ein offenes Basismodell mit Mistral AI auf (NVIDIA, März 2026).

• Gemeldet, unbestätigt – das Flaggschiff-Ziel von „mindestens 1 Billion“; der Zeitplan für den Spätherbst; das Cloud-Engagement von rund 28 Milliarden US-Dollar mit rund 7 Milliarden in diesem Geschäftsjahr; welches Koalitionsmitglied welchen Beitrag leistet.

• Unbekannt — Anzahl der aktiven Parameter, Kontextlänge, Modalitätsmix, Lizenzbedingungen, Preis, welche Checkpoints zuerst ausgeliefert werden, und ob die von Mistral mitentwickelte Basis tatsächlich das Fundament der Familie wird.

Zeitleiste und worauf man achten sollte

Es gibt kein Veröffentlichungsdatum. Der letzte Trainingslauf hat noch nicht begonnen; Mitarbeiter beschreiben ihn als monatelang, und die Schätzungen reichen von „Spätherbst“ (zwei Quellen) bis später. NVIDIA hat die Familie in der Zwischenzeit in Bewegung gehalten: Das Unternehmen hat Nemotron 3.5 Lightning ausgeliefert, einen Agent-Worker mit 31,6 Milliarden Parametern, der am 11. August veröffentlicht wurde – am selben Tag, an dem der Nemotron-4-Bericht erschien –, zusammen mit NeMo Switchyard, NVIDIAs eigener Open-Source-Routing-Software. Mit anderen Worten: NVIDIA entwickelt die Produktlinie aktiv weiter, während das Flaggschiff noch auf dem Reißbrett liegt.

Was man sich ansehen sollte, in etwa nach Wichtigkeit geordnet:

• Aktive Parameter — die Gesamtzahl ist das Aushängeschild; die Anzahl der aktiven Parameter entscheidet über Kosten und Geschwindigkeit. Ein MoE mit ~1T Gesamtparametern und ~100B aktiven Parametern verändert das Gesamtbild im Vergleich zu einem mit ~50B.

• Unabhängige Bewertungen — für ein Modell, das nicht trainiert wurde, gibt es keine Bewertung durch Dritte. Beobachten Sie den Artificial Analysis Intelligence Index, sobald ein gehosteter Checkpoint erscheint.

• Lizenzbedingungen — Nemotron 3 Ultra wird unter OpenMDW-1.1 ausgeliefert, permissiv, aber nicht MIT oder Apache 2.0. Ob Nemotron 4 dem folgt oder es verschärft, ist unentschieden, und für ein Unternehmen, das auf den Gewichten aufbaut, entscheidet das alles.

• Welche Größen werden zuerst ausgeliefert — Nemotron 3 kam als Familie (Nano, Super, Ultra). Erwarten Sie eine Reihe von Nemotron-4-Größen, und erwarten Sie die kleinen vor dem Flaggschiff.

• Die Mistral-Basis — ob das Basismodell der Koalition tatsächlich zur Grundlage der Familie wird, ist die strukturelle Frage hinter all dem Parameter-Gerede.

• Preis — nichts wird gehostet, also hat nichts einen Preis. Wenn ein Hosting-Partner Nemotron 4 listet, ist der Durchreichpreis das, was Sie tatsächlich zahlen.

Was es für Ihre Inferenzschicht bedeutet

Sie können Nemotron 4 heute nicht aufrufen – niemand kann das –, also ist die praktische Frage, wie viel von Ihrem Stack sich ändern sollte, um ein Modell zu unterstützen, dessen Datenblatt noch in Bewegung ist. Die Antwort ist dieselbe wie bei jedem noch nicht veröffentlichten Frontier-Modell: Halten Sie die Inferenzschicht modellagnostisch. Wenn Sie über eine einzelne API routen, die 200+ Modelle bereitstellt, ist eine neue Nemotron-Familie eine Konfigurationsänderung, kein Rewrite. OrcaRouter leitet den Listenpreis des Anbieters mit 0% Aufschlag durch, sodass Sie genau das bezahlen, was ein Host letztendlich für Nemotron 4 verlangt, und eine Preissenkung des Anbieters greift noch am selben Tag, an dem sie erfolgt. Automatisches Failover ist das Werkzeug für ein unerprobtes erstes Release: Lenken Sie den frühen Traffic auf das neue Modell, fallen Sie auf eine stabile Alternative zurück, wenn es hakt oder Fehler wirft, und nehmen Sie es erst dann in Produktion, wenn es sich Ihre Workloads verdient hat. Nichts davon erfordert, einen Produktionspfad auf ein Leak zu setzen – was genau die richtige Haltung ist, wenn das Datenblatt so vorläufig ist.

FAQ

Wann wird Nemotron 4 veröffentlicht?

Es wurde noch kein Datum festgelegt. Mitarbeiter teilten The Information mit, dass der letzte Trainingslauf noch nicht begonnen hat und Monate dauern wird; zwei sagten, der späte Herbst 2026 sei möglich, und andere erwarten später. Behandeln Sie „später Herbst“ als eine hoffnungsvolle Schätzung aus dem Projekt heraus, nicht als Fahrplan.

Wird Nemotron 4 Open-Source sein?

NVIDIAs erklärte Absicht ist offene Gewichte, und das erste Projekt der Nemotron-Koalition – das gemeinsam mit Mistral entwickelte Basismodell – soll als Open Source veröffentlicht werden. Aber „offene Gewichte“ ist nicht „Open Source“: Nemotron 3 Ultra erscheint unter der OpenMDW-1.1-Lizenz, die freizügiger ist als NVIDIAs ältere Bedingungen, aber immer noch nicht MIT oder Apache 2.0. Die konkrete Lizenz von Nemotron 4 wurde noch nicht bekannt gegeben.

Ist „mindestens 1 Billion Parameter" eine echte Spezifikation?

Es handelt sich um ein von Mitarbeitern stammendes Ziel, über das The Information berichtet hat, und nicht um eine bestätigte Spezifikation; derselbe Bericht besagt, dass sich die Zahl noch ändern könnte. Selbst bei insgesamt 1 Billion läge es in der reinen Größe hinter Kimi K3 (2,8 Billionen) und Qwen3.8-Max (2,4 Billionen); die Anzahl der aktiven Parameter – die nicht durchgesickert ist – ist die Zahl, die Kosten und Geschwindigkeit bestimmen wird.

Sollte ich auf Nemotron 4 warten, bevor ich ein Modell auswähle?

Nein. Es ist bestenfalls noch Monate entfernt und unbewiesen. Wählen Sie jetzt das beste verfügbare Modell für die Aufgabe und halten Sie die Routing-Ebene flexibel; wenn Nemotron 4 tatsächlich erscheint, bewerten Sie es genauso wie jedes neue Modell — aktive Parameter, unabhängige Benchmarks, Lizenz und Preis — statt nach der Schlagzeilen-Gesamtzahl.

Fazit

Die Familie ist real; die Zahlen sind Schätzungen. NVIDIA hat bestätigt, Nemotron 4 zu bauen, und die Koalitionsstruktur darum herum ist der interessanteste Teil der Geschichte – aber jede Schlagzeilen machende Zahl aus dem Leak, von der Untergrenze von 1 Billion über den Zeitplan für den Spätherbst bis zum Budget von 28 Milliarden Dollar, stammt von ungenannten Mitarbeitern und könnte sich ändern. Open-Weight-Modelle haben die Marke von 1 Billion Parametern bereits überschritten, angeführt von chinesischen Laboren, und NVIDIAs Antwort ist ein Konsortial-Basismodell plus ein Versprechen. Für einen Leser, der heute Modelle auswählt, bedeutet das eines: Planen Sie nicht auf Basis des Leaks. Halten Sie die Inferenzschicht flexibel, bewerten Sie alles, was tatsächlich erscheint, anhand seiner realen Zahlen, und lassen Sie Routing das tun, wofür Routing da ist – das Neue auszuprobieren, ohne den Produktionspfad davon abhängig zu machen.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Sie betreiben eine Inferenz-Plattform? Bringen Sie Ihre Modelle auf OrcaRouter.

Kontaktieren Sie uns

Community beitreten

DiscordEmailXGitHubYouTube