Titelkarte für 'dots-note-3.0: Das 42/42-IMO-Modell wurde gerade durch einen vLLM-PR geleakt': große Überschrift 'dots-note-3.0', Untertitel 'Was wir bisher wissen', und zwei flache Symbolkarten — 'IMO 2026 · 42/42' mit einem Pokal-Liniensymbol und Abzeichen 'offizielle Bewertung', sowie 'vLLM PR #51255' mit einem Code-Datei-Liniensymbol und Abzeichen 'Architektur geleakt'. OrcaRouter-Logo unten rechts eingefügt.
Guides & Insights

dots-note-3.0: Das 42/42-IMO-Modell, das durch einen vLLM-PR geleakt wurde, ist jetzt Open-Source

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 14. August 2026 war dots-note-3.0 kein Leak mehr. Das Dots Model Lab von Xiaohongshu veröffentlichte das erste öffentliche Modell seiner dots3-Familie als dots3-note-Preview als Open Source — 280 Milliarden Parameter (16 Milliarden aktive), ein 512K-Kontextfenster, Apache-2.0-lizenziert — acht Tage nachdem ein vLLM-Pull-Request die Architektur des Modells vor der Veröffentlichung durchsickern ließ. Die Gewichte sind auf Hugging Face, der Code auf GitHub, und der Checkpoint, der bei der Internationalen Mathematik-Olympiade 2026 offiziell 42/42 erreichte, ist zum ersten Mal von jedermann ausführbar.

Dieses Release beantwortet alle offenen Fragen, die der Leak-Artikel dieses Blogs vom 6. August offen ließ — Größe, Kontextlänge, Lizenz, ein Hugging-Face-Pfad, ein Veröffentlichungsdatum — und verwandelt eine „Was wir bisher wissen“-Story in eine, die überprüfbar ist. Was folgt, ist das Update: was ausgeliefert wurde, was die veröffentlichte Konfiguration über die Architektur bestätigt, die der PR zuerst enthüllte, was nun unabhängig verifizierbar ist, und was weiterhin nur die Behauptung des Anbieters ist.

Von einem PR-Entwurf zu einem öffentlichen Checkpoint

Das Leak, kurz: Am 6. August 2026 eröffnete ein Mitwirkender, der sich KurodaKanbei nennt – ein selbsternannter Doktorand der ETH Zürich, kein Xiaohongshu-Mitarbeiter – den Pull-Request #51255 im Repository vllm-project/vllm, der Unterstützung für ein Sprachmodell namens „Dots3 NOTE“ hinzufügte. Der Draft-Status wurde am 7. August um 13:55 UTC entfernt, und die Validierungsnotizen des Pull-Requests selbst verrieten es: Der Autor hatte einen 8-GPU-DP8/EP8-Dienst „mit einem Dots3-NOTE-FP8-Checkpoint“ betrieben. Man kann keinen FP8-Checkpoint validieren, den man nicht hat – wer auch immer diesen Pull-Request geschrieben hat, hatte das tatsächliche Modell. Er betraf 14 Dateien, darunter ein neues Modul vllm/models/dots3_note, und trug die Labels „new-model“ und „verified“.

Alle vier Anzeichen, die wir am 8. August aufgeführt haben, sind inzwischen eingetreten, bis auf das eine, das am wichtigsten ist. Das Hugging-Face-Repository ist aufgetaucht — dots-studio/dots3-note-prev, Apache-2.0. Die offizielle Ankündigung ist erfolgt — die Open-Source-Veröffentlichung selbst, heute. Der Inferenz-Stack ist kein Entwurf mehr: vLLM-Unterstützung ist nativ auf main, und sowohl transformers als auch SGLang bieten dots3-note-Unterstützung. Das vierte Anzeichen, die unabhängige Verifizierung des 42/42-Mathematikergebnisses, steht noch aus — und es ist jetzt auf eine Weise möglich, wie es nie zuvor möglich war, denn die Gewichte sind öffentlich.

Screenshot of the vLLM GitHub pull request #51255 titled 'Draft: [Model] Add Dots3 NOTE language model support', opened August 6, 2026 by KurodaKanbei — the draft PR that first revealed the dots-note-3.0 architecture (hybrid DSA full-attention + sliding-window MLA layers).

Was tatsächlich ausgeliefert wurde

Die veröffentlichte Model Card macht aus den Inferenzen des PR ein Datenblatt – und die Zahlen stammen aus der eigenen Konfiguration des Checkpoints, nicht aus einer Drittanbieter-Zusammenfassung. dots3-note preview ist ein Mixture-of-Experts-Modell:

• 280B gesamt / 16B aktive Parameter — 256 geroutete Experten plus ein gemeinsamer Experte, Top-8-Routing, auf 1 dichten + 45 MoE-Schichten mit einer Hidden Size von 5.120.

• 512K-Token-Kontextfenster, 152K-Vokabular, BF16- und FP8-Präzision.

• Ein Multi-Token-Prädiktionsmodul (MTP) — eine gemeinsame Schicht mit 1,13B Parametern, die bis zu drei zusätzliche Token parallel vorhersagt, {{1}}was spekulative Dekodierung ohne separates Draft-Modell ermöglicht{{/1}}.

• Multimodale Eingabe — Text, Bild, Video und Audio — die Textausgabe erzeugt. Der Vision-Encoder ist ein MoE ViT (7B gesamt / 1.2B aktiv) und der Audio-Encoder ist ein dense 800M.

Im Scope-Hinweis des PR hieß es, die vLLM-Arbeit decke „nur das LLM“ ab und die multimodalen Komponenten seien nicht Teil des Umfangs. Das bezog sich auf den Inferenz-Patch, nicht auf das Modell: Das veröffentlichte Checkpoint enthält die Vision- und Audio-Encoder zusammen mit dem Sprachkern. Wenn du die multimodale Version möchtest, schaust du dir dasselbe Repo an, das über die transformers- und SGLang-Pfade bereitgestellt wird, anstatt über den vLLM-LLM-only-Pfad, der zuerst durchgesickert ist.

Verfügbarkeit, konkret: Die Gewichte liegen unter der Apache-2.0-Lizenz auf Hugging Face unter dots-studio/dots3-note-prev; der Code und die Serving-Rezepte befinden sich im Repository studio-dots-ai/dots3-note-prev auf GitHub; und der gehostete Zugriff erfolgt über das eigene API-Portal des Anbieters sowie mehrere Drittanbieter-Plattformen. Es ist die erste Open-Weight-Veröffentlichung der dots3-Familie – die Aussage „open-sourcing soon“ (近期将开源), die Xiaohongshu laut seinen chinesischsprachigen Aussagen zwei Wochen lang verwendet hatte, ist damit erfüllt worden.

Die Architektur, bei der der Leak richtig lag

Der PR beschrieb dots-note-3.0 als „strukturell mit DeepSeek-V3.2 verwandt“, aber mit einer Mischung aus zwei Attention-Geometrien in einem Stack. Die veröffentlichte Konfiguration bestätigt das. Die Model Card teilt die 46 Attention-Ebenen in 13 DeepSeek-artige Sparse-Attention-Ebenen (DSA) – mit Top-2048-Indexierung – und 33 Sliding-Window-Attention-Ebenen (SWA) auf, also etwa eine Sparse-Ebene auf drei dichte Ebenen. Das ist die Struktur des „Hops zwischen sparsamer globaler und dichter lokaler Aufmerksamkeit“, auf die der Branchname note-hopper hindeutete, nun im Checkpoint selbst festgehalten.

Mechanisch ist es dieselbe Idee, die DeepSeek mit V3.2 eingeführt hat: Die DSA-Hälfte ist ein leichtgewichtiger Indexierer, der jeden gecachten Schlüssel gegen die Anfrage bewertet, eine Top-k-Shortlist führt und darüber statt über den gesamten Kontext Aufmerksamkeit berechnet – wodurch die quadratischen Kosten langer Sequenzen auf annähernd linear reduziert werden. Die Sliding-Window-Hälfte ist das Gegengewicht: ein begrenzter Bereich dichter lokaler Aufmerksamkeit, der garantiert, dass die jüngsten Token immer vollständig berücksichtigt werden, egal was der spärliche Indexierer entscheidet. Global spärlich plus dicht lokal im selben Modell war der wirklich ungewöhnliche Teil des Lecks – und es ist nun der bestätigte Teil.

Der Rest der Blaupause ist vertraute DeepSeek-Familienmechanik, wie der PR sagte: ein ungruppierter MoE-Router, sequenzparalleles MoE, Langkontext-Chunked-Prefill, das bis zum vollen 512K-Fenster validiert wurde, und eine MTP-Schicht, die standardmäßig den Sliding-Window-Attention-Typ für spekulatives Decoding verwendet.

Der 42/42-Rekord — und was jetzt überprüfbar ist

Das IMO-Ergebnis selbst ändert sich nicht, und auch die Kennzeichnung nicht. Am 25. Juli 2026 gab Xiaohongshu bekannt, dass das Modell bei der offiziellen Bewertung der 67. Internationalen Mathematik-Olympiade in Shanghai volle 42/42 Punkte erzielt hatte, wo nur 7 von 666 menschlichen Teilnehmern dieses Ergebnis erreichten und die Goldmedaillen-Grenze bei 29 lag – 13 Punkte über der Goldgrenze und 7 Punkte über Gemini Deep Thinks 35/42, dem bisher besten KI-Ergebnis in der offiziellen IMO-Bewertung. Das bleibt die Darstellung des Unternehmens von einem offiziell bewerteten Wettbewerb: Die Punktzahl ist echt und vom Komitee verifiziert, aber die umliegenden Behauptungen – wie auf die Aufgaben zugegriffen wurde, wie Stichproben und Bewertung kontrolliert wurden – wurden nie unabhängig geprüft, weil niemand außerhalb des Labors das Modell ausführen konnte.

Das ist der Teil, den das Release verändert. Da die Gewichte öffentlich sind, ist die 42/42 keine Zahl mehr, die man blind glauben oder dem Wort eines Pull-Requests vertrauen muss; sie ist ein Ergebnis, das ein Dritter zu reproduzieren versuchen kann, und das ist das Wertvollste, was an diesem Release überprüfbar ist. Sie bleibt auch in den Randbereichen auf dieselbe Weise umstritten wie vor zwei Wochen: Chinesische Medien berichteten, dass Huaweis Celia ebenfalls 42/42 in derselben Bewertung erzielte, sodass dots-note-3.0 einer der ersten ist, nicht der erste; und die auf X gemachte Behauptung eines Partners von Menlo Ventures, dass OpenAI, Anthropic, Axiom Math und Moonshots Kimi K3 ebenfalls in diesem Jahr 42/42 erreicht haben, ist immer noch ein unverifizierter Social-Media-Beitrag ohne dahinterstehenden Bewertungsnachweis.

Das Unternehmen veröffentlichte anlässlich des Releases zudem neue Benchmark-Behauptungen, die allesamt vom Anbieter stammen und bislang nicht reproduziert wurden. Beim ARC-AGI-3-Benchmark erzielt die dots3-note preview laut Dots etwa 0,35 bei gemeldeten Testzeitkosten von unter 500 $. Bei Reasoning- und Agenten-Suites wie WebShop, HotpotQA und ALFWorld behauptet das Unternehmen, das Modell sei Modellen ebenbürtig oder überlegen, die ein Vielfaches seiner aktiven Parameterzahl aufweisen – mit einer Vision, die in dieser Größenklasse heraussticht. Das sind Dots' Zahlen zu ihrem eigenen Modell – behandeln Sie sie auch so, bis ein neutrales Labor sie erneut überprüft.

Dots hat außerdem die zwei Evaluations-Harnesses veröffentlicht, die es für diese Art von Aufgaben gebaut hat, und deren Open-Sourcing ist fast so nützlich wie das Modell selbst. VibeLifeBench führt 200 Aufgaben über 22 simulierte Dienste und 288 Tool-Schnittstellen aus und prüft 1.247 atomare Bedingungen darauf, ob ein Agent konsistent bleibt, wenn sich die Umgebung während der Aufgabe ändert; laut Dots' eigenen Ergebnissen erreicht das bisher stärkste getestete Modell nur 32,5 avg@3, und die meisten führenden Closed-Weight-Modelle scheitern komplett. VibeSearchBench ist enger gefasst – 20 Domänen, 200 Aufgaben, die testen, ob ein Agent nachfragt, wenn eine Anfrage mehrdeutig ist. Beide tragen dasselbe vom Anbieter gemeldete Etikett wie die ARC-AGI-Zahl, aber die Harnesses sind öffentlich, was die 32,5 falsifizierbar statt nur rhetorisch macht.

Warum dies ein Agentenmodell und kein Mathematikmodell ist

Weder das Leck noch die IMO-Punktzahl sollten Sie darüber täuschen, wofür dieses Modell gedacht ist. Die Positionierung des Releases ist nicht Mathematik — es sind langfristige, offene Aufgaben: personalisierte Reiseplanung, Hochzeitsvorbereitungs-Workflows, die Führung eines kleinen Ladens, eine Hausrenovierung. Aufgaben ohne eine einzige richtige Antwort, Ziele, die sich mitten in der Aufgabe ändern, und Zeiträume von Stunden oder Tagen. Das ist eine bewusst andere Benchmark-Gruppe als die Mathematik- und Programmier-Bestenlisten, und genau hier zahlen sich die dots3-note-Designentscheidungen — der 512K-Kontext, die Speicherdatei, die Selbstkritik-Schleife — tatsächlich aus.

Drei Techniken stechen in dem veröffentlichten Material hervor. Erstens führt das Modell eine Speicherdatei (memory.md) als fortlaufende Umgebungszusammenfassung, mit der es den Zustand über eine lange, offene Sitzung hinweg überträgt. Zweitens verwendet es einen „Selbstkritik“-Mechanismus — dieselbe rekursive Selbstprüfung, die laut Beschreibung auch die IMO-Lösung nutzte — um seine eigenen Zwischenschritte zu markieren und zu reparieren. Drittens heißt das Trainingsrezept TEMPO (Test-time-scaled Value Estimation with Macro-step Policy Optimization): Das Modell zerlegt lange Trajektorien in Makroschritte und wechselt zwischen Akteur- und Kritikerrolle, um sein eigenes Trainingssignal zu erzeugen — was laut Berichten der Grund dafür ist, dass es bei Aufgaben ohne Ground-Truth-Antwort optimiert werden kann.

Die praktischen Demos des Anbieters sind der Kern der Behauptung: den Deckbuilder Slay the Spire II bis zu Ebene 33 spielen, alle sechs ARC-AGI-3-Level in 320 Schritten lösen, ein räumliches Denkproblem bei einer Hausrenovierung durchgehen und eine visionOS-App End-to-End erstellen (12 Swift-Dateien, 1.876 Zeilen, „BUILD SUCCEEDED"). Betrachten Sie diese als Demonstrationen, nicht als Benchmarks – aber es sind Demonstrationen einer bestimmten Sache: eines Modells, das ein Ziel im Blick behält und viele Schritte ausführt, ohne den Faden zu verlieren, was die Fähigkeit ist, an der es dem Agentenmarkt derzeit am meisten mangelt.

Kosten, Self-Hosting und wie man es ausprobiert.

Die offenen Gewichte sind frei; die Kosten von dots3-note Preview fallen dort an, wo du es ausführst. Das Referenz-vLLM-Rezept für den FP8-Checkpoint läuft auf acht NVIDIA H100s mit Tensor-Parallelität 8 und Experten-Parallelität 8 – eine echte Hausnummer, kein Laptop-Modell. Teams mit dieser Hardware bekommen den gesamten Stack, einschließlich der spekulativen Dekodierung mit 3-Token-MTP und des dots-Tool-Call-Parsers, den die Laufzeitumgebungen mitliefern. Alle anderen greifen auf die gehostete Version zurück: Das API-Portal des Anbieters ist online, und gehostete Preview-Endpunkte gingen am selben Tag, an dem die Gewichte veröffentlicht wurden – dem 14. August – auf Drittanbieter-Plattformen live. Die Preview-Stufe ist auf den Plattformen, die sie anbieten, mit 0 $ pro Token gelistet, laut den eigenen Angaben dieser Plattformen und nicht der Preisseite des Anbieters. Daher sind die Einstiegskosten, um dots3-note Preview heute in der Produktion auszuprobieren, praktisch gleich null, solange der Preview-Status andauert.

Für Entwickler liest sich das zwei Wochen alte Argument, günstig auf ein unbewiesenes Modell zu setzen, nun als das Argument, ein gerade ausgeliefertes Modell zu evaluieren — das Muster ist identisch. Lenken Sie einen Teil des Traffics auf das neue Modell, hinter automatischem Failover, sodass ein überraschender Fehlermodus einen Testpfad statt eines Produktionspfads lahmlegt. Dafür ist ein Router da, und das ist die ehrliche Version des Pitches: dots3-note preview ist zum Zeitpunkt dieses Artikels nicht auf OrcaRouter gehostet, und niemand sollte so tun, als wäre es das. Aber die Routing-Haltung, über die wir im Leak-Artikel geschrieben haben, gilt ab dem Tag, an dem es so ist — eine API, die ein neues Modell in dem Moment erreichen kann, in dem ein Anbieter es hostet, mit Durchreichung der Anbieterlistenpreise bei 0 % Aufschlag und pro Anfrage konfiguriertem Failover. In der Zwischenzeit sind die DeepSeek-Familienmodelle, mit denen dieses strukturell verwandt ist, bereits auf diese Weise nutzbar: DeepSeek V4 Flash und DeepSeek V4 Pro sind beide hinter einem einzigen Schlüssel live, mit denselben Pass-through-Preisen und Failover pro Anfrage — ein vernünftiger Referenzpunkt, um zu beurteilen, wie sich ein Agentenmodell mit 16B aktiven Parametern wie dots3-note preview tatsächlich in der Produktion verhält.

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash (www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731), the released DeepSeek-generation model whose MLA + sparse-attention family dots-note-3.0 is structurally related to.

Was als Nächstes ansehen

Vier Dinge, ungefähr in der Reihenfolge, wie sehr sie das Bild verändern könnten:

• Unabhängige Reproduktion von 42/42. Die Gewichte sind veröffentlicht; der erste ernsthafte Drittanbieter-Nachlauf des IMO-Ergebnisses – oder ein neutrales Evaluierungspaket, das ihm widerspricht – ist der einzelne Datenpunkt mit dem höchsten Wert, den diese Veröffentlichung hervorbringen kann. Bis dahin bleibt die 42/42 eine offiziell bewertete, vom Unternehmen gemeldete Punktzahl.

• Die größeren Geschwister, jazz und aria. dots3-note preview ist die erste öffentliche Veröffentlichung und laut Unternehmen das leichteste Mitglied der dots3-Familie. Wenn 280B gesamt / 16B aktiv das kleine Modell ist, dann sind die beiden größeren Modelle der Ort, an dem die Frontier-Behauptungen tatsächlich auf die Probe gestellt werden.

• Gehostete Limits und Preview-Bedingungen. Der Preis ist jetzt öffentlich — die Preview-Stufe ist kostenlos pro Token auf den Plattformen, die sie anbieten — aber Rate-Limits und ob das Preview-Tag besondere Bedingungen mit sich bringt, werden weiterhin darüber entscheiden, wer selbst hostet und wer sie aufruft.

• Wo es auf unabhängigen Bestenlisten landet. Die vom Anbieter gemeldeten ARC-AGI- und Agent-Suite-Behauptungen brauchen eine neutrale Messung, um zu brauchbaren Fakten zu werden — das ist derselbe Prozess, der bei jeder offenen Veröffentlichung in diesem Jahr Hype von Realität getrennt hat.

Als wir im August über das Leak berichteten, war die ehrliche Zusammenfassung kurz: echte Architektur, echte Aufzeichnung, keine Gewichte, kein Datum. Drei dieser vier Einschränkungen sind weg. Die Architektur ist öffentlich, die Aufzeichnung ist an einen herunterladbaren Checkpoint gebunden, und das Datum ist gekommen. Was bleibt, ist die Verifizierung – und jetzt, da die dots3-note preview ausgeführt statt nur gelesen werden kann, wird die Antwort darauf, ob Xiaohongshu das Agentenmodell gebaut hat, das es behauptet, von jedem kommen, der acht H100s und ein Benchmark-Harness hat, nicht von einem Pull-Request.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert