Titelkaart voor 'dots-note-3.0: Het 42/42 IMO-model is zojuist gelekt via een vLLM PR': grote kop 'dots-note-3.0', ondertitel 'Wat we tot nu toe weten', en twee platte iconenkaarten — 'IMO 2026 · 42/42' met een lijnpictogram van een trofee en badge 'officiële beoordeling', en 'vLLM PR #51255' met een lijnpictogram van een codebestand en badge 'architectuur gelekt'. OrcaRouter-logo rechtsonder samengesteld.
Guides & Insights

dots-note-3.0: Het 42/42 IMO-model dat via een vLLM PR gelekt is, is nu open-source

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op 14 augustus 2026 was dots-note-3.0 niet langer een lek. Xiaohongshu's Dots Model Lab heeft het eerste openbare model uit de dots3-familie als open source uitgebracht onder de naam dots3-note preview — 280 miljard parameters (16 miljard actief), een contextvenster van 512K, gelicentieerd onder Apache-2.0 — acht dagen nadat een vLLM-pull-request de architectuur van het model vóór de release had gelekt. De gewichten staan op Hugging Face, de code op GitHub, en het checkpoint dat officieel 42/42 scoorde op de Internationale Wiskundeolympiade 2026 is voor het eerst door iedereen te draaien.

Die release beantwoordt elke open vraag die het lekartikel van 6 augustus op deze blog openliet — grootte, contextlengte, licentie, een Hugging Face-pad, een releasedatum — en verandert een verhaal van "wat we tot nu toe weten" in een verhaal dat gecontroleerd kan worden. Hieronder volgt de update: wat er is uitgebracht, wat de uitgebrachte config bevestigt over de architectuur die de PR voor het eerst onthulde, wat nu onafhankelijk verifieerbaar is, en wat nog steeds de claim van de leverancier zelf is.

Van een draft-PR naar een openbaar checkpoint

Het lek, in het kort: op 6 augustus 2026 opende een bijdrager die zich KurodaKanbei noemt — een zelfbenoemde promovendus aan de ETH Zürich, geen medewerker van Xiaohongshu — pull request #51255 van vllm-project/vllm, waarmee ondersteuning voor een 'Dots3 NOTE'-taalmodel werd toegevoegd. De conceptvlag werd op 7 augustus om 13:55 UTC verwijderd, en de validatie-opmerkingen van de PR zelf waren de onthulling: de auteur had een 8-GPU DP8/EP8-service gedraaid 'met een Dots3 NOTE FP8-checkpoint.' Je kunt geen FP8-checkpoint valideren dat je niet hebt — wie die PR ook schreef, die had het daadwerkelijke model. Het raakte 14 bestanden, waaronder een nieuwe vllm/models/dots3_note-module, en droeg de labels 'new-model' en 'verified'.

Elk van de vier signalen die we op 8 augustus hebben genoemd, is inmiddels afgegaan, behalve degene die er het meest toe doet. De Hugging Face-repo verscheen — dots-studio/dots3-note-prev, Apache-2.0. De officiële aankondiging kwam — de open-source release zelf, vandaag. De inference-stack is geen concept meer: vLLM-ondersteuning is native op main, en zowel transformers als SGLang ondersteunen dots3-note. Het vierde signaal, onafhankelijke verificatie van het 42/42-wiskunderesultaat, is degene die nog openstaat — en het is nu op een manier mogelijk die voorheen nooit mogelijk was, omdat de weights openbaar zijn.

Screenshot of the vLLM GitHub pull request #51255 titled 'Draft: [Model] Add Dots3 NOTE language model support', opened August 6, 2026 by KurodaKanbei — the draft PR that first revealed the dots-note-3.0 architecture (hybrid DSA full-attention + sliding-window MLA layers).

Wat er daadwerkelijk is uitgebracht

De uitgebrachte modelkaart zet de afleidingen van de PR om in een specificatieblad — en de cijfers komen uit de eigen config van de checkpoint, niet uit een samenvatting van derden. dots3-note preview is een mixture-of-experts-model:

• 280B totaal / 16B actieve parameters — 256 gerouteerde experts plus één gedeelde expert, top-8-routering, op 1 dense laag + 45 MoE-lagen met een hidden size van 5.120.

• 512K-token contextvenster, 152K vocabulaire, BF16- en FP8-precisie.

• Een multi-token-predictie (MTP)-module — één gedeelde laag van 1.13B parameters die tot drie extra tokens parallel voorspelt, wat speculatieve decodering mogelijk maakt zonder een apart draftmodel.

• Multimodale invoer — tekst, afbeelding, video en audio — die tekstuitvoer produceert. De vision-encoder is een MoE ViT (7B totaal / 1.2B actief) en de audio-encoder is een dense 800M.

De scope-notitie van de PR zei dat het vLLM-werk "alleen de LLM" omvatte, waarbij de multimodale componenten buiten scope vielen. Dat ging over de inferentiepatch, niet over het model: het vrijgegeven checkpoint bevat de vision- en audio-encoders naast de taalkern. Als je de multimodale versie wilt, kijk je naar dezelfde repo, aangeboden via de transformers- en SGLang-paden in plaats van het LLM-only-pad van vLLM dat als eerste uitlekte.

Beschikbaarheid, concreet: de gewichten staan op dots-studio/dots3-note-prev op Hugging Face onder de Apache-2.0-licentie; de code en serving-recepten zijn te vinden in de repository studio-dots-ai/dots3-note-prev op GitHub; en gehoste toegang is beschikbaar via het eigen API-portaal van de leverancier en verschillende platforms van derden. Het is de eerste open-weight-release van de dots3-familie — de formulering "open-sourcing soon" (近期将开源) die Xiaohongshu twee weken lang had gebruikt in haar Chinese verklaringen, is daarmee ingelost.

De architectuur waar het lek gelijk over had

De PR beschreef dots-note-3.0 als "structureel gerelateerd aan DeepSeek-V3.2", maar met een mix van twee aandachtgeometrieën in één stack. De gepubliceerde configuratie bevestigt dit. De modelkaart verdeelt de 46 aandachtslagen in 13 DeepSeek-stijl sparse-aandacht (DSA) lagen — met top-2048-indexering — en 33 sliding-window-aandacht (SWA) lagen, grofweg één sparse laag per drie dichte lagen. Dat is de "wissel tussen sparse globaal en dicht lokaal" structuur waar de branchnaam note-hopper op duidde, nu vastgelegd in de checkpoint zelf.

Mechanisch gezien is het hetzelfde idee dat DeepSeek introduceerde met V3.2: de DSA-helft is een lichtgewicht indexeerder die elke gecachte sleutel tegen de query scoort, een top-k-shortlist bijhoudt en daarover in plaats van over de volledige context aandacht berekent — waardoor de kwadratische kosten van lange sequenties tot ongeveer lineair worden teruggebracht. De sliding-window-helft is het tegenwicht: een begrensd bereik van dichte lokale aandacht dat garandeert dat de meest recente tokens altijd volledig worden meegenomen, wat de sparse-indexeerder ook besluit. Globale sparse plus dichte lokale aandacht, in hetzelfde model, was het werkelijk ongebruikelijke deel van het lek — en het is nu het bevestigde deel.

De rest van het blauwdruk is vertrouwde DeepSeek-familie-mechaniek, zoals de PR zei: een ongegroepeerde MoE-router, sequentie-parallelle MoE, chunked prefill voor lange contexten, gevalideerd tot het volledige 512K-venster, en een MTP-laag die standaard het sliding-window-aandachtstype gebruikt voor speculatieve decodering.

Het 42/42-record — en wat nu controleerbaar is

Het IMO-resultaat zelf verandert niet, en de labeling ook niet. Op 25 juli 2026 maakte Xiaohongshu bekend dat {{1}}het model een perfecte 42/42 had gescoord{{/1}} bij de officiële beoordeling van de 67e Internationale Wiskundeolympiade in Shanghai, waar {{2}}slechts 7 van de 666 menselijke deelnemers het resultaat evenaarden en de goudgrens op 29 lag{{/2}} — {{3}}13 punten boven goud en 7 punten boven Gemini Deep Think's 35/42, het vorige beste AI-resultaat bij officiële IMO-beoordeling{{/3}}. Dat blijft de lezing van het bedrijf van een officieel beoordeelde wedstrijd: de score is echt en {{4}}door de commissie geverifieerd{{/4}}, maar de omringende beweringen — {{5}}hoe de problemen werden verkregen, hoe sampling en beoordeling werden gecontroleerd{{/5}} — werden nooit onafhankelijk gecontroleerd, omdat niemand buiten het lab het model kon draaien.

Dat is het deel dat de release verandert. Nu de gewichten openbaar zijn, is de 42/42 niet langer een getal dat je op geloof of op het woord van een pull request moet aannemen; het is een resultaat dat een derde partij kan proberen te reproduceren, en dat is het meest waardevolle controleerbare aspect van deze release. Het blijft ook aan de randen betwist op dezelfde manieren als twee weken geleden: Chinese media meldden dat Huawei's Celia ook 42/42 scoorde in dezelfde beoordeling, dus dots-note-3.0 is een van de eersten in plaats van de eerste; en een bewering van een Menlo Ventures-partner op X dat OpenAI, Anthropic, Axiom Math en Moonshot's Kimi K3 dit jaar ook 42/42 haalden, is nog steeds een ongeverifieerd sociaal bericht zonder beoordelingsgegevens erachter.

Het bedrijf publiceerde bij de release ook nieuwe benchmarkclaims, allemaal door de leverancier gerapporteerd en tot nu toe niet gereproduceerd. Op de ARC-AGI 3-benchmark zegt Dots dat dots3-note preview rond de 0,35 scoort bij een gerapporteerde testtijdkost van onder de $500. Bij redenerings- en agent-suites zoals WebShop, HotpotQA en ALFWorld claimt het dat het model gelijkwaardig is aan of beter dan modellen met een meerdere keren zo groot aantal actieve parameters, met visuele mogelijkheden die opvallen gezien zijn omvang. Dat zijn Dots' cijfers over het eigen model — behandel ze zo totdat een neutraal laboratorium ze opnieuw draait.

Dots heeft ook de twee evaluatie-harnesses uitgebracht die het voor deze klasse taken heeft gebouwd, en het open-sourcen ervan is bijna net zo nuttig als het model. VibeLifeBench voert 200 taken uit over 22 gesimuleerde diensten en 288 tool-interfaces, en controleert 1.247 atomaire voorwaarden op de vraag of een agent consistent blijft wanneer de omgeving midden in een taak verandert; volgens de eigen resultaten van Dots scoort het sterkste tot nu toe geteste model slechts 32,5 avg@3, en de meeste topmodellen met gesloten gewichten falen ronduit. VibeSearchBench is smaller van opzet — 20 domeinen, 200 taken — en test of een agent om verduidelijking vraagt wanneer een verzoek dubbelzinnig is. Beide dragen hetzelfde door de leverancier gerapporteerde label als het ARC-AGI-cijfer, maar de harnesses zijn openbaar, waardoor de 32,5 falsifieerbaar is in plaats van retorisch.

Waarom dit een agentmodel is, geen wiskundig model.

Noch de leak, noch de IMO-score zouden je moeten misleiden over waar dit model voor bedoeld is. De releasepositionering is geen wiskunde — het zijn langetermijntaken met een open einde: persoonlijke reisplanning, huwelijksvoorbereidingsworkflows, het runnen van een kleine winkel, een huisrenovatie. Taken zonder één enkel juist antwoord, doelen die halverwege verschuiven, en tijdspannes van uren of dagen. Dat is een bewust andere benchmarkset dan de wiskunde- en codeerleaderboards, en het is precies daar dat de dots3-note-ontwerpkeuzes — de 512K-context, het geheugenbestand, de zelfkritiek-lus — daadwerkelijk hun vruchten afwerpen.

Drie technieken springen eruit in het vrijgegeven materiaal. Ten eerste houdt het model een geheugenbestand (memory.md) bij als doorlopende omgevingssamenvatting, waarmee het de toestand meeneemt over een lange sessie zonder vooraf bepaald einde. Ten tweede gebruikt het een 'zelfkritisch' mechanisme — dezelfde recursieve zelfevaluatie waarvan werd beschreven dat de IMO-oplossing die gebruikte — om zijn eigen tussenstappen te markeren en te herstellen. Ten derde heet het trainingsrecept TEMPO (Test-time-scaled Value Estimation with Macro-step Policy Optimization): het model splitst lange trajecten op in macro-stappen en wisselt af tussen actor- en criticusrollen om zijn eigen trainingssignaal te genereren, wat de gerapporteerde reden is dat het kan worden geoptimaliseerd op taken zonder bekend correct antwoord.

De hands-on demo's van de leverancier zijn de smaak van de claim: de deckbuilder Slay the Spire II spelen tot floor 33, alle zes ARC-AGI 3-niveaus oplossen in 320 stappen, een ruimtelijk-redeneringsprobleem voor woningrenovatie doorlopen, en een visionOS-app end-to-end bouwen (12 Swift-bestanden, 1.876 regels, "BUILD SUCCEEDED"). Beschouw die als demonstraties, niet als benchmarks — maar het zijn demonstraties van iets specifieks: een model dat één doel voor ogen houdt en veel stappen zet zonder de draad kwijt te raken, wat de vaardigheid is waar de agentmarkt momenteel het meest tekort aan heeft.

Kosten, self-hosting en hoe je het kunt uitproberen

De open gewichten zijn gratis; de kosten van dots3-note preview zitten in waar je het serveert. Het referentie-vLLM-recept voor de FP8-checkpoint draait op acht NVIDIA H100's met tensor-parallelisme 8 en expert-parallelisme 8 — een serieuze budgetpost, geen laptopmodel. Teams met dat soort hardware krijgen de hele stack, inclusief de speculatieve decodering met 3 tokens (MTP) en de dots tool-call-parser die de runtimes meeleveren. Iedereen anders zal het gehost noemen: het API-portaal van de leverancier staat online, en gehoste preview-eindpunten gingen live op platforms van derden op dezelfde dag dat de gewichten uitkwamen — 14 augustus. De preview-laag staat vermeld op $0 per token op de platforms die deze aanbieden, volgens hun eigen vermeldingen in plaats van de prijspagina van de leverancier, dus de instapkosten om dots3-note preview vandaag in productie te proberen zijn feitelijk nihil zolang het preview-label van kracht is.

Voor bouwers leest het twee weken oude argument over goedkoop inzetten op een onbewezen model nu als het argument over het evalueren van een net uitgekomen model — het patroon is identiek. Wijs een deel van het verkeer naar het nieuwe model, achter automatische failover, zodat een verrassende faalmodus een testpad neerhaalt in plaats van een productiepad. Dat is waarvoor een router dient, en het is de eerlijke versie van de pitch: dots3-note preview wordt op dit moment niet gehost op OrcaRouter, en niemand moet doen alsof dat wel zo is. Maar de routeringshouding waarover we schreven in het lekartikel is van toepassing vanaf de dag dat dat gebeurt — één API die een nieuw model kan bereiken op het moment dat een provider het host, met providerlijstprijzen die worden doorberekend met 0% opslag en failover die per verzoek wordt geconfigureerd. Ondertussen zijn de DeepSeek-modellen waaraan dit model structureel verwant is al op die manier aanroepbaar: DeepSeek V4 Flash en DeepSeek V4 Pro zijn beide live achter één sleutel, met dezelfde doorberekende prijzen en failover per verzoek — een redelijk referentiepunt om te beoordelen hoe een agentmodel met 16B actieve parameters, zoals dots3-note preview, zich in productie daadwerkelijk gedraagt.

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash (www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731), the released DeepSeek-generation model whose MLA + sparse-attention family dots-note-3.0 is structurally related to.

Wat nu te kijken

Vier dingen, ongeveer in volgorde van hoeveel ze het beeld zouden kunnen veranderen:

Onafhankelijke reproductie van 42/42. De gewichten zijn vrijgegeven; de eerste serieuze heruitvoering van het IMO-resultaat door een derde partij — of een neutraal evaluatiepakket dat dit tegenspreekt — is het datapunt met de hoogste waarde dat deze release kan opleveren. Tot die tijd blijft de 42/42 een officieel beoordeelde, door het bedrijf gerapporteerde score.

• De grotere modellen, jazz en aria. dots3-note preview is de eerste openbare release en, volgens het bedrijf, het lichtste lid van de dots3-familie. Als 280B totaal / 16B actief het kleine model is, dan zijn de twee grotere modellen waar de frontier-claims daadwerkelijk worden getest.

• Hosted-limits en preview-voorwaarden. De prijs is nu openbaar — de preview-laag is gratis per token op de platforms die deze aanbieden — maar de limieten en de vraag of de preview-tag speciale voorwaarden met zich meebrengt, zullen nog steeds bepalen wie zelf host en wie het aanroept.

{{1}}Waar het op onafhankelijke leaderboards terechtkomt{{/1}}. De door leveranciers gerapporteerde ARC-AGI- en agent-suite-claims hebben een neutrale meting nodig om bruikbare feiten te worden — dat is hetzelfde proces dat dit jaar bij elke open release hype van realiteit scheidde.

Toen we in augustus het lek bespraken, was de eerlijke samenvatting kort: echte architectuur, echt record, geen gewichten, geen datum. Drie van die vier kwalificaties zijn verdwenen. De architectuur is openbaar, het record is gekoppeld aan een downloadbare checkpoint, en de datum is aangebroken. Wat overblijft is de verificatie — en nu dat de dots3-note preview kan worden uitgevoerd in plaats van erover te lezen, zal het antwoord op de vraag of Xiaohongshu het agentmodel dat het beweert te hebben gebouwd ook echt heeft gebouwd, van iedereen met acht H100's en een benchmark-harness komen, niet van een pull request.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt