
dots-note-3.0: 42/42 IMO-modellen som läcktes via en vLLM PR är nu öppen källkod
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Den 14 augusti 2026 slutade dots-note-3.0 att vara en läcka. Xiaohongshus Dots Model Lab släppte som öppen källkod den första publika modellen i dots3-familjen som dots3-note preview — 280 miljarder parametrar (16 miljarder aktiva), ett kontextfönster på 512K, Apache-2.0-licensierad — åtta dagar efter att en vLLM-pull request läckte modellens arkitektur i förväg. Vikterna finns på Hugging Face, koden finns på GitHub, och den checkpoint som officiellt fick 42/42 vid Internationella matematikolympiaden 2026 är för första gången körbar för vem som helst.
Den utgåvan besvarar alla öppna frågor som denna bloggs läckageinlägg från den 6 augusti lämnade hängande — storlek, kontextlängd, licens, en Hugging Face-sökväg, ett releasedatum — och det förvandlar en "vad vi vet hittills"-berättelse till en som kan verifieras. Det som följer är uppdateringen: vad som släpptes, vad den släppta konfigurationen bekräftar om arkitekturen som PR:n först avslöjade, vad som nu är oberoende verifierbart, och vad som fortfarande är leverantörens eget påstående.
Från ett PR-utkast till en offentlig checkpoint
Läckan, i korthet: den 6 augusti 2026 öppnade en bidragsgivare som går under namnet KurodaKanbei — en självbeskriven doktorand vid ETH Zürich, inte en Xiaohongshu-anställd — pull request #51255 i vllm-project/vllm, som lade till stöd för en språkmodell kallad "Dots3 NOTE". Utkastsflaggan togs bort den 7 augusti klockan 13:55 UTC, och PR:ns egna valideringsanteckningar var det som avslöjade allt: författaren hade kört en 8-GPU DP8/EP8-tjänst "med en Dots3 NOTE FP8-checkpoint." Man kan inte validera en FP8-checkpoint som man inte har — den som skrev PR:n hade den faktiska modellen. Den berörde 14 filer, inklusive en ny vllm/models/dots3_note-modul, och bar etiketterna new-model och verified.
Alla fyra tecken vi listade den 8 augusti har nu infriats, förutom det som betyder mest. Hugging Face-repot dök upp — dots-studio/dots3-note-prev, Apache-2.0. Det officiella tillkännagivandet kom — själva open source-utgåvan, idag. Inferensstacken slutade vara ett utkast: vLLM-stöd är inbyggt i main, och både transformers och SGLang har stöd för dots3-note. Det fjärde tecknet, oberoende verifiering av matematikresultatet 42/42, är fortfarande utestående — och det är nu möjligt på ett sätt som aldrig tidigare, eftersom vikterna är publika.
![Screenshot of the vLLM GitHub pull request #51255 titled 'Draft: [Model] Add Dots3 NOTE language model support', opened August 6, 2026 by KurodaKanbei — the draft PR that first revealed the dots-note-3.0 architecture (hybrid DSA full-attention + sliding-window MLA layers).](https://cms.orcarouter.ai/api/media/file/2-11.png)
Vad som faktiskt levererades
Det publicerade modellkortet förvandlar PR:ns slutsatser till ett specifikationsblad — och siffrorna kommer från checkpointens egen konfiguration, inte från en tredjepartssammanfattning. dots3-note preview är en mixture-of-experts-modell:
• 280B totalt / 16B aktiva parametrar — 256 routade experter plus en delad expert, top-8-routning, på 1 tätt + 45 MoE-lager med en dold storlek på 5 120.
• 512K-tokens kontextfönster, 152K vokabulär, BF16- och FP8-precision.
• En multi-token-prediktionsmodul (MTP) — ett delat lager med 1,13B parametrar som förutsäger upp till tre extra tokens parallellt, vilket driver spekulativ avkodning utan en separat utkastmodell.
• Multimodal inmatning — text, bild, video och ljud — som producerar textutdata. Bildkodaren är en MoE ViT (7B totalt / 1,2B aktiv) och ljudkodaren är en tät 800M.
PR:ns omfattningsanteckning sade att vLLM-arbetet omfattade "endast LLM:en", med de multimodala komponenterna utanför omfattningen. Det gällde inferenspatchen, inte modellen: den släppta checkpointen levererar vision- och ljudkodarna tillsammans med språkkärnan. Om du vill ha den multimodala versionen tittar du på samma repo, som serveras via transformers- och SGLang-vägarna snarare än den vLLM LLM-only-väg som läckte först.
Tillgänglighet, konkret: vikterna finns på dots-studio/dots3-note-prev på Hugging Face under Apache-2.0-licensen; koden och serveringsrecepten ligger i arkivet studio-dots-ai/dots3-note-prev på GitHub; och värdad åtkomst erbjuds via leverantörens egen API-portal samt flera tredjepartsplattformar. Det är den första öppna viktutgåvan av dots3-familjen — uttrycket ’öppen källkod snart’ (近期将开源) som Xiaohongshu hade använt i två veckor, enligt sina kinesiskspråkiga uttalanden, har infriats.
Arkitekturen som läckan fick rätt om
PR:n beskrev dots-note-3.0 som "strukturellt relaterad till DeepSeek-V3.2" men med en blandning av två uppmärksamhetsgeometrier i en enda stack. Den släppta konfigurationen bekräftar detta. Modellkortet delar upp de 46 uppmärksamhetslagren i 13 DeepSeek-liknande sparse-attention (DSA)-lager — med top-2048-indexering — och 33 sliding-window-attention (SWA)-lager, ungefär ett sparse-lager för var tredje tätt lager. Det är strukturen "hoppa mellan sparse global och tät lokal" som grennamnet note-hopper antydde, nu inskrivet i själva checkpointen.
Mekaniskt sett är det samma idé som DeepSeek introducerade med V3.2: DSA-halvan är en lättviktig indexerare som poängsätter varje cachad nyckel mot frågan, behåller en topp-k-kortlista och beräknar attention över den istället för över hela kontexten — vilket sänker den kvadratiska kostnaden för långa sekvenser till ungefär linjär. Den glidande fönster-halvan är motvikten: ett begränsat spann av tät lokal attention som garanterar att de senaste token alltid får full attention, oavsett vad den glesa indexeraren bestämmer. Global gles plus tät lokal, i samma modell, var den verkligt ovanliga delen av läckan — och det är nu den bekräftade delen.
Resten av planen är välbekant DeepSeek-maskineri, som PR:n sade: en ogrupperad MoE-router, sekvensparallell MoE, långkontext chunked prefill validerad över hela 512K-fönstret, och ett MTP-lager som använder sliding-window attention som standard för spekulativ avkodning.
42/42-rekordet — och vad som nu är kontrollerbart
Själva IMO-resultatet ändras inte, och inte heller märkningen. Den 25 juli 2026 meddelade Xiaohongshu att modellen hade fått perfekta 42/42 i den officiella bedömningen av den 67:e Internationella matematikolympiaden i Shanghai, där endast 7 av 666 mänskliga tävlande matchade resultatet och guldgränsen var 29 — 13 poäng över guldgränsen och 7 poäng över Gemini Deep Thinks 35/42, det tidigare bästa AI-resultatet i officiell IMO-bedömning. Det förblir företagets redogörelse för en officiellt bedömd tävling: poängen är äkta och kommittéverifierad, men de omgivande påståendena — hur problemen nåddes, hur sampling och bedömning kontrollerades — granskades aldrig oberoende, eftersom ingen utanför labbet kunde köra modellen.
Det är den del som releasen ändrar. Med vikterna offentliga är 42/42 inte längre en siffra som man tar på tro eller på ett pull requests ord; det är ett resultat som en tredje part kan försöka återskapa, och det är det mest värdefulla verifierbara med denna release. Det förblir också ifrågasatt i marginalerna på samma sätt som för två veckor sedan: Kinesiska medier rapporterade att Huaweis Celia också fick 42/42 i samma bedömning, så dots-note-3.0 är en av de första snarare än den första; och en Menlo Ventures-partners X-påstående att OpenAI, Anthropic, Axiom Math och Moonshots Kimi K3 också nådde 42/42 i år är fortfarande ett overifierat socialt inlägg utan bedömningsunderlag bakom sig.
Företaget publicerade också färska benchmark-påståenden i samband med releasen, alla leverantörsrapporterade och hittills ej oberoende reproducerade. På benchmarken ARC-AGI 3 säger Dots att dots3-note preview får ungefär 0,35 vid en rapporterad testtidskostnad på under 500 dollar. När det gäller resonemangs- och agentuppsättningar som WebShop, HotpotQA och ALFWorld hävdar företaget att modellen är i paritet med eller bättre än modeller som har flera gånger fler aktiva parametrar, med en vision som utmärker sig i sin storleksklass. Det är Dots egna siffror om sin egen modell – behandla dem så tills ett neutralt labb kör dem igen.
Dots släppte också de två utvärderingsramverk som de byggt för denna typ av uppgift, och att göra dem öppet tillgängliga är nästan lika användbart som modellen. VibeLifeBench kör 200 uppgifter över 22 simulerade tjänster och 288 verktygsgränssnitt, och kontrollerar 1 247 atomära villkor för huruvida en agent förblir konsekvent när miljön förändras mitt i uppgiften; enligt Dots egna resultat får den starkaste modellen som testats hittills bara 32,5 i avg@3, och de flesta ledande stängda modellerna misslyckas helt. VibeSearchBench är smalare – 20 domäner, 200 uppgifter, som testar om en agent ber om förtydligande när en begäran är tvetydig. Båda bär samma leverantörsrapporterade etikett som ARC-AGI-siffran, men ramverken är offentliga, vilket gör 32,5 falsifierbart snarare än retoriskt.
Varför detta är en agentmodell, inte en matematisk modell.
Varken läckan eller IMO-poängen bör vilseleda dig om vad den här modellen är till för. Lanseringspositioneringen handlar inte om matematik – det handlar om långsiktiga, öppna uppgifter: personlig resplanering, arbetsflöden för bröllopsförberedelser, att driva en liten butik, en hemrenovering. Uppgifter utan ett enda rätt svar, mål som skiftar mitt i uppgiften, och tidsskalor på timmar eller dagar. Det är medvetet en annan benchmarkuppsättning än topplistorna för matematik och kodning, och det är där dots3-note-designvalen – 512K-kontexten, minnesfilen, självkritikloopen – faktiskt lönar sig.
Tre tekniker utmärker sig i det publicerade materialet. För det första underhåller modellen en minnesfil (memory.md) som en löpande sammanfattning av miljön, vilket är hur den bär med sig tillstånd genom en lång, öppen session. För det andra använder den en ”självkritik”-mekanism – samma rekursiva självgranskning som IMO-lösningen beskrevs använda – för att flagga och reparera sina egna mellansteg. För det tredje heter träningsreceptet TEMPO (Test-time-scaled Value Estimation with Macro-step Policy Optimization): modellen delar upp långa banor i makrosteg och växlar mellan aktörs- och kritikerroller för att generera sin egen träningssignal, vilket är den rapporterade anledningen till att den kan optimeras på uppgifter som saknar facit.
Säljarens praktiska demonstrationer är kärnan i påståendet: att spela deckbuilder-spelet Slay the Spire II till våning 33, att lösa alla sex ARC-AGI 3-nivåerna på 320 steg, att gå igenom ett rumsligt resonemangsproblem för hemrenovering och att bygga en visionOS-app från början till slut (12 Swift-filer, 1 876 rader, "BUILD SUCCEEDED"). Betrakta dessa som demonstrationer, inte som benchmarks – men de är demonstrationer av en specifik sak: en modell som håller ett mål i åtanke och tar många steg utan att tappa tråden, vilket är den förmåga som agentmarknaden för närvarande har störst brist på.
Kostnad, självhosting och hur du provar det
De öppna vikterna är gratis; kostnaden för dots3-note preview ligger i serveringen. Referensreceptet för vLLM för FP8-checkpointen körs på åtta NVIDIA H100:or med tensorparallellism 8 och expertparallellism 8 — en reell budgetnivå, inte en laptopmodell. Team med den typen av hårdvara får hela stacken, inklusive 3-token MTP-spekulativ avkodning och dots-verktygsanropsparsern som medföljer runtime. Alla andra kommer att använda den som värdtjänst: leverantörens API-portal är uppe, och värdbaserade preview-slutpunkter gick live på tredjepartsplattformar samma dag som vikterna släpptes — 14 augusti. Preview-nivån är listad till 0 dollar per token på de plattformar som serverar den, enligt plattformarnas egna listningar snarare än leverantörens prissida, så inträdeskostnaden för att prova dots3-note preview i produktion idag är i praktiken noll så länge preview-märkningen gäller.
För utvecklare framstår det två veckor gamla argumentet om att satsa billigt på en oprövad modell nu som argumentet om att utvärdera en nyss lanserad sådan — mönstret är identiskt. Rikta en del av trafiken mot den nya modellen, bakom automatisk failover, så att en överraskande felmod slår ut en testväg i stället för en produktionsväg. Det är vad en router är till för, och det är den ärliga versionen av pitchen: dots3-note preview hostas inte på OrcaRouter i skrivande stund, och ingen bör låtsas något annat. Men den routingstrategi vi skrev om i läckageartikeln gäller den dag den är det — ett API som kan nå en ny modell i samma ögonblick som en leverantör hostar den, där leverantörens listpriser förs vidare med 0 % påslag och failover konfigureras per anrop. Under tiden är DeepSeek-familjens modeller, som den här är strukturellt besläktad med, redan anropsbara på det sättet: DeepSeek V4 Flash och DeepSeek V4 Pro är båda live bakom en enda nyckel, med samma pass-through-prissättning och failover per anrop — en rimlig referenspunkt för att bedöma hur en agentmodell med 16B aktiva parametrar, som dots3-note preview, faktiskt beter sig i produktion.

Vad du ska titta på härnäst
Fyra saker, ungefär i ordning efter hur mycket de skulle kunna förändra bilden:
• Oberoende reproduktion av 42/42. Vikterna är ute; den första seriösa tredjepartskörningen av IMO-resultatet — eller ett neutralt utvärderingspaket som motsäger det — är den enskilt mest värdefulla datapunkten som denna release kan producera. Tills dess förblir 42/42 ett officiellt betygsatt, företagsrapporterat resultat.
De större syskonen, jazz och aria. dots3-note preview är den första offentliga utgåvan och, enligt företaget, den lättaste medlemmen i dots3-familjen. Om 280B totalt / 16B aktiv är den lilla, så är de två större modellerna där frontier-anspråken faktiskt kommer att sättas på prov.
• Värdbaserade begränsningar och förhandsversionsvillkor. Priset är nu offentligt — förhandsversionsnivån är gratis per token på de plattformar som tillhandahåller den — men hastighetsbegränsningar och huruvida preview-taggen medför särskilda villkor kommer fortfarande att avgöra vem som självhostar jämfört med vem som anropar den.
• Var den hamnar på oberoende topplistor. De leverantörsrapporterade ARC-AGI- och agent-svit-påståendena behöver en neutral mätning för att bli användbara fakta — det är samma process som skilde hype från verklighet vid varje öppen release i år.
När vi bevakade läckan i augusti var den ärliga sammanfattningen kort: riktig arkitektur, riktigt resultat, inga vikter, inget datum. Tre av dessa fyra förbehåll är borta. Arkitekturen är offentlig, resultatet är kopplat till en nedladdningsbar checkpoint, och datumet har kommit. Det som återstår är verifieringen — och nu när dots3-note preview kan köras snarare än läsas om, kommer svaret på huruvida Xiaohongshu byggt den agentmodell de påstår att komma från vem som helst med åtta H100:or och en utvärderingsmiljö, inte från en pull request.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
