「dots-note-3.0:42/42 IMO 模型剛被 vLLM PR 洩漏」的標題卡片:大標題「dots-note-3.0」、副標題「目前已知資訊」、以及兩張扁平圖示卡片——「IMO 2026 · 42/42」搭配獎盃線條圖示與「官方評分」徽章、「vLLM PR #51255」搭配程式碼檔案線條圖示與「架構洩漏」徽章。OrcaRouter logo 合成於右下角。
Guides & Insights

dots-note-3.0:由 vLLM 的 PR 洩漏的 42/42 IMO 模型現已開源

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年8月14日,{{1}}dots-note-3.0{{/1}}不再只是一則洩漏消息。小紅書的 Dots Model Lab 開源了其 dots3 系列的第一個公開模型 dots3-note preview——2800億參數(160億活躍參數)、512K 上下文視窗、Apache-2.0 授權——距離 vLLM 的一則 pull request 在發布前洩漏模型架構僅八天。權重檔案位於 Hugging Face,程式碼位於 GitHub,而{{2}}在2026年國際數學奧林匹克競賽中官方拿下42/42滿分的檢查點{{/2}},首次開放給所有人執行。

這次發布解答了本部落格8月6日洩漏文章留下的所有未解問題——尺寸、上下文長度、授權條款、Hugging Face路徑、發布日期——並將一篇「目前已知資訊」的故事,轉變為可供查證的內容。以下是後續更新:實際發布了什麼、發布的配置對PR最初揭露的架構做了哪些確認、哪些現在可以獨立驗證、以及哪些仍屬於供應商自身的說法。

從草稿 PR 到公開檢查點

洩漏事件,快速說明:2026年8月6日,一位自稱是 ETH Zürich 博士生、而非 Xiaohongshu 員工的貢獻者 KurodaKanbei,開啟了 vllm-project/vllm 的 pull request #51255,加入對「Dots3 NOTE」語言模型的支援。8月7日 13:55 UTC,草稿狀態被解除,而該 PR 自身的驗證紀錄洩了底:作者曾以「Dots3 NOTE FP8 checkpoint」執行一個 8-GPU DP8/EP8 服務。你無法驗證一個你手上沒有的 FP8 checkpoint——寫下該 PR 的人,確實握有實際模型。此 PR 觸及 14 個檔案,包括新增的 vllm/models/dots3_note 模組,並帶有 new-model 與 verified 標籤。

我們在8月8日列出的四個跡象,如今每一個都已應驗,除了最重要的一個。Hugging Face 上的 repo 已出現——dots-studio/dots3-note-prev,Apache-2.0。官方公告也已發布——也就是今天的開源釋出本身。推論堆疊不再是草稿:vLLM 已在 main 上原生支援,transformers 與 SGLang 也都帶有 dots3-note 支援。第四個跡象,也就是 42/42 數學結果的獨立驗證,仍是唯一尚未實現的——但它如今已能以過去從未可能的方式進行,因為權重已經公開。

Screenshot of the vLLM GitHub pull request #51255 titled 'Draft: [Model] Add Dots3 NOTE language model support', opened August 6, 2026 by KurodaKanbei — the draft PR that first revealed the dots-note-3.0 architecture (hybrid DSA full-attention + sliding-window MLA layers).

實際發佈的內容

發布的模型卡將 PR 的推論轉化為規格表——而這些數字來自 checkpoint 自身的設定,而非第三方摘要。dots3-note preview 是一個混合專家(mixture-of-experts)模型:

• 280B 總參數 / 16B 啟用參數 — 256 個路由專家加上 1 個共享專家,採用 Top-8 路由,配置於 1 個密集層 + 45 個 MoE 層,隱藏層維度為 5,120。

• 512K token 上下文窗口、152K 詞彙量、BF16 與 FP8 精度。

• 多令牌預測(MTP)模組 —— 一個共享的 1.13B 參數層,可平行預測最多三個額外令牌,這正是無需獨立草稿模型即可實現推測解碼的關鍵。

• 多模態輸入 — 文字、圖像、影片及音訊 — 產生文字輸出。視覺編碼器為 MoE ViT(總計 7B / 激活 1.2B),音訊編碼器為密集 800M。

PR 的範圍說明中寫道,vLLM 相關工作僅涵蓋「僅限 LLM」,多模態元件不在範圍內。這指的是推理補丁,而非模型本身:已發布的 checkpoint 會連同視覺與音訊編碼器一起打包。如果你想要多模態版本,你看到的是同一個 repo,透過 transformers 和 SGLang 路徑提供服務,而非最早流出的 vLLM 僅限 LLM 路徑。

具體而言,可用性如下:權重存放於 Hugging Face 上的 dots-studio/dots3-note-prev,採用 Apache-2.0 授權;程式碼與服務部署配方位於 GitHub 上的 studio-dots-ai/dots3-note-prev 儲存庫;託管存取則可透過廠商自己的 API 入口網站及數個第三方平台取得。這是 dots3 家族首次開放權重的釋出——Xiaohongshu 依其中文聲明使用了兩週的「open-sourcing soon」(近期將開源)說法,如今已獲兌現。

洩漏內容言中的架構

該 PR 將 dots-note-3.0 描述為「與 DeepSeek-V3.2 結構相關」,但在同一個堆疊中混合了兩種注意力幾何結構。釋出的設定檔證實了這點。模型卡將 46 個注意力層拆分為 13 個 DeepSeek 風格的稀疏注意力(DSA)層(使用 top-2048 索引)與 33 個滑動視窗注意力(SWA)層,大約每三個密集層就有一個稀疏層。這就是分支名稱 note-hopper 所暗示的「在稀疏全域與密集區域之間跳躍」的結構,如今已寫入 checkpoint 本身。

從機制上來說,這正是 DeepSeek 在 V3.2 中提出的同一個概念:DSA 這一半是輕量級索引器,它會對每個快取鍵與查詢進行評分,保留一份 top-k 候選清單,並僅針對這些候選而非完整上下文計算注意力——藉此將長序列的二次方成本降至近似線性。滑動視窗那一半則是制衡:一段有界的密集局部注意力,無論稀疏索引器做出什麼決定,都保證最近的 token 始終會被完整納入注意力範圍。全域稀疏加上局部密集,共存於同一個模型,正是這起洩漏中真正不尋常之處——而這如今已獲得證實。

其餘的藍圖是熟悉的 DeepSeek 家族技術,正如 PR 所述:一個不分組的 MoE 路由器、序列並行 MoE、經完整 512K 上下文窗口驗證的長上下文分塊預填充,以及一個預設使用滑動視窗注意力類型進行推測性解碼的 MTP 層。

42/42 的紀錄——以及現今可以查證的事

IMO 成績本身沒有改變,標示方式亦然。2026年7月25日,小紅書宣布該模型在上海舉行的第67屆國際數學奧林匹亞官方評分中獲得滿分42/42;在666名人類參賽者中,僅有7人取得相同成績,而金牌分數線為29分——這比金牌線高出13分,也比Gemini Deep Think的35/42高出7分,後者是先前官方IMO評分中最佳的AI成績。這仍是該公司對一場官方評分競賽的說法:分數真實無誤,且經委員會驗證;但周邊的宣稱——題目如何取得、抽樣與評分如何受控——從未經獨立稽核,因為實驗室外無人能運行該模型。

這就是這次發布所改變的地方。權重公開之後,42/42 不再是一個需要憑信仰或憑 pull request 上的說法來接受的分數;它是第三方可以嘗試重現的結果,而這也是這次發布中最高價值的可驗證事項。它同時在邊緣處仍存在爭議,情況與兩週前相同:中國媒體報導華為的 Celia 在同樣評測中也拿到 42/42,所以 dots-note-3.0 是首批之一而非第一個;而 Menlo Ventures 合夥人在 X 上的宣稱,說 OpenAIAnthropic、Axiom Math 和 Moonshot 的 Kimi K3 今年也達到 42/42,至今仍是未經證實的社群貼文,背後沒有任何評測紀錄。

該公司也在發布時一併公布了最新的基準測試數據,這些數據目前均為廠商自行報告,尚未經獨立重現驗證。在 ARC-AGI 3 基準測試中,Dots 表示 dots3-note 預覽版得分約為 0.35,報告的測試成本低於 500 美元。在包括 WebShop、HotpotQA 和 ALFWorld 在內的推理與 Agent 測試套件中,該公司聲稱其模型表現與參數量為其數倍的模型相當或更優,且其視覺能力在同尺寸模型中表現突出。這些都是 Dots 對自家模型的數據——在第三方獨立實驗室重新驗證之前,請以此標準看待。

Dots 也釋出了它為此類任務打造的兩個評測框架,而將它們開源的價值幾乎不亞於模型本身。VibeLifeBench 在 22 個模擬服務與 288 個工具介面上執行 200 項任務,檢查 1,247 個原子條件,以判斷代理程式在任務中途環境變化時是否能保持一致;根據 Dots 自己的結果,目前測試過的最強模型僅獲得 32.5 avg@3,而且大多數頂尖的封閉權重模型直接失敗。VibeSearchBench 範圍較窄——20 個領域、200 項任務,測試代理程式在請求含糊時是否會要求釐清。兩者都帶有與 ARC-AGI 數字相同的供應商自報標籤,但這些評測框架是公開的,這使得 32.5 這個數字可以被證偽,而非僅是修辭。

為什麼這是一個代理模型,而不是數學模型

無論是洩漏的資訊還是IMO分數,都不該讓你對這個模型的用途產生誤判。這次發佈的定位不是數學運算,而是長時程、開放式任務:個人化旅遊規劃、婚禮籌備流程、經營小店、居家翻修。這些任務沒有單一正確答案,目標會在過程中改變,時間尺度是數小時或數天。這是一套刻意與數學和程式競賽排行榜不同的評測基準,也是dots3-note設計選擇——512K上下文、記憶檔案、自我批判迴圈——真正發揮價值的地方。

在釋出的資料中,有三項技術格外突出。首先,模型會維護一個記憶檔案(memory.md),作為持續更新的環境摘要,藉此在漫長且開放式的會話中保存狀態。其次,它採用「自我批判」機制——也就是 IMO 解法據稱所使用的遞迴式自我審查——來標記並修復自身的中間步驟。第三,其訓練配方名為 TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization):模型將長軌跡拆解為宏觀步驟,並交替扮演行動者(actor)與評論者(critic)的角色,以產生自身的訓練訊號;據報導,這正是該模型能在沒有標準答案的任務上進行最佳化的原因。

廠商的實機示範體現了這項主張:將卡牌構築遊戲《Slay the Spire II》玩到第33層、在320步內解完全部六個ARC-AGI 3關卡、逐步完成一個居家裝潢的空間推理問題,並端對端地建構一個visionOS應用程式(12個Swift檔案,1,876行程式碼,顯示「BUILD SUCCEEDED」)。請將這些視為示範,而非基準測試——但這些示範針對的是一項特定能力:一個能牢記單一目標、執行許多步驟而不偏離主線的模型。而這正是目前代理(agent)市場最缺乏的能力。

成本、自行託管與試用方式

開放權重是免費的;dots3-note 預覽版的成本在於你部署它的地方。FP8 檢查點的參考 vLLM 配方在八張 NVIDIA H100 上運行,採用張量並行 8 與專家並行 8——這是一條真正的預算線,不是筆電等級的模型。擁有這類硬體的團隊可以取得完整技術棧,包括 3-token MTP 推測解碼,以及運行時隨附的 dots 工具呼叫解析器。其他所有人都會稱之為託管服務:供應商的 API 入口網站已上線,託管預覽端點也在權重發布的同一天——8 月 14 日——於第三方平台上線。預覽層級在提供該服務的平台上標示為每 token $0,此依據是這些平台自身的列表,而非供應商的定價頁面,因此在預覽標籤仍有效的期間,今天在生產環境中試用 dots3-note 預覽版的進入成本實際上為零。

對於開發者來說,兩週前關於「低成本押注未經驗證模型」的爭論,如今讀起來就像是關於「評估剛出貨模型」的爭論——模式完全相同。將一部分流量指向新模型,並置於自動故障轉移背後,這樣一來,意外的失敗模式只會擊中測試路徑,而非生產路徑。這就是路由器的用途,也是這項提案的真實版本:截至目前,dots3-note preview 並未託管在 OrcaRouter 上,任何人都不應假裝並非如此。但我們在洩漏文章中談到的路由姿態,在它上線的那一天就適用——一個 API,只要供應商一託管新模型就能即刻存取,供應商列表價格以 0% 加價轉傳,並可依請求配置故障轉移。與此同時,這個模型在結構上相關的 DeepSeek 系列模型已經可以透過這種方式呼叫:DeepSeek V4 Flash 和 DeepSeek V4 Pro 都已上線,共用一個金鑰,同樣的轉傳定價和每請求故障轉移——這對於評估像 dots3-note preview 這樣的 16B 活躍參數代理模型在生產環境中的實際表現,是一個合理的參考點。

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash (www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731), the released DeepSeek-generation model whose MLA + sparse-attention family dots-note-3.0 is structurally related to.

接下來要看什麼

四件事,大致按照它們可能改變局面的程度排序:

• 42/42 的獨立複現。權重已經釋出;首次由第三方認真重跑 IMO 結果——或是一套與之牴觸的中立評測套件——是此次發布所能產出的最高價值單一數據點。在那之前,42/42 仍是一項經官方評分、由公司呈報的成績。

• 更大的同系列產品是 jazz 和 aria。dots3-note 預覽版是首個公開釋出的版本,且據公司表示,它是 dots3 系列中最輕量的成員。如果總參數 280B / 活躍參數 16B 算是小模型,那麼這兩個更大的模型才是真正考驗其前沿主張的地方。

• 託管限制與預覽條款。價格現已公開——在提供預覽的平台上,預覽層級每個 token 免費——但速率限制以及預覽標籤是否帶有特殊條款,仍將決定誰會自行託管、誰會呼叫它。

• 它在獨立排行榜上的排名位置。廠商回報的 ARC-AGI 與代理套件宣稱,需要中立的測量才能成為可用的實據——這正是今年每次開放釋出中,將誇大宣傳與現實區分開來的同一套流程。

我們在八月報導這起洩漏時,誠實的總結很簡短:真實的架構、真實的記錄,沒有權重,沒有日期。這四個限定條件中有三個已經不存在了。架構公開了,記錄附在可下載的檢查點上,日期也到了。剩下的是驗證——而現在 dots3-note 預覽版可以實際運行,而不是只能閱讀相關資料,小紅書是否真的建構了它所宣稱的智能體模型,答案將來自任何擁有八張 H100 和基準測試工具的人,而不是來自一個 pull request。