标题卡片「dots-note-3.0:42/42 IMO 模型刚被 vLLM PR 泄露」:大标题「dots-note-3.0」,副标题「目前已知信息」,以及两张扁平图标卡片——「IMO 2026 · 42/42」配奖杯线条图标和「官方评分」徽章,「vLLM PR #51255」配代码文件线条图标和「架构泄露」徽章。OrcaRouter 标志合成于右下角。
Guides & Insights

dots-note-3.0:由 vLLM PR 泄露的 42/42 IMO 模型现已开源

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年8月14日,dots-note-3.0不再只是泄露版本。小红书Dots Model Lab将dots3系列的首个公开模型以dots3-note preview的形式开源——2800亿参数(160亿激活参数)、512K上下文窗口、Apache-2.0许可证——而就在发布前八天,一个vLLM拉取请求提前泄露了该模型的架构。模型权重已在Hugging Face上发布,代码已在GitHub上开源,而这个在2026年国际数学奥林匹克竞赛中官方获得42/42满分的检查点,首次可供任何人运行。

那次发布回答了本博客8月6日泄密文章留下的所有悬而未决的问题——模型规模、上下文长度、许可证、Hugging Face路径、发布日期——并将一篇"迄今已知信息"的报道变成了一篇可以被核查的文章。以下是更新内容:实际发布了什么、已发布的配置对PR首次透露的架构印证了什么、现在有哪些内容可以独立验证,以及哪些仍然只是厂商的单方面说法。

从草稿 PR 到公开检查点

长话短说,这次泄密事件:2026 年 8 月 6 日,一位化名 KurodaKanbei 的贡献者——自称是苏黎世联邦理工学院(ETH Zürich)的博士生,而非小红书员工——在 vllm-project/vllm 仓库开启了拉取请求(PR)#51255,为“Dots3 NOTE”语言模型添加支持。8 月 7 日 13:55 UTC,该 PR 的草稿标记被移除,而 PR 自带的验证记录正是破绽所在:作者曾运行一个 8-GPU DP8/EP8 服务,“使用了 Dots3 NOTE FP8 检查点”。你无法验证一个你并不拥有的 FP8 检查点——写这个 PR 的人确实持有真实模型。该 PR 涉及 14 个文件,包括一个新的 vllm/models/dots3_note 模块,并带有 new-model 和 verified 标签。

我们在8月8日列出的四个迹象中,除了最关键的那个,其余都已应验。Hugging Face仓库已经出现——dots-studio/dots3-note-prev,Apache-2.0许可。官方公告也已落地——开源版本本身就在今天发布。推理栈不再只是草案:vLLM已在main分支上原生支持,transformers和SGLang也都加入了dots3-note支持。第四个迹象,即对42/42数学结果的独立验证,仍是唯一尚未兑现的——但现在它已经以前所未有的方式成为可能,因为权重已经公开。

Screenshot of the vLLM GitHub pull request #51255 titled 'Draft: [Model] Add Dots3 NOTE language model support', opened August 6, 2026 by KurodaKanbei — the draft PR that first revealed the dots-note-3.0 architecture (hybrid DSA full-attention + sliding-window MLA layers).

实际发布的内容

{{1}}已发布的模型卡将PR的推论转化为规格表{{/1}} — {{2}}这些数字来自检查点自身的配置,而非第三方摘要。{{/2}} {{3}}dots3-note 预览版是一个专家混合(MoE)模型:{{/3}}

• 总参数280B / 激活参数16B — 256个路由专家加1个共享专家,Top-8路由,1个稠密层 + 45个MoE层,隐藏层大小5,120。

• 512K token 上下文窗口,152K 词表,支持 BF16 和 FP8 精度。

{{1}}• 多令牌预测(MTP)模块{{/1}} — {{2}}一个共享的1.13B参数层{{/2}},可{{3}}并行预测最多三个额外令牌{{/3}},这正是无需单独草稿模型即可驱动{{KEEP}}speculative decoding{{/KEEP}}的关键。

• 多模态输入——文本、图像、视频和音频——生成文本输出。视觉编码器是一个MoE ViT(总参数量7B / 激活参数1.2B),音频编码器是一个稠密的800M模型。

该PR的范围说明指出,vLLM相关的工作只覆盖了“仅LLM部分”,多模态组件不在范围内。那是针对推理补丁而言,而非模型本身:发布的checkpoint除了语言核心外,还一并包含视觉和音频编码器。如果你想要多模态版本,需要看的是同一个仓库,通过transformers和SGLang路径来提供服务,而不是最先泄露出来的那个仅支持LLM的vLLM路径。

具体而言,可用性如下:权重以Apache-2.0许可证托管在Hugging Face上的dots-studio/dots3-note-prev中;代码和部署方案位于GitHub上的studio-dots-ai/dots3-note-prev仓库中;托管访问则通过供应商自家的API门户以及多个第三方平台提供。这是dots3系列的首次开放权重发布——小红书在此前的中文声明中使用了“即将开源”(近期将开源)的说法,历时两周,如今这一承诺已经兑现。

架构泄露对了

PR 将 dots-note-3.0 描述为"在结构上与 DeepSeek-V3.2 相关",但在同一堆叠中混合了两种注意力几何结构。发布的配置证实了这一点。模型卡将 46 个注意力层拆分为 13 个 DeepSeek 风格稀疏注意力(DSA)层——采用 top-2048 索引——以及 33 个滑动窗口注意力(SWA)层,大约每三个稠密层对应一个稀疏层。这正是分支名称 note-hopper 所暗示的"在稀疏全局与稠密局部之间跳跃"的结构,如今已写入检查点本身。

从机制上讲,这与DeepSeek在V3.2中引入的思路相同:其中一半是DSA,一个轻量级索引器,它对每个缓存的键与查询进行评分,保留一个top-k候选清单,并仅对这些候选计算注意力,而非对整个上下文计算——从而将长序列的二次方开销降至近似线性。另一半是滑动窗口,作为平衡机制:一段有界的密集局部注意力,确保最近的token始终得到完全关注,无论稀疏索引器如何决定。全局稀疏加上密集局部,共存于同一模型,才是这次泄露真正不寻常的部分——而如今这一部分已得到证实。

蓝图的其余部分是熟悉的DeepSeek系列机制,正如PR所述:未分组的MoE路由器、序列并行MoE、经过验证可支持完整512K窗口的长上下文分块预填充,以及默认采用滑动窗口注意力类型进行推测解码的MTP层。

42/42的战绩——以及如今可以查证的内容

IMO 成绩本身没有变化,标签也没有变化。2026年7月25日,小红书宣布该模型在第67届国际数学奥林匹克竞赛(上海)的官方阅卷中获得了完美的42/42满分,参赛的666名人类选手中仅有7人达到这一成绩,金牌分数线为29分——高出金牌线13分,比 Gemini Deep Think 的35/42高出7分,这是此前官方IMO阅卷中AI取得的最好成绩。这仍然是该公司对一场官方评分竞赛的说法:分数是真实的,并经过委员会核实,但围绕其的说法——题目如何获取、采样和评分如何控制——从未经过独立审计,因为实验室之外没有人能够运行该模型。

这就是本次发布所改变的部分。随着权重公开,42/42 不再是一个需要凭信仰或凭 pull request 的一面之词来接受的数字;它是一个第三方可以尝试复现的结果,而这正是本次发布中最具价值的可验证之处。它在边缘层面仍然存在争议,与两周前的情况相同:中国媒体报道称,华为的 Celia 在同一项评测中也获得了 42/42,因此 dots-note-3.0 是最早达到这一成绩的模型之一,而非第一个;此外,Menlo Ventures 一位合伙人在 X 上声称 OpenAIAnthropic、Axiom Math 和 Moonshot 的 Kimi K3 今年也达到了 42/42,这仍然是一条未经证实的社交媒体帖子,背后没有任何评测记录。

该公司还在发布时一并公布了新的基准测试声称,目前这些数字全部来自厂商自报,尚未被复现。在 ARC-AGI 3 基准测试上,Dots 称 dots3-note 预览版的得分约为 0.35,报告称其测试时成本低于 500 美元。在包括 WebShop、HotpotQA 和 ALFWorld 在内的推理与智能体套件上,它声称该模型与活跃参数数量为其数倍的模型旗鼓相当甚至更胜一筹,其视觉能力在同尺寸模型中尤为突出。这些是 Dots 对自己模型给出的数据——在中立实验室重新跑一遍之前,请姑且如此看待。

Dots 还发布了为这类任务构建的两个评估框架,将其开源几乎与模型本身一样有用。VibeLifeBench 在 22 个模拟服务和 288 个工具接口上运行 200 项任务,检查 1,247 个原子条件,以判断智能体在任务中途环境变化时是否保持一致;根据 Dots 自己的结果,目前测试过的最强模型仅得分 32.5 avg@3,而且大多数顶级闭权重模型直接失败。VibeSearchBench 范围较窄——20 个领域、200 项任务,测试智能体在请求模糊时是否会请求澄清。两者都与 ARC-AGI 数据一样带有相同的供应商报告标签,但这些框架是公开的,这使得 32.5 这个数字可以被证伪,而非仅仅是修辞。

为什么这是一个智能体模型,而不是数学模型

无论是泄露的信息还是IMO分数,都不应让你误解这个模型的用途。它的发布定位不是数学——而是长周期、开放式的任务:个性化旅行规划、婚礼筹备流程、经营一家小店、房屋翻新。这些任务没有唯一正确答案,目标会在中途改变,时间跨度从几小时到几天。这与数学和编程排行榜是刻意区分开来的基准集,也正是dots3-note的设计选择——512K上下文、记忆文件、自我批评循环——真正发挥作用的地方。

在已发布的材料中,有三项技术尤为突出。第一,模型维护一个内存文件(memory.md)作为持续更新的环境摘要,这正是它在长时间开放式会话中传递状态的方式。第二,它采用一种“自我批评”机制——与IMO解题方案中所描述的递归式自我审查相同——来标记并修复自身的中间步骤。第三,该训练方案名为TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization,即测试时缩放的价值估计与宏步策略优化):模型将长轨迹拆分为宏步,并在行动者(actor)与评论者(critic)角色之间交替,从而生成自身的训练信号——据称这正是它能在没有标准答案的任务上进行优化的原因。

厂商的实操演示印证了这一说法:玩卡牌构筑游戏《Slay the Spire II》打到第33层,用320步解决全部六个ARC-AGI 3关卡,逐步走通一个家装改造的空间推理问题,并端到端构建一个visionOS应用(12个Swift文件,1,876行代码,"BUILD SUCCEEDED")。这些应视为演示,而非基准测试——但它们演示的是一个具体的能力:一个能始终牢记单一目标、执行多步骤操作而不偏离正轨的模型,而这正是当前智能体市场最稀缺的能力。

成本、自托管以及如何试用

开放权重是免费的;dots3-note 预览版的成本在于你把它托管在哪里。FP8 检查点的参考 vLLM 配方可在八块 NVIDIA H100 上运行,张量并行度为 8,专家并行度为 8——这是真正的预算级配置,而不是笔记本能跑的模型。拥有这类硬件的团队能拿到整套栈,包括运行时自带的 3-token MTP 投机解码和 dots 工具调用解析器。其他人都只能通过托管方式来调用:厂商的 API 门户已经上线,托管预览端点也在权重发布当天——8月14日——同步在第三方平台上启用。在提供该预览版的平台上,预览层按每 token $0 计价,这是依据这些平台自己的定价页面,而不是厂商的定价页。因此,在预览标签持续期间,今天在生产环境中试用 dots3-note 预览版的入门成本实际上是零。

对于构建者来说,两周前关于“低价押注一个未经证实的模型”的争论,如今读起来就像是“评估一个刚刚发布的模型”的争论——模式完全一样。将一部分流量指向新模型,并置于自动故障转移之后,这样意外故障模式只会击垮测试路径,而非生产路径。这正是路由器的用途,也是这一宣传的诚实版本:截至本文撰写时,dots3-note preview 并未托管在 OrcaRouter 上,任何人都不要假装并非如此。但我们在泄露事件文章中写到的路由策略,一旦它上线便同样适用——一个 API,能在提供商一托管新模型时就立即访问它,提供商标价以 0% 加价转传,并且每次请求单独配置故障转移。与此同时,与此模型结构相关的 DeepSeek 系列模型已经可以通过这种方式调用了:DeepSeek V4 Flash 和 DeepSeek V4 Pro 都已在一个密钥下上线,同样不加价,也支持每请求故障转移——这是一个合理的参照点,用以判断像 dots3-note preview 这样拥有 160 亿活跃参数的智能体模型在生产环境中的实际表现。

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash (www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731), the released DeepSeek-generation model whose MLA + sparse-attention family dots-note-3.0 is structurally related to.

接下来看什么

四件事,大致按它们可能改变局面的程度排序:

• 42/42 的独立复现。权重已公开;对 IMO 结果的首次严肃第三方复跑——或与之相矛盾的中立评估包——是本发布能产生的最高价值数据点。在那之前,42/42 仍然是一项经官方评分、由公司报告的成绩。

• 更大的兄弟型号,jazz 和 aria。dots3-note 预览版是首个公开发布版本,据公司称,也是 dots3 家族中最轻量的成员。如果 280B 总参数 / 16B 激活参数是较小的那个,那么两个更大的模型才是真正检验前沿宣称的地方。

• 托管限制和预览条款。价格现已公开——在提供预览层的平台上,预览层按令牌免费——但速率限制以及预览标签是否带有特殊条款,仍将决定谁自行托管、谁调用它。

• 它在独立排行榜上的排名。供应商报告的 ARC-AGI 和 agent-suite 声明需要中立测评才能成为可用的事实——这正是今年每一次开源发布中区分炒作与现实的同一过程。

当我们八月份报道这次泄露时,诚实的总结很简短:真实架构、真实记录、没有权重、没有日期。这四个限定条件中已有三个不复存在。架构公开了,记录附在可下载的检查点上,日期也已到来。剩下的就是验证——既然 dots3-note 预览版现在可以运行,而不仅仅是阅读介绍,小红书是否真的构建了它所宣称的智能体模型,答案将来自任何拥有八块 H100 和一套基准测试工具的人,而不是来自拉取请求。