「dots-note-3.0: vLLMのPRで流出した42/42のIMOモデル」のタイトルカード: 大きな見出し「dots-note-3.0」、サブタイトル「これまでに判明していること」、および2つのフラットアイコンカード — トロフィーラインアイコンとバッジ「公式採点」付きの「IMO 2026 · 42/42」、コードファイルラインアイコンとバッジ「アーキテクチャ流出」付きの「vLLM PR #51255」。OrcaRouterのロゴを右下に合成。
Guides & Insights

dots-note-3.0: vLLMのPRで流出した42/42 IMOモデルがオープンソース化

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年8月14日、dots-note-3.0はリークではなくなった。小紅書(Xiaohongshu)のDots Model Labは、dots3ファミリー初の公開モデルをdots3-note previewとしてオープンソース化した。2800億パラメータ(うち160億がアクティブ)、512Kのコンテキストウィンドウ、Apache-2.0ライセンスという内容だ。リリースに先立ち、vLLMのプルリクエストがモデルのアーキテクチャを漏洩してから8日後のことであった。重みはHugging Faceに、コードはGitHubに公開されており、2026年国際数学オリンピックで公式に42/42を獲得したチェックポイントは、初めて誰でも実行可能になった。

今回のリリースは、このブログの8月6日のリーク記事が未解決のまま残したすべての疑問——サイズ、コンテキスト長、ライセンス、Hugging Face上のパス、リリース日——に答えるものであり、「これまでにわかっていること」をまとめた記事を、検証可能な記事へと変える。以下がそのアップデートである:何がリリースされたのか、リリースされた設定がPRが最初に明かしたアーキテクチャについて何を裏付けるのか、今や独立に検証可能なことは何か、そしてまだベンダー自身の主張にすぎないことは何か。

ドラフトPRから公開チェックポイントへ

リークを手短に:2026年8月6日、KurodaKanbei というハンドル名のコントリビューター(本人は ETH Zürich の博士課程学生と名乗っており、Xiaohongshu の従業員ではない)が、vllm-project/vllm のプルリクエスト #51255 を開き、「Dots3 NOTE」言語モデルのサポートを追加した。ドラフトフラグが外れたのは8月7日13:55 UTCで、PR自体の検証メモが決定的な証拠だった。著者は8基のGPUによるDP8/EP8サービスを「Dots3 NOTE FP8チェックポイントを使用して」実行していた。手元にないFP8チェックポイントを検証できるはずがない——つまり、そのPRを書いた人物は実際のモデルを手にしていたのだ。このPRは14ファイルに変更を加え、新しい vllm/models/dots3_note モジュールを含み、new-model と verified のラベルが付けられていた。

8月8日に挙げた4つの兆候は、最も重要なものを除いて、今やすべて的中した。Hugging Faceのリポジトリが出現した——dots-studio/dots3-note-prev、Apache-2.0。公式発表もまた行われた——今日、オープンソースリリースそのものが。推論スタックはもはやドラフトではない。vLLMのサポートはmainブランチでネイティブ対応となり、transformersもSGLangもdots3-noteサポートを備えている。4つ目の兆候である42/42の数学結果の独立検証は、依然として未達のものだ——だが、それは以前には決してあり得なかった形で、今や可能になっている。重みが公開されているからだ。

Screenshot of the vLLM GitHub pull request #51255 titled 'Draft: [Model] Add Dots3 NOTE language model support', opened August 6, 2026 by KurodaKanbei — the draft PR that first revealed the dots-note-3.0 architecture (hybrid DSA full-attention + sliding-window MLA layers).

実際に出荷されたもの

公開されたモデルカードは、PRの推論内容をスペックシートへと変換しており、その数値は第三者の要約ではなく、チェックポイント自身の設定に由来しています。dots3-noteプレビューは、Mixture-of-Experts(MoE)モデルです:

• 合計280B / アクティブ16Bパラメータ — ルーティング先エキスパート256個と共有エキスパート1個、Top-8ルーティング、1つのデンス層+45個のMoE層、隠れサイズ5,120。

• 512Kトークンのコンテキストウィンドウ、152K語彙、BF16およびFP8精度。

• {{1}}マルチトークン予測(MTP)モジュール{{/1}}:1.13Bパラメータの共有レイヤーを1つ備え、並行して最大3つの追加トークンを予測する。これにより、別個のドラフトモデルなしで投機的デコードが可能になる。

• マルチモーダル入力 — テキスト、画像、ビデオ、オーディオ — からテキスト出力を生成。ビジョンエンコーダーはMoE ViT(合計7B / アクティブ1.2B)、オーディオエンコーダーはdense 800M。

そのPRのスコープノートには、vLLMの作業は「LLMのみ」を対象とし、マルチモーダルコンポーネントは対象外と記載されていました。それは推論パッチについての話であり、モデル自体の話ではありません。リリースされたチェックポイントには、言語コアに加えてビジョンエンコーダーとオーディオエンコーダーが同梱されています。マルチモーダル版が必要なら、同じリポジトリを、先にリークしたvLLMのLLM専用パスではなく、transformersとSGLangのパス経由で利用することになります。

具体的には、利用可能性について:重みはHugging Face上のdots-studio/dots3-note-prevにApache-2.0ライセンスで公開されており、コードとサービングレシピはGitHubのstudio-dots-ai/dots3-note-prevリポジトリにあります。また、ホストされたアクセスは、ベンダー自身のAPIポータルと、いくつかのサードパーティプラットフォームを通じて提供されています。これはdots3ファミリー初のオープンウェイトリリースです。Xiaohongshuが中国語の声明で2週間にわたって使用していた「近日オープンソース化」(近期将开源)という表現は、これによって実現されました。

リークが言い当てたアーキテクチャ

そのPRは、dots-note-3.0を「DeepSeek-V3.2と構造的に関連する」と説明していたが、1つのスタックに2種類のアテンション幾何を混在させたものだった。リリースされたconfigがそれを裏付けている。モデルカードは46のアテンション層を、top-2048インデックスを使う13のDeepSeekスタイルのスパースアテンション(DSA)層と、33のスライディングウィンドウアテンション(SWA)層に分解しており、おおよそ高密度層3つにつきスパース層1つの割合である。これこそ、ブランチ名のnote-hopperが示唆していた「スパースなグローバルと高密度なローカルの間を行き来する」構造であり、今やチェックポイント自体に書き込まれている。

構造的には、DeepSeekがV3.2で導入したのと同じアイデアだ。DSA側は軽量なインデクサーで、キャッシュされたすべてのキーをクエリに対してスコアリングし、top-kの候補リストを保持して、全コンテキストの代わりにその候補に対してアテンションを計算する。これにより、長いシーケンスの2次コストをほぼ線形に抑える。スライディングウィンドウ側は、そのカウンターウェイトとして機能する。スパースインデクサーが何を決定しようとも、直近のトークンが常に完全にアテンションされることを保証する、境界付きの密なローカルアテンションのスパンだ。同じモデル内でグローバルスパースと密なローカルを組み合わせるという点こそ、リーク情報の中でも真に異例な部分だった——そして今やそれが確認された部分となった。

設計図の残りの部分は、PRが述べたように、おなじみのDeepSeekファミリーの仕組みです。グループ化されていないMoEルーター、シーケンス並列MoE、完全な512Kウィンドウまで検証された長コンテキストのチャンク化プレフィル、そして投機的デコード用にデフォルトでスライディングウィンドウアテンションタイプを使用するMTPレイヤーです。

42/42の記録 — そして今や確認できるもの

IMOの結果自体は変わらず、ラベル付けも変わりません。2026年7月25日、Xiaohongshuは、第67回国際数学オリンピック(上海開催)の公式採点において、モデルが42/42の満点を獲得したと発表しました。この大会では、666人の人間の参加者のうちわずか7人が同じ結果を達成し、金賞の基準点は29点でした。これは金賞を13点上回り、公式なIMO採点における従来の最高AI成績であるGemini Deep Thinkの35/42を7点上回るものです。このことは、公式に採点されたコンテストに関する同社の説明のままです。スコアは本物で、委員会によって検証されていますが、周辺の主張——問題へのアクセス方法、サンプリングと採点の管理方法——は、独立に監査されたことがありません。研究所の外部の誰もそのモデルを実行できなかったからです。

これが今回のリリースで変わる部分です。重みが公開されたことで、42/42はもはや信仰やプルリクエストの記述を鵜呑みにする数字ではなく、第三者が再現を試みることのできる結果となりました。そしてそれがこのリリースで検証可能な最も価値の高い点です。また、2週間前と同じ形で、細部では依然として異論が残っています。中国のメディアはファーウェイのCeliaも同じ採点で42/42を獲得したと報じており、dots-note-3.0は最初の一つであって、唯一の最初ではありません。また、Menlo VenturesのパートナーがXに投稿した「OpenAIAnthropic、Axiom Math、MoonshotのKimi K3も今年42/42を達成した」という主張は、依然として裏付けとなる採点記録のない未検証のソーシャル投稿です。

同社はリリースと同時に新たなベンチマーク結果も発表したが、これらはすべてベンダー自身による報告で、これまでのところ再現検証されていない。ARC-AGI 3ベンチマークでは、Dotsはdots3-note previewがテスト時コスト500ドル未満で約0.35のスコアを出すと報告している。WebShop、HotpotQA、ALFWorldを含む推論・エージェントスイートでは、同モデルはアクティブパラメータ数が数倍のモデルと同等かそれ以上であり、同サイズとしては際立ったビジョン性能を持つと主張している。これらはDotsが自社モデルについて示した数字であり、中立なラボが再実行するまではそのように扱うべきだ。

Dotsはまた、この種のタスク向けに構築した2つの評価ハーネスを公開した。これらをオープンソース化することは、モデル自体とほぼ同等に有用である。VibeLifeBenchは22のシミュレーションサービスと288のツールインターフェースにわたる200タスクを実行し、タスク途中で環境が変化した際にエージェントが一貫性を維持するかどうかを1,247の原子的条件でチェックする。Dots自身の結果によると、これまでにテストされた最強モデルでもavg@3でわずか32.5点にとどまり、主要なクローズドウェイトモデルのほとんどは完全に失敗する。VibeSearchBenchはより狭く、20ドメイン・200タスクで、リクエストが曖昧な場合にエージェントが明確化を求めるかどうかをテストする。どちらもARC-AGIの数値と同じベンダー報告ラベルを帯びているが、ハーネスが公開されているため、32.5という数字はレトリックではなく反証可能なものとなっている。

なぜこれはエージェントモデルであって、数学モデルではないのか

リークもIMOスコアも、このモデルが何のためにあるのかを誤解させてはならない。このリリースの位置づけは数学ではない。長期的な視野を必要とする、答えが一つに定まらないタスクだ。つまり、パーソナライズされた旅行計画、結婚式の準備ワークフロー、小規模店舗の運営、住宅リノベーションといったものだ。正解が単一でなく、タスクの途中で目標が変わり、数時間から数日に及ぶ時間スケールのタスクである。これは、数学・コーディングのリーダーボードとは意図的に異なるベンチマークセットであり、そここそが、dots3-noteの設計上の選択肢——512Kコンテキスト、メモリファイル、自己批判ループ——が実際に効果を発揮する場である。

公開された資料の中で、3つの手法が際立っている。第一に、このモデルはメモリファイル(memory.md)を実行中の環境サマリーとして維持しており、これが長く制約のないセッション全体にわたって状態を引き継ぐ仕組みとなっている。第二に、「自己批判」メカニズムを使用している——IMOの解答で説明されていたものと同じ再帰的セルフレビュー——これにより、自身の中間ステップにフラグを立てて修正する。第三に、トレーニング手法はTEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization)と名付けられている。このモデルは長い軌跡をマクロステップに分割し、アクターとクリティックの役割を交互に担うことで、自身のトレーニング信号を生成する。これが、正解(グラウンドトゥルース)が存在しないタスクでも最適化できると報告されている理由である。

ベンダーのハンズオンデモは、その主張の具体例を示している。デッキ構築ゲーム『Slay the Spire II』を33階までプレイし、ARC-AGI 3の全6レベルを320ステップで解き、住宅リノベーションの空間推論問題を順を追って検証し、visionOSアプリをエンドツーエンドで構築する(Swiftファイル12個、1,876行、"BUILD SUCCEEDED")。これらはベンチマークではなくデモとして扱うべきだ。しかし、それらが示しているのは特定の能力、すなわち一つの目標を念頭に置き、途中で見失うことなく多くのステップを実行できるモデルであり、これは現在エージェント市場が最も不足している能力である。

コスト、セルフホスティング、そして試す方法

オープンウェイトは無料です。dots3-noteプレビューのコストは、それをどこで運用するかにかかっています。FP8チェックポイント向けのリファレンスvLLMレシピは、テンソル並列度8、エキスパート並列度8で8枚のNVIDIA H100上で動作します。これは現実の予算ラインであり、ノートパソコン向けのモデルではありません。そのようなハードウェアを持つチームは、3トークンのMTP投機的復号や、ランタイムに同梱されているdotsツール呼び出しパーサーを含むスタック全体を手に入れられます。それ以外の全員は、ホストされた形で利用することになるでしょう。ベンダーのAPIポータルは稼働しており、ホストされたプレビューエンドポイントは、ウェイトが公開された同日(8月14日)にサードパーティプラットフォーム上で稼働を開始しました。プレビューティアは、それを提供するプラットフォーム上ではトークンあたり$0と記載されています。これはベンダーの価格ページではなく、各プラットフォーム自身の記載に基づくものです。そのため、現在本番環境でdots3-noteプレビューを試すための初期コストは、プレビュータグが続く限り事実上ゼロです。

ビルダーにとって、2週間前に「未検証のモデルに安く賭ける」という論点は、今や「出荷されたばかりのモデルを評価する」という論点として読める — パターンはまったく同じだ。自動フェイルオーバーの背後で、新モデルへトラフィックの一部を向ける。そうすれば、想定外の障害モードが発生しても、本番パスではなくテストパスが落ちるだけで済む。それがルーターの役割であり、この提案の正直な形だ。本稿執筆時点で、dots3-note preview は OrcaRouter 上でホストされておらず、誰もそうでないふりをするべきではない。しかし、リーク記事で述べたルーティングの姿勢は、それが実現した日に適用される — プロバイダーがホストした瞬間に新モデルへ到達できる単一のAPI、プロバイダーのリスト価格を0%マークアップで透過させ、リクエストごとにフェイルオーバーを設定するものだ。その間、このモデルと構造的に関連するDeepSeekファミリーのモデルは、すでにその方法で呼び出し可能だ。DeepSeek V4 Flash と DeepSeek V4 Pro はどちらも単一のキーで稼働しており、同じ透過価格設定とリクエストごとのフェイルオーバーを備えている — dots3-note preview のようなアクティブパラメータ16Bのエージェントモデルが本番環境で実際にどう動作するかを判断するための、妥当な参考点だ。

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash (www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731), the released DeepSeek-generation model whose MLA + sparse-attention family dots-note-3.0 is structurally related to.

次に見るもの

4つのこと、それがどれほど状況を変え得るかのおおよその順に並べると:

• 独立した再現は 42/42。重みは公開されており、IMO の結果に対する最初の本格的な第三者による再実行、またはそれに反駁する中立の評価パッケージが、このリリースが生み出せる最も価値の高い単一のデータポイントである。それまでは、42/42 は公式に採点され、企業が報告したスコアのままである。

• より大きな兄弟モデルであるjazzとaria。dots3-noteプレビューは最初の公開リリースであり、同社によると、dots3ファミリーの中で最も軽量なモデルです。280B合計/16Bアクティブが小さい方であれば、より大きな2つのモデルこそが、フロンティアの主張が実際に試される場となるでしょう。

• ホスト型の制限とプレビュー条件。価格は現在公開されている — プレビュー層は、それを提供するプラットフォームではトークンあたり無料 — だが、レート制限と、プレビュータグに特別な条件が付くかどうかは、依然として誰がセルフホストし、誰が呼び出すのかを左右する。

• 独立したリーダーボードのどこに位置するか。ベンダーが報告するARC-AGIやエージェントスイートの主張は、有用な事実となるためには中立的な測定が必要である——これは、今年のあらゆるオープンリリースで誇大広告と現実を区別してきたのと同じプロセスである。

8月にリークを報じた際、正直な要約は短いものだった。本物のアーキテクチャ、本物の記録、重みなし、日付なし。その4つの条件のうち3つはもう当てはまらない。アーキテクチャは公開され、記録はダウンロード可能なチェックポイントに紐づけられ、日付も到来した。残るのは検証だけだ。そして今や、dots3-noteプレビューは読むだけでなく実際に実行できる。Xiaohongshuが主張するエージェントモデルを本当に構築したのかという答えは、プルリクエストからではなく、H100を8枚とベンチマークハーネスを持つ誰からでも得られるだろう。