
dots-note-3.0: Mô hình IMO 42/42 bị rò rỉ qua một PR của vLLM hiện đã được mã nguồn mở
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Vào ngày 14 tháng 8 năm 2026, dots-note-3.0 không còn là một bản rò rỉ. Phòng thí nghiệm Mô hình Dots của Xiaohongshu đã mã nguồn mở mô hình công khai đầu tiên trong gia đình dots3 của mình dưới dạng bản xem trước dots3-note — 280 tỷ tham số (16 tỷ hoạt động), cửa sổ ngữ cảnh 512K, giấy phép Apache-2.0 — tám ngày sau khi một yêu cầu kéo vLLM làm rò rỉ kiến trúc của mô hình trước khi phát hành. Các trọng số nằm trên Hugging Face, mã nguồn nằm trên GitHub, và checkpoint chính thức đạt 42/42 tại Kỳ thi Olympic Toán học Quốc tế 2026 lần đầu tiên có thể chạy được bởi bất kỳ ai.
Bản phát hành đó trả lời mọi câu hỏi còn bỏ ngỏ mà bài viết về rò rỉ ngày 6 tháng 8 của blog này để lại — kích thước, độ dài ngữ cảnh, giấy phép, đường dẫn Hugging Face, ngày phát hành — và biến một câu chuyện kiểu "những gì chúng ta biết cho đến nay" thành một câu chuyện có thể kiểm chứng. Phần tiếp theo là cập nhật: những gì đã phát hành, cấu hình được phát hành xác nhận điều gì về kiến trúc mà PR lần đầu tiên tiết lộ, điều gì giờ đây có thể xác minh độc lập, và điều gì vẫn chỉ là tuyên bố của nhà cung cấp.
Từ một PR nháp đến một checkpoint công khai
Thông tin rò rỉ, nói ngắn gọn: vào ngày 6 tháng 8 năm 2026, một người đóng góp có biệt danh KurodaKanbei — tự nhận là nghiên cứu sinh tiến sĩ tại ETH Zürich, không phải nhân viên Xiaohongshu — đã mở pull request #51255 của vllm-project/vllm để thêm hỗ trợ cho mô hình ngôn ngữ "Dots3 NOTE". Cờ nháp đã được gỡ vào ngày 7 tháng 8 lúc 13:55 UTC, và các ghi chú xác thực của chính PR là manh mối: tác giả đã chạy một dịch vụ 8-GPU DP8/EP8 "với một checkpoint FP8 Dots3 NOTE." Bạn không thể xác thực một checkpoint FP8 mà bạn không có — người viết PR đó chắc chắn đã có mô hình thật. PR đã chỉnh sửa 14 tệp, bao gồm một module mới vllm/models/dots3_note, và mang các nhãn new-model và verified.
Mỗi một trong bốn dấu hiệu chúng tôi đã liệt kê vào ngày 8 tháng 8 giờ đây đều đã ứng nghiệm, ngoại trừ cái quan trọng nhất. Kho lưu trữ Hugging Face đã xuất hiện — dots-studio/dots3-note-prev, Apache-2.0. Thông báo chính thức đã được đưa ra — chính bản phát hành mã nguồn mở, hôm nay. Ngăn xếp suy luận không còn là bản nháp nữa: hỗ trợ vLLM đã được tích hợp sẵn trên main, và cả transformers lẫn SGLang đều hỗ trợ dots3-note. Dấu hiệu thứ tư, xác minh độc lập kết quả toán 42/42, vẫn còn đang chờ — và giờ đây nó có thể được thực hiện theo cách chưa từng có trước đây, vì các trọng số đã được công khai.
![Screenshot of the vLLM GitHub pull request #51255 titled 'Draft: [Model] Add Dots3 NOTE language model support', opened August 6, 2026 by KurodaKanbei — the draft PR that first revealed the dots-note-3.0 architecture (hybrid DSA full-attention + sliding-window MLA layers).](https://cms.orcarouter.ai/api/media/file/2-11.png)
Những gì thực sự đã được phát hành
Bản model card được phát hành đã biến những suy luận trong PR thành một bảng thông số kỹ thuật — và các con số đến từ chính cấu hình của checkpoint, không phải từ bản tóm tắt bên thứ ba. Bản xem trước dots3-note là một mô hình mixture-of-experts:
• 280B tổng / 16B tham số hoạt động — 256 expert được định tuyến cùng 1 expert dùng chung, định tuyến top-8, trên 1 lớp dense + 45 lớp MoE với kích thước ẩn 5,120.
• Cửa sổ ngữ cảnh 512K token, từ vựng 152K, độ chính xác BF16 và FP8.
• Mô-đun dự đoán đa token (MTP) — một lớp dùng chung có 1,13B tham số dự đoán song song tối đa ba token bổ sung, đây chính là cơ chế hỗ trợ giải mã suy đoán mà không cần mô hình nháp riêng.
Đầu vào đa phương thức — văn bản, hình ảnh, video và âm thanh — tạo ra đầu ra dạng văn bản. Bộ mã hóa thị giác là MoE ViT (tổng 7B / 1.2B hoạt động) và bộ mã hóa âm thanh là dense 800M.
Ghi chú phạm vi của PR cho biết công việc vLLM chỉ bao gồm "phần LLM", còn các thành phần đa phương thức nằm ngoài phạm vi. Điều đó nói về bản vá suy luận, không phải về mô hình: checkpoint được phát hành đi kèm các bộ mã hóa thị giác và âm thanh cùng với phần lõi ngôn ngữ. Nếu bạn muốn phiên bản đa phương thức, bạn đang nhìn vào cùng một repo, được phục vụ qua các đường dẫn transformers và SGLang thay vì đường dẫn chỉ-LLM của vLLM bị rò rỉ trước.
Về tính khả dụng, cụ thể: các trọng số nằm tại dots-studio/dots3-note-prev trên Hugging Face dưới giấy phép Apache-2.0; mã nguồn và các công thức phục vụ nằm trong kho lưu trữ studio-dots-ai/dots3-note-prev trên GitHub; và quyền truy cập trực tuyến được cung cấp thông qua cổng API riêng của nhà cung cấp cùng với một số nền tảng bên thứ ba. Đây là bản phát hành trọng số mở đầu tiên của dòng dots3 — cụm từ "open-sourcing soon" (近期将开源) mà Xiaohongshu đã sử dụng trong hai tuần, theo các tuyên bố bằng tiếng Trung của họ, nay đã được hiện thực hóa.
Kiến trúc mà rò rỉ đã xác định đúng
PR đã mô tả dots-note-3.0 là "có cấu trúc liên quan đến DeepSeek-V3.2" nhưng với sự pha trộn của hai hình học attention trong cùng một stack. Cấu hình được công bố xác nhận điều này. Thẻ mô hình chia 46 lớp attention thành 13 lớp sparse-attention (DSA) kiểu DeepSeek — với cơ chế lập chỉ mục top-2048 — và 33 lớp sliding-window attention (SWA), gần như một lớp sparse cho mỗi ba lớp dense. Đó chính là cấu trúc "nhảy giữa sparse toàn cục và dense cục bộ" mà tên nhánh note-hopper đã gợi ý, giờ đây đã được ghi ngay trong chính checkpoint.
{{1}}Về mặt cơ chế, đây cũng chính là ý tưởng mà DeepSeek đã giới thiệu cùng V3.2:{{/1}} {{2}}nửa DSA là một bộ lập chỉ mục nhẹ, chấm điểm từng khóa trong bộ nhớ đệm so với truy vấn, giữ lại danh sách rút gọn top-k, rồi tính attention trên danh sách đó thay vì trên toàn bộ ngữ cảnh — cắt giảm chi phí bậc hai của các chuỗi dài xuống gần như tuyến tính.{{/2}} {{3}}Nửa cửa sổ trượt đóng vai trò đối trọng:{{/3}} {{4}}một khoảng attention cục bộ dày đặc có giới hạn, đảm bảo các token gần nhất luôn được attention đầy đủ, bất kể bộ lập chỉ mục thưa quyết định ra sao.{{/4}} {{5}}Việc kết hợp attention thưa toàn cục với attention cục bộ dày đặc trong cùng một mô hình chính là điểm thực sự bất thường của thông tin rò rỉ — và giờ đây nó đã là phần được xác nhận.{{/5}}
Phần còn lại của bản thiết kế là cơ chế quen thuộc thuộc dòng DeepSeek, như PR đã nêu: một bộ định tuyến MoE không phân nhóm, MoE song song theo chuỗi, prefill theo khối cho ngữ cảnh dài được kiểm chứng trên toàn bộ cửa sổ 512K, và một lớp MTP mặc định sử dụng loại chú ý cửa sổ trượt cho giải mã suy đoán.
Kỷ lục 42/42 — và điều giờ đây có thể kiểm chứng
Kết quả IMO tự nó không thay đổi, và việc gán nhãn cũng không thay đổi. Vào ngày 25 tháng 7 năm 2026, Xiaohongshu công bố rằng mô hình đã đạt điểm tuyệt đối 42/42 trong kỳ chấm điểm chính thức của Kỳ thi Olympic Toán học Quốc tế lần thứ 67 tại Thượng Hải, nơi chỉ có 7 trong số 666 thí sinh con người đạt được kết quả tương đương và ngưỡng huy chương vàng là 29 — vượt ngưỡng huy chương vàng 13 điểm và cao hơn 7 điểm so với thành tích 35/42 của Gemini Deep Think, kết quả AI tốt nhất trước đó trong kỳ chấm điểm IMO chính thức. Đó vẫn là lời tường thuật của công ty về một kỳ thi được chấm điểm chính thức: điểm số là thật và đã được hội đồng xác minh, nhưng những tuyên bố xung quanh — cách tiếp cận đề bài, cách kiểm soát việc lấy mẫu và chấm điểm — chưa bao giờ được kiểm toán độc lập, vì không ai bên ngoài phòng thí nghiệm có thể chạy mô hình.
Đó là phần mà bản phát hành này thay đổi. Với việc công bố trọng số, con số 42/42 không còn là một con số phải tin tưởng một cách mù quáng hay dựa vào lời của một pull request; nó là một kết quả mà bên thứ ba có thể cố gắng tái tạo, và đó là điều có thể kiểm chứng có giá trị cao nhất về bản phát hành này. Nó cũng vẫn còn bị tranh cãi ở các khía cạnh ngoài lề theo cách tương tự như hai tuần trước: Các hãng truyền thông Trung Quốc đưa tin rằng Celia của Huawei cũng đạt 42/42 trong cùng bài chấm điểm, vì vậy dots-note-3.0 là một trong những cái đầu tiên chứ không phải là cái đầu tiên; và tuyên bố trên X của một đối tác Menlo Ventures rằng OpenAI, Anthropic, Axiom Math và Kimi K3 của Moonshot cũng đạt 42/42 trong năm nay vẫn chỉ là một bài đăng mạng xã hội chưa được xác minh, không có hồ sơ chấm điểm đằng sau.
Công ty cũng công bố các tuyên bố benchmark mới cùng với bản phát hành, tất cả đều do nhà cung cấp báo cáo và chưa được tái lập cho đến nay. Trên benchmark ARC-AGI 3, Dots cho biết bản xem trước dots3-note đạt khoảng 0,35 với chi phí test-time được báo cáo là dưới 500 đô la. Trên các bộ benchmark reasoning và agent bao gồm WebShop, HotpotQA và ALFWorld, họ tuyên bố mô hình này ngang bằng hoặc tốt hơn các mô hình có số tham số hoạt động lớn gấp nhiều lần, với khả năng vision nổi bật ở kích thước của nó. Đó là những con số của Dots về chính mô hình của họ — hãy coi chúng đúng như vậy cho đến khi một phòng thí nghiệm trung lập chạy lại.
{{1}}Dots cũng đã phát hành hai bộ khung đánh giá mà họ xây dựng cho loại tác vụ này{{/1}}, {{2}}và việc mã nguồn mở hóa chúng gần như hữu ích ngang với chính mô hình{{/2}}. {{3}}VibeLifeBench chạy 200 tác vụ trên 22 dịch vụ mô phỏng và 288 giao diện công cụ, kiểm tra 1.247 điều kiện nguyên tử về việc liệu một tác nhân có duy trì tính nhất quán khi môi trường thay đổi giữa chừng hay không{{/3}}; {{4}}theo kết quả do chính Dots công bố, mô hình mạnh nhất được thử nghiệm cho đến nay chỉ đạt 32,5 avg@3{{/4}}, {{5}}và hầu hết các mô hình đóng quyền truy cập hàng đầu đều thất bại hoàn toàn{{/5}}. {{6}}VibeSearchBench hẹp hơn — 20 lĩnh vực, 200 tác vụ, kiểm tra việc liệu một tác nhân có yêu cầu làm rõ khi một yêu cầu mơ hồ hay không{{/6}}. {{7}}Cả hai đều mang nhãn do nhà cung cấp báo cáo giống như con số ARC-AGI{{/7}}, {{8}}nhưng các bộ khung này là công khai, điều này khiến con số 32,5 có thể bác bỏ được thay vì chỉ mang tính tu từ{{/8}}.
Tại sao đây là mô hình tác tử, không phải mô hình toán học.
Cả rò rỉ lẫn điểm IMO đều không nên đánh lừa bạn về mục đích của mô hình này. Định vị của bản phát hành không nằm ở toán học — mà nằm ở các tác vụ dài hạn, kết thúc mở: lên kế hoạch du lịch cá nhân hóa, quy trình chuẩn bị đám cưới, vận hành một cửa hàng nhỏ, cải tạo nhà. Những tác vụ không có một đáp án đúng duy nhất, mục tiêu thay đổi giữa chừng, và thời gian tính bằng giờ hoặc ngày. Đó là một bộ benchmark cố ý khác biệt so với các bảng xếp hạng toán và lập trình, và chính tại đây các lựa chọn thiết kế dots3-note — ngữ cảnh 512K, tệp bộ nhớ, vòng lặp tự phản biện — thực sự phát huy tác dụng.
Ba kỹ thuật nổi bật trong tài liệu được công bố. Thứ nhất, {{1}}mô hình duy trì một tệp bộ nhớ (memory.md) như một bản tóm tắt môi trường được cập nhật liên tục, qua đó nó lưu giữ trạng thái xuyên suốt một phiên làm việc dài và mở{{/1}}. Thứ hai, {{2}}nó sử dụng cơ chế "tự phê bình" — cũng chính là cách tự đánh giá đệ quy mà lời giải IMO được mô tả là đã dùng — để đánh dấu và sửa chữa các bước trung gian của chính nó{{/2}}. Thứ ba, {{3}}công thức huấn luyện được đặt tên là TEMPO (Ước tính Giá trị co giãn theo thời gian kiểm thử với Tối ưu hóa Chính sách theo Bước vĩ mô): mô hình chia các quỹ đạo dài thành các bước vĩ mô và luân phiên giữa vai trò actor và critic để tự tạo ra tín hiệu huấn luyện, đây là lý do được báo cáo giải thích vì sao nó có thể được tối ưu hóa trên các nhiệm vụ không có đáp án chuẩn (ground truth){{/3}}.
{{1}}Các bản demo thực hành của nhà cung cấp chính là điểm nhấn của tuyên bố: chơi game xây bộ bài Slay the Spire II tới tầng 33, giải cả sáu cấp độ ARC-AGI 3 trong 320 bước, xử lý một bài toán suy luận không gian về cải tạo nhà, và xây dựng một ứng dụng visionOS từ đầu đến cuối (12 tệp Swift, 1.876 dòng, "BUILD SUCCEEDED").{{/1}} Hãy coi đó là các màn trình diễn, không phải điểm chuẩn — nhưng chúng là các màn trình diễn của một điều cụ thể: {{2}}một mô hình luôn giữ một mục tiêu trong đầu và thực hiện nhiều bước mà không bị lạc hướng{{/2}}, đây chính là năng lực mà {{3}}thị trường agent hiện đang thiếu hụt nhất{{/3}}.
Chi phí, tự lưu trữ và cách dùng thử
Các trọng số mở là miễn phí; chi phí của bản xem trước dots3-note nằm ở nơi bạn phục vụ nó. Công thức vLLM tham chiếu cho checkpoint FP8 chạy trên tám NVIDIA H100 với tensor parallelism 8 và expert parallelism 8 — một mức kinh phí thực sự, không phải mô hình laptop. Các đội có phần cứng loại đó sẽ nhận được toàn bộ stack, bao gồm giải mã suy đoán MTP 3 token và bộ phân tích cú pháp lời gọi công cụ dots mà các runtime đi kèm. Mọi người còn lại sẽ dùng qua hình thức hosted: cổng API của nhà cung cấp đã hoạt động, và các endpoint xem trước được lưu trữ đã lên sóng trên các nền tảng bên thứ ba cùng ngày các trọng số được tung ra — 14 tháng 8. Bậc xem trước được niêm yết ở mức $0 mỗi token trên các nền tảng phục vụ nó, theo danh sách của chính các nền tảng đó chứ không phải trang giá của nhà cung cấp, vì vậy chi phí ban đầu để thử dots3-note preview trong sản xuất hôm nay gần như bằng không trong khi nhãn preview còn hiệu lực.
Đối với các nhà phát triển, lập luận từ hai tuần trước về việc đặt cược rẻ vào một mô hình chưa được kiểm chứng giờ đây được hiểu như lập luận về việc đánh giá một mô hình vừa mới phát hành — khuôn mẫu là giống hệt. Hãy hướng một phần lưu lượng đến mô hình mới, với cơ chế chuyển đổi dự phòng tự động phía sau, để một dạng lỗi bất ngờ chỉ làm sập đường thử nghiệm thay vì đường production. Đó chính là mục đích của một router, và đó là phiên bản trung thực của lời chào hàng: bản xem trước dots3-note hiện chưa được lưu trữ trên OrcaRouter tại thời điểm viết bài này, và không ai nên giả vờ điều ngược lại. Nhưng cách tiếp cận định tuyến mà chúng tôi viết trong bài về vụ rò rỉ sẽ được áp dụng ngay khi điều đó thành hiện thực — một API có thể truy cập mô hình mới ngay khi nhà cung cấp lưu trữ nó, với giá niêm yết của nhà cung cấp được truyền thẳng với mức chênh lệch 0% và chuyển đổi dự phòng được cấu hình theo từng yêu cầu. Trong lúc đó, các mô hình thuộc họ DeepSeek có liên quan về mặt cấu trúc với mô hình này đã có thể gọi theo cách đó: DeepSeek V4 Flash và DeepSeek V4 Pro đều đang hoạt động sau một khóa duy nhất, với cùng mức giá truyền thẳng và chuyển đổi dự phòng theo từng yêu cầu — một điểm tham chiếu hợp lý để đánh giá cách một mô hình agent có 16B tham số hoạt động như bản xem trước dots3-note thực sự hoạt động trong production.

Xem gì tiếp theo
Bốn điều, đại khái theo thứ tự mức độ chúng có thể thay đổi cục diện:
• Tái lập độc lập kết quả 42/42. Các trọng số đã được phát hành; lần chạy lại nghiêm túc đầu tiên bởi bên thứ ba cho kết quả IMO — hoặc một gói đánh giá trung lập mâu thuẫn với nó — là điểm dữ liệu có giá trị cao nhất mà bản phát hành này có thể tạo ra. Cho đến khi đó, 42/42 vẫn là số điểm được chấm chính thức và do công ty báo cáo.
• Những phiên bản lớn hơn, jazz và aria. {{1}}dots3-note preview là bản phát hành công khai đầu tiên và, theo công ty, là thành viên nhẹ nhất trong gia đình dots3.{{/1}} {{2}}Nếu 280B tổng / 16B hoạt động là phiên bản nhỏ, thì hai mô hình lớn hơn sẽ là nơi các tuyên bố dẫn đầu thực sự được kiểm chứng.{{/2}}
Giới hạn lưu trữ và điều khoản xem trước. Giá hiện đã được công khai — gói xem trước miễn phí theo token trên các nền tảng phục vụ nó — nhưng giới hạn tốc độ và việc nhãn xem trước có đi kèm điều khoản đặc biệt hay không vẫn sẽ quyết định ai tự lưu trữ và ai gọi API.
• Vị trí của nó trên các bảng xếp hạng độc lập. Các tuyên bố về ARC-AGI và bộ tác nhân do nhà cung cấp báo cáo cần một phép đo trung lập để trở thành dữ kiện đáng tin cậy — đó chính là quy trình đã tách biệt cường điệu khỏi thực tế trong mọi bản phát hành mở năm nay.
Khi chúng tôi đưa tin về vụ rò rỉ hồi tháng Tám, bản tóm tắt trung thực rất ngắn gọn: kiến trúc thật, hồ sơ thật, không có trọng số, không có ngày. Ba trong bốn yếu tố đó đã không còn. Kiến trúc đã được công khai, hồ sơ được đính kèm với một checkpoint có thể tải xuống, và ngày tháng đã đến. Điều còn lại là sự xác minh — và giờ đây khi bản xem trước dots3-note có thể chạy được thay vì chỉ đọc về nó, câu trả lời cho việc liệu Xiaohongshu có xây dựng được mô hình agent như họ tuyên bố hay không sẽ đến từ bất kỳ ai có tám chiếc H100 và một bộ khung đo điểm chuẩn, chứ không phải từ một pull request.
