
dots-note-3.0: Model IMO 42/42 yang Dibocorkan melalui PR vLLM Kini Bersumber Terbuka
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Pada tanggal 14 Agustus 2026, dots-note-3.0 tidak lagi menjadi sebuah kebocoran. Dots Model Lab milik Xiaohongshu merilis open-source model publik pertama dalam keluarga dots3-nya sebagai pratinjau dots3-note — 280 miliar parameter (16 miliar aktif), jendela konteks 512K, dilisensikan Apache-2.0 — delapan hari setelah sebuah pull request vLLM membocorkan arsitektur model tersebut sebelum perilisan. Bobotnya ada di Hugging Face, kodenya di GitHub, dan checkpoint yang secara resmi mencetak 42/42 di Olimpiade Matematika Internasional 2026, untuk pertama kalinya, dapat dijalankan oleh siapa pun.
Rilis tersebut menjawab setiap pertanyaan terbuka yang masih menggantung dari artikel kebocoran blog pada 6 Agustus — ukuran, panjang konteks, lisensi, jalur Hugging Face, tanggal rilis — dan mengubah cerita "apa yang kita ketahui sejauh ini" menjadi sesuatu yang bisa diverifikasi. Berikut ini adalah pembaruannya: apa yang dirilis, apa yang dikonfirmasi oleh konfigurasi yang dirilis mengenai arsitektur yang pertama kali diungkap PR tersebut, apa yang kini dapat diverifikasi secara independen, dan apa yang masih merupakan klaim dari vendor itu sendiri.
Dari draft PR hingga checkpoint publik
Kebocorannya, singkatnya: pada 6 Agustus 2026, seorang kontributor dengan nama KurodaKanbei — yang mengaku sebagai mahasiswa PhD ETH Zürich, bukan karyawan Xiaohongshu — membuka pull request #51255 di vllm-project/vllm yang menambahkan dukungan untuk model bahasa "Dots3 NOTE". Bendera draf dihapus pada 7 Agustus pukul 13:55 UTC, dan catatan validasi PR itu sendiri yang menjadi petunjuk: penulisnya telah menjalankan layanan DP8/EP8 dengan 8 GPU "dengan checkpoint FP8 Dots3 NOTE." Anda tidak dapat memvalidasi checkpoint FP8 yang tidak Anda miliki — siapa pun yang menulis PR itu memiliki model aslinya. PR tersebut menyentuh 14 file, termasuk modul vllm/models/dots3_note baru, dan membawa label new-model dan verified.
Masing-masing dari empat tanda yang kami daftarkan pada 8 Agustus kini telah terpicu, kecuali yang paling penting. Repo Hugging Face muncul — dots-studio/dots3-note-prev, Apache-2.0. Pengumuman resmi telah tiba — rilis sumber terbuka itu sendiri, hari ini. Tumpukan inferensi tidak lagi berupa draf: dukungan vLLM sudah native di main, dan transformers serta SGLang sama-sama membawa dukungan dots3-note. Tanda keempat, verifikasi independen atas hasil matematika 42/42, adalah satu yang masih belum selesai — dan sekarang hal itu menjadi mungkin dengan cara yang belum pernah ada sebelumnya, karena bobotnya bersifat publik.
![Screenshot of the vLLM GitHub pull request #51255 titled 'Draft: [Model] Add Dots3 NOTE language model support', opened August 6, 2026 by KurodaKanbei — the draft PR that first revealed the dots-note-3.0 architecture (hybrid DSA full-attention + sliding-window MLA layers).](https://cms.orcarouter.ai/api/media/file/2-11.png)
Apa yang sebenarnya dirilis
Kartu model yang dirilis mengubah inferensi PR menjadi lembar spesifikasi — dan angka-angkanya berasal dari konfigurasi checkpoint itu sendiri, bukan dari ringkasan pihak ketiga. dots3-note preview adalah model mixture-of-experts:
• Total 280B / 16B parameter aktif — 256 eksper terutekan ditambah satu eksper bersama, perutean top-8, pada 1 lapisan dense + 45 lapisan MoE dengan ukuran hidden 5.120.
• Jendela konteks 512K token, kosakata 152K, presisi BF16 dan FP8.
• Modul prediksi multi-token (MTP) — satu lapisan bersama dengan 1,13 miliar parameter yang memprediksi hingga tiga token tambahan secara paralel, yang mendukung decoding spekulatif tanpa model draf terpisah.
• Masukan multimodal — teks, gambar, video, dan audio — menghasilkan keluaran teks. Encoder visi adalah MoE ViT (total 7B / 1.2B aktif) dan encoder audio adalah dense 800M.
Catatan ruang lingkup PR tersebut mengatakan bahwa pekerjaan vLLM mencakup "hanya LLM," dengan komponen multimodal di luar ruang lingkup. Itu tentang patch inferensi, bukan modelnya: checkpoint yang dirilis menyertakan encoder visual dan audio bersama dengan inti bahasa. Jika Anda menginginkan versi multimodal, Anda melihat repo yang sama, dilayani melalui jalur transformers dan SGLang, bukan jalur khusus-LLM vLLM yang bocor lebih dulu.
Ketersediaan, secara konkret: bobot berada di dots-studio/dots3-note-prev di Hugging Face di bawah lisensi Apache-2.0; kode dan resep serving ada di repositori studio-dots-ai/dots3-note-prev di GitHub; dan akses yang di-hosting tersedia melalui portal API milik vendor itu sendiri serta beberapa platform pihak ketiga. Ini adalah rilis open-weight pertama dari keluarga dots3 — frasa "open-sourcing soon" (近期将开源) yang selama dua minggu digunakan Xiaohongshu, menurut pernyataan berbahasa Tionghoa-nya, telah terpenuhi.
Arsitektur yang Tepat Menurut Bocoran
PR tersebut mendeskripsikan dots-note-3.0 sebagai "secara struktural terkait dengan DeepSeek-V3.2" tetapi dengan campuran dua geometri attention dalam satu tumpukan. Konfigurasi yang dirilis mengonfirmasi hal ini. Kartu model memecah 46 lapisan attention menjadi 13 lapisan sparse-attention (DSA) ala DeepSeek — dengan pengindeksan top-2048 — dan 33 lapisan sliding-window attention (SWA), kira-kira satu lapisan sparse untuk setiap tiga lapisan dense. Itulah struktur "lompatan antara global sparse dan lokal dense" yang diisyaratkan oleh nama cabang note-hopper, kini tertulis di dalam checkpoint itu sendiri.
Secara mekanis, ini adalah ide yang sama yang diperkenalkan DeepSeek dengan V3.2: bagian DSA adalah pengindeks ringan yang memberi skor pada setiap kunci yang di-cache terhadap kueri, menyimpan daftar pendek top-k, dan menghitung perhatian atas itu alih-alih seluruh konteks — mengurangi biaya kuadrat dari urutan panjang menjadi kira-kira linear. Bagian sliding-window adalah penyeimbang: rentang terbatas dari perhatian lokal padat yang menjamin token-token terbaru selalu diperhatikan sepenuhnya, apa pun yang diputuskan oleh pengindeks sparse. Sparse global plus lokal padat, dalam model yang sama, adalah bagian yang benar-benar tidak biasa dari bocoran itu — dan sekarang menjadi bagian yang terkonfirmasi.
Sisa dari cetak biru ini {{1}}merupakan mekanisme khas keluarga DeepSeek{{/1}}, seperti yang disebutkan dalam PR: {{2}}router MoE tanpa pengelompokan{{/2}}, {{3}}MoE paralel sekuens{{/3}}, {{4}}prefill terpotong konteks panjang yang divalidasi hingga jendela 512K penuh{{/4}}, dan lapisan MTP yang secara bawaan menggunakan tipe perhatian jendela geser untuk decoding spekulatif.
Rekor 42/42 — dan apa yang kini dapat diperiksa
Hasil IMO itu sendiri tidak berubah, dan begitu pula pelabelannya. Pada 25 Juli 2026, Xiaohongshu mengumumkan bahwa model tersebut mencetak sempurna 42/42 dalam penilaian resmi Olimpiade Matematika Internasional ke-67 di Shanghai, di mana hanya 7 dari 666 kontestan manusia yang menyamai hasil tersebut dan batas emas adalah 29 — 13 poin di atas emas dan 7 poin di atas 35/42 milik Gemini Deep Think, hasil AI terbaik sebelumnya dalam penilaian IMO resmi. Itu tetap menjadi catatan perusahaan tentang kontes yang dinilai secara resmi: skor tersebut nyata dan diverifikasi komite, tetapi klaim-klaim di sekitarnya — bagaimana soal diakses, bagaimana pengambilan sampel dan penilaian dikendalikan — tidak pernah diaudit secara independen, karena tidak ada orang di luar lab yang bisa menjalankan model tersebut.
Itulah bagian yang diubah oleh rilis ini. Dengan bobot yang dipublikasikan, angka 42/42 tidak lagi sekadar angka yang dipercaya begitu saja atau berdasarkan kata-kata dalam sebuah pull request; ini adalah hasil yang dapat dicoba untuk direproduksi oleh pihak ketiga, dan itulah hal yang paling berharga untuk diverifikasi dari rilis ini. Rilis ini juga masih diperdebatkan di bagian-bagian pinggirannya, sama seperti dua minggu lalu: media Tiongkok melaporkan bahwa Celia milik Huawei juga mencetak 42/42 dalam penilaian yang sama, sehingga dots-note-3.0 adalah salah satu yang pertama, bukan yang pertama; dan klaim mitra Menlo Ventures di X bahwa OpenAI, Anthropic, Axiom Math, dan Kimi K3 milik Moonshot juga mencapai 42/42 tahun ini masih merupakan unggahan sosial yang belum terverifikasi tanpa catatan penilaian di belakangnya.
Perusahaan juga menerbitkan klaim benchmark terbaru bersamaan dengan peluncurannya, semuanya dilaporkan oleh vendor dan belum direproduksi sejauh ini. Pada benchmark ARC-AGI 3, Dots mengatakan versi pratinjau dots3-note mencetak skor sekitar 0,35 dengan biaya saat pengujian yang dilaporkan di bawah $500. Pada suite penalaran dan agen, termasuk WebShop, HotpotQA, dan ALFWorld, perusahaan mengklaim model ini setara dengan atau lebih baik daripada model yang jumlah parameter aktifnya beberapa kali lebih besar, dengan kemampuan vision yang menonjol untuk ukuran modelnya. Itu adalah angka-angka Dots tentang modelnya sendiri — perlakukan seperti itu sampai laboratorium netral mereproduksinya.
Dots juga merilis dua kerangka evaluasi yang dibuatnya untuk kelas tugas ini, dan menjadikannya open-source hampir sama bermanfaatnya dengan model tersebut. VibeLifeBench menjalankan 200 tugas di 22 layanan simulasi dan 288 antarmuka alat, memeriksa 1.247 kondisi atomik tentang apakah agen tetap konsisten saat lingkungan berubah di tengah tugas; berdasarkan hasil Dots sendiri, model terkuat yang diuji sejauh ini hanya mencapai skor 32,5 avg@3, dan sebagian besar model closed-weight teratas gagal total. VibeSearchBench lebih sempit — 20 domain, 200 tugas, menguji apakah agen meminta klarifikasi saat permintaan bersifat ambigu. Keduanya membawa label yang dilaporkan vendor yang sama dengan angka ARC-AGI, tetapi kerangka tersebut bersifat publik, sehingga angka 32,5 dapat diuji (falsifiable) alih-alih sekadar retoris.
Mengapa ini adalah model agen, bukan model matematika.
Baik kebocoran maupun skor IMO seharusnya tidak menyesatkan Anda tentang tujuan model ini. Posisi rilisnya bukan soal matematika — melainkan tugas-tugas jangka panjang yang bersifat terbuka: perencanaan perjalanan yang dipersonalisasi, alur kerja persiapan pernikahan, menjalankan toko kecil, renovasi rumah. Tugas tanpa satu jawaban benar, tujuan yang berubah di tengah pengerjaan, dan rentang waktu berjam-jam atau berhari-hari. Itu adalah kumpulan tolok ukur yang sengaja dibuat berbeda dari papan peringkat matematika dan pengodean, dan di situlah pilihan desain dots3-note — konteks 512K, file memori, putaran kritik diri — benar-benar membuahkan hasil.
Tiga teknik menonjol dalam materi yang dirilis. Pertama, model mempertahankan file memori (memory.md) sebagai ringkasan lingkungan yang berjalan, yang merupakan cara model membawa status lintas sesi yang panjang dan terbuka. Kedua, model menggunakan mekanisme "kritik-diri" — tinjauan diri rekursif yang sama seperti yang digambarkan pada solusi IMO — untuk menandai dan memperbaiki langkah-langkah antaranya sendiri. Ketiga, resep pelatihan diberi nama TEMPO (Test-time-scaled Value Estimation with Macro-step Policy Optimization): model membagi lintasan panjang menjadi langkah-langkah makro dan bergantian antara peran aktor dan kritikus untuk menghasilkan sinyal pelatihannya sendiri, yang dilaporkan menjadi alasan model dapat dioptimalkan pada tugas yang tidak memiliki jawaban dasar kebenaran.
Demonstrasi langsung dari vendor tersebut menjadi inti klaimnya: memainkan game pembangun dek *Slay the Spire II* hingga lantai 33, menyelesaikan keenam level ARC-AGI 3 dalam 320 langkah, memandu penyelesaian masalah penalaran spasial renovasi rumah, serta membangun aplikasi visionOS dari awal hingga akhir (12 file Swift, 1.876 baris, "BUILD SUCCEEDED"). Anggap saja itu sebagai demonstrasi, bukan tolok ukur — tetapi demonstrasi tersebut menunjukkan satu hal yang spesifik: sebuah model yang tetap memegang satu tujuan dan menjalani banyak langkah tanpa kehilangan arah, yang merupakan kapabilitas yang paling langka di pasar agen saat ini.
Biaya, hosting sendiri, dan cara mencobanya
Bobot terbuka gratis; biaya pratinjau dots3-note terletak pada tempat Anda menyajikannya. Resep vLLM referensi untuk checkpoint FP8 berjalan pada delapan NVIDIA H100 dengan paralelisme tensor 8 dan paralelisme pakar 8 — itu adalah garis anggaran sungguhan, bukan model laptop. Tim dengan perangkat keras semacam itu mendapatkan seluruh tumpukan, termasuk decoding spekulatif MTP 3-token dan parser panggilan alat dots yang disertakan dalam runtime. Semua orang lainnya akan menyebutnya terhosting: portal API vendor sudah aktif, dan endpoint pratinjau terhosting diluncurkan di platform pihak ketiga pada hari yang sama ketika bobot dirilis — 14 Agustus. Tingkatan pratinjau terdaftar dengan harga $0 per token di platform yang menyajikannya, menurut daftar platform tersebut sendiri, bukan dari halaman harga vendor, sehingga biaya awal untuk mencoba pratinjau dots3-note di produksi saat ini praktis nol selama label pratinjau masih ada.
Bagi para pengembang, argumen berusia dua minggu tentang bertaruh dengan murah pada model yang belum teruji kini terbaca sebagai argumen tentang mengevaluasi model yang baru saja diluncurkan — polanya identik. Arahkan sebagian lalu lintas ke model baru, di belakang failover otomatis, sehingga mode kegagalan yang mengejutkan menjatuhkan jalur uji alih-alih jalur produksi. Itulah gunanya router, dan itulah versi jujur dari tawaran tersebut: dots3-note preview tidak di-hosting di OrcaRouter pada saat tulisan ini dibuat, dan tidak ada yang boleh berpura-pura sebaliknya. Tetapi postur perutean yang kami tulis dalam artikel kebocoran itu berlaku pada hari itu terjadi — satu API yang dapat menjangkau model baru begitu penyedia menghostingnya, dengan harga daftar penyedia diteruskan pada markup 0% dan failover dikonfigurasi per permintaan. Sementara itu, model-model keluarga DeepSeek yang secara struktural terkait dengan model ini sudah dapat dipanggil dengan cara itu: DeepSeek V4 Flash dan DeepSeek V4 Pro keduanya aktif di belakang satu kunci, dengan harga pass-through yang sama dan failover per permintaan — titik referensi yang masuk akal untuk menilai bagaimana model agen dengan 16B parameter aktif seperti dots3-note preview sebenarnya berperilaku di produksi.

Tontonan Berikutnya
Empat hal, kira-kira berurutan berdasarkan seberapa besar dampaknya terhadap gambaran:
• Reproduksi independen dari 42/42. Bobotnya sudah keluar; pengulangan serius pertama oleh pihak ketiga terhadap hasil IMO — atau paket evaluasi netral yang bertentangan dengannya — adalah titik data bernilai tertinggi tunggal yang dapat dihasilkan oleh rilis ini. Sampai saat itu, 42/42 tetap menjadi skor yang dinilai secara resmi dan dilaporkan perusahaan.
• Saudara-saudaranya yang lebih besar, jazz dan aria. dots3-note preview adalah rilis publik pertama dan, menurut perusahaan, anggota keluarga dots3 yang paling ringan. Jika 280B total / 16B aktif adalah yang kecil, dua model yang lebih besar adalah tempat klaim-klaim frontier akan benar-benar diuji.
• Batasan hosting dan ketentuan pratinjau. Harga kini sudah publik — tingkatan pratinjau gratis per token di platform yang menyediakannya — tetapi batas permintaan dan apakah tag pratinjau membawa ketentuan khusus akan tetap menentukan siapa yang melakukan self-host versus siapa yang memanggilnya.
• Di mana posisinya pada papan peringkat independen. Klaim ARC-AGI dan agent-suite yang dilaporkan vendor memerlukan pengukuran netral untuk menjadi fakta yang dapat digunakan — itu adalah proses yang sama yang memisahkan gembar-gembor dari kenyataan pada setiap rilis terbuka tahun ini.
Saat kami meliput kebocoran tersebut pada bulan Agustus, ringkasan jujurnya singkat: arsitektur nyata, catatan nyata, tanpa bobot, tanpa tanggal. Tiga dari empat kualifikasi itu telah hilang. Arsitekturnya publik, catatannya terlampir pada checkpoint yang dapat diunduh, dan tanggalnya telah tiba. Yang tersisa hanyalah verifikasi — dan kini pratinjau dots3-note dapat dijalankan, bukan sekadar dibaca, jawaban atas apakah Xiaohongshu benar-benar membangun model agen yang diklaimnya akan datang dari siapa pun yang memiliki delapan H100 dan perangkat benchmark, bukan dari pull request.
