Kartu judul hero untuk artikel 'MiMo-V2.6: Apa yang Ditunjukkan Makalah RL', dengan overline 'LAPORAN TEKNIS' dan subjudul 'Laporan RL campuran Xiaomi, dibaca untuk apa yang diverifikasinya dan apa yang tidak'. Empat chip membulat bertuliskan 'Router MoE beku', 'Biaya grader 12,7%', 'DeepSWE 58,4 hingga 72,6' dan 'AA Index 46'. Baris footer berbunyi 'Angka DeepSWE dilaporkan vendor; AA Index 46 diukur oleh Artificial Analysis.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

MiMo-V2.6: Apa yang Sebenarnya Ditunjukkan Makalah RL Xiaomi, dan Apa yang Dibiarkannya Tanpa Verifikasi

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Sebagian besar makalah model yang diterbitkan bulan ini adalah makalah arsitektur. Laporan teknis di balik Xiaomi MiMo-V2.6-Pro dan Xiaomi MiMo-V2.6-Flash bukanlah demikian. Berjudul MiMo-V2.6: Penskalaan Pembelajaran Penguatan Menuju Peningkatan Diri, yang diajukan pada 21 September 2026 dan diatribusikan kepada LLM-Core Xiaomi, laporan ini hampir tidak menghabiskan panjangnya untuk tulang punggung sparse mixture-of-experts dan hampir seluruhnya untuk satu pertanyaan: apa yang terjadi ketika seluruh anggaran pasca-pelatihan masuk ke dalam satu proses pembelajaran penguatan campuran. Sebaliknya, laporan DeepSeek-V4.1-Flash adalah dokumen memori — panjangnya digunakan untuk compressed sparse attention, penggunaan ulang KV lintas lapisan dan penyimpanan FP4. Bandingkan keduanya dan keduanya adalah argumen tentang dari mana kemampuan berasal, dan keduanya tidak sepakat.

Laporan itu layak dibaca berdasarkan kerangkanya sendiri, tetapi laporan itu layak dibaca dengan cermat, karena ini adalah laporan yang dibuat sendiri oleh lab yang menjalankan proses tersebut. Laporan itu menyebutkan mekanismenya, menunjukkan ablasi-nya, menerbitkan kegagalannya, dan sekaligus melaporkan angka-angka yang tidak dapat diperiksa dari luar. Memisahkan kedua hal itu merupakan sebagian besar pekerjaannya. Tulisan ini melakukannya, dan ditulis pada 23 September 2026 — dua hari setelah checkpoint diunggah, ketika makalah itu menjadi hal terbaru dan paling sedikit terkonfirmasi tentang checkpoint tersebut.

Mengapa tanggal pada kertas itu lebih penting daripada biasanya

Checkpoint MiMo-V2.6-Pro dan MiMo-V2.6-Flash milik Xiaomi tiba di model hub pada 21 September 2026, berlisensi MIT dan tanpa pembatasan akses. Laporan itu bertanggal hari yang sama dan mencapai puncak daftar trending di situs preprint tempat laporan itu diposting. Penetapan waktu itulah yang menjadi alasan ini merupakan artikel berita, bukan retrospektif: makalah ini bukan penjelasan belakangan tentang model yang sudah dibenchmark semua orang. Makalah ini hadir bersamaan dengan bobotnya, sebelum siapa pun di luar Xiaomi menerbitkan pengujian independen.

Screenshot of the MiMo-V2.6 technical report page captured September 23, 2026, showing the title 'MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement', attributed to LLM-Core Xiaomi and dated 21 September 2026, with the author list and the opening of the abstract visible.

Urutan itu juga menjadi kelemahan utama makalah ini sebagai bukti. Semua yang berada di hilirnya — kurva DeepSWE, peningkatan tingkat kelulusan, pertahanan terhadap reward hacking — adalah klaim tentang proses pelatihan yang terjadi sekali, di dalam satu laboratorium, pada satu klaster, dan yang belum direproduksi oleh siapa pun. Utas yang menandai laporan itu menganggap hal itu sebagai bagian yang menarik: ini adalah makalah data-dan-eksperimen, bukan makalah arsitektur, dan eksperimen justru merupakan jenis hasil yang bisa direplikasi atau tidak.

Tiga sumbu penskalaan, dan hanya satu di antaranya yang merupakan masalah perangkat keras.

Kerangka laporan ini adalah bahwa komputasi pembelajaran penguatan diperbesar sepanjang tiga sumbu sekaligus, dan yang ketiga adalah yang mengubah cara Anda berpikir tentang metode tersebut.

• Batch dan throughput — 1.568 sampel per pembaruan, diperluas menjadi enam belas rollout untuk masing-masing sampel, sehingga kira-kira 25.000 trajektori per langkah, yang menghabiskan 2,7 hingga 3,7 miliar token per langkah pada panjang konteks hingga satu juta token. Arsitektur rollout sepenuhnya asinkron, itulah yang membuat ukuran batch sebesar itu benar-benar dapat ditangani.

• Lingkungan — satu proses campuran yang mencakup tugas kode, agen umum, visual, dan siber, di bawah beberapa harness agen sekaligus, alih-alih proses RL terpisah per domain. Istilah singkat Xiaomi sendiri untuk ini adalah "You Only RL Once." Argumen untuk pencampuran adalah bahwa peningkatan pada satu kemampuan memperkuat kemampuan lainnya; risikonya adalah jenis tugas yang lambat tidak kebagian sumber daya, yang menurut laporan ditangani dengan penjadwalan adaptif.

• Komputasi penilai — sumbu yang bukan tentang GPU dalam pengertian biasa. Lulus/gagal biner tidak dapat memberi peringkat pada dua solusi yang keduanya lulus, sehingga sinyal imbalan itu sendiri menjadi hal yang Anda skalakan. Penilai agentik membandingkan enam belas percobaan untuk suatu tugas secara bersama-sama dan menghasilkan sinyal bertingkat alih-alih satu bit.

Sumbu ketiga itulah tempat frasa "self-improvement" dalam judul ini mendapatkan tempatnya, dan tempat laporan ini paling rentan. Model yang menilai rollout-nya sendiri adalah permukaan reward-hacking, dan laporan ini memperlakukannya sebagai demikian.

Dua mekanisme yang benar-benar layak dipahami

Redistribusi Keuntungan secara Berkelompok

Setelah setiap langkah, kebijakan tersebut menghasilkan enam belas percobaan per tugas dan semuanya ditempatkan di ruang kerja bersama agar model penilai dapat memeriksanya bersama-sama, bukan satu per satu. Patch yang lulus kemudian dinilai berdasarkan lima aspek: apakah pendekatannya cocok dengan masalahnya, apakah implementasinya tepat tanpa fallback yang tidak perlu, apakah perubahannya minimal, apakah ada yang diubah di luar cakupan, dan apakah sesuai dengan gaya kode di sekitarnya. Patch yang lulus dengan peringkat lebih rendah menerima penguatan positif lebih sedikit. Patch yang dikonfirmasi sebagai hack direset ke nol dan diperlakukan sebagai kegagalan.

Konsekuensinya adalah sinyal pelatihan yang mendorong ke solusi yang lebih pendek dan lebih murah ketimbang sekadar solusi yang benar — laporan menggambarkan ini sebagai mengarahkan ke lebih sedikit token per tugas. Itulah bagian yang perlu dipegang, karena hasil utama di bagian selanjutnya makalah ini justru menunjukkan arah sebaliknya.

Sintesis Reward per Kelompok

Separuh offline dari gagasan yang sama. Alih-alih menurunkan kualitas murni dari penilai langsung, tim menghitung terlebih dahulu rubrik khusus tugas dan mengalikan imbalan uji biner dengan skor kualitas dan perilaku yang diambil dari rubrik tersebut. Laporan itu menggambarkan ini sebagai membangun rubrik dari rollout yang kontras — yakni, dari kasus-kasus yang hasilnya berbeda, di situlah letak informasinya.

Penilaian tidak gratis. Laporan tersebut menempatkan biaya penilai sekitar 12,7% dari total biaya pembelajaran penguatan MiMo-V2.6-Pro. Satu angka itu adalah hal paling berguna dalam makalah tersebut bagi siapa pun yang mempertimbangkan untuk meniru metode ini, karena angka itu mengubah "menskalakan penilai Anda" dari sebuah gagasan menjadi pos anggaran.

Router yang dibekukan adalah hasil yang akan paling dulu disalin oleh sebagian besar tim.

Bagian stabilitas dalam laporan ini memuat temuan yang berdiri sendiri, terlepas dari MiMo-V2.6 dan terlepas dari seberapa baik performa model tersebut.

Dengan router mixture-of-experts yang dapat dilatih, beban expert menyimpang parah selama dua puluh langkah. Koefisien variasi antar expert naik dari 0,78 menjadi 2,0. Beban puncak pada expert tersibuk naik dari enam kali rata-rata menjadi enam belas kali. Proporsi expert dingin — yaitu expert yang menerima hampir tidak ada trafik — naik dari 0,5% menjadi 22%. Mengembalikan bobot router ke nilai awalnya pada langkah 20 segera memulihkan keseimbangan.

Respons Xiaomi adalah membekukan router MoE untuk proses tersebut. Alasannya tidak rumit: pada skala batch ini, ketidakstabilan routing adalah masalah dinamika pelatihan yang bisa saja tidak Anda miliki, dan router bukanlah tempat reinforcement learning menjalankan tugasnya. Apakah pembekuan itu menimbulkan biaya pada kualitas akhir tidak dijawab oleh ablasi dalam materi yang diterbitkan, dan itu hal yang wajar untuk diinginkan.

Yang tidak dikatakan oleh temuan ini adalah apa pun tentang penyajian. Keseimbangan beban router selama proses pelatihan dan pemanfaatan expert dalam trafik produksi adalah pertanyaan yang berbeda, dan laporan hanya membahas yang pertama.

Angka-angkanya, dengan labelnya yang terpasang.

Hasil utama laporan itu rapi dalam bentuk dan berantakan dalam detail, dan kekacauan itu bukanlah skandal — melainkan tiga pengukuran berbeda dari tiga objek berbeda yang berbagi satu nama.

• DeepSWE v1.1, yang disisihkan — MiMo-V2.6-Pro naik dari 58,4 ke 72,6 sepanjang proses; MiMo-V2.6-Flash dari 48,7 ke 65,7. Tolok ukur ini terdiri atas 113 tugas rekayasa repositori berhorizon panjang yang dinilai oleh verifier fungsional di lima bahasa pemrograman, dan metriknya adalah average@3 — rata-rata tingkat kelulusan verifier dari tiga percobaan yang disampel, yang tidak sama dengan apakah salah satu dari tiga percobaan berhasil. Menafsirkan avg@3 sebagai pass@3 akan melebih-lebihkan setiap angka di halaman ini.

• Tolok ukur yang sama, yang diukur di tempat lain — kartu model yang dirilis menampilkan 71,9 untuk Pro dan 67,9 untuk Flash. Dasbor pelatihan publik Xiaomi menampilkan 72,57 dan 65,68. Jadi ada tiga angka yang dipublikasikan per model, dua di antaranya berasal dari Xiaomi, dan arah perbedaannya berbeda untuk tiap varian. Tidak ada yang salah; semuanya menggambarkan cuplikan dasbor, entri kartu, dan baris laporan, pada titik waktu yang berbeda dan mungkin dengan harness yang berbeda.

• Distilasi — MiMo-V2.6-Distill-Qwen-9B, di-fine-tune dari Qwen3.5-9B pada demonstrasi yang dihasilkan MiMo, meningkatkan SWE-bench Verified dari 61,1 menjadi 66,2. Ini adalah angka yang paling dapat ditransfer dalam makalah ini, karena siswa 9B adalah ukuran yang sebagian besar tim benar-benar dapat menjalankan.

• Mini-benchmark keamanan siber internal — 31,3 hingga 47,0. Internal berarti internal: tugas-tugasnya tidak dipublikasikan, sehingga delta tidak dapat direproduksi bahkan secara prinsip.

• Indeks Kecerdasan Artificial Analysis — 46 untuk MiMo-V2.6-Pro. Yang ini berbeda secara jenis. Angka ini dihasilkan oleh Artificial Analysis yang menjalankan harness-nya sendiri terhadap checkpoint yang dirilis, bukan oleh Xiaomi, sehingga menjadikannya satu-satunya angka utama dalam rilis ini yang dapat dianggap oleh pembaca sebagai terukur, bukan sekadar dilaporkan. Ini juga angka yang harus dibandingkan dengan GLM-5.3, Kimi K3, dan frontier tertutup, serta berada lima poin di bawah Claude Opus 5.

A scoreboard card titled 'Published by Xiaomi vs verified from outside', subtitled 'Every headline figure in the report, and who stands behind it', with columns 'Dimension', 'In the report' and 'Independent status'. Rows read: DeepSWE v1.1, held out — 58.4 to 72.6 Pro; 48.7 to 65.7 Flash, average@3 — No third-party rerun; Released model card — 71.9 Pro; 67.9 Flash — Vendor-published; Public training dashboard — 72.57 Pro; 65.68 Flash — Vendor-published; Distill-Qwen-9B — SWE-bench Verified 61.1 to 66.2 — No third-party rerun; Internal cyber benchmark — 31.3 to 47.0 — Tasks not published; AA Intelligence Index — 46 for MiMo-V2.6-Pro — Measured by Artificial Analysis. A footer reads 'DeepSWE, card and dashboard figures are vendor-reported and have not been independently reproduced; the internal benchmark tasks are not published. The AA Intelligence Index is the one headline number produced outside Xiaomi.' The OrcaRouter logo is composited in the bottom-right corner.Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 23, 2026, showing an Intelligence Index of 46, an Intelligence versus Cost scatter placing MiMo-V2.6-Pro against Kimi K3, Claude Opus 5 and other frontier models, and a comparison table of the same models.

Laporan itu jujur tentang keterbatasan tabelnya sendiri, dan inilah kalimat yang layak dikutip kembali kepada siapa pun yang tidak jujur: perbandingan-perbandingan itu mencampur tolok ukur publik dan internal serta tidak mengisolasi kontribusi pembelajaran penguatan dari arsitektur atau pra-pelatihan. Model yang lebih baik setelah RL bukanlah bukti bahwa RL-lah penyebabnya.

Ada peringatan kedua, dan inilah yang berlawanan dengan kerangka tersebut. Perolehan yang dilaporkan umumnya menyertai penggunaan token yang meningkat. Laporan itu menyajikannya sebagai peningkatan kemampuan yang berkelanjutan, bukan sebagai efisiensi, dan memang benar begitu. Namun GAR secara eksplisit dirancang untuk mengarahkan ke jalur yang lebih pendek dan lebih sedikit token per tugas, dan hasil agregatnya tidak menunjukkan beban kerja menjadi lebih murah. Kemampuan meningkat; biaya per tugas tidak turun. Jika Anda membaca "self-improvement" sebagai "model akan membutuhkan lebih sedikit uang saya kuartal depan," makalah ini tidak mendukung pembacaan itu.

Apa yang dibiarkan belum diverifikasi oleh laporan itu

Per 23 September 2026, belum ada pihak ketiga yang menerbitkan uji ulang independen atas kolom DeepSWE, Terminal Bench, atau CyberGym. Perbedaan yang penting adalah antara titik indeks dan segala hal lainnya: 46 adalah pengukuran yang dilakukan pihak lain, dan 72,6 adalah klaim tentang run pelatihan yang tidak dapat dijalankan ulang oleh siapa pun, karena run tersebut dilaporkan menelan biaya $2,6 juta untuk Pro dan $0,9 juta untuk Flash serta tidak akan terjadi dua kali.

Yang Xiaomi terbitkan yang tidak dilakukan sebagian besar lab adalah dinamika pelatihan, kerangka kerja pembelajaran penguatan, dan lingkungan tugas — lebih dari 7.000 lingkungan berjenjang di seluruh rekayasa perangkat lunak, reproduksi kerentanan, pekerjaan berbasis pengetahuan, dan desain web. Itulah artefak dengan masa pakai terpanjang. Bobot memberi tahu Anda apa yang dihasilkan proses pelatihan itu; lingkungan memberi tahu Anda cara menjalankan eksperimennya sendiri, yang merupakan satu-satunya cara klaim RL apa pun akhirnya bisa diselesaikan.

Pertahanan terhadap peretasan reward layak mendapat catatan khusus. Pertahanan itu digambarkan sebagai berlapis-lapis — desain reward, evaluasi adversarial, deteksi anomali, dan pemeriksaan silang antarpemverifikasi — dan semuanya digambarkan sepenuhnya oleh pihak yang akan merasa malu jika pertahanan itu gagal. Pertahanan terhadap model yang mengakali penilai berbasis model bukanlah hal yang bisa ditutup hanya dengan laporan mandiri. Mekanismenya disebutkan dan mode kegagalannya diakui, yang lebih dari yang dilakukan sebagian besar makalah, dan itu masih menjadi pertanyaan terbuka.

Apa yang sebenarnya bisa Anda lakukan dengan ini hari ini

Kedua checkpoint dapat diunduh, tanpa pembatasan akses, di bawah label lisensi MIT: Xiaomi MiMo-V2.6-Pro-RL dan Xiaomi MiMo-V2.6-Flash-RL, omnimodal, konteks satu juta token, dengan indeks Flash melaporkan 172,9 GB data bobot di 65 shard dalam FP8. Xiaomi belum menerbitkan kartu tarif per token untuk generasi V2.6, jadi pilihan saat ini adalah self-hosting versus model hosted yang sudah Anda bayar.

Perbandingan itulah tempat nilai nyata makalah ini berada, dan hal itu kurang menguntungkan bagi makalah ini dengan cara yang berguna. Klaim yang diuji bukanlah "apakah MiMo-V2.6-Pro bagus" — 46 jawaban itu sudah menjawabnya. Klaimnya adalah "apakah pembelajaran penguatan pada tugas-tugas agentic campuran menghasilkan penalaran yang dapat ditransfer ke beban kerja saya," dan satu-satunya cara jujur untuk menjawabnya adalah menjalankan keduanya lalu membandingkan, yang merupakan masalah routing sebelum menjadi masalah penelitian. DeepSeek-V4.1-Flash hanya berjarak satu kunci API dengan harga $0.15 dan $0.60 per juta token, Qwen3.8-Flash dan GLM-5.3-Flash berada pada kunci yang sama, dan jika Anda ingin menempatkan checkpoint MiMo yang di-host sendiri di belakang endpoint yang sama selama seminggu dan melihat apakah kurva DeepSWE muncul di eval Anda sendiri, itu adalah perubahan konfigurasi, bukan migrasi. OrcaRouter tidak menghosting model Xiaomi, dan tidak ada apa pun di sini yang boleh ditafsirkan sebagai klaim sebaliknya — tetapi model-model yang akan Anda jadikan tolok ukur semuanya dapat dijangkau melalui satu kunci API OrcaRouter dengan harga daftar penyedia dengan markup 0% yang diteruskan, dengan failover otomatis jika checkpoint yang sedang Anda uji coba ternyata tidak stabil di bawah beban.

Kasus model yang belum terbukti adalah kasus yang menjadi alasan failover dibuat. Checkpoint yang diterbitkan dua hari lalu, dengan evaluasi yang dijalankan vendor dan tanpa pengujian ulang independen, adalah persis hal yang ingin Anda coba tanpa menempatkan jalur produksi di belakangnya.

Siapa yang harus membaca makalah ini

Jika Anda menjalankan post-training, bacalah itu untuk temuan router dan angka biaya penilai. Keduanya dapat diterapkan, keduanya murah untuk diuji, dan tidak satu pun bergantung pada mempercayai apa pun tentang tabel benchmark MiMo-V2.6. Hasil frozen-router khususnya adalah jenis hal yang hanya membutuhkan satu sore untuk dicoba dan menghemat satu run.

Jika Anda sedang memilih model, bacalah poin indeksnya dan lewati sisanya. Artificial Analysis mengukur 46 pada artefak yang dirilis; itulah satu-satunya angka dalam rilis ini yang tidak berasal dari vendor, dan angka itu menempatkan MiMo-V2.6-Pro di puncak bidang open-weight serta tertinggal lima poin dari Claude Opus 5. Semua hal lain dalam laporan itu menjelaskan bagaimana Xiaomi sampai ke sana, dan bagaimana Xiaomi sampai ke sana bukanlah sesuatu yang bisa Anda beli.

Dan jika Anda membaca liputannya alih-alih makalahnya, hal yang perlu diperhatikan adalah kata "self-improvement." Hasil laporan itu sendiri menunjukkan kemampuan meningkat seiring penggunaan token, sebuah temuan yang nyata dan dapat diulang tentang penskalaan pembelajaran penguatan. Ini bukan klaim bahwa model menjadi lebih murah untuk dijalankan, dan makalah-makalah yang menyusul setelah ini adalah yang akan memberi tahu Anda apakah pada akhirnya hal itu terjadi.