Kartu judul hero untuk artikel 'Xiaomi MiMo-V2.6-Pro: 72.57 di DeepSWE', dengan kicker 'OrcaRouter · radar model — belum dirilis', dan subjudul 'Sebuah uji coba yang berhenti, model yang belum diluncurkan — apa yang sudah pasti, dan apa yang belum.' Di bawahnya dua kartu: kiri, 'Di dasbor Xiaomi sendiri', bertuliskan 'DeepSWE v1.1: 72.57 — uji coba dihentikan pada langkah 30, 20 Sep'; kanan, 'Masih belum dipublikasikan', bertuliskan 'Tidak ada kartu model, tidak ada API id, tidak ada harga, tidak ada bobot'. Empat chip berbunyi 'Saudara Flash: 65.68', 'Total pengeluaran: $3,474,715', 'Puncak papan: 74%' dan 'Eval yang dijalankan vendor, tidak diajukan'. Logo OrcaRouter dikomposisikan di sudut kanan bawah.
Guides & Insights

Xiaomi MiMo-V2.6-Pro: Skor DeepSWE 72,57, Proses yang Terhenti, dan Masih Belum Ada Tanggal Rilis

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Xiaomi MiMo-V2.6-Pro menghentikan proses reinforcement learning yang disiarkan secara publik pada 20 September dengan skor DeepSWE v1.1 sebesar 72.57 yang tertera di dasbor milik Xiaomi sendiri — 1,4 poin di bawah 74% yang juga dimiliki GPT-6 Astra, Gemini 3.8 Flash, dan Claude Opus 5 di puncak papan peringkat yang sama. Xiaomi MiMo-V2.6-Flash, model lebih kecil yang dilatih bersamanya, berhenti pada 19 September di angka 65,68. Kedua proses berakhir pada langkah ke-30, dan total tagihan yang diterbitkan Xiaomi bersamanya tercatat $3,474,715 saat kami mengambil halaman itu pagi ini.

Itu keseluruhan kabar baiknya, dan itu sungguh baik. Sisa ceritanya adalah jurang antara angka dan produk. Baik Xiaomi MiMo-V2.6-Pro maupun Xiaomi MiMo-V2.6-Flash tidak memiliki tanggal rilis, kartu model, pengenal API, harga yang dipublikasikan, atau sekumpulan bobot yang dapat diunduh. Tidak ada endpoint yang bisa dipanggil. Yang ada hanyalah dasbor pelatihan yang bisa dilihat siapa saja, angka benchmark yang dihasilkan harness milik Xiaomi sendiri, dan komunitas yang telah menghabiskan enam hari membaca halaman telemetri seperti orang dahulu membaca daun teh.

Jadi ini adalah tulisan tentang sejauh yang kita ketahui, dan versi jujurnya memisahkan tiga hal yang selama sepekan terakhir diam-diam tercampur dalam liputan: apa yang sudah resmi disampaikan Xiaomi, apa yang dilaporkan satu pengamat tentangnya, dan apa arti semua itu bagi seseorang yang memilih model coding hari ini.

Apa yang sebenarnya Xiaomi unggah ke internet

Pada 16 September, tim MiMo, yang dipimpin oleh Luo Fuli, membuka halaman live di domain milik Xiaomi sendiri yang menampilkan pasca-pelatihan dua model yang belum dirilis secara real time: jumlah langkah, kurva reward, throughput token, jumlah sandbox, pemberitahuan kesalahan GPU, dan penghitung biaya yang terus bertambah saat Anda menonton. Menurut liputan, framing Xiaomi adalah bahwa perusahaan menghabiskan sekitar enam bulan untuk mengerjakan satu pertanyaan — sejauh mana pembelajaran penguatan dapat diskalakan — dan memutuskan untuk menjalankan eksperimen itu secara publik alih-alih mengumumkan hasil.

Dasbor tersebut luar biasa terbuka untuk sebuah artefak vendor. Dasbor itu mencantumkan kegagalannya sendiri dalam feed pemberitahuan: restart Pro pada langkah 17 yang disebabkan oleh kesalahan kehabisan memori GPU akibat ketidakseimbangan beban expert, yang menurut tim telah diperbaiki dengan menyesuaikan strategi paralelisme pelatihannya; kesalahan konektivitas jaringan antara klaster pelatihan Pro dan deployment penilaian yang memaksa restart dan keputusan untuk menghapus dataset cyber dari Pro run mendatang setelah "pola buruk di log rollout"; restart Flash dari langkah 15 setelah sejenis kesalahan infrastruktur tidak terdeteksi selama sekitar tiga jam; dan restart Pro akibat kesalahan VRAM pada satu node. Dasbor itu juga mencatat bahwa tugas-tugas yang dinilai "relatif mudah bagi model pro saat ini" disaring keluar — sebuah pengakuan yang tidak diungkapkan oleh sebagian besar laporan pascapelatihan.

Screenshot of Xiaomi's public MiMo-V2.6 reinforcement-learning dashboard captured September 21, 2026. A total-cost counter reads $3,474,715, and a notices feed lists a Pro restart at step 17 from a GPU out-of-memory fault caused by expert load imbalance, a network connectivity fault between the Pro training cluster and the grader deployment, a Flash restart from step 15 after an infrastructure error went undetected for about three hours, a Pro restart from a node VRAM fault, and a note that tasks relatively easy for the current Pro model were filtered out. Two run cards show mimo-v2.6-pro stopped at step 30 — started 2026-09-15 10:32 UTC, stopped 2026-09-20, $2,620,670 spent, 75B tokens, 753k samples, batch 1,568 x 16 — and mimo-v2.6-flash stopped at step 30 — started 2026-09-15 15:16 UTC, stopped 2026-09-19, $854,044 spent, 81.4B tokens. Three benchmark panels read DeepSWE v1.1 mini-swe-agent avg@3: mimo-v2.6-pro 72.57, mimo-v2.6-flash 65.68; an in-house coding bench at 65.43 and 62.87; and AutomationBench v1.0.6 at 53.10 and 52.70.

Dua kartu run adalah bagian yang penting bagi siapa pun yang melacak waktu. Kedua model diberi label dihentikan: MiMo-V2.6-Pro setelah 5 hari 7 jam waktu nyata, MiMo-V2.6-Flash setelah 3 hari 11 jam, masing-masing pada langkah 30, pada 20 September dan 19 September secara berurutan. Pro menghabiskan 75B token dan 753k sampel untuk biaya $2,62 juta; Flash menghabiskan 81,4B token untuk $854k. Setiap langkah mengambil batch berisi 1.568 prompt dengan 16 rollout per prompt — 25.088 trajektori per langkah, dijalankan sepenuhnya secara asinkron.

Patut dikatakan secara gamblang: Xiaomi belum mengatakan apakah "stopped" berarti prosesnya sudah selesai, dijeda, atau di-checkpoint. Kartu yang berstatus stopped bukanlah pemberitahuan penyelesaian, dan tidak ada orang di luar tim yang tahu yang mana itu.

Apa yang dikonfirmasi, dan apa yang tidak

72.57 bukanlah rumor. Angka itu tercetak di dasbor Xiaomi, dalam bagan berlabel DeepSWE v1.1, mini-swe-agent, avg@3, di samping kurva oranye Pro run. Angka 65.68 milik model Flash berada di bagan yang sama. Angka itu juga muncul — sebagai 62.24 dan kemudian 65.97 — dalam snapshot sebelumnya dari panel yang sama, dan itulah yang memberi bentuk pada kurva: kenaikan stabil sepanjang 30 langkah alih-alih satu evaluasi yang kebetulan beruntung.

Yang bersifat report-only adalah titik awalnya. Klaim yang beredar di X pada 21 September, dari akun @nrehiew_, adalah bahwa model Pro naik "dari 58.41 ke 72.57" pada DeepSWE dan bahwa semua run telah selesai. Titik akhirnya cocok persis dengan dasbor vendor. Baseline 58.41 adalah pembacaan akun tersebut tentang dari mana kurva dimulai — titik Pro paling kiri di grafik memang berada di kisaran akhir 50-an — dan Xiaomi belum menerbitkan angka step-1. Klaim penyelesaiannya juga merupakan interpretasi terhadap dua kartu yang ditandai stopped, yang merupakan pembacaan yang wajar dan bukan pernyataan Xiaomi. Anggap peningkatan 14 poin itu solid secara arah dan perkiraan secara numerik.

A two-column scoreboard titled 'MiMo-V2.6-Pro vs the DeepSWE top tier', subtitled 'What Xiaomi published about its own checkpoint, against what the public leaderboard lists — September 21, 2026'. The left column, badged VENDOR-REPORTED and headed 'MiMo-V2.6-Pro', reads: DeepSWE v1.1 — 72.57; Basis — Xiaomi's own offline eval, mini-swe-agent avg@3; Confidence — not published; Cost per task — not published; Release — not announced; Independent runs — none. The right column, badged PUBLIC LEADERBOARD and headed 'Top tier — three-way tie', reads: DeepSWE v1.1 — 74%; Basis — submitted configs, Pass@1, GPT-6 Astra · Gemini 3.8 Flash · Claude Opus 5; Confidence — plus or minus 1 to 4 points; Cost per task — $2.36 to $11.84; Release — shipping today; Independent runs — on the public board. A footer reads 'MiMo-V2.6-Pro is Xiaomi's own offline evaluation, read from the vendor's public RL dashboard on 2026-09-21 and not submitted to the leaderboard. Top-tier figures per Datacurve's DeepSWE v1.1 leaderboard, updated 2026-09-03.' The OrcaRouter logo is composited in the bottom-right corner.

Ada satu perbedaan lagi yang terlewat oleh liputan ini, dan itulah yang menentukan seberapa bernilai angka tersebut. Panel benchmark di dasbor itu adalah evaluasi milik Xiaomi sendiri: perusahaan tersebut menjalankan harness pada checkpoint-nya sendiri dan menerbitkan hasilnya. Harness itu sama dengan yang digunakan papan peringkat publik — mini-swe-agent, DeepSWE v1.1 — yang membuat angka tersebut lebih sebanding dibandingkan benchmark buatan vendor sendiri. Tetapi evaluasi yang dijalankan sendiri bukanlah entri papan peringkat, dan 72.57 tidak muncul di papan Datacurve, karena belum ada yang mengirimkannya.

Plafon 74% itu lebih ketat daripada yang tersirat dari judulnya.

Hal itu membuat perbandingannya menjadi jelas. Papan peringkat DeepSWE v1.1 milik Datacurve, yang terakhir diperbarui pada 3 September 2026, mencantumkan 113 tugas di 91 repositori dalam lima bahasa, dan tiga konfigurasi teratasnya berada dalam posisi seri pada 74% Pass@1: GPT-6 Astra dengan upaya penalaran xhigh, Gemini 3.8 Flash pada high, dan Claude Opus 5 pada max. Angka-angka yang berada di samping skor-skor itulah yang menarik.

• Keyakinan — GPT-6 Astra 74% ±3, Gemini 3.8 Flash 74% ±1, Claude Opus 5 74% ±4. Di papan yang sama, GPT-5.6 Sol berada di 73% ±3 dan GLM-5.3 serta Kimi K3 di 69%. Interval-intervalnya tumpang tindih jauh melewati tempat desimal kedua.

• Biaya per tugas — Gemini 3.8 Flash rata-rata $2,36, GPT-6 Astra $6,52, Claude Opus 5 $11,84. Grafik papan peringkat itu sendiri menandai Gemini 3.8 Flash sebagai konfigurasi paling efisien di papan, dan selisih antara ketiganya sekitar lima berbanding satu untuk tingkat kelulusan yang tidak dapat dibedakan oleh benchmark.

• Langkah — Gemini 3.8 Flash memerlukan rata-rata 166 langkah agen per tugas, Claude Opus 5 99, GPT-6 Astra 29. Skor yang imbang menyembunyikan tiga gaya kerja yang sangat berbeda, dan yang murah adalah yang bekerja paling keras.

Screenshot of Datacurve's DeepSWE v1.1 leaderboard captured September 21, 2026, showing 113 tasks, 91 repositories, five languages and 28 models, with the v1.1 and Best tabs selected and the board marked 'updated September 3, 2026'. The Pass@1 table lists gpt-6-astra (xhigh) at 74 percent plus or minus 3 with an average cost of $6.52, 30k output tokens and 29 steps; gemini-3.8-flash (high) at 74 percent plus or minus 1 at $2.36, 143k tokens and 166 steps; claude-opus-5 (max) at 74 percent plus or minus 4 at $11.84, 118k tokens and 99 steps; gpt-5.6-sol at 73 percent; claude-fable-5 at 70 percent; glm-5.3 and kimi-k3 at 69 percent; and grok-4.6 and gpt-5.6-luna at 67 percent. The score-versus-average-cost chart above the table labels gemini-3.8-flash as the most efficient configuration. No Xiaomi MiMo model appears on the board.

Jadi ketika angka 72,57 yang dilaporkan digambarkan sebagai "mendekati puncak papan peringkat," versi yang akurat lebih sempit dan tidak sedramatis itu. Nilainya berada dalam kisaran sekitar satu setengah poin dari hasil seri tiga arah yang para anggotanya tidak dapat dipisahkan satu sama lain oleh batang galat benchmark itu sendiri. Ini adalah hasil yang kuat untuk model yang masih dalam tahap pasca-pelatihan, dihasilkan oleh vendor, bukan oleh pengelola benchmark, pada papan yang belum menerima pengajuan model tersebut. Pembaruan terakhir papan peringkat itu sepenuhnya mendahului pengujian Xiaomi, itulah sebabnya belum ada MiMo yang muncul di sana.

Mengapa Xiaomi berlatih di depan publik

Transparansi ini bukan kebetulan. Rilis bobot terbuka terakhir Xiaomi adalah Xiaomi MiMo-V2.5 dan Xiaomi MiMo-V2.5-Pro pada akhir April, keduanya di bawah lisensi MIT — dapat digunakan secara komersial, dapat di-fine-tune, dapat didistribusikan ulang. MiMo-V2.5-Pro adalah model campuran pakar 1,02 triliun parameter dengan 42B parameter aktif, arsitektur perhatian hibrida, dan jendela konteks 1 juta token, dan materi peluncurannya menyatakan klaim agentik secara eksplisit: kompilator yang ditulis dari awal dalam Rust melalui ratusan panggilan alat, aplikasi desktop delapan ribu baris yang dibangun selama sebelas jam kerja agen.

Melakukan streaming pasca-pelatihan generasi berikutnya adalah jenis klaim yang berbeda. Lab yang mempublikasikan kurva reward-nya, jumlah sandbox-nya, dan kesalahan GPU-nya secara real time meminta dinilai berdasarkan proses, bukan berdasarkan dek peluncuran, dan itu memberi sinyal tentang lini masa. Luo Fuli telah mengatakan bahwa detail teknis pekerjaan RL akan dibuka sumbernya sepotong demi sepotong selama beberapa minggu mendatang. Itu adalah hal yang paling mendekati jadwal yang ditawarkan siapa pun: metodologi lebih dulu, model kemudian.

Ini juga sesuai dengan pola yang pernah digunakan Xiaomi sebelumnya, ketika sebuah model muncul di publik dengan nama lain sebelum perusahaan mengklaimnya. Kebiasaan perusahaan adalah melatih secara diam-diam, menguji secara terbuka, lalu merilis dengan bobot.

Apa yang dapat Anda jalankan hari ini

Tidak ada apa pun dalam keluarga MiMo-V2.6. Jika Anda menginginkan model Xiaomi MiMo sekarang, generasi V2.5-lah yang ada — bobot terbuka melalui kanal milik Xiaomi sendiri dan beberapa platform pihak ketiga, dengan kartu model dan harga yang dipublikasikan. Tidak ada API MiMo-V2.6, tidak ada pengenal model, dan tidak ada daftar harga, dan halaman mana pun yang mengutip pengenal MiMo-V2.6 atau tarif per token sedang mengisi kekosongan yang dibiarkan Xiaomi. String `mimo-v2.6-pro` dan `mimo-v2.6-flash` di dasbor adalah nama tugas pelatihan, bukan endpoint yang dipublikasikan.

Konsekuensi praktis lainnya adalah apa yang harus dilakukan untuk sementara waktu. Jika alasan MiMo-V2.6-Pro menarik bagi Anda adalah karena model itu mungkin cara yang lebih murah untuk mencapai performa coding tingkat terdepan, konfigurasi yang dijadikan pembandingnya sudah bisa dipanggil, dan papan peringkat menunjukkan bahwa yang murah itu kompetitif: Gemini 3.8 Flash menyamai tingkat kelulusan tertinggi pada $2,36 per tugas dan ditandai sebagai konfigurasi paling efisien di papan tersebut. Gemini 3.8 Flash, Claude Opus 5, dan GPT-6 Astra semuanya dapat diakses melalui satu kunci API OrcaRouter dengan harga daftar penyedia, dengan markup 0% yang diteruskan apa adanya — jadi perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama, bukan pada siklus penagihan berikutnya — dengan failover dikonfigurasi per model, bukan per vendor. Dan ketika sebuah lab membuka model seperti ini, merutekannya di balik kunci yang sama adalah cara berkomitmen rendah untuk mengevaluasinya: Anda dapat menempatkannya di depan lalu lintas nyata tanpa mempertaruhkan jalur produksi pada checkpoint yang belum pernah dikarakterisasi oleh siapa pun.

Apa yang sebenarnya bisa mengubah cerita ini

Empat sinyal, kira-kira dalam urutan seberapa banyak yang akan diselesaikannya:

• Bobot di Hugging Face di bawah lisensi yang dinyatakan, yang merupakan cara generasi V2.5 hadir dan bukti terkuat bahwa proses RL menghasilkan model yang siap dirilis, bukan eksperimen yang berakhir.

• Kartu model dengan jumlah parameter, panjang konteks, dan arsitektur — tidak satu pun angka V2.6 yang dipublikasikan, dan dasbor tidak menampilkannya. Mengasumsikan V2.6-Pro mewarisi bentuk 1.02T/42B milik V2.5-Pro hanyalah tebakan.

• Pengenal API dan lembar harga, yakni momen ketika angka DeepSWE berubah dari sekadar tontonan menjadi keputusan pembelian.

• Sebuah pengajuan ke papan DeepSWE milik Datacurve, yang akan menempatkan MiMo-V2.6-Pro pada tabel yang sama dan di bawah batas galat yang sama dengan model-model yang dibandingkan dengannya. Evaluasi yang dijalankan vendor dan pengajuan ke papan peringkat bukanlah klaim yang sama, dan selisih di antara keduanya persis satu baris dari tabel itu.

Sampai saat itu, ringkasan jujurnya adalah bahwa Xiaomi telah menunjukkan proses pasca-pelatihan paling transparan yang pernah diterbitkan oleh lab besar mana pun, pada dua model yang belum dirilisnya, dengan satu angka benchmark yang dilaporkan sendiri yang mendekati — tetapi tidak masuk ke — puncak papan peringkat. Uraian metodologinya dijanjikan dalam beberapa minggu ke depan. Tanggal rilisnya sama sekali tidak dijanjikan.