
Xiaomi MiMo-V2.6-Pro: Skor DeepSWE 72,57, Proses yang Terhenti, dan Masih Belum Ada Tanggal Rilis
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro menghentikan proses reinforcement learning yang disiarkan secara publik pada 20 September dengan skor DeepSWE v1.1 sebesar 72.57 yang tertera di dasbor milik Xiaomi sendiri — 1,4 poin di bawah 74% yang juga dimiliki GPT-6 Astra, Gemini 3.8 Flash, dan Claude Opus 5 di puncak papan peringkat yang sama. Xiaomi MiMo-V2.6-Flash, model lebih kecil yang dilatih bersamanya, berhenti pada 19 September di angka 65,68. Kedua proses berakhir pada langkah ke-30, dan total tagihan yang diterbitkan Xiaomi bersamanya tercatat $3,474,715 saat kami mengambil halaman itu pagi ini.
Itu keseluruhan kabar baiknya, dan itu sungguh baik. Sisa ceritanya adalah jurang antara angka dan produk. Baik Xiaomi MiMo-V2.6-Pro maupun Xiaomi MiMo-V2.6-Flash tidak memiliki tanggal rilis, kartu model, pengenal API, harga yang dipublikasikan, atau sekumpulan bobot yang dapat diunduh. Tidak ada endpoint yang bisa dipanggil. Yang ada hanyalah dasbor pelatihan yang bisa dilihat siapa saja, angka benchmark yang dihasilkan harness milik Xiaomi sendiri, dan komunitas yang telah menghabiskan enam hari membaca halaman telemetri seperti orang dahulu membaca daun teh.
Jadi ini adalah tulisan tentang sejauh yang kita ketahui, dan versi jujurnya memisahkan tiga hal yang selama sepekan terakhir diam-diam tercampur dalam liputan: apa yang sudah resmi disampaikan Xiaomi, apa yang dilaporkan satu pengamat tentangnya, dan apa arti semua itu bagi seseorang yang memilih model coding hari ini.
Apa yang sebenarnya Xiaomi unggah ke internet
Pada 16 September, tim MiMo, yang dipimpin oleh Luo Fuli, membuka halaman live di domain milik Xiaomi sendiri yang menampilkan pasca-pelatihan dua model yang belum dirilis secara real time: jumlah langkah, kurva reward, throughput token, jumlah sandbox, pemberitahuan kesalahan GPU, dan penghitung biaya yang terus bertambah saat Anda menonton. Menurut liputan, framing Xiaomi adalah bahwa perusahaan menghabiskan sekitar enam bulan untuk mengerjakan satu pertanyaan — sejauh mana pembelajaran penguatan dapat diskalakan — dan memutuskan untuk menjalankan eksperimen itu secara publik alih-alih mengumumkan hasil.
Dasbor tersebut luar biasa terbuka untuk sebuah artefak vendor. Dasbor itu mencantumkan kegagalannya sendiri dalam feed pemberitahuan: restart Pro pada langkah 17 yang disebabkan oleh kesalahan kehabisan memori GPU akibat ketidakseimbangan beban expert, yang menurut tim telah diperbaiki dengan menyesuaikan strategi paralelisme pelatihannya; kesalahan konektivitas jaringan antara klaster pelatihan Pro dan deployment penilaian yang memaksa restart dan keputusan untuk menghapus dataset cyber dari Pro run mendatang setelah "pola buruk di log rollout"; restart Flash dari langkah 15 setelah sejenis kesalahan infrastruktur tidak terdeteksi selama sekitar tiga jam; dan restart Pro akibat kesalahan VRAM pada satu node. Dasbor itu juga mencatat bahwa tugas-tugas yang dinilai "relatif mudah bagi model pro saat ini" disaring keluar — sebuah pengakuan yang tidak diungkapkan oleh sebagian besar laporan pascapelatihan.

Dua kartu run adalah bagian yang penting bagi siapa pun yang melacak waktu. Kedua model diberi label dihentikan: MiMo-V2.6-Pro setelah 5 hari 7 jam waktu nyata, MiMo-V2.6-Flash setelah 3 hari 11 jam, masing-masing pada langkah 30, pada 20 September dan 19 September secara berurutan. Pro menghabiskan 75B token dan 753k sampel untuk biaya $2,62 juta; Flash menghabiskan 81,4B token untuk $854k. Setiap langkah mengambil batch berisi 1.568 prompt dengan 16 rollout per prompt — 25.088 trajektori per langkah, dijalankan sepenuhnya secara asinkron.
Patut dikatakan secara gamblang: Xiaomi belum mengatakan apakah "stopped" berarti prosesnya sudah selesai, dijeda, atau di-checkpoint. Kartu yang berstatus stopped bukanlah pemberitahuan penyelesaian, dan tidak ada orang di luar tim yang tahu yang mana itu.
Apa yang dikonfirmasi, dan apa yang tidak
72.57 bukanlah rumor. Angka itu tercetak di dasbor Xiaomi, dalam bagan berlabel DeepSWE v1.1, mini-swe-agent, avg@3, di samping kurva oranye Pro run. Angka 65.68 milik model Flash berada di bagan yang sama. Angka itu juga muncul — sebagai 62.24 dan kemudian 65.97 — dalam snapshot sebelumnya dari panel yang sama, dan itulah yang memberi bentuk pada kurva: kenaikan stabil sepanjang 30 langkah alih-alih satu evaluasi yang kebetulan beruntung.
Yang bersifat report-only adalah titik awalnya. Klaim yang beredar di X pada 21 September, dari akun @nrehiew_, adalah bahwa model Pro naik "dari 58.41 ke 72.57" pada DeepSWE dan bahwa semua run telah selesai. Titik akhirnya cocok persis dengan dasbor vendor. Baseline 58.41 adalah pembacaan akun tersebut tentang dari mana kurva dimulai — titik Pro paling kiri di grafik memang berada di kisaran akhir 50-an — dan Xiaomi belum menerbitkan angka step-1. Klaim penyelesaiannya juga merupakan interpretasi terhadap dua kartu yang ditandai stopped, yang merupakan pembacaan yang wajar dan bukan pernyataan Xiaomi. Anggap peningkatan 14 poin itu solid secara arah dan perkiraan secara numerik.

Ada satu perbedaan lagi yang terlewat oleh liputan ini, dan itulah yang menentukan seberapa bernilai angka tersebut. Panel benchmark di dasbor itu adalah evaluasi milik Xiaomi sendiri: perusahaan tersebut menjalankan harness pada checkpoint-nya sendiri dan menerbitkan hasilnya. Harness itu sama dengan yang digunakan papan peringkat publik — mini-swe-agent, DeepSWE v1.1 — yang membuat angka tersebut lebih sebanding dibandingkan benchmark buatan vendor sendiri. Tetapi evaluasi yang dijalankan sendiri bukanlah entri papan peringkat, dan 72.57 tidak muncul di papan Datacurve, karena belum ada yang mengirimkannya.
Plafon 74% itu lebih ketat daripada yang tersirat dari judulnya.
Hal itu membuat perbandingannya menjadi jelas. Papan peringkat DeepSWE v1.1 milik Datacurve, yang terakhir diperbarui pada 3 September 2026, mencantumkan 113 tugas di 91 repositori dalam lima bahasa, dan tiga konfigurasi teratasnya berada dalam posisi seri pada 74% Pass@1: GPT-6 Astra dengan upaya penalaran xhigh, Gemini 3.8 Flash pada high, dan Claude Opus 5 pada max. Angka-angka yang berada di samping skor-skor itulah yang menarik.
• Keyakinan — GPT-6 Astra 74% ±3, Gemini 3.8 Flash 74% ±1, Claude Opus 5 74% ±4. Di papan yang sama, GPT-5.6 Sol berada di 73% ±3 dan GLM-5.3 serta Kimi K3 di 69%. Interval-intervalnya tumpang tindih jauh melewati tempat desimal kedua.
• Biaya per tugas — Gemini 3.8 Flash rata-rata $2,36, GPT-6 Astra $6,52, Claude Opus 5 $11,84. Grafik papan peringkat itu sendiri menandai Gemini 3.8 Flash sebagai konfigurasi paling efisien di papan, dan selisih antara ketiganya sekitar lima berbanding satu untuk tingkat kelulusan yang tidak dapat dibedakan oleh benchmark.
• Langkah — Gemini 3.8 Flash memerlukan rata-rata 166 langkah agen per tugas, Claude Opus 5 99, GPT-6 Astra 29. Skor yang imbang menyembunyikan tiga gaya kerja yang sangat berbeda, dan yang murah adalah yang bekerja paling keras.

Jadi ketika angka 72,57 yang dilaporkan digambarkan sebagai "mendekati puncak papan peringkat," versi yang akurat lebih sempit dan tidak sedramatis itu. Nilainya berada dalam kisaran sekitar satu setengah poin dari hasil seri tiga arah yang para anggotanya tidak dapat dipisahkan satu sama lain oleh batang galat benchmark itu sendiri. Ini adalah hasil yang kuat untuk model yang masih dalam tahap pasca-pelatihan, dihasilkan oleh vendor, bukan oleh pengelola benchmark, pada papan yang belum menerima pengajuan model tersebut. Pembaruan terakhir papan peringkat itu sepenuhnya mendahului pengujian Xiaomi, itulah sebabnya belum ada MiMo yang muncul di sana.
Mengapa Xiaomi berlatih di depan publik
Transparansi ini bukan kebetulan. Rilis bobot terbuka terakhir Xiaomi adalah Xiaomi MiMo-V2.5 dan Xiaomi MiMo-V2.5-Pro pada akhir April, keduanya di bawah lisensi MIT — dapat digunakan secara komersial, dapat di-fine-tune, dapat didistribusikan ulang. MiMo-V2.5-Pro adalah model campuran pakar 1,02 triliun parameter dengan 42B parameter aktif, arsitektur perhatian hibrida, dan jendela konteks 1 juta token, dan materi peluncurannya menyatakan klaim agentik secara eksplisit: kompilator yang ditulis dari awal dalam Rust melalui ratusan panggilan alat, aplikasi desktop delapan ribu baris yang dibangun selama sebelas jam kerja agen.
Melakukan streaming pasca-pelatihan generasi berikutnya adalah jenis klaim yang berbeda. Lab yang mempublikasikan kurva reward-nya, jumlah sandbox-nya, dan kesalahan GPU-nya secara real time meminta dinilai berdasarkan proses, bukan berdasarkan dek peluncuran, dan itu memberi sinyal tentang lini masa. Luo Fuli telah mengatakan bahwa detail teknis pekerjaan RL akan dibuka sumbernya sepotong demi sepotong selama beberapa minggu mendatang. Itu adalah hal yang paling mendekati jadwal yang ditawarkan siapa pun: metodologi lebih dulu, model kemudian.
Ini juga sesuai dengan pola yang pernah digunakan Xiaomi sebelumnya, ketika sebuah model muncul di publik dengan nama lain sebelum perusahaan mengklaimnya. Kebiasaan perusahaan adalah melatih secara diam-diam, menguji secara terbuka, lalu merilis dengan bobot.
Apa yang dapat Anda jalankan hari ini
Tidak ada apa pun dalam keluarga MiMo-V2.6. Jika Anda menginginkan model Xiaomi MiMo sekarang, generasi V2.5-lah yang ada — bobot terbuka melalui kanal milik Xiaomi sendiri dan beberapa platform pihak ketiga, dengan kartu model dan harga yang dipublikasikan. Tidak ada API MiMo-V2.6, tidak ada pengenal model, dan tidak ada daftar harga, dan halaman mana pun yang mengutip pengenal MiMo-V2.6 atau tarif per token sedang mengisi kekosongan yang dibiarkan Xiaomi. String `mimo-v2.6-pro` dan `mimo-v2.6-flash` di dasbor adalah nama tugas pelatihan, bukan endpoint yang dipublikasikan.
Konsekuensi praktis lainnya adalah apa yang harus dilakukan untuk sementara waktu. Jika alasan MiMo-V2.6-Pro menarik bagi Anda adalah karena model itu mungkin cara yang lebih murah untuk mencapai performa coding tingkat terdepan, konfigurasi yang dijadikan pembandingnya sudah bisa dipanggil, dan papan peringkat menunjukkan bahwa yang murah itu kompetitif: Gemini 3.8 Flash menyamai tingkat kelulusan tertinggi pada $2,36 per tugas dan ditandai sebagai konfigurasi paling efisien di papan tersebut. Gemini 3.8 Flash, Claude Opus 5, dan GPT-6 Astra semuanya dapat diakses melalui satu kunci API OrcaRouter dengan harga daftar penyedia, dengan markup 0% yang diteruskan apa adanya — jadi perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama, bukan pada siklus penagihan berikutnya — dengan failover dikonfigurasi per model, bukan per vendor. Dan ketika sebuah lab membuka model seperti ini, merutekannya di balik kunci yang sama adalah cara berkomitmen rendah untuk mengevaluasinya: Anda dapat menempatkannya di depan lalu lintas nyata tanpa mempertaruhkan jalur produksi pada checkpoint yang belum pernah dikarakterisasi oleh siapa pun.
Apa yang sebenarnya bisa mengubah cerita ini
Empat sinyal, kira-kira dalam urutan seberapa banyak yang akan diselesaikannya:
• Bobot di Hugging Face di bawah lisensi yang dinyatakan, yang merupakan cara generasi V2.5 hadir dan bukti terkuat bahwa proses RL menghasilkan model yang siap dirilis, bukan eksperimen yang berakhir.
• Kartu model dengan jumlah parameter, panjang konteks, dan arsitektur — tidak satu pun angka V2.6 yang dipublikasikan, dan dasbor tidak menampilkannya. Mengasumsikan V2.6-Pro mewarisi bentuk 1.02T/42B milik V2.5-Pro hanyalah tebakan.
• Pengenal API dan lembar harga, yakni momen ketika angka DeepSWE berubah dari sekadar tontonan menjadi keputusan pembelian.
• Sebuah pengajuan ke papan DeepSWE milik Datacurve, yang akan menempatkan MiMo-V2.6-Pro pada tabel yang sama dan di bawah batas galat yang sama dengan model-model yang dibandingkan dengannya. Evaluasi yang dijalankan vendor dan pengajuan ke papan peringkat bukanlah klaim yang sama, dan selisih di antara keduanya persis satu baris dari tabel itu.
Sampai saat itu, ringkasan jujurnya adalah bahwa Xiaomi telah menunjukkan proses pasca-pelatihan paling transparan yang pernah diterbitkan oleh lab besar mana pun, pada dua model yang belum dirilisnya, dengan satu angka benchmark yang dilaporkan sendiri yang mendekati — tetapi tidak masuk ke — puncak papan peringkat. Uraian metodologinya dijanjikan dalam beberapa minggu ke depan. Tanggal rilisnya sama sekali tidak dijanjikan.
