
Xiaomi MiMo-V2.6-Pro Memuncaki Indeks Open-Weights dengan Skor 46 — dan Menerbitkan Rincian Biaya Pelatihan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro kini menjadi model open-weights dengan peringkat tertinggi di Artificial Analysis Intelligence Index, yaitu 46 pada v4.3.2 — unggul satu poin dari GLM-5.3 dan dua poin dari Kimi K3, serta dua puluh poin di atas 26 yang dicatat oleh pendahulunya, MiMo-V2.5-Pro, pada skala indeks sebelumnya. Angka itu dihasilkan oleh Artificial Analysis yang menjalankan harness-nya sendiri, bukan oleh Xiaomi, dan itu adalah fakta paling berguna dalam rilis ini. Fakta paling berguna kedua adalah harga yang tercetak di sampingnya: $0,43 per juta token input, $0,87 per juta output, dibandingkan $5,00 dan $25,00 untuk Claude Opus 5 — model yang berada lima poin indeks lebih tinggi. Fakta ketiga adalah hal yang tidak diduga akan diserahkan oleh Xiaomi: pengungkapan publik tentang berapa biaya sebenarnya dari proses reinforcement-learning yang menghasilkan MiMo-V2.6-Pro.
Skor adalah pengukuran, bukan klaim
Hampir semua yang diterbitkan tentang peluncuran sebuah model Tiongkok hadir sebagai angka dari vendor, dan para pembaca sudah belajar untuk meremehkannya. Yang ini berbeda, dan perbedaannya perlu dijelaskan secara tepat karena liputan peluncuran sudah mengaburkannya.
Artificial Analysis mengevaluasi MiMo-V2.6-Pro itu sendiri, pada komposit v4.3.2 — sepuluh evaluasi yang mencakup penalaran, pengetahuan, matematika, dan pengodean, termasuk AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, dan AA-LCR v1.1. Angka 46 adalah hasil yang dikembalikan oleh rangkaian tersebut. Laporan itu juga mencatat karakteristik operasional yang menentukan apakah suatu model dapat digunakan dan bukan sekadar bagus: 134,3 token keluaran per detik, 2,15 detik menuju token pertama, diskon cache 99%, dan biaya terukur $0,13 per tugas Intelligence Index.
Dua di antaranya perlu ditekankan. 134,3 token per detik menempatkan MiMo-V2.6-Pro di urutan kesebelas dari 114 model dalam hal kecepatan — untuk model mixture-of-experts bertriliun parameter, itu adalah hasil serving, bukan sekadar hasil pelatihan. Dan $0,13 per tugas adalah angka yang bertahan saat dihadapkan pada anggaran: itulah biaya yang sebenarnya dikeluarkan untuk menjalankan indeks terhadap model ini, diukur dengan cara yang sama di seluruh model di papan, sehingga membuatnya dapat dibandingkan dengan cara yang tidak dimiliki oleh tarif per token utama.

Apa yang dicakup dan tidak dicakup oleh indeks tersebut
Mahkota open-weights itu nyata tetapi lebih sempit daripada kesan yang ditimbulkannya. Dengan skor 46, MiMo-V2.6-Pro memimpin kategori open-weights. Ia tidak memimpin indeks. Puncak v4.3 adalah Claude Fable 5.1 pada upaya maksimum dengan fallback default dan GPT-6 Astra pada upaya maksimum, keduanya pada 53, dengan Claude Opus 5 pada 51 dan Claude Fable 5 pada 50. Jadi kerangka yang jujur adalah selisih lima poin dari frontier pada komposit yang menghargai keluasan, dan peningkatan dua puluh poin dibanding generasi sebelumnya milik Xiaomi sendiri.
• Pemimpin open-weights — Xiaomi MiMo-V2.6-Pro 46, GLM-5.3 (max) 45, Kimi K3 (max) 44
• Puncak indeks yang sama — Claude Fable 5.1 (max, fallback) 53, GPT-6 Astra (max) 53, Claude Opus 5 (max) 51
• Kecepatan — 134,3 token keluaran/detik, peringkat kesebelas dari 114 model yang diukur; median untuk kelas ukuran adalah 77,9
• Waktu hingga token pertama — 2,15 detik, dibandingkan median 2,34 detik
• Biaya per tugas Intelligence Index — $0,13, dengan biaya menjalankan seluruh evaluasi sebesar $206,66
• Tarif yang tercantum — $0,43 per juta token masukan, $0,87 per juta keluaran, diskon cache 99%, dan biaya gabungan $0,18 pada komposisi cache-hit/masukan/keluaran 7:2:1
Satu angka di halaman Artificial Analysis adalah peringatan yang sesungguhnya, bukan sebuah sikap menyombongkan diri: angka itu menghitung satu penyedia API saja untuk MiMo-V2.6-Pro pada saat penulisan. Itulah hambatan praktis bagi model ini saat ini, dan itu bukan masalah kualitas — melainkan masalah ketersediaan. Model yang dapat diakses melalui satu rute tidak memiliki failover. Jika rute itu menurun kualitasnya, aplikasi Anda ikut menurun, dan justru kemampuan failover itulah yang menjadi alasan sebuah router hadir. Pengamatan yang relevan bagi siapa pun yang merencanakan sesuatu seputar rilis ini adalah bahwa kami tidak menghosting MiMo-V2.6-Pro, dan kami tidak akan berpura-pura sebaliknya; rute menuju model itu saat ini adalah platform milik Xiaomi sendiri dan segelintir katalog pihak ketiga yang mencantumkannya.

Dua angka yang tidak boleh dicampur
Xiaomi juga menerbitkan angka tolok ukur miliknya sendiri, dan itu adalah jenis objek yang berbeda dari 46. Dasbor perusahaan melaporkan MiMo-V2.6-Pro bergerak dari 58,4 ke 72,57 pada DeepSWE v1.1 selama proses reinforcement learning-nya, dievaluasi dengan mini-swe-agent pada rata-rata tiga. Itu adalah harness Xiaomi, penilai Xiaomi, eksekusi offline Xiaomi. Itu belum dikirimkan ke papan peringkat DeepSWE publik dan belum direproduksi oleh siapa pun.
Baca keduanya secara berdampingan dan godaannya adalah menganggap 72,57 sebagai skor yang setara dengan 74% yang dicantumkan papan DeepSWE publik di tingkat teratas. Keduanya tidak berada pada skala yang sama. Angka papan peringkat adalah konfigurasi yang dikirimkan, Pass@1, dengan interval kepercayaan yang dipublikasikan dan biaya rata-rata per tugas; angka vendor adalah evaluasi internal tanpa semua itu. Tulisan kami sendiri pada 21 September membuat poin ini ketika angkanya masih berupa pembacaan dasbor, dan hal itu tetap berlaku sekarang setelah bobotnya dirilis. Harness vendor bisa sepenuhnya jujur dan tetap bukan entri papan peringkat, karena entri papan peringkat adalah klaim tentang konfigurasi tertentu di bawah kondisi tertentu yang dapat dijalankan ulang oleh pihak ketiga.
Disiplin yang sama berlaku untuk pengeluaran pelatihan. Xiaomi melaporkan sekitar $3.474.715 untuk Pro dan Flash — $2.620.670 untuk Pro, $854.044 untuk Flash — masing-masing lebih dari tiga puluh langkah pembelajaran penguatan dan sekitar 750.000 trajektori, diselesaikan dalam waktu kurang dari enam hari. Itu adalah angka akuntansi komputasi milik perusahaan sendiri. Angka-angka itu menarik karena laboratorium hampir tidak pernah menerbitkannya, dan bukan merupakan harga API, bukan biaya yang akan Anda bayar, dan bukan angka yang telah diaudit oleh pihak ketiga mana pun.
Apa yang sebenarnya dirilis Xiaomi
Rilis ini adalah model sparse mixture-of-experts dengan total 1,02 triliun parameter dengan 42 miliar yang diaktifkan per token, jendela konteks 1 juta token, dan multimodalitas native di seluruh teks, gambar, video, dan audio. Saudaranya, Xiaomi MiMo-V2.6-Flash, memiliki arsitektur yang sama pada skala lebih kecil, 309 miliar total dan 15 miliar aktif. Bobot yang diterbitkan membawa label lisensi MIT, dan bundel rilis mencakup laporan teknis, instruksi deployment, dan — menurut Xiaomi — lingkungan pelatihan reinforcement-learning serta kode yang diperlukan untuk memeriksa dan mereproduksi pasca-pelatihan.
Hal terakhir itu adalah perbedaan substantif antara peluncuran ini dan pengumuman API pada umumnya, dan layak dipisahkan dari materi pemasaran. Menerbitkan lingkungan RL adalah klaim bahwa penyiapan pelatihan dapat diperiksa. Apakah lingkungan yang diterbitkan cukup untuk mereproduksi 72.57 adalah pertanyaan terpisah yang akan dijawab oleh orang-orang yang mencoba melakukannya, bukan oleh catatan rilis. Catatan pelatihan Xiaomi sendiri menggambarkan sebuah proses yang mencampur tugas coding, agen umum, visual, dan keamanan siber dalam satu lintasan, dengan penilai yang memeringkat lintasan yang berhasil dan mendistribusikan ulang imbalan ke jalur yang lebih baik — dan catatan itu juga mencatat kegagalan: restart GPU kehabisan memori yang dipicu oleh ketidakseimbangan beban pakar, gangguan jaringan antara klaster pelatihan dan deployment penilai, serta restart Flash setelah kesalahan infrastruktur tidak terdeteksi selama sekitar tiga jam. Menerbitkan kegagalan bersama keberhasilan adalah bagian yang membuat sisa pengungkapannya kredibel.
Berapa biaya untuk menelepon, dan di mana pertanyaan perutean itu berada
Dengan $0,43 dan $0,87 per juta token, MiMo-V2.6-Pro dihargai seperti model kelas menengah dan di-benchmark seperti model open-weights terdepan. Xiaomi mempertahankan harga standar dari generasi MiMo-V2.5 sebelumnya alih-alih menaikkan harga checkpoint baru, itulah sebabnya tarifnya terlihat rendah dibandingkan jumlah parameter. Diskon cache 99% berarti loop agen yang berat cache membaca konteksnya nyaris tanpa biaya, dan di situlah tagihan agen horizon panjang sebenarnya menumpuk.
Ada versi dari perdagangan ini yang dirutekan dengan mulus dan ada versi yang tidak. Versi yang berhasil: model-model frontier yang akan Anda bandingkan dengan MiMo-V2.6-Pro — Claude Opus 5 pada $5,00/$25,00, GPT-6 Astra, Gemini 3.8 Flash, GLM-5.3 — semuanya dapat dijangkau melalui satu kunci OrcaRouter pada harga daftar penyedia dengan markup 0%, sehingga pemotongan harga dari vendor mana pun di antaranya langsung berlaku di sisi kami pada hari yang sama, dan aturan perutean dapat mengirim permintaan ke model kedua ketika model pertama lambat atau tidak tersedia. Hal ini lebih penting dari biasanya di sini, karena model dengan skor open-weights terbaik juga merupakan model dengan rute paling tipis untuk mencapainya. Menggabungkan keduanya — jalur open-weights murah untuk pekerjaan massal dan jalur frontier untuk ekor yang sulit — adalah keputusan perutean, dan itulah jenis keputusan yang berhenti menjadi taruhan begitu kedua jalur berada pada kunci yang sama.
Satu produk lagi yang perlu dibedakan dengan jelas, karena mudah disamakan dengan model: Xiaomi juga menawarkan MiMo-V2.6-Pro-UltraSpeed, tier layanan terhosting yang dibangun dari checkpoint yang sama. Materi Xiaomi sendiri mengklaim hingga dua puluh kali kecepatan keluaran layanan Pro standar pada kualitas yang sama; daftar katalog pihak ketiga menyebutkan sekitar sepuluh kali. Itu adalah dua angka berbeda yang menggambarkan tier yang sama, tidak ada yang menerbitkan distribusi latensi per permintaan yang menyelaraskan keduanya, dan tier tersebut memiliki tarif yang secara material lebih tinggi. Tidak ada apa pun tentang UltraSpeed yang mengubah apa yang dapat dilakukan bobot — UltraSpeed mengubah seberapa cepat server milik orang lain menjalankannya.
Apa yang akan mengubah gambaran ini?
Tiga hal, sesuai urutan seberapa besar pengaruhnya.
Rute penyajian kedua dan ketiga. Jumlah penyedia tunggal di Artificial Analysis adalah kendala bagi semua hal lainnya. Lebih banyak rute berarti failover, berarti persaingan harga di lapisan penyajian, dan berarti model dapat dimasukkan ke jalur produksi, bukan sekadar eksperimen.
Reproduksi independen atas angka-angka DeepSWE. Angka 46 sudah independen; angka 72.57 belum. Jika uji coba dari pihak luar hasilnya mendekati angka itu, argumen untuk model ini akan menguat secara signifikan. Jika hasilnya jauh di bawah, angka Artificial Analysis tetap menjadi yang bisa dipercaya dan angka dari vendor akan bergabung dengan daftar panjang klaim peluncuran yang tidak bertahan saat diuji.

Rincian per evaluasi. Komposit tetaplah komposit. Evaluasi mana di antara sepuluh evaluasi yang dimenangkan MiMo-V2.6-Pro dan mana yang kalah adalah perbedaan antara model yang Anda terapkan untuk pengodean agentik dan model yang Anda terapkan untuk tanya jawab yang berat pengambilan informasi, dan indeks saja tidak memberi tahu Anda. Detail itulah yang perlu dicermati berikutnya, dan itulah yang dibutuhkan konfigurasi perutean sebelum layak dituliskan.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
